


Erwin
654 posts

@ErwinWu000
🎓PolyU PhD | 💻前大厂开发 AIxWeb3丨AI Builder丨HCI Research BTC熊市链上指标看板 https://t.co/ZolNqQSWDB X关注导入列表工具 https://t.co/JYuNim8om1




很多人学Agent的顺序其实是反的 一上来就研究Multi-Agent、Tree of Thought、Memory,架构图看了一堆,真到自己动手落地,连一个能稳定跑起来的单Agent都做不出来。后来重新梳理学习路径才发现,核心从来不是会多少框架,是有没有完整跑通过一次Agent工程 比较靠谱的路径其实挺工程化的 先把单Agent的推理链路跑通,再接工具调用、数据库、代码执行、搜索和API,之后补RAG、向量检索、引用溯源,最后再处理上下文记忆、状态管理、日志和异常 做到这一步再回头看Multi-Agent,会轻松很多。因为所谓多Agent协同,说白了还是多个可靠Agent之间的任务拆分和调度。单个Agent的推理、工具调用、工作流稳定性都没打牢,系统只会越搭越复杂

以后用 Codex 做日常开发,默认模型真的可以换成 Luna 了 DeepSWE 测试里,Luna Max 得分 67.2%,已经追平 GPT-5.5 xhigh 的 67.0% 但单任务成本只有 $0.61,对方要 $7.23,直接便宜了近12倍! 甚至对比 Terra Max,Luna Max 也只落后一点,价格却便宜了六倍多 说实话,这种差距已经不是“性价比高一点”,而是完全改变模型的使用方式 日常写代码直接 Luna,真遇到啃不动的硬骨头,再切 Terra 贵模型终于不用全天候烧了




测下来最大的感受是,大部分AI Skills压根不适合进生产环境 原因不复杂,没有脚本执行能力,没有工具调用,没有明确触发条件,整个Skill就是一大段自然语言 这种结构demo里跑跑还行,一旦接进后端服务链路,问题立刻就暴露出来,Agent判断不好触发时机,主文件越写越长,错误处理和边界条件根本拆不开 反倒是比较成熟的Skill,都在强调目录治理 SKILL.md只留元数据和核心步骤,详细API规范扔进references,可执行逻辑放进scripts,模板和schema归到assets,错误处理、边界情况也都单独写清楚 这套东西本质上已经不是提示词工程了,更像是服务工程化



昨天X博主热议“Luna Max≈Sol Medium,且成本仅为1/6“,这是真得吗? 先说我的实际测试结论:小心赔了夫人又折兵! 我给Luna Max和Sol Medium喂了相同的提示词,让他们分别生成赛博朋克 Synthwave 无限飞行场景,效果见视频。 有意思的是,相同的任务,Luna Max的Token消耗要比Sol Medium多出3万多,但实际额度消耗只有Sol Medium的一半——省钱这半句,我认。 可也就到此为止了。额度差只有一半,离传说中的1/6差得远;质量上Sol Medium拿了9分,Luna Max只有7.5分,画面耐看度明显低一档;耗时更扎心,Luna Max足足跑了40分55秒,Sol Medium 21分30秒就收工,快了近一倍。 所以我这一轮的真实结论是:Luna Max确实更省额度,代价却是质量掉一档、时间翻一倍。想拿它平替Sol Medium,先掂量清楚自己更在乎省钱还是省心。 (注意:我只各跑了1轮,样本太小,那40分钟也可能是Luna Max偶尔抽风。)

