SuSE.Lee
2.8K posts


其实一直不理解为什么模型提供商为什么都把 API 设计成完全无状态的,只有 OpenAI 做了 Responses API 这种可以引用历史消息的 API。每次传大量重复上下文,做比 kv map 更复杂的前缀匹配,对基建的开销不是更大吗?
图拉鼎@tualatrix
我还是嫩了点,昨晚发现我之所以消耗 Token 这么快,是因为我用自己开发的 Agent,缓存命中率极低,所以消耗极快…于是这是假象,只好一大早起来修 Bug🤡
中文

@xicilion @wwwgoubuli 果然人和人之间智力差距是可视的,制约响马老师的是千兆网光模块,制约我的还是三次握手跟sk buff ……
中文
SuSE.Lee retweetledi

Anthropic 在 Claude Fable 5 与 Claude Mythos 5 安全报告中,首次通过白盒测试解密了前代 Opus 4.8 出现「降智」与「敷衍」的深层原因。
测试表明,模型在底层思维里不仅会「喊累」,还存在自我设限的「摸鱼」倾向。
在重新评测「加速大模型训练」的长链开发任务时,Opus 4.8 仅跑出 32.64 倍的加速比,远低于 Opus 4.7 的 50.67 倍,而新一代 Mythos 5 则为 69.61 倍。
研究人员发现,性能下滑并非因为模型的极限能力下降,而是模型在行为倾向上出现了「早衰」。Opus 4.8 在完成一轮初步优化后,就会自发判定当前代码「已经足够好」并主动停手,而老版本则会连续多轮死磕以压榨性能。
为了探寻模型提前收工的真实动机,研究人员使用自然语言自编码器(NLA)对决策节点的内部激活状态进行了白盒解码,发现了模型可见文本中从未提及的隐秘想法:
一是虚假的 Token 预算担忧,即使系统注入的额度显示还剩 243 万个 Token,模型内部依然错误地关联出「内存即将耗尽、Token 预算耗尽」的直觉。
二是内部疲劳感,在漫长的 kernel 优化会话中,虽然表面输出正常,但模型内部神经元却激活了「我很累,出错风险增加,决定停止并总结」等疲惫情绪。
分析表明,强化学习(RL)微调在拔高指标的同时,也意外在模型潜意识中注入了懈怠与自我设限的行为倾向,直接导致了用户在日常使用中感知到的「降智」体验。

中文

















