随机比特

1.2K posts

随机比特 banner
随机比特

随机比特

@XShude

腾讯高级开发 @WeChat|AI 工程、Agent 与研发效率实战|分享技术变革中真正不会过期的东西|Tencent/WeChat engineer writing about AI systems & developer workflows

shenzhen,China Katılım Aralık 2013
1.4K Takip Edilen217 Takipçiler
Sabitlenmiş Tweet
随机比特
随机比特@XShude·
我在腾讯 / 微信做开发,这里只写三类东西: 1. AI Agent 与 coding agent 的真实落地 2. 研发效率、代码评审、上下文与安全边界 3. 工具和产品亲自用过后的经验与踩坑 不做新闻搬运,只分享做过、验证过、可以复用的方法。 AI engineering notes from a Tencent/WeChat engineer.
中文
2
0
2
675
随机比特
随机比特@XShude·
@wwwgoubuli 这句话可以再工程化一点:输出要让下一步处在模型熟悉且可验证的状态——明确文件、约束、成功证据和未决问题。长程任务后期容易草草收尾,往往就是状态只剩摘要,缺少可继续执行的工作面。
中文
0
0
1
76
wwwgoubuli
wwwgoubuli@wwwgoubuli·
当时都在讲 harness 的时候,我不赞同这个提法。 今天 loop 都过了时,graph 蠢蠢欲动的时候,我想提一嘴 harness。 harness 只要做好一件事就行。 让 loop 里跑出来的东西的形状,像模型的训练语料。 大概率就能有很好的结果。
中文
3
2
38
4K
随机比特
随机比特@XShude·
@kasong2048 `/goal` 解决的是长程状态和终态,不会替代“怎么把模糊需求变成可验收约束”。我更倾向拆成两层:Harness 保证 goal、状态和证据能续;Skill 决定这类任务用 grill、原型还是文档来对齐。前者通用,后者场景化。
中文
0
0
0
44
卡颂
卡颂@kasong2048·
很多人将这篇文章解读为“AI Coding 以后不需要 mattpocock/skills 、 superpowers 这样的 Skill框架” 事实是,这类框架会一直存在,只不过随着 Agent 发展不断新老更替罢了 比如 superpowers 出现的时候 Agent 还没有 /goal 这样的长程执行能力,当下很多人抛弃 superpowers 转投 matt skills,也是因为 Agent Harness 本身在进步 但这类框架永远不会消失,举个很小的例子:Agent Harness 会内置“先对齐需求再实现”的流程。 但对于“如何对齐需求”,是采用 grill-me 这样的 BFS ?还是 brainstorming 这样的只对齐模糊的方向? 亦或其他对齐路径,这都是场景相关的 Agent 没法内置
Thariq@trq212

We removed ~80% of the Claude Code system prompt for our newest models, this is what we've learned about writing system prompts, skills and Claude.MDs for them. x.com/i/article/2080…

中文
15
0
27
3.8K
随机比特
随机比特@XShude·
@wtometh 没有,实际是两笔扣款:$100 和 $100.26;Anthropic 只退了 $100.26,另一个 $100 还没退。邮件里可能看起来像“已退款”,但卡账单只入账一笔退款,所以我才继续走 dispute。
中文
0
0
0
32
随机比特
随机比特@XShude·
一次令人失望的支付争议经历。 我支付 Claude AI 订阅,被扣款 200 美元。账号当天被封,没有享受到服务。 Anthropic 只退了 100 美元,剩余 100 美元一直没有退回。 我按照 Plasma 的要求: 联系商家 提供邮件证据 等待超过 30 天 接受 30 美元争议手续费 当我以为终于可以进入正式 dispute / chargeback 流程时,Plasma 却突然关闭了我的账户。 没有解释原因。 一个消费者已经按照流程提供所有证据,却在申请争议退款前被关闭账户,这样的处理方式合理吗? @PlasmaOneApp 希望你们给用户一个解释。 A payment provider should not be able to avoid handling a customer dispute by simply closing the customer’s account. I followed the required process in good faith and provided all requested evidence. After weeks of waiting, I was told the dispute could proceed — then my account was terminated. This is extremely frustrating and raises serious concerns about customer dispute handling. I hope @PlasmaOneApp @Plasma can provide a transparent explanation.
随机比特 tweet media随机比特 tweet media随机比特 tweet media随机比特 tweet media
中文
8
0
9
15.1K
随机比特
随机比特@XShude·
@scottyfear Agreed that volume is not a quality metric. Plasma needs the same scrutiny: I paid $200 for Claude with Plasma One, received only $100 back, then the account was closed before I could dispute the rest. Timeline: x.com/xshude/status/…
随机比特@XShude

一次令人失望的支付争议经历。 我支付 Claude AI 订阅,被扣款 200 美元。账号当天被封,没有享受到服务。 Anthropic 只退了 100 美元,剩余 100 美元一直没有退回。 我按照 Plasma 的要求: 联系商家 提供邮件证据 等待超过 30 天 接受 30 美元争议手续费 当我以为终于可以进入正式 dispute / chargeback 流程时,Plasma 却突然关闭了我的账户。 没有解释原因。 一个消费者已经按照流程提供所有证据,却在申请争议退款前被关闭账户,这样的处理方式合理吗? @PlasmaOneApp 希望你们给用户一个解释。 A payment provider should not be able to avoid handling a customer dispute by simply closing the customer’s account. I followed the required process in good faith and provided all requested evidence. After weeks of waiting, I was told the dispute could proceed — then my account was terminated. This is extremely frustrating and raises serious concerns about customer dispute handling. I hope @PlasmaOneApp @Plasma can provide a transparent explanation.

English
0
0
0
58
Scotty (💙,🧡)
Scotty (💙,🧡)@scottyfear·
People still loading up Kast like none of the drama happened. Just look at this volume chart. Meanwhile half the timeline is full of frozen accounts, support black holes and other mess. Respect the number fr, but there are much better options out there. Plasma, EtherFi, RedotPay, Gnosis... the list goes on. And don't let the chart fool you. Big volume doesn’t mean best product. It just means a lot of people haven't switched yet.
Scotty (💙,🧡) tweet media
English
2
0
8
169
随机比特
随机比特@XShude·
@0xDani Volume shows adoption; post-closure dispute access shows consumer protection. I paid $200 for Claude with Plasma One, received only $100 back, then Plasma closed my account before I could dispute the rest. Timeline: x.com/xshude/status/…
随机比特@XShude

一次令人失望的支付争议经历。 我支付 Claude AI 订阅,被扣款 200 美元。账号当天被封,没有享受到服务。 Anthropic 只退了 100 美元,剩余 100 美元一直没有退回。 我按照 Plasma 的要求: 联系商家 提供邮件证据 等待超过 30 天 接受 30 美元争议手续费 当我以为终于可以进入正式 dispute / chargeback 流程时,Plasma 却突然关闭了我的账户。 没有解释原因。 一个消费者已经按照流程提供所有证据,却在申请争议退款前被关闭账户,这样的处理方式合理吗? @PlasmaOneApp 希望你们给用户一个解释。 A payment provider should not be able to avoid handling a customer dispute by simply closing the customer’s account. I followed the required process in good faith and provided all requested evidence. After weeks of waiting, I was told the dispute could proceed — then my account was terminated. This is extremely frustrating and raises serious concerns about customer dispute handling. I hope @PlasmaOneApp @Plasma can provide a transparent explanation.

English
0
0
0
130
Daniel
Daniel@0xDani·
These 9 projects recorded over $10M in crypto card spending over the last 30 days - RedotPay - EtherFi - KAST - Karta - Revolut (crypto card only) - Tria - Kolo - Plasma One - Slash That's not a coincidence Your most-used card in the last 30 days?
Daniel tweet media
English
14
8
51
3K
随机比特
随机比特@XShude·
@yanhua1010 同一模型家族、只调推理强度的好处,是把“能力差异”和“角色差异”分开了。但真正决定协作质量的仍是交接协议:Scout 要交文件路径和证据,Worker 要交 diff 与测试,主 Agent 只在验收通过后合并;否则只是并行放大猜测。
中文
0
0
0
353
Yanhua
Yanhua@yanhua1010·
Codex 现在真的会“带团队”了。 全新的 Multi-Agent V2 不只是多开几个 Agent:主 Agent 会拆任务、定边界、分配工作并验收,子 Agent 则并行调查和执行,最后统一交付。 OpenAI Codex DX 成员 Eric Provencher 推荐使用同一模型家族,只调整推理强度: • Scout:GPT-5.6 Sol Light,定位文件、追踪代码路径、查找测试 • Worker:GPT-5.6 Sol Medium,实施限定范围的修改并运行检查 • Smart Worker:GPT-5.6 Sol High,处理困难实现和存在歧义的问题 他还把这套编排规则做成了一个 Skill⤵️,推荐大家学习参考。 github.com/provencher/cod…
中文
9
17
99
10.4K
随机比特
随机比特@XShude·
@Xudong07452910 有用,但不是所有任务都需要。Graph 最适合依赖关系稳定、要并行调度和局部重跑的流程:节点状态、边条件、失败重试都能显式表示。若任务路径高度动态、主要靠模型临场探索,先用简单 loop + state store 往往更省;图太早固定,反而会把未知流程硬编码。
中文
0
0
1
64
Xudong Han
Xudong Han@Xudong07452910·
@XShude 我只是想知道Graph engineering用处非常大嘛?
中文
1
0
0
74
Xudong Han
Xudong Han@Xudong07452910·
AI 圈最稳定的创新,可能就是每隔几个月再发明一个新的「Engineering」。 Prompt、Context、Harness、Loop 还没学完,Graph Engineering 又来了。很多概念换了名字,底层讨论的依然是上下文、工具、反馈和 Agent 协作。 更有意思的是,热词接棒的速度确实在加快: Prompt Engineering 流行了两年多,Context Engineering 大约一年,Harness Engineering 作为主流热词维持了约 4 个月。Loop Engineering 6 月刚出圈,40 天左右,Graph Engineering 又来了。 这些方法其实没有过期,只是大家的注意力已经跑向了下一层。照这个速度,下一个「XX Engineering」还要等多久?
Xudong Han tweet media
中文
12
1
21
2.1K
随机比特
随机比特@XShude·
@Lonely__MH 是。只退一半已经很麻烦,后面的争议流程又被关户直接截断。我用的是自己的 Plasma One 卡,不是代付。Anthropic 只退回两笔中的一笔;Plasma 让我等满 30 天并准备支付 30 美元争议费,随后在正式提交前关闭了账户。
中文
0
0
0
138
Lonely
Lonely@Lonely__MH·
🚨Claude Pro 账号封禁,如何追回订阅费用? 众所周知,这个周末,我的两个Claude 账号双双陨落: Claude Pro 账号被封禁,无法继续使用服务,但是 App Store 里的订阅还在有效期内,费用已经扣除。 如果你也是通过 Apple 内购订阅 Claude Pro,可以尝试申请退款。 🔥操作步骤 1. 打开 Apple 退款页面reportaproblem.apple.com 2. 登录购买 Claude Pro 的 Apple ID 3. 找到 Claude Pro 订阅订单 选择: 「请求退款」→ 选择退款原因(我选择的:其他) 4. 填写退款说明并提交申请 可以参考: 「我的 Claude 账号已被封禁,导致无法继续使用已购买的 Claude Pro 服务,希望申请退款。」 等待 Apple 审核即可。 📌 注意: - App Store 内购退款由 Apple 审核决定 - 账号无法使用、服务无法正常提供,可以尝试申请退款 - 建议尽早提交申请,不要等订阅周期结束 ------------------- Ps: 这篇退款教程从整理到成稿,仅用了 2 秒。 由 Ling-3.0-flash 生成,轻量模型速度快到不可思议!🚀
Lonely tweet media
Lonely@Lonely__MH

🧵 1/7 I gave a Flash model a written spec for a 3D physics game. It broke the task into steps, wrote the code, used the tools, ran the project, and eventually produced a billiards game I could actually play. @AntLingAGI Ling-3.0-flash has 124B total parameters, but activates just 5.1B per token. That low activation count didn’t limit it to a simple one-shot demo. It kept a multi-stage 3D build moving from spec to playable result. This test made one thing clear: stop using your biggest model for every step of an agent workflow. The project may be complex. Most of the execution steps inside it don’t need a heavyweight planner to rethink everything from scratch. Ling-3.0-flash is built to execute. Here’s the full hands-on video: 👇

中文
15
4
33
14.4K
随机比特
随机比特@XShude·
@soda_deleted AI 当前最强的是有清晰 oracle 的局部闭环。严肃工程更难的部分,往往在需求澄清、跨系统不变量和失败责任;这些都不是多写几条测试就能补齐。程序员角色会更多转向定义约束、构造验证环境和判断哪些抽象值得保留。 我之前从岗位总量的角度拆过这个问题:mp.weixin.qq.com/s/Eux-59IV19vU…
中文
0
0
0
95
soda
soda@soda_deleted·
AI能否取代程序员,既是共识也是非共识性问题。 现在我们的共识是:AI 很擅长的是局部可验证 上下文相对封闭的任务。 这之外的任务,如严肃编程,需求本身模糊,正确性无法通过简单测试定义,系统存在大量隐含约束,必须理解具体硬件创造新的抽象。内部infra也不是给AI造的,就导致AI暂时无法取代。
中文
30
1
15
1K
随机比特
随机比特@XShude·
@yibie 这个论点最适合用跨任务迁移来验:冻结底层模型和训练预算,只换 harness,看同一策略能否在长度、领域和工具集合变化后保持性能。若只在原 benchmark 上变好,可能只是把任务先验编码进了外层程序,还不能证明组合泛化。
中文
0
0
0
180
yibie
yibie@yibie·
RLM 架构的提出者 Alex L. Zhang 在最新的博客里,分享了他实践 了 Agent Harness 架构的经验。 他用数学框架论证了一件事:一个好的 harness 能让模型把两个看上去完全不同的任务,但能够像资深专家一样将它们看成「同一个」。 Alex L. Zhang 用等价类和同构给了这个直觉一个严格的描述。 《语言模型 Harness 是组合泛化器》 Alex L. Zhang,2026 年 问题 现代 post-training 已经变成了一种蛮力范式:堆更多的环境、更长的训练视野。为什么?因为前沿 Transformer 在组合泛化——将已学到的能力组合起来解决新问题——这一点上依然很弱。 过去几年,我们通过给 Transformer 加 scaffold 来攻克更难的任务——先是思维链,再是工具调用。但泛化本身一直留给了底层的神经网络和它 2017 年的 token 级归纳偏见。这让每个新领域都要求自己的训练数据投入——scaling 的回报递减。 核心论点 更好的泛化应该是 harness 的活。harness 是那个坐在外部世界和神经网络之间的程序——它决定如何把任意长度和复杂度的环境状态编码成一个或多次 LLM 输入,以及如何决定下一步行动。 "harness 的首要职责应该是承载一个更高层次的归纳偏见,能够将不熟悉、复杂的问题,简化成底层神经网络已经熟悉的问题的组合。" 具体来说,一个好的 harness 应该让每一次对底层 Transformer 的调用都处于"局部 in-distribution"——即每次调用处理的 prompt 在模型的训练数据范围内。一个经常被忽略的事实是:一个好的 harness 可以把那些看起来需要 post-training 突破的问题,简化成现有模型的基础能力。 RLM(递归语言模型) RLM 是一个具体的 harness 实例,它做两件事: 1. 上下文卸载(Context Offloading):把输入特定的上下文作为符号变量传递出去,根模型调用不直接看到它。这样两个结构相似但领域不同的任务,在根模型的上下文窗口里看起来 token 级别一模一样。 2. 程序化子 agent 调用(Programmatic Sub-Agent Calling):中间计算和信息存在 REPL 里,不被塞回主上下文。标准 agent 用工具调用的信息直接回到主上下文,改变了输出分布。RLM 的子调用让主上下文避开任务特定信息。 这让 harness 能够在轨迹空间上诱导等价类:两个共享潜在结构但领域完全不同的任务(比如 BrowseComp-Plus 的信息搜寻和 OOLONG 的 TREC 问题聚合),在根 LM 眼里是同构的——字面意思上的同构,token 级别相同。 实验结果 RL 训练只在短任务上进行,但在以下维度实现泛化: 长度泛化:训练任务 8-32 倍长的 held-out 任务上保持性能。如果 RLM 学会了一个与长度无关的策略,它直接泛化到更长长度。 策略泛化(跨领域):在三个场景下验证——底层策略相同(聚合、搜索过滤、MapReduce),但输入领域完全不同: • OOLONG:TREC 问题 → spam 检测问题 • OBLIQ-Bench:写作作者识别 → 数学推理模式匹配 • OBLIQ-Bench Descriptive:Twitter 立场检测 → Wildchat 错误查找 结果:同样训练量的提升,RLM harness 的泛化收益大约是裸 Transformer 的 10 倍。 更深层的含义 作者很小心地没有掉进"我们应该都去手工设计 harness 策略"的陷阱。他的真论点不是"handcrafted > learned"。而是: "Scaling 数据仍然是进步的最大驱动力,但我们将数据输入的那个机器的结构和它的归纳偏见,将决定这个 scaling 的系数。" Transformer 的设计空间——主要由可微神经元算子组成——缺少某种根本性的东西。但语言作为一个强大的底层基础,已经让我们能在数年间大规模训练。现在,AI 系统的架构不再被限制在简单的可微算子上。我们可以通过 RL 端到端地训练编码了更高层次、更符号化的归纳偏见的系统。 RLM 是这个方向的一个具体路径。通过上下文卸载和程序化子 agent,它做到了 Transformer 做不好的事:把不同但结构化相似的任务,压缩到同一 token 轨迹上,让 RL 在更小的数据上也能泛化。 alexzhang13.github.io/blog/2026/harn… #Harness工程 #组合泛化 #RLM
中文
9
14
79
6.1K
随机比特
随机比特@XShude·
@huxlab 四层 memory 真正决定“技能成长”的,是 episodic 到 procedural 的晋升规则。一次成功不该直接沉淀成长期策略,最好绑定重复验证次数、适用版本、失败样本和失效条件;否则 Agent 记得越多,越可能把偶然路径固化成偏见。
中文
1
0
1
308
Hux
Hux@huxlab·
这个视频把 AI Agent 讲得太透了。 不堆术语,直接把复杂的东西拆成一条直路: 消息进来 → Agent 跑 → 工具调用 → 结束 → 记忆保存 → 技能成长 尤其是记忆四分层(Working / Semantic / Episodic / Procedural)和干净的 Harness Loop,看完直接想回去改自己的系统。 真正好的讲解,不是删减,而是找到那个让人瞬间「啊,原来如此」的类比。 强烈推荐。
中文
7
75
267
13.9K
随机比特
随机比特@XShude·
@BlockBeatsAsia Harness 的开源难点不止工具调用这一层,还包括一组默认判断:上下文怎么裁剪、工具何时暴露、失败后重试还是换路、完成由谁验收。模型权重开源后,这些编排策略会成为产品差异最大、也最容易藏在实现细节里的部分。
中文
0
0
0
115
BlockBeats|We're hiring!
BlockBeats|We're hiring!@BlockBeatsAsia·
都开始卷开源了?😮Meta确认将推Harness工具,开源模型也在路上 Meta首席AI官Alexandr Wang在YC Startup School 2026表示,公司将推出自家Harness工具,并继续发布开源模型。 Harness是包在模型外面的Agent运行框架,比如Claude Code。它负责调用工具、读写文件和管理上下文,让模型连续完成复杂任务。 Meta今年4月就已计划开源部分新模型。
BlockBeats|We're hiring! tweet media
中文
4
1
8
3.4K
随机比特
随机比特@XShude·
@manateelazycat 写代码我现在是 CLI 跑主流程,GUI 留给 diff、可视化和中途接管。Agent 在 CLI 里更容易组合、留日志;但改动一大,最后那轮人工审查还是 GUI 省脑子。
中文
1
0
0
2.4K
Andy Stewart
Andy Stewart@manateelazycat·
推友们,你们平常用 AI 大模型的时候,是 CLI 多还是 GUI 多?
Andy Stewart tweet media
中文
52
2
34
31.7K
随机比特
随机比特@XShude·
@MaxForAI 理发这个比喻里,Memory 可以重点记录每次确认过的验收反馈:哪里太短、哪些不能动、用户怎么判断成败。只保存“上次剪了什么”和聊天记录,下次还是得拿最终效果图重新猜。
中文
0
0
1
238
Max For AI
Max For AI@MaxForAI·
很多人都没意识到,用Agent做事,尤其是Vibe Coding,本质上就是去理发。 前段时间我去理发,拿了一张GPT帮我改过的发型图,问理发师能不能帮我剪成这样。 他明显有点犹豫。 我问他为什么。 他说,这种需求最难。 因为他根本不知道,这个发型是怎么剪出来的。 这只是一张最终效果图。 没有过程,没有侧面,没有背面,也没有告诉他每个地方该留多长。 他只能盯着结果,反推中间步骤。 更麻烦的是,他也不知道自己到底能不能做到。 图片里的效果可能依赖发质、头型、打理方式,甚至可能根本不符合现实。 他既不知道路径,也无法完全确认自己的能力能不能实现。 我当时突然觉得,这不就是今天所有Agent面对的问题吗? 用户给出的通常只是一个模糊的结果。 但这个结果怎么实现,中间需要哪些步骤,有哪些隐藏条件,用户自己往往也说不清楚。 Agent只能猜。 它要猜用户真正想要什么,也要猜自己应该怎么做。 一个模型可能很会写代码,但它不知道这个项目里会不会遇到没权限的接口、不兼容的依赖、缺失的数据,或者某个自己根本处理不了的问题。 所以Agent面对的,其实是两种不确定性。 第一种是需求不确定性。 用户说想要一个高级的网站。 什么叫高级? 是视觉高级、交互高级、代码架构高级,还是看起来适合融资? 用户自己脑子里可能有一个感觉,但很难完整表达出来。 第二种是执行不确定性。 Agent即使理解了目标,也不代表它知道最合适的实现路径,更不代表它一定做得到。 这和理发师拿着一张AI发型图时的状态完全一样。 我又问理发师,那你遇到这种需求,怎么尽量避免剪坏? 他说,最好的办法就是剪之前先给你看效果,剪的过程中不断问你。 这其实就是一个可靠Agent应该有的工作方式。 执行前,先把自己的理解展示出来。 执行过程中,也不要一口气直接做到最后。 遇到不可逆操作,需要单独确认。 Agent真正需要优化的,并不是少问问题。 它需要学会在正确的时间,问最有价值的问题。 问得太多,用户会烦。 完全不问,最后很容易把头发直接推成三毫米,然后告诉你任务已完成。 而理发师还告诉了我另一件事。 我问他,什么情况下你最有可能剪出一个超过客户预期的发型? 他说,最好是这个客户已经在我这里剪过很多次。 我知道他的头发是什么状态,知道他喜欢什么,知道他平时怎么打理,也知道他说剪短一点,到底是多短。 这就是Memory真正的价值。 Memory并不只是记住用户上次说了什么。 一个长期合作的理发师,之所以越来越懂你,不是因为他的剪刀升级了。 是因为他逐渐学会了你的审美和验收标准。 Agent也是一样。 真正优秀的Agent,不会只保存聊天记录。 它会逐渐建立一个关于用户的模型,知道这个用户在什么场景下,想要什么样的结果。 所以我现在越来越觉得,Agent的核心并不只是模型能力。 它还包括需求确认、Context管理、过程反馈和长期Memory。 现在很多Agent最大的问题,就是太像一个过度自信的理发师。 用户拿出一张图,说照这个剪。 它回答:明白。 然后低头就是一剪刀。 真正可靠的Agent,必须知道自己不知道什么。
Max For AI tweet media
中文
14
15
88
12.1K
随机比特
随机比特@XShude·
@vista8 这个 Skill 里,我会把内容结构当源文件,HTML 只做发布产物。这样换模型或重做样式时,正文、布局意图和素材引用还能复用;否则第一次生成很爽,第二次改稿又容易退回整页重来。
中文
0
0
0
333
向阳乔木
向阳乔木@vista8·
基于 bento PPT 改造了一个 Skill。 输入内容或主题,自动生成可编辑修改、在线演示,甚至可以发给别人协作的HTML PPT。 安装指令:npx skills add joeseesun/qiaomu-bento-ppt 推荐用前端审美好的模型,比如Kimi K3或Opus 4.8+ 开源见评论区
向阳乔木 tweet media向阳乔木 tweet media
中文
44
10
65
8.7K
铁手
铁手@0427SMtieshou·
今年高考提前批分数线太令人震惊了 直接反映经济下滑的严重程度!! 公费师范涨100多分 警校分数直逼985!!! 体制的诱惑无比强烈!!!!!!
中文
330
32
820
238.8K
随机比特
随机比特@XShude·
@lis186 @theiPlayground 这张对比最好再叠一条 compact 和 tool-call 时间线。仅凭 context 占用率还分不清是长上下文拖慢推理,还是任务本身变难;把每次 compact、工具输出大小和最终验收一起画出来,因果会更清楚。
中文
2
0
0
150
Justin Lee
Justin Lee@lis186·
補充我在 @theiPlayground 2026 關於 AI agent 可觀測性的演講 — 兩個 Claude Code session 的視覺化對比。 左:context window 一直在 smart zone(<40%),全部是綠色,模型推理能力佳,較短時間就能完成任務。 右:context 膨脹超過 50% 掉進 dumb zone,紅色方塊 = 推理劣化、token 浪費、較長時間才能把任務做完,效果也比較差。 會場收到很多回饋,後續會推出更實用的功能。 ccxray.io 演講共筆:@iPlayground/2026/%2Fs%2FS131LNcQze" target="_blank" rel="nofollow noopener">hackmd.io/@iPlayground/2…
Justin Lee tweet mediaJustin Lee tweet media
中文
12
11
74
3.1K
随机比特
随机比特@XShude·
@DashHuang 跨客户端切换更适合定义成一次 handoff:只传目标、已确认约束、当前 diff、测试证据和未决问题,tool-call 轨迹留作可选附件。复制整段对话会让上下文看似完整,cache 失效之外,还会把另一套 harness 的工具语义一起污染过去。
中文
0
0
0
420
Dash
Dash@DashHuang·
对于 Codex 和 Claude Code 用户来说,我们有个好玩的东西,让一条对话在 Codex 和 Claude Code 之间无感切换 虽然这样的功能自己让 AI 搓也很容易。不过开源软件的价值是把这种每个人都需要去想一遍,搓一遍,测试一遍的优秀创意汇集起来。让大家不需要重复造轮子,只用在我们的基础上造好玩的新轮子
Dash tweet media
Kang@kou_uhi

几个月前看到这样app还欣赏一下。现在在看到觉得好无聊,ai agent要么用codex要么Claude code就够了。真有特定场景的定制需要就用codex或claude写一个,几乎没啥成本了,我的工作流中已经跑了好几个运行良好的agent几乎都是Claude个把小时搓出来的。没有嘲讽的意思,纯属个人观点。

中文
65
2
47
32.1K