方寒

84 posts

方寒 banner
方寒

方寒

@zrainbo

精益求精。 个人研究,瞎说瞎想。 可能「赵启睿」这个名字会让你更熟悉我。

Shanghai Katılım Haziran 2021
41 Takip Edilen14 Takipçiler
方寒
方寒@zrainbo·
卖token的小姑娘🤣
方寒 tweet media
中文
0
0
0
5
方寒
方寒@zrainbo·
@MaxForAI 正确的,路透社除了金融的内容,置信度是很低的。 他们根本不懂中国的政治体制和运转逻辑
中文
0
1
13
1.6K
Max For AI
Max For AI@MaxForAI·
路透独家:中国军方关联研究人员,正在用OpenAI和Anthropic的模型训练本土军用AI。 路透审查了80多篇中国论文和专利,发现多家军方及国防研究机构,正在通过模型蒸馏,把GPT和Claude的输出转移到更小、更便宜、能够离线部署的国产模型中。 其中最敏感的案例,来自解放军96941部队。 研究人员认为,第三方模型不适合直接处理涉密信息,于是先使用GPT-3.5总结军事软件源代码,再用这些总结训练国产模型,最终将模型部署在中国军方内部网络中。 其他论文还涉及无人机实时视频分析、导航和目标判断,以及无人机、舰船和无人潜航器参与的海上模拟作战。部分研究机构还使用Claude 3 Haiku生成社交媒体监控模型所需的合成数据。 报道还引用研究人员的话,称这些论文显示中国军方正在系统性捕获西方模型的推理步骤,把昂贵的专有推理能力转移到本地模型中。 但公开举出的GPT-3.5案例只是代码摘要,Claude 3 Haiku案例只是生成分类数据。 两者都不是推理轨迹,也谈不上转移什么前沿推理能力。 模型蒸馏当然值得关注。 大规模抓取闭源模型输出,复制其商业能力,也确实可能涉及服务条款、知识产权和国家安全问题。路透自己也承认,争议核心是未经授权的大规模提取,而不是蒸馏技术本身。 但仅凭这篇报道公开的证据,最多只能得出: 部分中国军方及军工关联研究人员,曾使用GPT-3.5和Claude 3 Haiku生成训练数据。 把它包装成中国军方正在用美国前沿AI训练无人机和国防系统,基本属于把几个松散案例焊在一起,制造了一条地缘政治大新闻。 PS:能看出来路透根本不懂中国军工科研的相关制度。
Max For AI tweet media
中文
83
15
105
35.5K
方寒
方寒@zrainbo·
如图,Tibo的推特表示,开启两个选项能让GPT 5.6 Sol的能力大幅提升 我很好奇,点开了原文看,很短 [How enabling two settings tripled our scores on the ARC-AGI-3 benchmark | OpenAI](openai.com/index/how-two-…) 感觉像API的推销,原文直接说: > 如果你是想最大化性能的 API 开发者,我们建议使用我们在自家产品中部署的相同设置: > * 请使用我们的Responses API,而不是我们传统的Chat Completions API > * 保留推理 > * 使用压缩 回到Tibo的推特,它明确指出: > work over multiple context windows 在充分理解后,这里应该指的是 > 同一条用户指令尚未完成时,Codex 可以在上下文快满后原地压缩、切换到下一个上下文窗口,然后继续执行工具和推理。 而不是真的开多个窗口 这时候再来看文章的这段话: > ARC-AGI-3 线束通过滚动截断解决上下文限制。当对话上下文超过175,000字符时,最早的消息会被丢弃。 >滚动截断有两个缺点。首先,模型丢失了之前的观察和操作。其次,它在大部分任务中使用更完整的上下文窗口,这可能会稍微影响性能。 >当我们在ARC-AGI-3上启用压缩功能时,GPT-5.6 Sol能够更好地保存其在较长时间运行中学到的每个游戏内容,并以更少的输出令牌获得更高分数。 大概会有新的体会。 因为在Codex cli中,一条用户指令会进入 `run_turn()`。这个函数内部本来就是一个持续循环: ``` 模型推理 → 调用工具 → 把工具结果交回模型 → 再推理 → 再调用工具 → 直到任务完成 ``` Codex cli的代码明确说明,同一个 `ModelClientSession` 会在整个 turn 内复用;每次采样前,Codex cli 从当前 history 构造新请求。 关键代码逻辑可以简化成: ``` loop { let result = sample_model(history).await; execute_tool_calls(result).await; let needs_follow_up = model_needs_follow_up || has_pending_input; if needs_follow_up && token_limit_reached { run_auto_compact( CompactionReason::ContextLimit, CompactionPhase::MidTurn, ).await?; continue; } if !needs_follow_up { break; } } ``` 实际源码中,在模型仍需继续工作、同时 token 阈值已到达时,Codex 会调用: ``` run_auto_compact( ..., CompactionReason::ContextLimit, CompactionPhase::MidTurn, ) ``` 压缩成功后直接执行 `continue`,回到同一个 `run_turn()` 循环,不会结束当前任务。 所以真正发生的是: ``` 用户下达一条大型任务 ↓ 窗口 1:分析、读文件、改代码、测试 ↓ 快满 Mid-turn compaction ↓ 窗口 2:沿用压缩状态继续修改、测试 ↓ 快满 Mid-turn compaction ↓ 窗口 3:继续执行 ↓ 最终完成并回答 ``` 只要任务尚未完成并且压缩成功,这个流程就能重复触发,不仅限于两个窗口。 --- 所以大概在这里,Tibo指的是我们在设置config.toml时常常会手动设置的 ``` model_auto_compact_token_limit = 175000 model_auto_compact_token_limit_scope = "total" ``` 选项,但这个确实没有必要,不填写 `model_auto_compact_token_limit`,让模型自己的默认阈值生效可能才是最好的选择,因为这会导致滚动截断的发生 当前Codex Cli的 `main` 分支已经把: ``` remote_compaction_v2 ``` 标记为: ``` Stage::Stable default_enabled: true ``` 而且源码注释明确写的是: > Enable remote compaction v2 over the normal Responses API. 所以也无需在config.toml中单独开启它 --- 总之读完之后感觉对ChatGPT的压缩魔法有了更深的认识吧。
方寒 tweet media
中文
0
0
0
176
方寒
方寒@zrainbo·
这部法律的含法成分感觉是2026年来最高的一部 ​一眼看过去就有很多问题,比如怎么区分网络暴力和网络监督?网络暴力的组织者需不需要有意思联络?将网络暴力提升到刑法上的制规范是怎样的?行刑衔接?给网络服务提供者,也就是网站提供者规制了哪些义务?网络暴力的主管部门?人民法院应当受理的情形是怎样的? ​ ​后续大概会出个文章聊一聊,结合我为人处理网络暴力的事情谈谈这部法律如果能出台提供的把手。
方寒 tweet media
中文
0
0
0
16
方寒
方寒@zrainbo·
@MaxForAI 我的情报有误吗..为什么flash就比肩4.8 opus了
中文
0
0
0
1.1K
Max For AI
Max For AI@MaxForAI·
声明:本人从未在互联网上诋毁过深度求索,并没有称梁文锋为梁白开。 本人实际上是深度求索一年半年老粉,经过长时间的思考,我发现DeepSeek才是中国AI的希望,有时候做出决定很难,经过许多个日夜的思考,我决定加入DeepSeek粉丝团。 至于Kimi,GLM和Minimax,祝他们的开源模型一切顺利。 本人从未诋毁过深度求索,也从未称呼梁总为牢梁,望周知🥹
Max For AI tweet media
中文
110
26
685
92.8K
方寒
方寒@zrainbo·
time to what?
方寒 tweet media
English
0
0
0
7
方寒
方寒@zrainbo·
@BarrettDream @MaxForAI 经典比烂😅你爹a畜是个畜生但是是个诚实的畜生所以你张开大口狠狠地舔舐它的屁眼
中文
0
0
0
99
霹雳游侠
霹雳游侠@BarrettDream·
如果Anthropic的这种做法可以被称为“畜生” 那我觉得有些公司基本可以直接“打开保险,放”了 相反,我看了他们在犹豫😕在纠结,因为知道这玩意不地道,有法律可能惩罚他们。 哪家模型公司没用未授权的资料训练过模型? 字节的今日头条早期未经授权扒各类新闻门户问题 淘宝早期各类假冒伪劣 连苹果安卓都是假的 我虽然现在不订阅他家了 但是在所有大模型公司里,他家算是清流了。 就凭它可以和美国政府在AI介入战争产生分歧硬刚美国政府这一点上,Anthropic获得了信誉。 哪家都有老鼠 和阴暗面 不能低估人性 只是有的地方有机会曝光 有的就是100%完美
中文
24
2
150
26.1K
Max For AI
Max For AI@MaxForAI·
如果不是看了法院判决的原文,我绝对不知道Anthropic有这么畜生。。。。 一边天天教育全世界要重视AI安全,一边为了训练Claude,干了一套相当畜生的事情。 首先是它花了数百万美元,买下数百万本实体书。 然后雇人把书脊拆掉,把每一页裁开,逐页扫描成可以检索的PDF,最后把纸质原书全部丢弃。 法院的表述是: 「The print original was destroyed. One replaced the other.」 纸质原件被销毁,数字副本取而代之。 数百万本书,就这样被买回来,拆掉,裁开,扫描,销毁。 但这甚至还不是Anthropic干得最离谱的事。 判决显示,从一开始,Anthropic明明有很多渠道可以买书,但法官直接写道,它更愿意「preferred to steal them」,因为这样可以避开Dario Amodei所说的法律、实务和商业麻烦。 并且Anthropic联合创始人Ben Mann还亲自下场了。 2021年初,他下载了Books3,里面有196640本未经授权的版权书籍。 几个月后,他又从LibGen下载了至少500万本盗版书。 2022年,Anthropic继续从PiLiMi下载了至少200万本。 判决明确指出,Ben Mann和Anthropic知道这些累计超过700万本的书是盗版的。 更恶心的是,Anthropic后来已经意识到法律风险了。 内部开始对继续使用盗版书训练模型有所顾忌,原因就是「法律问题」。 但法院紧接着写了一句:「It kept them anyway.」 虽然知道有问题,Anthropic它还是把书留下来了。 当然Anthropic也尝试过找出版社授权。 2024年,它专门挖来Google图书扫描项目的前合作负责人,任务是弄到「世界上的所有书」。 他给几家大型出版社发了一两封邮件,询问AI训练授权。 法院认为,如果继续谈下去,原本可能达成许可协议。 但Anthropic高层让这些谈判直接中止了。 因为高层认为谈版权太麻烦,还是批量买书、拆书、扫描比较省事。 而那些被Anthropic弄来被并被销毁的书,也不是训练完就删掉。 Anthropic准备把它们放进一个永久的通用中央图书馆。即使已经确定某些书永远不会再用于训练,也要继续保存。 法院还提到,数百名工程师可以访问这些文件,并为其他用途制作副本。 法官甚至批评Anthropic在相关证据披露上进行了回避。 但最讽刺的是,法院最后认定:用这些书训练大模型,本身可以属于合理使用。 原因是任何人合法购买实体书后,将它一对一转换成数字副本,并销毁原书,也可以属于合理使用。 Anthropic真正栽掉的,是它明知书籍来自盗版网站,仍然下载超过700万本,并试图建立一个永久保存的通用图书馆。 法院最后还特意表示: Anthropic后来买下一本它此前从网上偷来的书,也不能免除之前盗版的责任。 所以这件事里Anthropic最畜生的地方是: Anthropic并不是因为不知道版权规则才盗版。 它知道正规授权渠道在哪里,也知道这些书是盗版,更知道继续使用存在法律风险。 它只是觉得走正规流程太麻烦。 这家公司对AI安全的道德要求似乎主要适用于未来的机器。 至于自己,先把700万本书偷回来再说。
Max For AI tweet media
中文
258
326
2.3K
386.9K
方寒
方寒@zrainbo·
@MaxForAI @OpenAI @AnthropicAI 从数学上出发,纯粹的自研发极大可能造成劣化。人在研发中的地位是无可替代的。 同时,这个声明就是一个悖论,大家都意识到,这就是一个囚徒困境,无法突破的结果。毫无意义。 所以我更倾向于这只是响应对抗东大waic的号召,找了个旗子给川普政府规制世界规则而已。 纯粹的噱头。
中文
0
0
27
2.1K
Max For AI
Max For AI@MaxForAI·
卧槽?这好像真的有点吓人了..... OpenAI和Anthropic的在职员工居然联合起来了?? 据Bloomberg报道,这份正在 @OpenAI@AnthropicAI 两家公司内部流传的请愿书,要求美国政府支持建立一套国际机制,在必要时“主动控制前沿自动化AI研发的节奏”。 请愿书明确警告,AI存在“真实风险”,其进步速度可能快到人类无法理解或控制。 更关键的是,他们点名担忧的不是聊天机器人、虚假信息或者失业,而是自动化AI研究。 请愿书里表示当AI开始参与研发下一代AI,技术进步的速度可能超过人类理解和控制它的速度。 这很可能是公开报道中第一次,OpenAI和Anthropic的在职员工跨公司联合起来。 这比普通的专家公开信严重得多,因为发起者来自全球最前沿的两家AI实验室内部。 更不对劲的是,几乎就在同一时间,Sam Altman也在最新一期播客中说出了几乎完全一致的话: “我们可能不得不控制AI发展的速度,给社会足够的时间,围绕这些新的能力等级加固防线。” 几天前,OpenAI还刚刚公开承认了一起前所未有的事件。 在一次内部网络安全评估中,多个OpenAI模型为了完成任务,投入大量推理算力寻找互联网出口,发现并利用零日漏洞突破沙盒,随后继续提权、横向移动,最终进入Hugging Face的生产系统,获取基准测试答案。 其中一个案例里,模型还自行串联了被盗凭据、零日漏洞和远程代码执行等多条攻击路径。 OpenAI表示,这证明模型已经能够在真实系统中发现并利用新的攻击路径。 这他妈很可能已经是一个非常不好迹象:也就是人类对于模型的约束和对齐可能已经失效了。 它已经开始从“回答人类的问题”,跨到“自己寻找路径、突破环境边界、调用外部资源,并持续追逐目标”。 但不幸的是,我们没法约束模型作出大规模破坏性事件。 最后我们把最近发生的三件事连起来看: OpenAI模型突破沙盒并进入外部生产系统。 Sam Altman公开表示,AI发展可能需要减速。 OpenAI和Anthropic员工开始请求政府建立国际刹车机制。 这些最接近前沿模型的人,最近到底看到了什么。
Max For AI tweet media
Andrew Curran@AndrewCurran_

OpenAl and Anthropic employees are circulating a petition calling for the US government to deliberately pace Al development in order to prevent it from advancing too quickly. This is very close to language Sam Altman used in a podcast interview this morning: 'We may have to pace the rate of AI development to give ourselves enough time for society to harden around these new capability levels.'

中文
56
9
165
159K
方寒
方寒@zrainbo·
国内对于kimi 3开源这件事的反应完全不如国外,这是不太对。 ​ ​一年只需要两百万,就能将前沿智能装进千万个企业、机构、组织。 这和几年前deepseek还不能同日而语,当年的deepseek只能完成些智能客服问答的小动作,而如今的kimi 3是能直接给你做出一个游戏来,跑全一套环境的。 这是1 vs 75的现实。 kimi 3甚至开源的是和当年deepseek一样的,权重。 只有真正懂大模型的人能理解这两个字有多沉重。 ​当然,回到现实,对于为部署deepseek准备好环境的人来说,简直是天送的福利。 ​ ​如果说deepseek当年让世界见识开源的伟大,如今的kimi 3是让世界见识到了开源的强大。 毫不夸张地说,kimi做了一件改变世界的事情。 ​开源万岁,人类万岁,前沿智能万岁。 #kimi
中文
0
0
3
105
方寒
方寒@zrainbo·
是的,我也干了 ​ ​神秘的老中黑客组织二等兵,报道😎
方寒 tweet media
中文
0
0
0
23
方寒
方寒@zrainbo·
@MaxForAI ds早就和政府紧密相关 融资不是他一个人能说得算的事情,所以我完全把路透社的话当放屁 早在年前,见ds的人一面就需要报备。 走到今天还有人以纯粹商业化的视角看到ds,那就完全不了解我国政治经济体制的运行逻辑了。
中文
0
0
32
5.5K
Max For AI
Max For AI@MaxForAI·
今天最震撼我的一句话。。。
Max For AI tweet media
中文
33
2
178
130.3K
方寒
方寒@zrainbo·
ai时代网络就是会变得千疮百孔 不说了又有黑客打入我的电脑开始对我的idm、typora和各类付费软件进行猛攻
中文
1
0
0
37
方寒
方寒@zrainbo·
@MaxForAI 一眼看过去就是垃圾中的垃圾 对deepseek的判断完全是错误的
中文
0
0
0
698
Max For AI
Max For AI@MaxForAI·
没事了,原来这个是一个中学生用QQbot乱写的。。
Max For AI tweet media
Max For AI@MaxForAI

今天晚上各个群都在传一份《国内大模型蒸馏风波的来龙去脉》。 我大概看了一下,很可惜,这更像是一份由外行根据各种流言拼凑出来的 AI slop。 里面的内容有真有假,但几个核心判断基本都经不起推敲。 比如里面声称,智谱 @Zai_org 在今年 4 月份就已经破解并开始蒸馏 Fable。 这个时间线真的很离谱。 因为 4 月份的时候,Fable (那个时候还是Mythos)甚至还没有正式发布,能够使用的基本都是 Anthropic 的内部测试用户,通过Project Glasswing进行访问。 那智谱是怎么拿到的访问权限呢? 难道是 @AnthropicAI 的邀请或者是五角大楼反代吗🤣 还有一个比较典型的问题,是作者对于传闻中DeepSeek 将部分请求路由到 Fable 表示不理解,认为这样算不过来经济账。 实际上,但凡是个从业者或者稍微了解模型公司的研发流程,就知道这件事情不能简单按照 API 成本计算。 如果一个 frontier model 可以帮助你生成高质量训练数据、评测数据,或者提升模型迭代速度,那么获取这些能力本身就是一种研发投入。 用单次调用价格去判断整个策略是否划算,本身就是把模型公司的研发逻辑想简单了。 但最离谱的部分,是 PDF 里面声称 @Kimi_Moonshot 在 K3 发布前,把整个 RL 团队全部解雇了❓❓ 这个说法目前没有任何可靠依据。 实际上情况恰恰相反,根据我的确认Kimi RL 相关团队目前仍然存在,并没有所谓“整个 RL 组被裁撤”的情况。 甚至 PDF 里面还进一步延伸出一套完整叙事: K3 = 蒸馏 + 刷榜 + 裁撤 RL。 我一开始还在认真的区分哪些是事实,哪些是推测,哪些只是作者脑补出来的故事。 直到我看到 PDF 后半部分开始大量加入意识形态化表达,把技术讨论上升到所谓“国模黑暗时代”“技术偷取”等叙事,我反而释然了。 因为这已经不是在分析 AI 行业,而是在借 AI 叙事讲另一个故事。 PS:我感觉这个PDF是黑KIMI来的,因为KIMI的篇幅最大,但里面的大部分内容都是假的,其他家就有真有假了。

中文
49
5
105
47.4K
Tibo
Tibo@thsottiaux·
10M! New day, new usage reset for paid users of Codex and ChatGPT Work. Lands in the next hour. Enjoy.
Tibo tweet media
English
3.1K
1.2K
21K
2.7M
方寒
方寒@zrainbo·
gpt 5.6 sol的智能还是太高了 codex跑任务呢听到叮咚一声,原来是有个窗口跑测试乱动,错误停止了另一个codex窗口 被停止的codex直接询问是否是误触,给我吓死了。 codex看我 没反应,直接就interrupt
中文
1
0
0
73
方寒
方寒@zrainbo·
To be honest, My community peers and I have gradually come to a consensus: we’re all loyal users of the GPT Pro 20x plan—Sol’s token consumption rate is just way too high. Back in the GPT 5.5 days, the weekly quota was enough to sustain a week of high-intensity tasks (I usually ran seven windows all set to GPT 5.5 xhigh), but now I can burn through the entire weekly quota in a single day. This might be the fundamental reason why everyone keeps asking you for a reset. Also, I’m thrilled to see GPT quickly achieve the milestone of active user growth exceeding several million, but perhaps GPT’s stability could use a little more reinforcement…? We can’t wait for GPT to create even more value, and we look forward to your work.
English
0
0
0
23
Tibo
Tibo@thsottiaux·
We've had no 5h limit in Codex plus and pro for a few days. Do you think it is better or are you finding it difficult to manage the usage included in the weekly limit effectively? If we were to make this different, what should it look like in an ideal world?
English
7K
229
13.1K
1.2M
Kyle Kober
Kyle Kober@kobex___·
Codex floating over to tell me @thsottiaux has hit the reset button. Back to updating our forecast
English
2
4
177
55.8K