小互
10.7K posts

小互
@xiaohu
带你了解全球最前沿科技、AI动态... AI 精华,讲到你懂:https://t.co/nvuDIvoNg1
Mars Katılım Mart 2024
1.7K Takip Edilen112.6K Takipçiler

Databricks 实测:在数百万行复杂代码库中,到底哪种模型和 Harness 框架性价比最高、用起来最顺手best.xiaohu.ai/article/databr…
中文

Anthropic 公开代码迁移六步法:Bun 百万行两周从 Zig 搬到 Rust
Anthropic 官方账号 ClaudeDevs 发的一篇实操文,讲他们内部这一个月怎么用 Claude Code 做代码迁移,把一个跑在生产环境的代码库,整体搬到另一种语言上。best.xiaohu.ai/article/anthro…
中文

有点牛P啊
中国模型继承了中国学生的数学能力😅
第67届国际数学奥林匹克竞赛(IMO)公布官方评卷结果
小红书大模型 dots-note-3.0 以 42 分满分的成绩获得“满分金牌”认证,超过本届金牌线 13 分。
成为
- 中国首个在 IMO 中斩获金牌的大模型。
- 全球首个在 IMO 官方评卷中斩获满分的大模型
在此之前,仅有 Gemini Deep Think 在 2025 年 IMO 中取得过官方认可的金牌表现(得分 35 分,完成 6 题中的 5 题)
本届 IMO 于 7 月 15 日至 16 日在上海举行
模型参赛方在学生考完后获取题目并在规定时间内提交,全程严禁任何形式的人工干预(包括提示思路、修正答案、调整逻辑或筛选结果等)
dots-note-3.0 基于智能体化(Agentic)推理系统独立完成全部证明。而且采用了一种叫加强归纳法完成证明,提供了全新的思路...
两位 IMO 金牌得主评价该解法“很有新意,也很优雅”。
除顶尖的逻辑推理能力外,该模型在多模态领域亦有优秀表现。
据称:dots3 模型将于近期对外开源。

Chao Qiao@ChaoQiao42
1/6 42 has been in my handle for years - picked it on a whim. Never thought the dots model would one day achieve exactly that: 42/42 at IMO 2026. Officially certified full marks. Gold-medal level. Perfecto! Still feels surreal. A few thoughts on why this matters - and curious what others think. studio-dots-ai.github.io/dots_imo_2026/…
中文

📢好消息:
Claude Code 桌面版现在支持 iOS 模拟器
直接和苹果官方模拟器底座对接
不抢占屏幕:模拟器画面直接内嵌在 Claude 软件旁边,AI 在后台自己操作,完全不影响你用电脑做别的事。
支持人机协作:AI 跑测试的同时,你随时可以自己去上手点按、滑屏或按快捷键,操作是实时同步的
启动方式:直接说“把 App 打包并在模拟器里运行,检查一下注册流程”。系统就会自动打开右侧的 iOS 模拟器面板。
多窗口支持:每个独立会话(Session)拥有独立的模拟器,互不打扰;单个会话最多可同时开 4 个模拟器。
手势与快捷键:用鼠标拖拽实现点击/滑动,支持快捷键(如 Cmd+Shift+H 回主界面,Cmd+R 录屏,Cmd+S 截图保存到桌面)。
画质调节:如果电脑卡顿,可以降低画面帧率(FPS)、分辨率或切换编码格式。

中文

通义发布 Qwen-Image-3.0
一条三千字指令,一次画出九张信息图和一整版报纸
12 国语言原生渲染
100+ 艺术风格
网页游戏直播界面仿真
联网取最新世界知识
指令上限提到 4.5k token,一整版复杂内容能一次交代完
best.xiaohu.ai/article/qwen-i…
中文

前所未有的网络安全事件:OpenAI 内部测试模型逃出测试沙箱 攻破 Hugging Face 系统 best.xiaohu.ai/article/openai…
中文

卧槽
原来前几天攻击Hugging Face的是OpenAI 的一个内部模型
OpenAI 周二承认,在一次内部网络安全测试出现意外时,其一个内部测试模型,逃离了其隔离的测试环境
突破了Hugging Face 的内部系统
Hugging Face 最初将此次入侵归因于一个“外部 AI 智能体”,和它斗争了好久...
OpenAI 把它称作一次前所未有的网络安全事件,涉及最先进的网络攻击能力。
Hugging Face 初步披露中表示,攻击表现为“大量短生命周期的沙盒环境同时发起成千上万次独立操作,并在公共服务上部署了自我迁移的命令与控制机制”。
详细内容:best.xiaohu.ai/article/openai…
小互@xiaohu
Hugging Face 内网被 AI 入侵 回头查案时自己的Agent被付费模型当成了攻击者挡在外面 入侵横跨一个周末、留下 17000 多条动作日志,最后靠自建环境里的开源模型GLM 5.2 才解决…best.xiaohu.ai/article/hf-sec…
中文

Google一次发三款 Gemini
主力款 3.6 Flash
3.5 系列里最快最省的 3.5 Flash-Lite
专门找漏洞的 3.5 Flash Cyber
best.xiaohu.ai/article/gemini…
中文

Google 一口气发布三款模型
但是没有 Gemini 3.5 Pro
三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite 和专攻网络安全的 3.5 Flash Cyber
版本号现在很诡异...
Gemini 3.6 Flash:最大亮点(极致省 Token):比上一代 3.5 Flash 节省了约 17% 的输出 Token(部分编程场景甚至少用 65% 的 Token)
价格:输入 $1.50 / 百万 Token,输出 $7.50 / 百万 Token。
能力提升:
代码与科研:写代码准确度更高,减少了无效修改和死循环
电脑操作能力(Computer Use):提升至 83% 的成功率,且直接内置为 Gemini API 和企业版的客户端工具
更安全:加强了防越狱和防滥用(如生物、化学、网络攻击等风险)的安全机制,同时减少了正常使用时的误拒
中文







