小互

10.7K posts

小互 banner
小互

小互

@xiaohu

带你了解全球最前沿科技、AI动态... AI 精华,讲到你懂:https://t.co/nvuDIvoNg1

Mars Katılım Mart 2024
1.7K Takip Edilen112.6K Takipçiler
小互
小互@xiaohu·
导出效果也不错
小互 tweet media
中文
0
0
0
310
小互
小互@xiaohu·
喜欢造神 不尊重客观规律和科学 总幻想着弯道超车 一次性搞个大的 然而Deepseek的核心价值观全是和上面的背道而驰的 Deepseek之所以取得之前的成就,正因为他们是脚踏实地的重客观规律和科学取得的 但是一些人却把幻想弯道超车不切实际的幻想强加在他们身上 当最终没有达到他们预期的时候 这些人肯定会上去再踩几脚
中文
5
0
15
1.8K
小互
小互@xiaohu·
@SI_Xiaolong_101 因为视觉效果最能吸引人和方便展示 别的也不好给你展示
中文
1
0
2
1.4K
司晓龙 | 𝚂𝚒-𝚇𝚒𝚊𝚘 𝚕𝚘𝚘𝚗𝚐 (𝙳𝚊𝚒𝚕𝚢)
国内现在的各种AI博主对模型代码能力的评测几乎都是在写前端,或者拿tree.js写网页游戏的。够炫酷就是牛逼,不够炫酷就是垃圾。 至于模型在其他业务代码、架构合理性上的表现,无人在意,但后者才是生产中最重要的。
中文
26
2
40
19.5K
小互
小互@xiaohu·
Databricks 实测:在数百万行复杂代码库中,到底哪种模型和 Harness 框架性价比最高、用起来最顺手best.xiaohu.ai/article/databr…
中文
51
5
44
13.4K
小互
小互@xiaohu·
Anthropic 公开代码迁移六步法:Bun 百万行两周从 Zig 搬到 Rust Anthropic 官方账号 ClaudeDevs 发的一篇实操文,讲他们内部这一个月怎么用 Claude Code 做代码迁移,把一个跑在生产环境的代码库,整体搬到另一种语言上。best.xiaohu.ai/article/anthro…
中文
62
14
129
24.7K
知止
知止@jiji_do9802·
@xiaohu 没开发出来,就是都用过一遍。我还是会员呢,用起来就是不爽,幻觉一大堆,找的网页链接基本都错的。
中文
1
0
3
569
小互
小互@xiaohu·
Google 似乎在走另外一条路 就是对抗开源模型 因为实际上现在模型的能力已经非常强了,在大部分企业生产过程中已经足够,唯一阻碍的可能是价格和速度 所以Google 最近一直在提升Gemini的速度和降低价格 因为这才是企业所关心的问题,而开源模型在很大程度上受到企业青睐,很大因素是价格... Google 很可能是观察和实践中遇到到了这一方面的强大需求,所以在往这方面努力。 就像之前 Anthropic 专注代码,Google 可能选择专注企业实际生产,走差异化道路...
中文
77
4
104
41.6K
小互
小互@xiaohu·
@jiji_do9802 我洗什么,只是正常观点想法输出,你开发出什么牛逼的东西了我看看
中文
2
0
12
2.6K
知止
知止@jiji_do9802·
@xiaohu 没必要强行洗。gemini 是什么垃圾还需要强调吗?
中文
2
0
15
2.9K
小互
小互@xiaohu·
有点牛P啊 中国模型继承了中国学生的数学能力😅 第67届国际数学奥林匹克竞赛(IMO)公布官方评卷结果 小红书大模型 dots-note-3.0 以 42 分满分的成绩获得“满分金牌”认证,超过本届金牌线 13 分。 成为 - 中国首个在 IMO 中斩获金牌的大模型。 - 全球首个在 IMO 官方评卷中斩获满分的大模型 在此之前,仅有 Gemini Deep Think 在 2025 年 IMO 中取得过官方认可的金牌表现(得分 35 分,完成 6 题中的 5 题) 本届 IMO 于 7 月 15 日至 16 日在上海举行 模型参赛方在学生考完后获取题目并在规定时间内提交,全程严禁任何形式的人工干预(包括提示思路、修正答案、调整逻辑或筛选结果等) dots-note-3.0 基于智能体化(Agentic)推理系统独立完成全部证明。而且采用了一种叫加强归纳法完成证明,提供了全新的思路... 两位 IMO 金牌得主评价该解法“很有新意,也很优雅”。 除顶尖的逻辑推理能力外,该模型在多模态领域亦有优秀表现。 据称:dots3 模型将于近期对外开源。
小互 tweet media
Chao Qiao@ChaoQiao42

1/6 42 has been in my handle for years - picked it on a whim. Never thought the dots model would one day achieve exactly that: 42/42 at IMO 2026. Officially certified full marks. Gold-medal level. Perfecto! Still feels surreal. A few thoughts on why this matters - and curious what others think. studio-dots-ai.github.io/dots_imo_2026/…

中文
74
5
63
34.6K
数与形
数与形@shyxng1067958·
@xiaohu grok 4.5算是智能、速度、成本最均衡的模型,gemini 3.6flash还比不上grok。
中文
1
0
13
3.3K
小互
小互@xiaohu·
OpenAI 和 Hugging Face 会不会是在唱双簧 😅
中文
32
0
61
22.4K
小互
小互@xiaohu·
📢好消息: Claude Code 桌面版现在支持 iOS 模拟器 直接和苹果官方模拟器底座对接 不抢占屏幕:模拟器画面直接内嵌在 Claude 软件旁边,AI 在后台自己操作,完全不影响你用电脑做别的事。 支持人机协作:AI 跑测试的同时,你随时可以自己去上手点按、滑屏或按快捷键,操作是实时同步的 启动方式:直接说“把 App 打包并在模拟器里运行,检查一下注册流程”。系统就会自动打开右侧的 iOS 模拟器面板。 多窗口支持:每个独立会话(Session)拥有独立的模拟器,互不打扰;单个会话最多可同时开 4 个模拟器。 手势与快捷键:用鼠标拖拽实现点击/滑动,支持快捷键(如 Cmd+Shift+H 回主界面,Cmd+R 录屏,Cmd+S 截图保存到桌面)。 画质调节:如果电脑卡顿,可以降低画面帧率(FPS)、分辨率或切换编码格式。
小互 tweet media
中文
11
5
57
10.2K
小互
小互@xiaohu·
通义发布 Qwen-Image-3.0 一条三千字指令,一次画出九张信息图和一整版报纸 12 国语言原生渲染 100+ 艺术风格 网页游戏直播界面仿真 联网取最新世界知识 指令上限提到 4.5k token,一整版复杂内容能一次交代完 best.xiaohu.ai/article/qwen-i…
中文
11
2
40
9.2K
小互
小互@xiaohu·
卧槽 原来前几天攻击Hugging Face的是OpenAI 的一个内部模型 OpenAI 周二承认,在一次内部网络安全测试出现意外时,其一个内部测试模型,逃离了其隔离的测试环境 突破了Hugging Face 的内部系统 Hugging Face 最初将此次入侵归因于一个“外部 AI 智能体”,和它斗争了好久... OpenAI 把它称作一次前所未有的网络安全事件,涉及最先进的网络攻击能力。 Hugging Face 初步披露中表示,攻击表现为“大量短生命周期的沙盒环境同时发起成千上万次独立操作,并在公共服务上部署了自我迁移的命令与控制机制”。 详细内容:best.xiaohu.ai/article/openai…
小互@xiaohu

Hugging Face 内网被 AI 入侵 回头查案时自己的Agent被付费模型当成了攻击者挡在外面 入侵横跨一个周末、留下 17000 多条动作日志,最后靠自建环境里的开源模型GLM 5.2 才解决…best.xiaohu.ai/article/hf-sec…

中文
15
5
30
22.1K
小互
小互@xiaohu·
Google一次发三款 Gemini 主力款 3.6 Flash 3.5 系列里最快最省的 3.5 Flash-Lite 专门找漏洞的 3.5 Flash Cyber best.xiaohu.ai/article/gemini…
中文
0
0
1
2.6K
小互
小互@xiaohu·
Google 一口气发布三款模型 但是没有 Gemini 3.5 Pro 三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite 和专攻网络安全的 3.5 Flash Cyber 版本号现在很诡异... Gemini 3.6 Flash:最大亮点(极致省 Token):比上一代 3.5 Flash 节省了约 17% 的输出 Token(部分编程场景甚至少用 65% 的 Token) 价格:输入 $1.50 / 百万 Token,输出 $7.50 / 百万 Token。 能力提升: 代码与科研:写代码准确度更高,减少了无效修改和死循环 电脑操作能力(Computer Use):提升至 83% 的成功率,且直接内置为 Gemini API 和企业版的客户端工具 更安全:加强了防越狱和防滥用(如生物、化学、网络攻击等风险)的安全机制,同时减少了正常使用时的误拒
中文
19
8
94
60.9K
小互
小互@xiaohu·
Claude Cowork 也发发布了一个类似Codex的看屏幕学习你操作的新功能: 教 会Claude 一项技能 你可以把你经常需要重复的操作,在你在执行任务时录制屏幕,边做边讲解 Claude 会学习你的操作,并将其转化为一项它可以再次运行的技能 下次只需要告诉他运行这个技能即可,它就能模仿你... 你可以在 Claude 桌面应用的 + 菜单下找到它: “Record a skill 录制技能”
小互 tweet media
中文
49
4
26
6.7K
小互
小互@xiaohu·
Gemini 3.5 Flash Cyber:网络安全“修补匠” 定位:专门针对网络安全漏洞检测与修复进行微调的特定模型。 应用场景:搭载在 Google 的安全 Agent 平台 CodeMender 中,多个 Cyber 模型协作,能在极低成本下自动找漏洞、修 Bug。
小互 tweet media
中文
0
0
8
5.7K
小互
小互@xiaohu·
Gemini 3.5 Flash-Lite:极致性价比与速度 定位:主打极速、高吞吐量,专门用来支撑大规模、高并发的 Agent 任务(如大规模商品数据提取、批量单据翻译与摘要)。 速度极快:输出速度高达 350 Token/秒 价格:输入 $0.30 输出 $2.50
小互 tweet media小互 tweet media
中文
1
0
3
6.4K