Fabianl1

38 posts

Fabianl1

Fabianl1

@FaaabianL1

Katılım Temmuz 2023
55 Takip Edilen1 Takipçiler
ppilu
ppilu@ligelang886·
@gkxspace 隔壁的 ZCODE 是使用 k3 最好的体验
中文
1
0
1
907
余温
余温@gkxspace·
玩了几天 Kimi K3,模型很好,但桌面端一言难尽,导致我对 K3 的欲望也变低了 而且他们的插件市场也挺别致,天眼查、同花顺,各种付费数据库居然都能直接调用,也算是有使用场景了😅😅😅
余温 tweet media
中文
79
1
61
77.4K
WeZZard
WeZZard@realWeZZard·
将自己的工作流从 GLM 5.2 换成 Kimi K3 之后发现 Kimi K3 的问题其实还是不少的
中文
10
0
60
28K
Fabianl1
Fabianl1@FaaabianL1·
@xmgplus 单看榜单没用,得结合各家的agent工具评测。最明显的例子就是hy3,网页端和workbuddy里能超出20-30%。
中文
1
0
0
493
小码哥
小码哥@xmgplus·
DeepSWE 榜单出炉! Claude Opus 5 位居第一,看起来编程方面 Opus 5 是无敌的存在啊?为什么很多人还说不如 Opus 4.8? 让我意外的是,美国豆包刚发布的 gemini-3.6-flash 居然超过了 glm-5.2…… 大模型的天日新月异啊。。 还要什么自行车? 补充下: DeepSWE 是测试 AI 编程能力的榜单,主要评估 AI 能否理解大型项目、修复 Bug、完成真实开发任务,被认为是衡量 AI 程序员能力的重要参考。 这个榜单还是值得认可的。
小码哥 tweet media
中文
39
0
17
12.6K
爱吃折耳根的Ace
爱吃折耳根的Ace@_zheergen·
@_FORAB OpenAI:欢迎大家支持开源。 OpenAI 内心:等等,好像哪里不对。
中文
1
0
17
4.8K
AB Kuai.Dong
AB Kuai.Dong@_FORAB·
就在谷歌代表,昨晚公开支持 AI 开源大模型后,前几天大家一起撰写的联名公开信,又多了一位成员,已从最初的 25 位支持者,扩大到了 33 家企业。 现在就差一家,我们熟悉的美国 AI 公司,还没有出现在联名信上。
AB Kuai.Dong tweet media
Sundar Pichai@sundarpichai

Very happy to support this on behalf of Google. We have long benefited from open source, are big contributors to open source and in fact have consistently made open weights models with Gemma available from @GoogleDeepMind @demishassabis . Onwards!

中文
196
13
227
130.4K
Fabianl1
Fabianl1@FaaabianL1·
@SnozakiSakura 居然没有指导厨说rebase是不符合生产环境的
中文
1
0
12
6.1K
草莓泡芙🍀
草莓泡芙🍀@SnozakiSakura·
程序员的孩子是这样来的:
草莓泡芙🍀 tweet media
中文
119
39
815
133.3K
Fabianl1
Fabianl1@FaaabianL1·
@MaxForAI 这时候就得推荐zcode了,唯一一个功能性和codex差不多的。还能自由接入第三方api
中文
0
0
3
2.8K
Max For AI
Max For AI@MaxForAI·
现在的黑客松现状🤣
Max For AI tweet media
中文
150
20
683
227.8K
Max For AI
Max For AI@MaxForAI·
哈,现在全硅谷的AI公司似乎就只有一家没有签署这个协议了🤣 @AnthropicAI 你还活着吗?
Max For AI tweet media
Jensen Huang@JensenHuang

For my first post, I’m sharing a letter @NVIDIA signed on why open models matter. AI will transform every industry, power every company, and be built by every country. Open models strengthen safety and cybersecurity, accelerate innovation and diffusion, and enable sovereignty. The world needs both frontier closed models and frontier open models. images.nvidia.com/pdf/Open-Weigh…

中文
94
34
738
231.3K
Max For AI
Max For AI@MaxForAI·
卧槽????tmd这次 @claudeai 把牙膏挤爆了🤯!!! Anthropic刚刚发布Claude Opus 5。 以拉爆Claude Fable 5的前沿能力,价格直接来到Fable的一半。 Opus 5的API价格是每百万Token输入5美元、输出25美元,和Opus 4.8完全相同。 Fable 5则是10美元和50美元。 Anthropic直接把它定义为一款可以每天使用的高端模型,并将其设为Claude Max默认模型、Claude Pro最强模型。 跑分方面在CursorBench 3.2中,Opus 5开启最高Effort后,成绩只比Fable 5峰值低0.5%,但单任务成本只有后者一半。 在Frontier-Bench上,它以更低的单任务成本,将Opus 4.8的成绩提升到两倍以上。 Anthropic称,Opus 5目前已经在Frontier-Bench和GDPval-AA等编程、知识工作评测中达到SOTA。 Agent和电脑操作的提升更夸张,同时ARC-AGI 3成绩是第二名的3倍。。。 Zapier AutomationBench中,同等成本下通过率约为第二名的1.5倍,即使使用最低Effort,完成的任务也比其他模型更多。 OSWorld 2.0中,Opus 5只花Fable 5略高于三分之一的成本,就超过了Fable 5的最好成绩。 但这次最值得关注的,可能还不是跑分。 Anthropic反复强调Opus 5更擅长验证自己的工作,并持续迭代到任务真正完成。 一个测试里,模型拿不到机械零件原图,只能访问原始像素。Opus 5自己写了一套计算机视觉管线,提取几何结构,最后在FreeCAD中重建出了完整零件。 另一个任务中,它发现没有实时数据流可以验证代码,于是顺手给自己搭了一套测试框架。 这是一种很关键的Agent能力:发现当前环境缺少完成任务所需的工具,然后自己创造工具。 Opus 5同时加入了Fast Mode,速度大约是默认模式的2.5倍,价格是基础版本的两倍。 API模型名为claude-opus-5,目前已经登陆Claude、Claude Code、Claude Cowork和Claude Platform。 Anthropic现在的模型分层也越来越清楚: Sonnet负责规模和成本; Opus负责绝大部分高难度日常工作; Fable和Mythos继续探索能力与高风险领域的最前沿。 Opus 5真正的场景是大量编程、研究、数据分析和Agent任务,它正在让用户很难继续为Fable 5支付两倍价格。 前沿模型开始主动下放能力、压低价格。 模型战争接下来的重点,会从谁的能力上限最高,逐渐变成谁能用更低成本,把任务稳定地做完。 牛逼,看来前段时间 @OpenAI 和中国开源模型们( @Kimi_Moonshot@Zai_org )真的给A/太多压力了! 继续加油啊家人们!
Max For AI tweet mediaMax For AI tweet mediaMax For AI tweet media
Claude@claudeai

Introducing Claude Opus 5. It's a thoughtful and proactive model that comes close to the frontier intelligence of Fable 5 at half the price.

中文
41
16
237
113.7K
Neanderthal
Neanderthal@brainfx994·
@MaxForAI @deepseek_ai 梁文峰的量化如果再不收敛点,就会影响他的福报。虽然是靠科技挣钱,但大部分散户这种穷人的钱还是不要涸泽而渔。
中文
5
0
2
3.8K
Max For AI
Max For AI@MaxForAI·
‼️突发:DeepSeek @deepseek_ai 创始人梁文锋在一场据称长达四小时的投资者会议上的发言内容曝光。 过去一个月里,这场对话的片段一直在中国 AI 圈和投资人圈内流传。 最引人注目的是梁文锋反复强调的“不”字。 不搞“天才”神话。 不追求利润最大化。 不搞闭源。 不盲目争夺用户。 不做视频生成、3D、世界模型,也不做下一个“超级应用”。 他的解释很简单: “克制是一种策略。放弃一些东西,是为了提高实现 AGI(通用人工智能)的概率。” 以下是会议中的核心观点: - DeepSeek只有一条主线:AGI 梁文锋认为,现在不是追求产品收益最大化的时候。 核心是追逐人工智能最高峰,即AGI。 他的AGI路线图非常清晰。 去年的台阶是思维链,今年的台阶是Agent。 Agent之后,是持续学习。 持续学习之后,是AI自我迭代。 然后,AI开始帮助人类研发更加先进的AI系统。 最后才是具身智能。 梁文锋将这个过程称为“渐进的奇点”。 根据这个思考,DeepSeek目前正在主动放弃许多热门方向。 “很多东西不在我们的主线上,包括3D和视频生成。” 他也质疑了世界模型的重要性: “世界模型跟智能的上限没有太大关系。” 多模态对产品和C端用户很重要,但它仍然只是一个组件。 “它不是主线,也不是智能本身。” - 下一代模型必须拥有持续学习能力 人类可以在工作中不断学习。 但AI每次开始一个新任务,都需要人类重新提供所有相关上下文。 “这几乎是不可能的。” 这也是梁文锋认为,当前AI还无法真正替代员工的原因。 “下一代模型必须具备持续学习能力,否则就不能叫下一代模型。” 同时他表示智能的终点可能是具身。 他的逻辑很简单: 人类真正需要的,并不是另一个计算机界面。 人类需要的是劳动力。 - DeepSeek不追求利润最大化 梁文锋表示,DeepSeek不会以收入最大化为目标进行定价。 “我们只赚一个合理的利润。” DeepSeek V4最初担心需求过多,所以价格定得比较高。 后来,DeepSeek把价格降到了四分之一。 “公司群里很多人都在欢呼。” 因为做出这个模型的目的,就是让更多人能够充分使用它。 备受关注的低成本不仅是一种商业策略。 “低成本是架构带来的结果。” 更低的成本可以让AI变得更加普惠。 但还有一个更深层的原因: 单位计算成本越低,DeepSeek就越能够在有限算力下训练更大的模型。 “大公司可以通过增加资源解决问题,我们优先考虑成本效率。” 有意思的是梁文锋并不觉得API生意有多么好。 “我不觉得卖API这个事情有那么大的吸引力。” DeepSeek只需要一个很小的团队维护服务。 几乎没有客服,也不需要销售,用户自己就会来。 “我们一直在商业化,只是不以商业化为目标。” 他认为,DeepSeek彻底转向商业化的时间点仍然非常遥远。 - 开源是DeepSeek的战略甜蜜点 对于员工来说,开源能够带来成就感和组织凝聚力。 对于社会来说,它能够帮助研究者、企业和普通用户。 “开源是一种让利。” 梁文锋认为,AI最终会成为一个规模极其庞大的产业,任何试图垄断它的人,最终都会失败。 “如果AI最终占到人类社会GDP的10%,任何想要独占这部分利益的人,都会被历史抛弃。” 梁文锋表示,DeepSeek不会开源一个较弱的版本,同时在内部保留更强的模型。 他不担心竞争对手部署DeepSeek模型。 小型创业公司可能缺乏资源和意愿,去进行前沿模型研究。 大型公司可能拥有资源,却存在组织上的困难。 梁文锋认为,DeepSeek刚好处于一个罕见的中间位置。 “这是属于我们这个规模公司的sweet point。” - 中美AI的差距主要在资源 梁文锋认为,中国并不真正缺乏人才。 DeepSeek希望改写中美AI竞争的叙事: 用几分之一的算力,把差距缩短到6个月,甚至3个月。 他作出这个判断的原因是他依然相信Scaling “我们相信Scaling,规模越大,效果肯定越好。” DeepSeek训练当前规模的模型,并不是因为这个规模已经足够。 而是因为现有算力只允许它做到这个规模。 梁文锋认为,前沿模型的竞争,最终会由三个因素决定: 成本、时间、用户体验。 “成本排在第一位。” 如果两家公司提供的模型质量相同,胜负将取决于谁能以更低的成本提供服务。 时间排在第二位。 早几个月和晚几个月,结果可能完全不同。 用户体验可以形成一定的黏性和壁垒,但梁文锋并不认为它是最本质的护城河。 - 团队稳定是梁文锋唯一不能让步的事情 他将其视为DeepSeek面临的最大风险之一。 原话是:“只有一个是没法退让的:必须保持团队的稳定性。” 而最近的一轮融资,已经大幅降低了这个风险。 “只要能够保持团队的稳定性,我一定能做成AGI。就这么简单。” 有趣的是DeepSeek的组织既是自上而下,也是自下而上 自上而下的部分,被梁文锋称为“做正事”。 但他不希望被安排的工作占用员工一半以上的时间。 另外一半时间应该保持自下而上。 研究人员可以自由探索他们认为重要的方向,不需要提前审批,也没有固定要求。 与很多AI团队不同,DeepSeek不鼓励过度加班。 “做研究需要一个相对松弛的环境。” 另一个原因是聚焦。 DeepSeek的许多产品并不完善,但公司会主动选择不去补齐所有问题。 梁文锋认为,这同样是一种克制。 有趣的是DeepSeek靠愿景驱动,而不是KPI “要实现某个KPI,不是我们的方式。” 梁文锋表示,DeepSeek的愿景甚至不一定被正式写下来。 它存在于公司的做事方式里,也存在于公司对待世界的态度里。 “愿景不是挂在墙上的标语,不是怎么说,而是怎么做。” 梁文锋最后的警告,可能也是最重要的一句话 “如果你的愿景是拿得更多,你就已经输了。你可能会面临更大的困难。这个世界就是这样。” DeepSeek不想赢下每一个AI市场。 它想保留实现AGI所需要的专注、成本优势、团队稳定性和组织自由。 而梁文锋似乎愿意放弃几乎所有其他东西,只为增加实现AGI的概率。 他在做真正很Cool的事情。
Max For AI tweet media
中文
219
636
4.1K
637.1K
Fabianl1
Fabianl1@FaaabianL1·
@LinearUncle kimi模型的层级太割裂。差一个在k3和k2.6之间的性价比模型,那个才是日常使用的主力。glm5.2刚好处在这个位置,d4p差一点。
中文
0
0
2
438
LinearUncle
LinearUncle@LinearUncle·
我吹 K3 的时候被人喷死,好多人不相信,现在不好买了。 吹完我就天天吐槽:K3 慢得要死,Kimi code没 GUI,体验也不好。 测完 qwen-3.8-preview,直接吐槽,阿里还是我干了 5 年的老东家。 天天调侃梁鸽,全是善意的,在我这儿,他是梁圣。 没有商单,真实评测。 嘴上很毒,该喷就喷; 但有一双发现美丽的眼睛。
中文
109
2
166
48.1K
Fabianl1
Fabianl1@FaaabianL1·
@jaraparilla @RnaudBertrand 那些私营公司的技术骨干都是从政府项目中出走的,有些甚至是被政府命令创建私营公司。
中文
1
0
2
303
Arnaud Bertrand
Arnaud Bertrand@RnaudBertrand·
There are two very interesting things to watch here - as I explained in my article on China's race against spaceX (open.substack.com/pub/arnaudbert…). First of all, the Long March 10B is a state program but China has several private companies that are also literally just weeks - even days - away from also nailing reusable rocket technology. For instance Landspace (蓝箭航天) is currently looking at launch opportunities for its Zhuque-3 reusable rocket in mid-July - so it's literally days away. You also have initiatives by about half a dozen other companies. So chances are this is but the first of an entire wave of Chinese rockets sticking their landings before the year is out. Much like Tesla is competing against dozens of Chinese EV companies, you're going to have SpaceX compete against a whole Chinese space ecosystem. The second thing is that, because it didn't have re-usable rocket technology (until now), Chinese companies have made enormous efforts in developing ultra-light and compact satellites that still made economic sense to launch with single-use rockets. For instance the company GalaxySpace (银河航天) developed the Lingxi (灵犀) satellite which folds down to just 30 centimeters (just slightly larger than a human hand) when stacked inside a rocket, uses flexible solar wings just 5 millimeters thick that roll up like paper, and is designed so that dozens can be packed tightly together on a rocket. As the saying goes, necessity is the mother of invention. Which means that, when the Chinese ecosystem finally cracks reusable rockets at scale - making launches 5 to 10 times cheaper - they're likely to have better unit economics than SpaceX, ironically largely **because** they were behind SpaceX on reusable rockets technology.
CNSPACE@CNSpaceflight

It's just the starting. More work ahead

English
27
204
950
64.7K
ゆきまさかずよし
ゆきまさかずよし@Kyukimasa·
中国の洋上ブースター回収、2024年に見かけたコンセプトがちゃんと動作してる。レール上を動くアンカーに張ったワイヤーが井桁状にロケットを保持するようになってる space.com/china-catch-re…
日本語
62
431
2.4K
554.1K
Fabianl1
Fabianl1@FaaabianL1·
@kaizhou89982409 @AYi_AInotes 我正在用glm做一个项目,它的测试例写的是最多的,难修的bug甚至会跟着进程全程读log
中文
0
0
0
58
victor
victor@kaizhou89982409·
@AYi_AInotes ayi使用过吗,保真吗。我对国内的大模型还是有一些小不信任
中文
1
0
0
2.6K
AYi
AYi@AYi_AInotes·
所有大模型排行榜都在骗你。 Cline团队用自己仓库的真实bug,在完全相同的环境下,测了GLM-5.2和Claude Opus 4.8。 结果非常打脸。 Opus速度快3倍,token消耗少一半,价格贵一倍。 它修完了bug,跑通了所有测试。 但生产构建直接崩了,留下了未被发现的类型错误。 GLM速度慢,token多67%,工具调用多2.3倍,价格便宜一半。 它不仅修好了bug,还主动清理了死代码。 最终构建干净通过,没有任何隐患。 这就是排行榜和真实世界的差距。 SWE-bench只能测出能不能修bug。 测不出修完之后会不会偷偷搞崩你的生产环境。 测试过了不等于代码能用。 这在大型项目里,是致命的。 本质不是谁更聪明,因为训练目标完全不一样。 GLM被强化学习训练出了验证文化。 多花的token,全用在了跑构建,查类型,清垃圾,防回归上。 它不是笨,是负责任。 Opus追求高效交差,GLM追求一次做对。 更值得注意的是,这是开源模型。 它不再只是闭源模型的廉价替代品。 它在长周期代码智能体的维度上,找到了自己的差异化优势。 智能体时代的性价比逻辑彻底变了。 以前比每千token多少钱。 现在比每次成功任务多少钱。 多花点token一次做对。 永远比快但要返工两次更划算。 更别说省下的人工排查成本。 给所有做智能体的人两个建议, 第一,别信排行榜,拿自己仓库的真实bug跑一遍。 第二,在你的系统提示里强制加一条,完成前必须跑构建验证,清理死代码。 未来比拼的从来不是谁的模型更聪明,而是看谁的模型更负责任。
AYi tweet media
Cline@cline

We've kept hearing how GLM-5.2 beats Opus 4.8, and are skeptical of benchmarks - so we tested them on a real bug from the Cline repo. While both models fixed the issue, GLM was the winner in terms of cost and code quality: - GLM used twice as many tokens (GLM 1.1m vs Opus 660K) but cost half as much (GLM $0.41 vs Opus $0.81) - Opus finished quicker - 1.6 min and 12 tool calls vs GLM 4.7 min and 28 tool calls - GLM cleaned up dead code and verified the build compiled before completing. Opus didn't - it left type errors that passed tests but broke the production build. Both runs used the same Cline harness prompting and tools, so it seems GLM is RL trained to spend more tokens verifying its work before completing. Impressive work by the @Zai_org team!

中文
78
22
218
116.2K
kerr
kerr@hepin1989·
@earayu 一个都没做完,挂了。只能聊天用吧
kerr tweet media
中文
1
0
1
4.3K
Fabianl1
Fabianl1@FaaabianL1·
@peakcooper 这没有任何意义,所有人都在蒸馏别人然后做后训练。甚至不一定是rl时候修改的权重,可能预训练用的数据就被污染了
中文
0
0
0
15
Cooper
Cooper@peakcooper·
GLM 5.2 is absolutely convinced that it is actually Claude, from Anthropic. When I tell it that it's GLM 5.2, it refuses to believe me, but is willing to check the local agent config to see what model is running. The realization:
Cooper tweet mediaCooper tweet media
English
319
242
4.6K
590K
冬岸
冬岸@dorgan_1224·
@XXY177 这就是为什么不能和平相处的原因,三种最典型的傻逼,还都是中国人
冬岸 tweet media
中文
76
3
443
47.5K
夏雪宜
夏雪宜@XXY177·
我是中国人,我希望看到中日韩真正携手,真心不希望中日韩三国继续内耗对立。 我们东亚三国人民,长相最相近、文化最相通、历史最交融、血缘最亲近。 从文字、哲学、饮食到节日习俗,我们共享着深厚的共同根脉,这在世界上都极为罕见。 东南亚、南亚乃至其他地区的朋友们固然各有特色,但我们三国之间的相似性和亲近感,是任何其他组合都难以比拟的。 我们本该成为最亲近的伙伴、相互成就的兄弟,而不是如今这样互相敌视、消耗内力。 这不是谁天生就该仇恨谁,而是外部力量长期挑拨培植意识形态分化我们的结果。我们不能再上当。 就拿这次韩国球迷在世界杯赛场遭遇歧视来说,中日韩三国民众几乎同时站出来声援——那一刻,我们分明看到的是同胞般的共情与默契。 如果我们能把这种共情变成日常,把“竞争”变成“共赢”,东亚的未来将不可限量。 同文同种,同气连枝。 放下旧怨,面向未来。 中日韩和,则东亚兴旺。
中文
2K
3.8K
21.2K
990K
☸️valzpants - vtuber ☸️
Indian memes are 99% just taking something horrid about your nation and applying it to another nation. Like actually wtf is a chinese caste system?
English
138
569
18.5K
579.1K