Hawkings

103 posts

Hawkings

Hawkings

@Hawkings395063

Hawkings Universe

UK Katılım Mayıs 2023
148 Takip Edilen42 Takipçiler
Hawkings
Hawkings@Hawkings395063·
@oalanicolas I frequently have the same issue in Claude Max20x: API Error: Connection closed mid-response. The response above may be incomplete.
English
1
0
0
69
Alan Nicolas
Alan Nicolas@oalanicolas·
Já cancelei 2 contas Claude 20x que eu tinha. Na última tentei usar agora o Fable e direto: API Error: Connection closed mid-response. The response above may be incomplete. Só aqui que toda hora da este erro?
Português
25
0
78
8.8K
sleep magician
sleep magician@sleepmagican·
@caiziboshi 韦神是个卵啊,一个国际奖没拿过,生活自理都成问题,话都讲不清楚,他就是被土共包装出来的,这样的人还少吗?雷锋是真的么?张海迪是真的么?
中文
11
1
193
17.6K
蔡子博士Chris
蔡子博士Chris@caiziboshi·
再让大家想象一下,如果韦神有了这样的导师,将达到什么样的境界?
蔡子博士Chris tweet media蔡子博士Chris tweet media蔡子博士Chris tweet media蔡子博士Chris tweet media
中文
209
92
945
314.6K
李老师不是你老师
李老师不是你老师@whyyoutouzhele·
7月23日,数学家丘成桐在接受红星新闻采访时表示,他曾多次邀请新晋菲尔兹奖得主王虹、邓煜回国任教,并称“两人回来对中国很重要”。 值得注意的是,在两人获奖后,中国舆论迅速强调他们的中国背景。 但截至目前,王虹、邓煜均未公开宣布接受国内教职。
李老师不是你老师 tweet media
中文
476
53
1.2K
471.3K
Lonely
Lonely@Lonely__MH·
Qwen-3.8 发布两天,实测体验来了。 第一时间订阅了 Token Plan,并在 Qwen Code 环境下进行了对比测试。 📊 实验对照: 第一次(弱提示):仅给出一句话模糊需求,生成效果较为平庸、模式化。 第二次(强结构):清晰梳理功能模块、交互逻辑、图片规则及页面结构。模型对长任务的指令遵循度表现极佳,最终成功交付了一个完整的可操作系统。 核心体验: 1. 推理与生成速度:即便面对超长 Prompt 和多页面构建,整个生成过程依然流畅,耗时17分钟,等待延迟相比 kimi k3(52分钟)、grok 4.5(26分钟) 小很多。 2. 长任务执行力:后加的交互细节与模块划分,基本都高水准地落到了最终成品中。 最后:还是那句话,模型能力固然重要,但想让模型稳定交付复杂任务,需求本身也得足够清楚。 把目标、模块和规则拆明白,Qwen 3.8 确实能把复杂任务推进得又快又完整。 越来越期待它接下来的开源评测了! 以上。 附上两次生成过程和最终效果👇
中文
75
5
72
51.2K
Max For AI
Max For AI@MaxForAI·
‼️提醒一下:Qwen3.8-Max-Preview 版本已在生产环境中悄然升级🫡 我用同一个Prompt连续进行测试,但效果完全不一样👀 第一天:一只无手鸬鹚。 第一天:一只静态且无聊的鸬鹚。 第三天:这个。 当大家还在评判第一个版本的效果时,模型已经升级了 迫不及待 @Alibaba_Qwen 发布Qwen3.8正式版🔥
中文
55
6
107
12.5K
lifcc
lifcc@mylifcc·
Qwen3.8-Max-Preview 自己蒸馏自己,13 小时已经干到 66%(近 33k traces),零拒绝,速度还很稳。 特别注意到 tool_use 领域明显落后(只有 37%),这很真实——长 prompt + 工具调用确实会拖慢生成效率,但也说明这个方向还有很大优化空间。 这种大规模自合成数据的玩法,现在越来越成为本地/开源大模型追赶闭源的常规操作了。50k 高质量 traces 蒸馏完,下一版能力提升应该会很明显。 持续关注中,期待完整数据集或者后续模型表现。🚀
mr-r0b0t@mr_r0b0t

Qwen3.8-Max-Preview distilling Qwen3.8-Max-Preview: hour 13 update 32,987/50,000 traces produced ZERO refusals 😛

中文
25
3
23
9.5K
Hawkings
Hawkings@Hawkings395063·
@xmgplus 我已经做了简单测试,相比3.7大有进步,但智能上相比sonnet5还有明显差距,还不要说opus
中文
2
0
3
547
小码哥
小码哥@xmgplus·
𝕏 上又开始出现大量鼓吹 Qwen 3.8-Max 的帖子,官方声称:“仅次于 Fable 5”,Kimi K3 这才坚持几天?是真的牛逼还是刷分的?
中文
68
0
53
37.1K
Hawkings
Hawkings@Hawkings395063·
Ran 3 flagship Chinese LLMs: Qwen3.8-Max-Preview, Qwen3.7-Max, DeepSeek-V4-Pro: same task battery (long-context, multi-tool, research-sim), same scoring rubric. Capability: nearly tied (92.9-96.4% strict pass rate). Cost per call: ~5x apart. Note: Qwen3.8-Max-Preview on promo pricing; likely to rise once that ends. Same job, up to 5x price difference by model choice.
Hawkings tweet mediaHawkings tweet media
English
1
0
1
339
Hawkings
Hawkings@Hawkings395063·
@xmgplus 我等国模额度恢复再进行一轮详细测评,到时候分享部分结论
中文
0
0
1
81
Hawkings
Hawkings@Hawkings395063·
@wangchangfu88 如果是实时调度四大天王+一群国模小弟呢
中文
0
0
1
33
王长富
王长富@wangchangfu88·
讲个事实: 如果你会翻墙 并且用过 AI 四大天王 那你在中国绝对算人中龙凤了
中文
483
16
643
363.1K
Google DeepMind
Google DeepMind@GoogleDeepMind·
We’re rolling out three new models to make AI agents faster, smarter, and cheaper at scale: 🔵 Gemini 3.6 Flash: It uses fewer tokens than 3.5 Flash to deliver higher quality work at the exact same cost. 🔵 Gemini 3.5 Flash-Lite: A fast, cost-effective option for everyday tasks like processing documents and agentic search. 🔵 Gemini 3.5 Flash Cyber: A cybersecurity model built to find and patch critical software vulnerabilities.
GIF
English
334
575
3.4K
2.1M
Hawkings
Hawkings@Hawkings395063·
@thsottiaux my codex statusline showed me: my codex bugget was just reset again😀
English
0
0
0
786
Tibo
Tibo@thsottiaux·
10M! New day, new usage reset for paid users of Codex and ChatGPT Work. Lands in the next hour. Enjoy.
Tibo tweet media
English
3.1K
1.2K
21.1K
2.6M
Hawkings
Hawkings@Hawkings395063·
my codex statusline showed me: my codex bugget was just reset again😀
English
0
0
0
25
Aiden_novak
Aiden_novak@logiclogic1223·
@__oQuery 个人觉得体感没有qwen最新的聪明, kimi因为线性注意力导致很莽, 不是很喜欢先思考后行动的模型
中文
1
0
2
3.7K
拾一.max-fast
拾一.max-fast@__oQuery·
Kimi K3 在我这里真的是一坨。Thinking 时间慢得要死,token 烧得老快,事情啥都干不好,分支管理也不行。那些说 K3 好用的人,我感觉全是收了钱的。我这几天用下来,感觉就是拉完了。
拾一.max-fast tweet media拾一.max-fast tweet media
中文
135
11
244
76.3K
Hawkings
Hawkings@Hawkings395063·
@__oQuery 感受一样 刷分考试在行 干活赚钱解决问题统统不在行
中文
0
0
2
1.2K
Bill The Investor
Bill The Investor@billtheinvestor·
吹到天上的国产模型真相: 1. GLM-5.2: 垃圾中的战斗机,几个小时解决不了的问题gtp5.5几分钟解决 2. MiniMax M3:婆娘的裹脚布,又臭又长,解决问题低效 3. Kimi K3:推理能力低下,token消耗速度快,编程能力充其量opus4.8水平,性价比低下 不贪便宜了,老老实实回到:Fable5+GPT5.6+Grok4.5
中文
255
25
288
149.1K
Hawkings
Hawkings@Hawkings395063·
@PandaTalk8 天天吹 天天扑街 对CN的套路已经习惯了。还是好好的打开CC和codex开始工作吧
中文
0
0
0
1K
Mr Panda
Mr Panda@PandaTalk8·
全推都在吹Kimi,非常不正常,又没有超过顶级的 Fable-5 和 Gpt-5.6 sol 。 时间线上拿Kimi 测试的也就是 让 Kimi 写一个three.js 的demo , 仅仅是看起来花里胡哨, 容易让一些不明所已的人感觉很强大。 但也就是Opus 水平, 我是Get 不到兴奋点。 刚刚豆包2.1 也达取Opus , 接下来国产第一梯队就是Opus 水平。
中文
153
2
170
107.9K
Hawkings
Hawkings@Hawkings395063·
@BoxMrChen 不管你花费瞎说,DS v4 pro还是挺好用的,花费上要比qwen3.7max贵(qwen目前打折)
中文
0
0
0
170
Box (mainnet arc)
Box (mainnet arc)@BoxMrChen·
美国AI集体被吓哭,瘫坐在椅子上,犹如看到了核弹爆炸 跑了一个小时,消耗了7毛钱,融合了两个游戏做出了一个完整并且不存在的游戏,并且融合效果极佳! DeepSeekV4Pro真实版能力极强,已经真做出了核弹爆炸的水平。目前还在灰度状态,预计20号周一发布。 有人测试的内容 做一个《我的世界》+《无人深空》 提示词只有4行 使用web技术,做一个《我的世界》+《无人深空》要求玩法与画风尽可能要融合且贴近原作可以去联网搜索。 UI和美术细节一定要漂亮。 所有基础的玩法要齐全,最好1:1还原原作的前期流程。 音效和交互要做好尤其是音效。 结果非常恐怖,不单单有游戏正常流程,并且融合的效果极佳,并且自动加入了任务系统,物品合成,无人深空风格的采集系统,还能操控飞船飞出太空。 对比的预览版游戏都无法打开。 生成内容链接:opncd.ai/share/vWCHfqpP 最重要的是这行内容:跑了一个小时,消耗了7毛钱 效果如视频 看完感觉天塌了 梁圣的恩情,这下真还不完了。
中文
45
22
267
82.4K