Tor

59 posts

Tor

Tor

@Nlet123

Katılım Şubat 2022
118 Takip Edilen3 Takipçiler
Tor
Tor@Nlet123·
@bigblue_2025 @Arcadia_Bao 是他们先拿opus4.8来对比说是同级,价格大小是一回事,能力是一回事,正确对比的应该是5.6luna。
中文
0
0
0
60
Big Blue
Big Blue@bigblue_2025·
@Nlet123 @Arcadia_Bao 对于fp4版可以在4000块的dgx spark里跑的模型,你要求得是不是有点太高了。
中文
1
0
0
52
忒修斯的船板
忒修斯的船板@Arcadia_Bao·
如果说一个便宜到近乎不要钱的 DeepSeek-V4-Flash ,可以在通用的 Coding 和 Agent 任务上做到 Opus 4.8 级别的能力,那请问SOTA旗舰模型,它们多出来的价格都是给谁了? 答案是旗舰模型价格当然不是白给的,而是诸如前端能力、金融领域、网安生物……各种行业知识、以及边缘场景。 那问题来了,这些领域的用户凭啥就要额外支付几十上百倍的价差? 为什么不能有一个前端领域的模型,或者一个聊天领域的模型,或者一个外语翻译领域的模型,甚至是金融办公领域的模型,把价格也做到 1%的同时它的垂直能力秒杀这些所谓的通用coding agent大模型,比如做到 Fable 级别呢? 垂直领域「小模型」的价值和潜力,又要被重新估计了
中文
83
4
103
23.7K
Tor
Tor@Nlet123·
@Arcadia_Bao aa分数,v4flash离opus4.8差了整整6分,中间还差了gemini3.6flash luna grok gpt5.5 glm5.2等等加起来十几个模型,正常的行业客户工作环境里这两个都不可能是差不多的产品。要这样都能等价了,从grok开始前面的模型都能号称是fable级,连gpt5.5都是fable级。
中文
0
0
1
197
忒修斯的船板
忒修斯的船板@Arcadia_Bao·
@Nlet123 如果你觉得k3可以号称 那我觉得V4flash也可以号称。对我 以及我这里所说的其他行业的用户,事实上区别就是这么无所谓。
中文
1
0
10
2.8K
Tor
Tor@Nlet123·
@ns123abc Luna has done a good enough job. Three months ago, the 5.4 Nano was much weaker than the V4 Flash, but now Luna is priced the same as the Nano but is stronger than the V4 Flash.
English
0
0
0
65
Tor
Tor@Nlet123·
@Susbunchanumber @aikangarooking Yes, Qwen is great and stronger than Gemini now, but I only get it through Alibaba and don't deploy it myself.
English
0
0
0
27
袋鼠帝
袋鼠帝@aikangarooking·
卧槽!Kimi K3 可能要动 OpenAI 和 Anthropic 的企业蛋糕了🤔 看到一个很有代表性的案例: 一家美国律所,每月在 Claude API 上烧近 3 万美元。现在他们在用 K3 跑内部基准测试,只要性能达标,就砸 50 万美元买硬件,模型本地跑。 账大概是这样算的: • 硬件:Gigabyte 8 卡 AMD MI355X 服务器,约 2.3TB 显存,已验证可跑 Kimi,约 40 万美元 • 不用全款,分 5 年融资,月供约 1 万 • 加上电费 + 托管,每月总成本约 1.8 万 对比原来每月 3 万的 API 账单: → 直接省 20-30% → 数据不出门(对律所来说是命根子) → 用量不设限,想怎么跑怎么跑 → 最狠的是:美国新税法允许硬件购置当年 100% 税前抵扣,融资买也算 这里有个值得记住的临界点: 月 API 支出一旦超过 2 万美元,自建硬件就开始划算。 开源权重 + 可融资的硬件,正在一点点填平闭源模型的护城河。 OpenAI 和 Anthropic 的万亿估值,接下来靠什么撑?
袋鼠帝 tweet media
中文
133
68
547
157.7K
Tor
Tor@Nlet123·
@robin__liang @aikangarooking 我的论点是你如果想买kimi来自己部署不如直接调用kimi的api,买云服务商的api,自己部署就是血亏。
中文
1
0
0
21
Bobin
Bobin@robin__liang·
@Nlet123 @aikangarooking 我得论点就是自己买kimi的产品来自己部署,不要买美国头部的ai了,肯定亏死。你好像怼错人了
中文
1
0
0
39
Tor
Tor@Nlet123·
@Susbunchanumber @aikangarooking And even with the full qwen3.6 27 b, it is still not stronger than Gemini2.5 flash, and in order to fit the 3090, you can only use a weaker compressed version.
English
1
0
0
127
Tor
Tor@Nlet123·
@Susbunchanumber @aikangarooking Yes, but now you can use the Alibaba Cloud platform to call qwen3.7 flash. If you want to save money, it can even be cheaper than your 3090 electricity bill and has stronger performance。
English
0
0
0
33
Tor
Tor@Nlet123·
@robin__liang @aikangarooking 这就跟现在这个时候放着云服务不用自己去大买涨价10倍内存组服务器一样,你明知道贵还要跟巨头硬拼资本开支这是有什么大病?
中文
1
0
0
16
Bobin
Bobin@robin__liang·
@Nlet123 @aikangarooking 那为什么Kimi 3出来了美国ai公司的股价却崩呢?难道不是因为投入太多却没有进展低成本投入的中国ai的存在吗?金融危机已经来临了,是先从韩国开始的,97年金融危机,2000年互联网泡沫,08年金融危机,全部都是从韩国股市崩盘开始的,等着看吧
中文
4
0
0
48
Tor
Tor@Nlet123·
@robin__liang @aikangarooking 不是这有什么关系呢?云厂商如果都因为大额资本投入收不回成本,那本地部署不更荒缪吗?你自己部署的gpu利用率比得过云厂商24小时工作的集群吗?就像你说的泡沫最终会破灭,那么正确的不应该是等之后等云厂商大打价格战去买他们的服务而不是在泡沫中自己买一堆将要贬值的设备?怎么就认为我是反对开源呢
中文
0
0
0
26
Tor
Tor@Nlet123·
@VoyDark0309 @aikangarooking 是的几年来一直都是这样的话术,普通人/小公司通过本地部署省下token钱,最早是通过4090 之后是m3 ultra现在是8卡/16卡节点,估计到明年律所和医院就要开始部署Nv144超节点了。旗舰开源其实一直利好的都是大厂巨头。普通人想省钱最好的方法就是去选择更廉价的plan或云服务商而不是折腾部署的最低下限。
中文
0
0
0
221
Tor
Tor@Nlet123·
@QTtJRvL1nOH4pVa @aikangarooking 我的观点一直很明确,我没有说自建就是蠢,我argue的是他在这个数量下去自建很蠢。
中文
0
0
1
352
米粥&饭团
米粥&饭团@QTtJRvL1nOH4pVa·
@Nlet123 @aikangarooking 你在说一个很奇怪的观点,你 comment 的帖子逻辑很简单,存在一个 turning point 的订阅月费大小,超过了这个值就是自建划算,这句话有什么问题吗?你只能去 argue 这个值具体为什么不是这么多,你不能 argue 说自建就是蠢,定量的问题你说成定性的
中文
1
0
1
393
Tor
Tor@Nlet123·
@robin__liang @aikangarooking 那是因为大模型厂商和云服务商压根就首先不会像这位一样刚刚好只买一套能跑的设备,面临模型一旦变大就得加购的窘境,其次大型服务商能够在训练、推理、试验、出租、等各种层面梯次利用新旧算力,充分榨干卡的价值而不会像本地部署一样一旦面临模型增大容量不够或者推理性价效率下降就被迫淘汰的结局。
中文
1
0
0
315
Bobin
Bobin@robin__liang·
@Nlet123 @aikangarooking 好问题,那你有没有想过这些超强的闭源模型,去年投资了一千亿,还没收回本呢,今年就过时了要买更新的卡?这个问题根本就和闭源还是来源无关,它们都面临迭代太快淘汰太快的问题
中文
1
0
0
351
Tor
Tor@Nlet123·
@xmgplus 并没有,2023年的顶级智能代表是GPT4,输入30$输出60$缓命中计费都没有,24年的o1输入15$输出60$且引入半价缓存命中明显降价。25年opus4.1输入15$输出75$但缓存命中来到1/10的级别使用成本继续降低,到今年fable5 10/50 1$的命中,相较前几年的顶级智能全方面降价。
中文
1
0
9
266
Tor
Tor@Nlet123·
@Zyen_Q @cyberjunsc @aikangarooking 那行吧就看8卡H100,25年初能应对一切开源模型现在最多只能部署qwen3-235B,dpv4flash,想部署K3?不好意思就算再买一组连glm5.2都装不下。到明年K4发布就得买gb200来装了,你要强行拿H卡来推电费都比云平台api贵了,年年花几十万,未来甚至花几百万美金来买新设备真的对于一个律所划算吗?
中文
1
0
4
363
Tor
Tor@Nlet123·
@AIKINGrug @aikangarooking 而且就算你不肯升级,AI技术照样升级,你的需求一定但满足你需求的模型无论开源闭源都会越来越便宜越来越小,看着摊销到5年能节省20%的成本实际上只要半年就会沦为巨大的浪费。
中文
0
0
1
84
AI KING
AI KING@AIKINGrug·
@Nlet123 @aikangarooking 律所的业务没有升级,这个系统要升什么呢?业务能跑就行了,为什么要最新版
中文
2
0
10
907
Tor
Tor@Nlet123·
@AIKINGrug @aikangarooking 要按你这样说压根就不要AI,前AI时代业务照跑,嫌贵直接砍掉得了立省100%。你保持不变能跑就行你的同行却在升级你怎么能在长期竞争中生存?
中文
0
0
11
849
赵纯想
赵纯想@chunxiangai·
@cherylnatsu 九个月后跪在kimi门口求开源最新版。
中文
4
0
266
67.2K
赵纯想
赵纯想@chunxiangai·
花 1200 万元人民币买一台英伟达 DGX B300 服务器,瞬间获得打包销售的 8 张 D300 GPU。显存 2.3 TB。 把 1.4 TB 的 Kimi K3 装进去。跑起来。 满载功耗 14.5 kw,24 小时连轴转不关机不断电每年电费 5 万元人民币。 每产出 100 万 token,按照官方价格,收入 260元。理论每天收入 45000元。 9个月回本,9个月后,化身纯粹的印钞机。走上人生巅峰。
中文
398
83
1.1K
593.5K