Tor
59 posts


如果说一个便宜到近乎不要钱的 DeepSeek-V4-Flash ,可以在通用的 Coding 和 Agent 任务上做到 Opus 4.8 级别的能力,那请问SOTA旗舰模型,它们多出来的价格都是给谁了?
答案是旗舰模型价格当然不是白给的,而是诸如前端能力、金融领域、网安生物……各种行业知识、以及边缘场景。
那问题来了,这些领域的用户凭啥就要额外支付几十上百倍的价差?
为什么不能有一个前端领域的模型,或者一个聊天领域的模型,或者一个外语翻译领域的模型,甚至是金融办公领域的模型,把价格也做到 1%的同时它的垂直能力秒杀这些所谓的通用coding agent大模型,比如做到 Fable 级别呢?
垂直领域「小模型」的价值和潜力,又要被重新估计了
中文

@Arcadia_Bao aa分数,v4flash离opus4.8差了整整6分,中间还差了gemini3.6flash luna grok gpt5.5 glm5.2等等加起来十几个模型,正常的行业客户工作环境里这两个都不可能是差不多的产品。要这样都能等价了,从grok开始前面的模型都能号称是fable级,连gpt5.5都是fable级。
中文

@Susbunchanumber @aikangarooking Yes, Qwen is great and stronger than Gemini now, but I only get it through Alibaba and don't deploy it myself.
English

@Nlet123 @aikangarooking My point is gemini is shit. Most people don't use gemini for coding, not even google engineers.
English

卧槽!Kimi K3 可能要动 OpenAI 和 Anthropic 的企业蛋糕了🤔
看到一个很有代表性的案例:
一家美国律所,每月在 Claude API 上烧近 3 万美元。现在他们在用 K3 跑内部基准测试,只要性能达标,就砸 50 万美元买硬件,模型本地跑。
账大概是这样算的:
• 硬件:Gigabyte 8 卡 AMD MI355X 服务器,约 2.3TB 显存,已验证可跑 Kimi,约 40 万美元
• 不用全款,分 5 年融资,月供约 1 万
• 加上电费 + 托管,每月总成本约 1.8 万
对比原来每月 3 万的 API 账单:
→ 直接省 20-30%
→ 数据不出门(对律所来说是命根子)
→ 用量不设限,想怎么跑怎么跑
→ 最狠的是:美国新税法允许硬件购置当年 100% 税前抵扣,融资买也算
这里有个值得记住的临界点:
月 API 支出一旦超过 2 万美元,自建硬件就开始划算。
开源权重 + 可融资的硬件,正在一点点填平闭源模型的护城河。
OpenAI 和 Anthropic 的万亿估值,接下来靠什么撑?

中文

@robin__liang @aikangarooking 我的论点是你如果想买kimi来自己部署不如直接调用kimi的api,买云服务商的api,自己部署就是血亏。
中文

@Susbunchanumber @aikangarooking Oh sorry you are true.But you can still easily find cloud products that are cheaper and stronger than him.
English


@Susbunchanumber @aikangarooking And even with the full qwen3.6 27 b, it is still not stronger than Gemini2.5 flash, and in order to fit the 3090, you can only use a weaker compressed version.
English

@Nlet123 @aikangarooking Lol Gemini. You can run a quantized qwen3.6 27B on a 3090 to beat Gemini 2.5 flash
English

@Susbunchanumber @aikangarooking Yes, but now you can use the Alibaba Cloud platform to call qwen3.7 flash. If you want to save money, it can even be cheaper than your 3090 electricity bill and has stronger performance。
English

@robin__liang @aikangarooking 这就跟现在这个时候放着云服务不用自己去大买涨价10倍内存组服务器一样,你明知道贵还要跟巨头硬拼资本开支这是有什么大病?
中文

@Nlet123 @aikangarooking 那为什么Kimi 3出来了美国ai公司的股价却崩呢?难道不是因为投入太多却没有进展低成本投入的中国ai的存在吗?金融危机已经来临了,是先从韩国开始的,97年金融危机,2000年互联网泡沫,08年金融危机,全部都是从韩国股市崩盘开始的,等着看吧
中文

@robin__liang @aikangarooking 不是这有什么关系呢?云厂商如果都因为大额资本投入收不回成本,那本地部署不更荒缪吗?你自己部署的gpu利用率比得过云厂商24小时工作的集群吗?就像你说的泡沫最终会破灭,那么正确的不应该是等之后等云厂商大打价格战去买他们的服务而不是在泡沫中自己买一堆将要贬值的设备?怎么就认为我是反对开源呢
中文

@VoyDark0309 @aikangarooking 是的几年来一直都是这样的话术,普通人/小公司通过本地部署省下token钱,最早是通过4090 之后是m3 ultra现在是8卡/16卡节点,估计到明年律所和医院就要开始部署Nv144超节点了。旗舰开源其实一直利好的都是大厂巨头。普通人想省钱最好的方法就是去选择更廉价的plan或云服务商而不是折腾部署的最低下限。
中文

@Nlet123 @aikangarooking 你在说一个很奇怪的观点,你 comment 的帖子逻辑很简单,存在一个 turning point 的订阅月费大小,超过了这个值就是自建划算,这句话有什么问题吗?你只能去 argue 这个值具体为什么不是这么多,你不能 argue 说自建就是蠢,定量的问题你说成定性的
中文

@robin__liang @aikangarooking 那是因为大模型厂商和云服务商压根就首先不会像这位一样刚刚好只买一套能跑的设备,面临模型一旦变大就得加购的窘境,其次大型服务商能够在训练、推理、试验、出租、等各种层面梯次利用新旧算力,充分榨干卡的价值而不会像本地部署一样一旦面临模型增大容量不够或者推理性价效率下降就被迫淘汰的结局。
中文

@Nlet123 @aikangarooking 好问题,那你有没有想过这些超强的闭源模型,去年投资了一千亿,还没收回本呢,今年就过时了要买更新的卡?这个问题根本就和闭源还是来源无关,它们都面临迭代太快淘汰太快的问题
中文

根据摩尔定律,每 18~24 个月应该越来越便宜。为什么现在的大模型却违反了摩尔定律,使用成本却越来越贵?
小码哥@xmgplus
有没有发现国内大模型也越来越贵了? DeepSeek 价格翻倍,Kimi k3 价格也上涨好几倍,其他我就不说了… 而且 Coding Plan 也越来越难买,不是限购、抢购就是预约购买,套餐内容一变再变,很没有安全感。 甚至 Token Plan 都出来了,都玩不起了吗? 大家觉得国内大模型厂商是真的算力不足,还是饥饿营销? 感觉以后国内大模型的成本也会越来越高了😮💨
中文

@Zyen_Q @cyberjunsc @aikangarooking 那行吧就看8卡H100,25年初能应对一切开源模型现在最多只能部署qwen3-235B,dpv4flash,想部署K3?不好意思就算再买一组连glm5.2都装不下。到明年K4发布就得买gb200来装了,你要强行拿H卡来推电费都比云平台api贵了,年年花几十万,未来甚至花几百万美金来买新设备真的对于一个律所划算吗?
中文

@AIKINGrug @aikangarooking 而且就算你不肯升级,AI技术照样升级,你的需求一定但满足你需求的模型无论开源闭源都会越来越便宜越来越小,看着摊销到5年能节省20%的成本实际上只要半年就会沦为巨大的浪费。
中文

@AIKINGrug @aikangarooking 要按你这样说压根就不要AI,前AI时代业务照跑,嫌贵直接砍掉得了立省100%。你保持不变能跑就行你的同行却在升级你怎么能在长期竞争中生存?
中文





