
結城遼
2K posts

結城遼
@ultralivis
結城 遼 | Geopolitics x Economy Exploring the intersection of East Asian politics and markets. 東アジア情勢 × 経済安全保障。ワシントンの論理とアジアの現場感を繋ぐ。 Ex-Investment Banker / Columbia
Tokyo Katılım Kasım 2017
1.2K Takip Edilen2.2K Takipçiler
Sabitlenmiş Tweet

トランプ米大統領の描く対中世界戦略は、端的に言えば「西半球の独覇、東半球の争覇」という言葉に凝縮される。
まず「西半球の独覇」とは、すなわち中国の影響力の「一掃」である。政治、軍事、科学技術、エネルギー、そして資源供給網(サプライチェーン)に至るまで、西半球における中国の浸透を徹底的に排除し、同地域全体を米国の安全保障上の「後背地」として再編することだ。西半球の繁栄と安定を確実にコントロール下に置き、長期にわたり米国へ活力を供給(輸血)し続ける体制を構築することにある。
対照的に、「東半球の争覇」は同地域の「戦場化」を画策するものだ。東半球を多次元的な対中包囲網の最前線と化すのである。経済・貿易戦争、金融戦争、エネルギー・資源獲得競争、技術封鎖に加え、地政学的衝突や資本逃避、産業移転、軍事摩擦、さらには難民問題による動揺――。ありとあらゆる混乱を東半球へと波及させる狙いがある。
東半球が混乱の極みに達するほど、相対的に西半球の優位は盤石となる。東半球が戦場と化してこそ、「東昇西降(東が昇り西が沈む)」の潮流を覆し、米国による覇権の維持、すなわち「偉大なアメリカ」の復権が成し遂げられるのである。
日本語

And with this model, you only need $6,000 to deploy it locally at home.
Pratham@Prathkum
Mad respect to DeepSeek. I still remember when DeepSeek launched R1 in early 2025. It was the first time many people realized that open-weight models could genuinely compete with frontier models. Now again, DeepSeek has dropped V4 Flash. No hype. No fake marketing. No unnecessary drama. Just a model that competes with the best frontier models while being 89 times cheaper. Crazy.
English

Mad respect to DeepSeek.
I still remember when DeepSeek launched R1 in early 2025.
It was the first time many people realized that open-weight models could genuinely compete with frontier models.
Now again, DeepSeek has dropped V4 Flash.
No hype.
No fake marketing.
No unnecessary drama.
Just a model that competes with the best frontier models while being 89 times cheaper.
Crazy.
English
結城遼 retweetledi

📢Meet Qwen3.8-Max — our most capable model to date.
Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!🎉
Qwen3.8-Max, a new bar for coding and cowork at 2.4T parameters:
- Autonomous coding: 10+ days of self-evolving development, from empty folder to production without hand-holding, complete project trace in the GitHub:github.com/qwen-code-dev-…
- Real work, real results: Production-quality deliverables across hundreds of professions.
- Long-horizon mastery: System-level autonomous planning with closed-loop adaptive learning, driving 500+ turns of chip design optimization and 365 days of e-commerce strategy.
- Native multimodal intelligence: Vision isn't just input — it's a continuous feedback loop for planning, execution, and self-correction.
💰Pricing:
Input: $2.0 / M tokens
Output: $6.0 / M tokens
Implicit Caching: $0.25 / M tokens
Start building with Qwen3.8-Max! 🚀
📖 Blog: qwen.ai/blog?id=qwen3.8
✅ Qwen Studio: chat.qwen.ai/?models=qwen3.…
⚡ API: qwencloud.com/models/qwen3.8…

English
結城遼 retweetledi
結城遼 retweetledi

日米の協調介入だったというFT報道、これは大変なことで、米国が「日本発の金融危機」を本気で恐れていることの表れです。高市首相の積極財政で、円安と日本国債売りが止まらず、それが米国債売りに波及し、世界的な金融危機に至ることをベッセント財務長官は本気で恐れているのです。
私は前回2011年の日米協調介入をワシントンで取材しました。このときは震災直後の異常な円高を是正する、円売りドル買い介入。今回は、ユーロを使っていますが実質的にはドル安容認介入で、異例です。
問題の中核は、高市首相の馬鹿げた「積極財政」で、円売り圧力が止まらない点にあります。米財務省や日本銀行が必死に円安を食い止めようとしても、当の高市政権が拡張財政というインフレ政策を取り続け、円安とインフレを促進するという真逆の政策をとっていることが最大の問題です。米財務省や日銀がバケツに水を貯めようとしても、高市首相がそのバケツの真ん中に大きな穴を開けているようなものです。昨日の植田日銀総裁会見で、高市首相がインフレ政策をとる一方で、日銀がインフレ叩きに奔走するという、日本の財政政策と金融政策の不整合を問いました。植田総裁は「(高市政権は)拡張的な財政運営というふうにおっしゃってるだけではなくて、責任ある積極財政ということで、財政規律にも一定の配慮はされつつ、政策運営をされていこうということだと思います」と答えるのが精一杯でした。
そもそも、円買いドル売りの為替介入に踏み切った日本の財務省が、同じ日に「もはやシーリングと呼ぶべきものはない」(片山財務相)などとタガが外れた財政政策にカジを切って円安を呼び込んでいるのですから、空いた口が塞がりません。
日本発の金融危機が起こらないか本当に心配です。日本だけでなく、世界に危機をばらまくリスクを高市首相が生み出しています。高市首相の責任は、きわめて重大です。それを座視して、本質的な報道をしない、日本の新聞とテレビは共犯です。
US Treasury undertakes historic intervention in yen market ft.com/content/0f9b2f…
日本語

@squareheadedd @GBC_Press China is one of the top five oil-producing countries in the world.
English

@GBC_Press Hard to fight a war without oil and that’s one thing China doesn’t have in their backyard.
So yea if war ever broke out, we just nuke the Middle East and China is defeated. Check mate.
English

Worked with a team in China recently. N=1, but:
Strengths:
- extremely competent SWEs
- very well educated
- work extremely hard
- no patience whatsoever for you if you suck, but once you’ve demonstrated competence they’re the biggest sweethearts you’ll ever meet
- very efficient, get a huge amount done with little resources
Weaknesses:
- very strong command and control structure, little happens bottom up. (Ppl might debate whether this is a weakness, but I’m more aligned with bottom-up teams philosophically, I think they’re more effective, and I will die on this hill)
- execution patterns not world-class yet, top US firms are a standard deviation better. This isn’t easy to level up quickly and is a huge advantage for the U.S.
Again n=1, but if U.S. and China are meant to be adversaries (which I’m still hoping we can avoid), I would not go up against that team lightly.
@levelsio@levelsio
The West's biggest blindspot is repeatedly underestimating China's speed and capabilities
English
結城遼 retweetledi

我靠,Kimi K3实在太强了:
一座3100万美元的酒店。
190个房间的所有管道、电线、风管、消防系统,全部提前建模协调完毕。
以前:3个工程师,6周,花费约4.7万美元。
现在:1个工程师确认AI输出,9天,总共约1.05万美元。
方法很简单:
把Kimi K3接到建模软件上,让它直接读蓝图照片和英文描述,然后自己把模型搭出来,而不是人一个一个组件去摆。
施工阶段的变更单直接少了60%到80%。
这不是演示,是真的在省钱、省时间、少出错。
当AI开始真正碰“真实世界的复杂系统”,变化才刚刚开始。
#kimi #kimik3 #k3
Rina@irinatoxi
中文

結城遼 retweetledi

In mathematics, Terence Tao and Peter Scholze show two different working styles.
Tao works very quickly. He has written many papers, collaborates with many co-authors, and produces results at a high pace.
Scholze works more slowly. He often works alone. But when he publishes, his work has a large impact on the field and changes how people think about the subject.

English
結城遼 retweetledi

从一个普通外国人的角度,聊聊日本政策变化带来的影响
大家好,我是2022年9月28日来到日本读语言学校的留学生。
当初决定出国,上海封城是一个重要的推动因素。其实我很早就有将来去国外生活的打算,只是最开始从来没有考虑过日本。因为我没有学过日语,身边也没有去日本留学的人,大家提到出国留学,想到的通常都是英语国家。
最初申请的是澳大利亚,也拿到了学校的录取通知书,但考虑到学费和生活成本太高,最后放弃了。后来是朋友建议下再加上自己各种对比,我选择了日本。
刚来到日本的时候,我对这个国家是心怀感激的。
2022年年底,我感染了新冠。当时已经发烧到40度,也没办法出门,申请了政府提供的生活物资,第三天就收到了一大箱免费的食品。那件事情让我觉得,日本并没有因为我是外国人,就对我区别对待。
后来,我把在日本获得的第一笔工作收入,一半捐给了日本赤十字会,另一半捐给了中国那边。
我的想法一直很简单:既然生活在这里,也得到了这个社会的帮助,那么就应该尽自己的能力回馈这里。
过去几年,在日本的生活虽然辛苦,却一直充满希望。因为我始终相信,只要认真学习、踏实工作、遵守规则,最后总能在这里找到属于自己的位置。
读语言学校期间,考上了大学院。在这几年里我考了日语证书,也考取了日本驾照。献血、捐款,认真做好垃圾分类,也努力适应日本社会的规则。
我从来没有想过依靠什么特殊待遇留下来。我只是觉得,只要把该做的事情做好,凭自己的能力找到工作、缴纳税金和社会保险,就应该有机会继续生活在这里。
但最近,这种确定感正在慢慢消失。
从2026年4月开始,日本的归化审查在实际运用上,原则上要求居住10年以上。永住制度的审查也越来越严格,经营管理签证的门槛已经提高,其他工作签证的审查标准也不断被重新明确。
虽然目前高度人才制度还没有受到直接影响,80分以上连续满足一定时间,仍然可以申请永住,但我不知道这样的制度以后还会不会继续改变。
当初选择读大学院,其中一个现实原因,就是希望通过日本的硕士学历提高高度人才积分。硕士学历可以加分,学校本身符合条件也可以再加分。
现在,我的高度人才打分早已超过80分,可即便如此,依然没有觉得轻松。
因为我越来越清楚地意识到,只要还没有取得日本国籍,自己的生活就始终建立在一种可能变化的制度之上。一次政策调整,或许就会改变一个外国人未来几年甚至十几年的人生安排。
日本当然是日本人的国家。作为外国人,我没有决定这些政策的权利,也理解日本政府需要根据本国的社会状况调整外国人政策。
但理解,并不意味着不会感到不安。
政策调整所影响的,不只是未来是否还有人选择来日本,更影响着那些已经在这里生活了几年、投入了大量时间和金钱,并且一直以“留下来”为目标努力的人。
以后准备来日本的人,看到门槛越来越高,或许可以及时改变目的地。
反而是像我这样已经在日本生活了几年的人,处境最为尴尬。
去欧美国家,我的语言能力和经济条件可能不够;回到中国,又并不是我会选择的道路;继续留在日本,却不知道自己现在所做的努力,在几年以后还能不能符合新的规则。
身边有朋友已经放弃直接就职,准备继续在日本读博士,希望通过延长留学时间等待新的机会。
在日本读书的四年里,我支付的学费已经接近500万日元。可是在网络上,留学生常常被骂成“蛀虫”,好像我们来到日本就是为了占便宜。
我有时也会认真想,留学生到底享受了什么特别的福利?
可能只是作为收入较低的留学生,国民健康保险缴得少一些。除此之外,学费、房租、生活费、考试费和各种行政费用,都是自己承担。毕业以后,我们同样需要工作、缴税、缴纳社会保险,也同样要接受在留资格的审查。
在日本生活的这几年,我总体上是开心的,也真心感谢曾经帮助过我的日本人和日本社会。
正因为我曾经对这里抱有很大的期待,今天才会变得不安。
在日本的几十万留学生中,或许有很多人和我抱着相似的想法来到这里:认真学习,毕业后找到工作,然后凭自己的努力慢慢留下来。
可真正来到以后才发现,留下来并不是一场只要努力就一定会有结果的考试。
个人可以规划学业、提高语言能力、寻找工作,也可以努力遵守所有规则,但个人无法预测几年后的政策会变成什么样。
时代的一粒灰,落在个人头上,就是一座山。
对制定政策的人来说,这可能只是居留年限、积分标准或者审查条件的调整;但对一个普通外国人来说,它所改变的,可能是已经投入数年时间的人生,以及原本相信能够抵达的未来。
中文
結城遼 retweetledi

Today, I had the pleasure of holding an inspiring and forward-looking meeting with President Xi Jinping of China. 🇸🇰🤝🇨🇳
Together, we reaffirmed the importance of our strategic partnership and our shared ambition to build stronger bridges between Slovakia and China. As an 🇪🇺 #EU member, Slovakia is committed to expanding cooperation in trade, investment, emerging technologies, scientific research, higher education, and tourism.
The future belongs to nations that embrace innovation, invest in knowledge, and foster international collaboration. By strengthening partnerships in research and development and encouraging the exchange of ideas and expertise, we can unlock new opportunities for sustainable economic growth, technological progress, and greater prosperity for our people.
I was honored to extend a warm invitation to President Xi to visit Slovakia. I am confident that this dialogue marks another important step toward a dynamic, future-oriented partnership that benefits both our nations and contributes to global cooperation.
#Partnership #Innovation #Future #Collaboration #Slovakia #China



English
結城遼 retweetledi

結城遼 retweetledi

Kimi K3は、フロンティアモデルに匹敵する性能を持つオープンウェイトモデルである。Technical Reportが公開されたので、重要な点をまとめる。
Kimi K3は、総パラメータ数2.8T、活性パラメータ数104BのMoEモデルである。アーキテクチャ、データ、ハイパーパラメータ、学習手法を総合的に改善し、Kimi K2と比べて、同じvalidation lossに到達するために必要な学習計算量を約2.5分の1にしたと主張している。
* アーキテクチャ
Kimi K3のアーキテクチャは、系列方向、深さ方向、幅方向という三つの情報流を、それぞれ拡張するように設計されている。
系列方向では、Kimi Delta Attention(KDA)とMulti-head Latent Attention(MLA)を組み合わせる。モデル全体は93層からなり、基本的には3層のKDAと1層のGated MLAを一つのブロックとして繰り返す。
KDAは、過去の履歴を固定サイズの状態行列へ圧縮する線形アテンションである。従来のDeltaNet系の構造を拡張し、過去の情報をどの程度保持するかをチャネルごとに調整できる。
KDAの基になったKimi Linearでは、忘却率が極端に小さくなる可能性があり、チャンク並列計算において累積減衰の逆数が過大になり、オーバーフローなどの数値不安定性を引き起こす問題があった。Kimi K3では、対数減衰に下限を設けている。
この変更により、以前は特殊なposition-pair計算が必要だった対角タイルも、Tensor Core上の密行列積として処理できるようになった。数式上は小さな変更だが、GPUカーネルを単純化し、学習速度を改善する重要な工夫である。
MLA層では、RoPEなどの明示的な位置符号化を使っていない。Kimi Linearでも示されていたように、位置や順序に関する情報は主にKDA側が担い、MLAは主として内容に基づくグローバルな情報検索を担当する。
この役割分担によって、コンテキスト長を拡張する際に、RoPEの周波数調整や補間を行う必要がない。
ただし、位置符号化の変更が不要だからといって、学習なしで100万トークンを利用できるわけではなく、Kimi K3は、8K、64K、256K、1Mと段階的にコンテキスト長を伸ばして学習している。
技術報告では、8Kから64Kまでをpre-training中に実行し、学習の最終段階であるcooldownにおいて256K、1Mに拡張したとしている。
次に特徴的なのが、深さ方向の情報流を改善するAttention Residualsである。
通常のTransformerでは、過去の層の情報が残差接続によって順番に加算され、一つのhidden stateへ集約される。深さ方向で見ると、過去の情報を単一の状態へ圧縮していくRNNのような構造になっている。
Attention Residualsでは、各層が過去の層やブロックの表現に対してattentionを行い、必要な深さの表現を選択的に取得する。
この実現にあたり、各層は、学習可能なpseudo-queryベクトルを持つ。このqueryは入力から計算されるのではなく、層ごとに保持される学習可能なパラメータである。一方、keyとvalueには、各入力トークンに対する過去の層出力が使われる。
pseudo-queryは、「この層がどのような種類の表現を必要としているか」を表す検索テンプレートとみなせる。query自体は入力に依存しないが、keyは入力に依存するため、実際のattention weightはトークンごとに変化する。
独立した学習可能ベクトルをqueryとして使うことで、各トークン、各層について大きなquery projectionを計算する必要がなくなる。また、Attention Residualsによって作られる現在層への入力からqueryを生成しようとした場合に生じる循環依存も避けられ、実装が単純になる。
Kimi K3では、全93層をおおむね12層ずつのブロックに分け、過去の全層ではなく、主としてブロック単位の表現にattentionするBlock Attention Residualsを用いている。これにより、過去の全層出力を保持するためのメモリと、pipeline parallelism時の通信量を削減している。
幅方向では、Stable LatentMoEを用いる。
Kimi K3には896個のrouted expertがあり、各トークンについて16個が選ばれる。ただし、各expertへ7168次元のhidden stateをそのまま送るわけではなく、expertへ入る前に3584次元のlatent空間へ圧縮し、expert処理後に元の幅へ戻す。一方、全トークンに共通して使われる2個のshared expertは、元の全幅で動作する。
Kimi K2では384個のrouted expertから8個を選択していたのに対し、Kimi K3ではexpert候補数が約2.3倍、同時に活性化するexpert数が2倍になっている。sparsity ratioはKimi K2の48に対してKimi K3は56であり、似たレベルである。より多くの専門的なexpertを組み合わせながら、latent空間を使うことで計算量と通信量を抑えている。
さらに、routed expertの集約後にRMSNormを挿入し、SwiGLUの代わりにSiTU-GLUを導入している。SiTU-GLUは、SwiGLUの原点付近における性質を保ちながら、大きな入力をtanhによって滑らかに飽和させる。Kimi K3の設定では、各出力座標の絶対値が最大100に抑えられる。大規模かつ極端に疎なMoEにおけるactivation explosionを防ぐための設計である。
また、expert負荷の均衡にはQuantile Balancingを使う。
従来方式では、過剰に使われたexpertのbiasを少し下げ、使われていないexpertのbiasを少し上げる更新を繰り返していた。しかし、896個のexpertを扱う場合、このような固定幅の更新では追従が遅く、負荷が振動しやすい。
Quantile Balancingでは、各expertが目標数のトークンを受け取るように、router scoreのmarginの分位点から次のbiasを直接推定する。
実際には、全marginを一箇所へ集めるのではなく、expertごとのhistogramをall-reduceし、全体の分位点を近似する。
さらに、Kimi K3は画像と動画を事前学習の段階から統合している。画像・動画のencoderには、約4億パラメータ、27層のMoonViT-V2を用いる。Kimi K3では、SigLIPなどで事前学習したvision encoderを接続するのではなく、vision encoderも言語モデルと同時にscratchから学習している。
技術報告では、SigLIPで初期化したencoderよりも、next-token predictionによってscratchから学習したMoonViT-V2の方がgradient normが安定し、最終的なvision評価も同等だったと報告している。
事前学習
===
事前学習は8K contextから始まり、その後64Kへ拡張される。さらに、学習の最終段階であるcooldownにおいて、256K、1Mへ伸ばしている。
一般的には4K~8Kなのに対し、64Kまでが事前学習の範囲とされているのが興味深い。どの規模でされたかの証明は示されていない。
自然な長文や動画には、重複、壊れたファイル、無効なlog、途中で切れたデータ、類似したframeの連続などが多く含まれる。そのため、長文専用のcleaning pipelineを用いて、重複除去、品質判定、構造検証を行う。
また、本当に長く一貫した文書や動画は短いデータに比べて少ないため、cooldownでは長文データを相対的にupsampleする。
ただし、長いsequenceを見せるだけでは、モデルが近くの情報だけを利用し、遠距離の情報を無視する可能性がある。そこで、複数の文書やsub-taskを並べ替えて連結し、100万トークンの中に分散した情報を集めなければ解けないような合成課題も作っている。
事後学習
===
事後学習は、SFT、RL、Multi-Teacher On-Policy Distillationの三段階で行う。
まずSFTによって、tool callingやagent trajectoryの基礎を学習する。
次に、general tasks、general agents、coding agentsという三領域について、それぞれlow、high、maxの三段階のreasoning effortを学習する。これにより、合計9個の専門policyが作られる。
まず、特定のエージェント実装への過学習を防ぐため、ツール、system prompt、memory、context management、subagentなどを交換可能な部品として構成する。Kimi CodeやClaude Code、Codexに近い形式だけでなく、未知の構成でも学習させることで、特定のハーネスに依存しない能力を目指している。
RL課題の生成には、自己拡張する知識グラフを利用する。数学、物理、化学、コンピュータ科学などの大分類から始め、エージェントがWeb検索を行いながら、より細かな概念へ分解する。そこから論文、ブログ、コードリポジトリなどを収集し、知識問題、コーディング、視覚推論などの課題を合成する。
学習対象は多岐にわたる。検索や法律、金融、データ分析などの専門業務に加え、画像をPythonでcrop、zoom、変換しながら解く視覚課題、CUDAやTritonを用いたGPUカーネル最適化なども含まれる。
また、Gmail、Slack、Notionなどを模した環境を構築し、複数日にわたるpersonal assistant課題も学習する。一つのrolloutが数千回のtool call、数百万context tokensに達することもある。
Autonomous Execution Tasksでは、正解手順を与えず、初期状態、目標、制約、ツール、実行予算だけを与える。モデルは自ら計画し、ツールを使い、失敗から回復し、最終状態を外部verifierに評価させる。公開verifierだけに過適合することを防ぐため、モデルには見えないhidden verifierも用いる。
Web開発では、Webサイト、ゲーム、3D、データ可視化、full-stack applicationなどを生成する。buildの成否、実行時error、機能、見た目、操作結果を評価し、画像を貼り付けただけの偽装などは報酬をゼロにする。
その後、9個の専門モデルを一つに統合するため、Multi-Teacher On-Policy Distillation(MOPD)を行う。
RL学習環境
===
長期エージェントRLでは、一つのtrajectoryが数百から数千回のtool callを含み、累積context tokensが数百万に達することもある。
すべてのtrajectoryの終了を待つと、一部の非常に長いtrajectoryが学習全体を待たせる。そのため、一定割合のrolloutが完了した時点でpolicy updateへ進み、未完了trajectoryは次のiterationで再開するpartial rolloutを使う。
未完了trajectoryを再開するには、モデル側のKV cacheと、外部環境側のsandbox stateの両方を保持する必要がある。
Kimi K3では、GPUからevictされた長いprefixをCPU DRAM上のexternal KV cache poolへ保存する。また、Firecrackerを用いたmicroVM sandboxであるAgentENVを使い、sandboxをpause、resume、fork、snapshotできるようにしている。
報告では、checkpointが最短133ミリ秒、resumeが最短49ミリ秒であり、学習と評価全体で約5122万個のsandboxが作成されたとしている。
学習基盤
===
KDAでは、各sequence segmentの作用を、入力状態に作用するtransitionと、zero stateから生成される局所状態に分解する。
これらの変換は結合可能であるため、prefix scanによって各GPUに必要な初期状態を計算できる。
MoE学習にはMoonEPを用いる。必要に応じてexpertを別rankへ動的に複製し、すべてのexpert parallel rankが正確に同数のトークンを処理するようにする。技術報告では、各rankに最大E/R個のredundant expert slotを確保すれば、完全に均衡した割り当てが常に存在することを示している。ここでEはexpert数、Rはexpert parallel rank数である。
完全に負荷を均衡できれば、遅いrankを待つ時間がなくなるだけでなく、通信bufferや計算shapeを固定でき、各層でhost側へ同期してtoken数を確認する処理も不要になる。
推論
==
推論時には、KDAの固定サイズ状態と、MLAの系列長に比例するKV cacheを、同じpaged cache managerで管理する。
MLAは細かいtoken境界でprefixを再利用する一方、KDA stateは大きいため、conversation turnなどの限られた境界でcheckpointする。
投機的デコーディングでは、draft tokenごとに巨大なKDA stateを保存せず、小さなprojection inputだけを保存する。
draft tokenの一部がrejectされた場合は、acceptされた部分についてKDA stateをGPU上で再計算し、正しい状態へ戻す。
性能評価
===
性能評価では、Kimi K3は総合的にClaude Fable 5とGPT-5.6 Solの直下に位置し、技術報告で比較された多くのオープンモデルおよびプロプライエタリモデルを上回っている。
特に、コーディング、検索、調査、長期ツール利用を必要とする課題で強い。
一方、Humanity’s Last ExamやCritPtのような研究レベルの推論、OSWorld 2.0のような難しいcomputer use、長期的な行動規律や複雑な協調では、最上位モデルとの差が残っている。
なお、技術報告では、以下の情報は公開されていない。
総事前学習トークン数、最終的なデータ配分、総学習FLOPs、使用GPU数、学習期間、実測MFU、各context lengthでの学習トークン数である。
コメント
===
Kimi K3は、現時点で最も強力なオープンウェイトモデルの一つであり、そのアーキテクチャ、学習方法、システム実装をまとめた重要な資料である。
新技術があるというよりも、必要な技術を幅広く取り込み、それぞれを大規模モデルで実際に動作するまで作り込んでいるという印象が強い。
モデル開発をしている立場から、特に印象的だった点は次の二つである。
・Kimi K2に引き続き、事後学習におけるエージェントRL環境へ非常に大きな投資をしている。テキスト、画像、コード、Web、業務アプリケーション、GPU kernelなどを含む多様なエージェント課題を合成し、長期間にわたるtool useと試行錯誤を学習させている。この部分については、改めて詳しく紹介したい。
・十分なablation studyが提供されていないため、それぞれの技術選択が、どのような比較や判断に基づいて行われたのかは分からない部分が多い。KDA、Attention Residuals、Stable LatentMoE、SiTU-GLU、Quantile Balancing、Per-Head Muonなどの個別技術が、最終性能や学習効率改善にどの程度寄与したのかは分解されていない。
実際には、内部実験の結果、学習安定性、GPUカーネルの効率、分散学習時の通信、メモリ制約など、さまざまな要因を総合して選択したと考えられる。
日本語
結城遼 retweetledi
結城遼 retweetledi
結城遼 retweetledi

We are releasing PerceptionBench, a benchmark that isolates visual perception and evaluates it as a set of atomic capabilities - discovered from how today's models fail, rather than defined in advance.
From frontier-model failures across 42 benchmarks, we derive 10 atomic perceptual capabilities and construct 3,000 verified questions, each isolating a single capability and answerable by looking, with no reasoning or external knowledge required.
Blog: kimi.com/blog/perceptio…
GitHub: github.com/MoonshotAI/Per…
Hugingface: huggingface.co/datasets/moons…

English
結城遼 retweetledi

With Kimi K3 going open source today, we put it to the test in WorkBuddy.
The challenge: spot one chili pepper buried in a sea of strawberries.
@Kimi_Moonshot 's K3 found it, noticed its first circle was off, fixed it, and returned a result anyone could verify at a glance.
Reason. Check. Correct. Ship.

English
結城遼 retweetledi

Releasing the model weights and technical report of Kimi K3.
Kimi K3 is our most capable model: a 2.8T MoE model with native visual understanding and a 1M-token context window.
New model architecture: 2.5x the intelligence per unit of compute, not just more params.
Alongside Kimi K3, we're opening up more of the stack behind it — high-performance attention kernels, MoE communication library, and infrastructure for running agent environments at scale.
Model weights: huggingface.co/moonshotai/Kim…
Tech report: github.com/MoonshotAI/Kim…
Tech blog: kimi.com/blog/kimi-k3

English
結城遼 retweetledi





