京橋のバイオインフォマティシャンの日常

南国のビーチパラソルの下で、Rプログラムを打ってる日常を求めて、、Daily Life of Bioinformatician in Kyobashi of Osaka

Kimi K3 技術報告書: オープンなフロンティア知能を読み解く

PAPER REVIEW / FRONTIER MODEL

今回、2.8兆パラメータのオープンモデル「Kimi K3」の技術報告書を読みました。数字を並べるだけの記事にはしたくなかったので、「GPT-2 から7年でいったい何が変わったのか」という補助線を引きながらこの記事では整理しています。

先にお断り:本記事が扱う Kimi K3 技術報告書は査読を経ていない技術文書で、掲載された数値はすべて開発元(Kimi Team)の自己申告です。評価スイートには自社の内部ベンチマークも含まれます。第三者による追試で確認されたものではない、という前提でお読みください。

§0まず要点だけ

2.8T
総パラメータ(MoE)
104B
トークンごとの活性化パラメータ
1M
コンテキスト長(K2 の8倍)
2.5×
K2 比のスケーリング効率

ひとことで言えば、世界初のオープンな 3T クラスモデルです。2026年7月末の時点で、重みは HuggingFace でフルリリースされています。

ただし報告書は自ら「総合性能では Claude Fable 5 と GPT-5.6 Sol に依然として及ばない」と明記しています。この率直さは、あとで見るベンチマークの読み方にも効いてきます。

§1なぜ今「3兆パラメータ(3T)」なのか

まず、LLM のスケーリングを二つの軸で整理します。①事前学習に投じる計算量と、②推論時の計算量(test-time computation)です。

②は OpenAI o シリーズ、拡張思考モデル、DeepSeek-R1、Kimi K1.5 などによって急速に発展し、いまやフロンティア研究の中心になりました。ここまではよく聞く話です。

用語のメモ:「o シリーズ」とは OpenAI の推論特化モデル群(o1、o3 など)のことです。報告書は「o シリーズは強化学習と推論時の思考をスケールさせた」と位置づけています。
同じ文脈で Anthropic の拡張思考モデル(思考予算を状況に応じて配分し、推論とツール利用を織り交ぜる)、そして DeepSeek-R1 や Kimi K1.5(大規模な強化学習によって、強い事前学習モデルから高度な推論のふるまいを引き出せることを示した)が並べて挙げられています。つまり②の軸は、特定の1社の工夫ではなく業界全体の潮流だ、というのが著者の見立てです。

実は、研究の課題はその先にあります。オープンソース陣営は②では進んだのに、①では遅れている。「最近の多くのモデルは 1T クラス、あるいはそれをやや上回る程度に留まっている」というわけです。

同規模の事前学習基盤の上に、より洗練された推論・エージェント RL を積み上げ続ければ、オープン側の進歩は収束し、最強のプロプライエタリとの差はむしろ開いていく。— 報告書 §1 の問題意識(要約)

「最強のプロプライエタリとの差」とは何か。報告書が具体名を挙げているのは Claude Fable 5GPT-5.6 Sol の2つで、総合性能ではこの2つに及ばないと自ら認めています。
ここで言われているのは、要するに土台の差です。推論時の工夫(②)は、あくまですでにできあがったモデルから引き出せる能力を伸ばすもの。だから土台(①)を 1T クラスに据え置いたまま②だけを磨き続けても、どこかで頭打ちになる。しかもクローズド側は①と②を両方伸ばしてくる。結果として、オープン側の到達点だけが先に収束してしまう——という課題感です。

だから K3 は両軸を同時に押し上げた — 事前学習を 3T クラスへ、かつ 1M 文脈で RL と長期対話をスケールさせる。これが「Open Frontier Intelligence」という副題の回収です。

この整理そのものが一番の収穫でした。「中国のオープンモデルが伸びている」という話は事実ですが、すでに真の課題を見出しているようです。

§2K2 から K3 で、何がどれだけ変わったか

報告書の Table 1 に、前世代 Kimi K2 との比較が載っています。数字で見ると、幅・深さ・疎性を同時に押し上げているのが分かります。

項目Kimi K2Kimi K3Δ
層数6193↑52%
総パラメータ1.04T2.78T↑167%
活性化パラメータ32.6B104.2B↑220%
ルーテッド・エキスパート数384896↑133%
トークンごとの活性エキスパート816↑100%
アテンションヘッド6496↑50%
学習時コンテキスト長128K1M
アテンション機構MLAHybrid KDA–MLA変更
活性化関数SwiGLUSiTU-GLU変更
ViT401M・27層新規

隠れ次元(7,168)と語彙サイズ(160K)は据え置きです。むやみに全部を大きくしたわけではない、という主張が読み取れます。

中核となった3つの技術
KDA
Kimi Delta Attention
効率的な長系列ミキシングを担う。ただし全部を KDA にはせず、周期的に Gated MLA 層を挟んで大域的な相互作用を保持している。
AttnRes
Attention Residuals
各層がそれ以前のすべての層の表現に選択的にアテンドできる。深さ方向の情報フローを確保する仕掛け。
MoE
Stable LatentMoE
896 エキスパート中 16 活性という極端な疎性を、正規化・SiTU-GLU・Quantile Balancing で安定化させている。

この3点の合わせ技で、K2 比のスケーリング効率が約 2.5 倍になったと報告されています。Fig.7 のスケーリング則曲線を見ると、この 2.5× は横軸(FLOPs)方向の差として示されています。つまり「lossが2.5倍良くなった」ではなく、同じ検証 loss に到達するのに必要な計算量が約 1/2.5 で済む、という意味です。

学習レシピの面でも、K3 は最初から言語と視覚を一緒に最適化するネイティブ・マルチモーダル方式を採っています。事前学習済みの言語モデルに後から視覚エンコーダを接ぎ木してアラインメントする、という手順を踏んでいません。単なる大型化ではなく「効く場所に容量を足した」という主張は、こうした設計の積み重ねに支えられています。

§3研究の作法として唸った所 ——「公平な比較」の徹底

この報告書でもっとも再利用価値が高いと思ったのは、実は性能の数字ではなく、学習率スケジュールの比較に関する、たった数行の記述です。

前提のメモ:「学習率スケジュール」とは、学習を進めるあいだ学習率(1回の更新でパラメータをどれだけ動かすか)をどう変化させるかの計画のことです。
ここで比べられているのは2方式。cosine decay はコサインカーブを描くように滑らかに下げ続ける方式、WSD(Warmup-Stable-Decay) はしばらく一定に保ってから最後に落とす方式です。

先行研究では WSD が cosine decay に匹敵、あるいは上回ると報告されている。しかし我々は、両者の最適ハイパーパラメータが著しく異なることを観測した。同じモデルサイズ・同じ学習トークン予算でも、最適なピーク学習率とバッチサイズが実質的に違う。

結果として、共通のハイパラ集合で両者を比較すると、たまたまそのハイパラに合っている側が不当に有利になりうる。公平な比較のため、各スケジュールについて独立にスケーリング則探索を実施した。— 報告書 §3.2(要約)

言い換えると、こういうことです。

2つの方式を比べるとき、普通は「条件を揃える」ためにピーク学習率もバッチサイズも同じ値にします。ところがこの2方式は、それぞれ得意な設定が違う

たとえるなら、2台の車の速さを比べるのに、両方へ同じギア比を強制するようなものです。そのギア比がたまたま片方の車に合っていれば、そちらが速いのは当たり前で、それは車の実力の比較になっていません。

そこで著者はそれぞれの方式について、別々に最適な設定を探し直してから比べました。その上で走らせると、cosine decay のほうが一貫して低い最終 loss に到達した — というのが結論です。

つまり「条件を揃えて比べる」ことが、かえって不公平になりうる。手間はかかりますが、比較の主張をするなら本来はここまでやる必要がある、ということです。

ベンチマークを作る側・読む側の両方にとって、これは効く話だと思います。「同一条件で比較しました」は一見フェアに見えますが、その条件が誰かに有利に働いていないかまでは保証していない。自分がベンチマークを設計するときにも、そのまま持ち帰れる論点でした。

§4Post-training は RL が主戦場

学習後の工程は3段階です。SFT でコールドスタートを作り、RL で「3ドメイン × 3つの推論努力レベル = 9つのエキスパート」を育て、最後に多教師 on-policy 蒸留(MOPD)で単一モデルへ畳み込みます。

用語のメモ
SFT(Supervised Fine-Tuning/教師あり微調整):お手本となる対話や作業ログを見せて、そのとおりに振る舞えるよう学習させる段階。「型を教える」工程です。
RL(Reinforcement Learning/強化学習):良い結果に報酬を与え、モデル自身に試行錯誤させて伸ばす段階。お手本のない領域でも上達させられる代わりに、設計を誤ると報酬を稼ぐことだけがうまくなる(報酬ハッキング)。
蒸留(distillation):できあがった複数の「先生モデル」の振る舞いを、1つの「生徒モデル」に写し取ること。ここでは9体の専門家を1体に畳み込むために使われています。

① SFT
コールドスタート
過去 Kimi シリーズのドメイン特化モデルで軌跡を合成し、多段階の検証+人手アノテーションを通す。この段階から量子化を意識した学習(QAT)を適用。
② RL
9つのエキスパート
general/general agents/coding agents の3ドメイン × {low, high, max} の3レベル。RL の計算量を増やすと、能力と同時にツール呼び出しのステップ数も伸びるのが8種類の評価すべてで観察されている。
③ MOPD
1つに畳む
9つのエキスパートを単一モデルへ統合。なお「より細粒度の蒸留も試したが明確な優位性はなかった」という否定的結果もきちんと書かれている。

ただし Fig.8 は軸に数値の目盛りが振られていません(縦軸は Score(%) と Avg. steps、横軸は RL FLOPs というラベルのみ)。したがってこれは「右肩上がりである」ことを示すトレンド図であって、定量的な図ではありません。どれだけ計算を投じたか、どれだけ伸びたかの絶対値は読み取れません。

細部で面白かったのは次の3つです。

「考えすぎ」にペナルティを与える
問題ごとに初期トークン予算 b₀(x) を見積もり、総消費が τ·b₀(x) を超えた軌跡には報酬 −1 を上書きする。τ を段階的に絞っていくことで max → high → low の各エキスパートを作る。max であっても上限を設けて overthinking を抑制している。
判定役に「手順」を強制する(Agentic GRM)
正解が定義できないタスクでは、判定エージェントに必須プロトコルを課している — (1) 出力(成果物・テキスト)を読む → (2) ルーブリックを生成する → (3) そのルーブリックで各候補を採点する → (4) 付けた点数をスコアパッドに記録する
「良し悪しを判断せよ」ではなく「採点基準を先に作らせてから採点させる」という順序が肝で、これは評価系を作るときにそのまま真似できる形です。
さらに「長く書けば高評価」という報酬ハッキングを防ぐため、出力長が σ·ℓ₀ を超えた候補は二値比較で自動的に負けになる、という冗長性の予算制御も入っています。

§5ベンチマーク ——「抜いた」の中身を見る

報告書の Fig.1 には12のベンチマークが載っています(すべて thinking effort を最大にした条件)。結果を数えると 1位が4件、2位が6件、3位が2件でした。

ベンチマークKimi K3順位トップ
ProgramBench77.8🥇 1位—(K3 が首位)
SWE-Marathon42.0🥇 1位—(K3 が首位)
BrowseComp91.2🥇 1位—(K3 が首位)
AutomationBench30.8🥇 1位—(K3 が首位)
Terminal-Bench 2.188.3🥈 2位GPT-5.6 Sol 88.8
FrontierSWE81.2🥈 2位Fable 5 86.6
Kimi Code Bench 2.0(自社内部)72.9🥈 2位Fable 5 76.9
JobBench54.3🥈 2位Fable 5 57.4
CharXiv (RQ) w/ tool91.3🥈 2位Fable 5 93.5
Zerobench w/ tool (Pass@5)41.0🥈 2位Fable 5 46.0
DeepSWE67.5🥉 3位GPT-5.6 Sol 73.0
GDPval-AA v2(Elo)1686🥉 3位Fable 5 1747

この表から読み取れることが3つあります。

  1. 1位を取った領域が、はっきり偏っている。SWE-Marathon(長期ソフトウェア開発)、BrowseComp(エージェント検索)、AutomationBench、ProgramBench — いずれも長期実行・エージェント系です。一方で総合的な職務遂行を測る GDPval-AA v2 では3位。つまり「1M 文脈で長期に動かす」という設計の狙いと、勝っている領域がきれいに一致しています。
  2. 自社の内部ベンチでも負けている。Kimi Code Bench 2.0 は自前のベンチマークですが、そこでも Fable 5(76.9)に対して 72.9。自分が勝つようにベンチを作っていない、という点は報告の姿勢として誠実だと感じました。
  3. SWE-Marathon は全体的にスコアが低い。首位の K3 でも 42.0、GPT-5.5 は 14.0、GLM-5.2 は 13.0。長期ソフトウェア開発は、現時点でどのモデルもまともに解けていないということです。裏を返せば、ここは伸びしろが大きい。

⚠️ 数値の扱いに注意。報告書は「Fable 5 の結果はすべて potential fallbacks を伴う」「GPT-5.6 Sol の結果はすべて potential cyberguards を含む」と明記しています。公開版の仕様上やむを得ない条件ですが、厳密な等条件比較ではありません
また、SNS では「中国が米国を抜いた」と要約されがちですが、正確には「特定のベンチマークで上回った、ただし総合では依然として差がある」です。報告書自身がそう書いています。

§6GPT-2 → Kimi K3 ——「スケールだけじゃない」の中身

ここからが、特に、一番面白かったところです。

22,580×
GPT-2(2019年・124M)が Kimi K3(2026年・2.8T)に収まる個数。
7年でおよそ 22,580 倍のスケールアップ。

なお、この 22,580 という数字は K3 の「総パラメータ 2.8T」と GPT-2 small(124M)を比べたものです。K3 は MoE なので1トークンあたりに実際に動くのは 104B。それでも約 840 倍ですが、「22,580倍」を額面どおり計算量の比と受け取ると過大評価になります。この点も含めて、次の話につながります。

この数字を掲げた worklog "From GPT-2 to Kimi3" の問いは、「それは単にスケールなのか?」でした。そして GPT-2 から K3 までのアーキテクチャの変遷を追っていくと、一本の筋が見えてきます。

固定容量の記憶には、追い出し(eviction)のポリシーが要る。

話の出発点は、身も蓋もない事実です。系列はいくらでも長くなるのに、記憶に使える容量は有限。この緊張関係を、どこでどう引き受けるかで設計が分かれます。

標準的な Softmax Attention は「全部そのまま覚えておく」という力技でこれを回避します。過去のトークンごとに専用の置き場(KV キャッシュ)があるので干渉は起きない。代わりに、覚える量が増えるほどメモリと計算が膨らんでいきます。

そこで登場したのが Linear Attention です。固定サイズの状態行列に足し込んでいくことで、系列がどれだけ伸びても記憶のサイズは一定に保てる。ただしここで代償が生まれます。同じ場所に足し続ければ、過去の記憶どうしが混ざって取り出せなくなるのです。

この問題を、worklog は Schlag らの Fast Weight Programmers 論文を引いて説明しています。要旨はこうです —— 系列長が容量を超えると、モデルは「容量オーバー」の状態に入る。そこで正しく動くには、記憶の中身とやりとりして、どの対応づけを残しどれを消すかを自分で決められなければならない。ただ足し続けるだけの命令はこの目的に適さず、有限の記憶に無限に足し込めば必ず限界に達する。

つまり「どう書き込むか」ではなく「どう消すか」が本丸になったわけです。ここから先の系譜は、その消し方の解像度を上げていく歴史として読めます。

世代解こうとした問題
Softmax Attention過去 N−1 トークン分をそのまま保持する。干渉はないが、メモリ帯域のボトルネックになるほど大きくなる。
Linear Attention固定サイズの状態に加算して更新し、O(N) の増大を防ぐ。ただし同じ操作が情報の干渉を生む。
DeltaNet「新しい事実を書くとき、その場所にあった古い情報を正確に置き換える」ことで復元可能性を回復。ただし置き換え先が特定できる記憶しか消せない。文脈の切り替えでまとめて消したり、容量を空けるために全体を薄めたりはできない。
Mamba-2前の状態を減衰させてから新しいものを加える。無制限な増大は防げるが、減衰が一律なので「1つだけ忘れたい」ができない(全部が等しく薄れる)。
Gated Delta Rule上の2つを合成。パラメータ α が 1 なら純粋な Delta 規則(ピンポイント置換)、0 なら記憶をクリアする。
KDA / Kimi Linearさらにチャンネルごとに別々の減衰値を学習する(fine-grained gating)。worklog はこれを「この論文の最も重要な貢献」と評している。

並べてみると筋が通っています。DeltaNet は「1点を正確に書き換える」ことはできるが「まとめて薄める」ことができない。Mamba-2 はその逆。Gated Delta Rule は両方できるが、薄め方はまだ全体一律。そして KDA は、その薄め方をチャンネル単位まで細かくした —— 消去の解像度が、一段ずつ上がってきたわけです。

だからこそ worklog は「これは闇雲なスケールアップではない」と書いています。K3 で増やした容量には「チャンネル単位で記憶の減衰を制御する」という具体的な数学的目的がある。パラメータを増やしたから賢くなったのではなく、増やした分を記憶の制御に使った、という順序です。

そして同じ発想が、時間方向だけでなく「深さ方向」にも効いているのが面白いところです。

層をまたぐ残差接続もまた、純粋な足し算です。すべての層の出力が同じ流れに足し込まれていくので、後段の層が全体に影響を与えようとするとどんどん大きな出力を学習せざるを得ず、学習が不安定になる。時間方向で起きていたのと同じ「加算による干渉」が、深さ方向でも起きているわけです。

そこで 各項に重みを掛けて「どの層の表現を取りに行くか」をモデルに選ばせるのが Attention Residuals です(12層ごとに配置、推論レイテンシの増加は約2%)。すべての層を等しく扱うのをやめ、いま必要な層の表現だけを選択的に取り出す。やっていることは、時間方向のゲーティングとまったく同じ形をしています。

7年かけて起きていたのは、記憶の解像度を、時間方向にも深さ方向にも上げていく作業だった。— 本記事の読み筋

ここが刺さりました。私は AI エージェントのループ設計で「使い捨ての作業メモリ」と「ラウンドをまたぐ長期記憶(LEDGER)」を物理的に分ける、という設計をずっと使っています。
アーキテクチャの側でも、結局のところ「有限の記憶に何を残し、何を捨てるか」という同じ問題を、gating・decay・選択的読み出しという形で解いていた。レイヤーはまったく違うのに、問題の形が同じなのは面白い偶然でした。

§7実装者として持ち帰ったもの

最後に、我々の開発に直接効きそうだと思った点を3つだけ。

③ について補足すると、なぜ普通のコンテナではダメだったのかが正直に書かれていて面白いです。エージェントは能力が上がるほど大胆に探索し、報酬ハッキングすら試みる。実際、初期実験では意図しないエージェントの操作でカーネルパニックとデッドロックが複数回発生したそうです。かといって探索を縛れば能力が落ちる。「ディスクをマウントし、コンテナを動かし、仮想マシンすら起動できる」現実に近い環境を、隔離を保ったまま与えるために microVM を選んだ、という筋の通し方でした。

① 評価設計
比較の公平性まで担保する
「共通条件で比べる」が不公平になりうる、という §3 の指摘。自分がベンチマークで「A より B が優れている」と言うときにも、条件ごとに独立にチューニングしたのかを明示する必要がある。
② 検証エージェント
人格ではなく手順で規定する
Agentic GRM の「読む → ルーブリックを作る → 採点する → 記録する」。判定役はキャラ設定ではなく手続きで縛るほうが筋がよさそう。
③ 実行基盤
環境の状態も一緒に保存する
100万トークン規模の RL を回すため、Firecracker の microVM を使った専用サンドボックス(AgentENV)を用意している。差分チェックポイント(前回以降に汚れたメモリページだけ保存)により、チェックポイント 133ms・再開 49ms を達成。

§8おわりに

数字としては「2.8兆パラメータ」「100万トークン」「22,580倍」がキャッチーですが、読み終えて残ったのはもっと地味な2つでした。

ひとつは、比較を公平にするための手間。もうひとつは、有限の記憶から何を捨てるかという設計の系譜です。どちらもスケールの話ではありません。

「大きくすれば強くなる」で説明を終えてしまうと、この7年で本当に積み上がったものを見落とす。そんなことを考えさせられる Kimi チームからの報告書でした。

出典・注記
  • Kimi Team「KIMI K3: OPEN FRONTIER INTELLIGENCE — Technical Report of Kimi K3」(全47頁)。モデル重みは HuggingFace moonshotai/Kimi-K3 で公開。
  • worklog「From GPT-2 to Kimi3, Explained」(@waterloo_intern, 2026-07-28)
  • 本記事の読解範囲は、報告書の Abstract・§1〜§4・インフラ章の要所・結論および一部 Appendix です。
  • 繰り返しになりますが、本報告書は査読を経ておらず、数値はすべて開発元の自己申告です。