Kimi K2: オープンウェイト思考モデル
Explore Kimi K2, Moonshot AI's open-weight thinking model with 1 trillion parameters, 128k token context, and benchmark-leading software engineering c...
Kimi K2は、Moonshot AIが2025年7月にリリースしたオープンウェイト思考モデルです。Mixture-of-Experts(MoE)トランスフォーマーアーキテクチャに基づいて構築されており、約1兆の総パラメータ数とトークンあたり320億のアクティブパラメータを持ちます。このモデルは、思考連鎖(CoT)推論、128,000トークンのコンテキストウィンドウ、およびエージェント型ツール利用ワークフローをサポートします。Kimi K2は、Moonshot AIの以前のロングコンテキスト推論モデルであるKimi k1.5の後継であり、DeepSeek R1やMetaのLlama 4と並び、同社がフロンティア・オープンウェイトモデルの分野に参入したことを示しています。
| 属性 | 値 |
|---|---|
| 開発者 | Moonshot AI |
| アーキテクチャ | Mixture-of-Experts (MoE) transformer |
| 総パラメータ数 | 約1兆 |
| トークンあたりのアクティブパラメータ数 | 約320億 |
| コンテキストウィンドウ | 128,000トークン(約96,000〜100,000語) |
| ライセンス | 改変MITライセンス |
| リリース日 | 2025年7月 |
| モデルバリアント | Kimi K2 base, K2-Instruct |
| 主なユースケース | ソフトウェアエンジニアリング、数学的推論、エージェントAIワークフロー |
["Moonshot AI とは","Kimi K2の技術アーキテクチャ","オープンウェイト vs. オープンソース:Kimi K2が実際に公開するもの","Kimi K2の思考法:推論モードの解説","Kimi K2のトレーニング方法","Kimi K2のベンチマーク性能","Kimi K2 vs. 競合モデル","Kimi K2の活用事例とエージェントとしての能力","Kimi K2へのアクセス方法","制限事項と正直なトレードオフ","よくある質問","あなたに合ったユースケースは? 決定フレームワーク"]
Moonshot AIとは?
Moonshot AIは、2023年に設立された北京を拠点とするAI研究企業です。アリババ(Alibaba)、テンセント(Tencent)、セコイア・チャイナ(Sequoia China)からの出資を受けており、欧米市場ではAI製品ブランド「Kimi」で広く知られています。同社の中国語名は英語で「Dark Side of the Moon(月の裏側)」と訳されます。Moonshot AIは、DeepSeek、Baidu、Alibaba Cloudと並び、中国国内で多額の資金提供を受けている主要なAIラボの一つとして活動しています。
同社は、長編書籍を単一のプロンプトとして処理できる最初のモデルの一部を開発し、ロングコンテキストリサーチで初期の評判を築きました。その消費者向け商品であるKimiチャットアシスタントは、中国全土で数千万人のユーザーを獲得しました。Kimi K2は、Moonshot AI初のフロンティアスケールでの一般公開されたオープンウェイトモデルです。
Alibabaは二重のポジションにあり、Moonshot AIへの投資家であると同時に、自社のQwen 2.5モデルシリーズを通じて直接競合する相手でもあります。Moonshot AIの資金調達実績と製品実績は、同社を投機的なスタートアップではなく、真面目な研究組織としてのポジションに置いています。
Moonshot AIの会社概要および全商品ラインナップの全体像については、Moonshot AI:会社概要およびKimi商品ガイド.
Kimi K2の技術アーキテクチャ
Kimi K2は、GPT-4やClaudeの基盤となっているアーキテクチャタイプと同じ、Mixture-of-Experts(MoE)トランスフォーマーアーキテクチャを採用しています。この設計により、モデルは合計1兆パラメータまでスケーリング可能でありながら、推論コストを320億パラメータの密な(dense)モデルと同等に抑えることができます。
Kimi K2におけるMixture of Expertsの仕組み
Mixture of Experts(エキスパート混合)を、何百人もの専門医がいる大きな病院と考えてください。患者が来院すると、病院のすべての医師がすべての診察に参加するのではなく、関連する専門医のみがその症例に対応します。モデルは、すべてのパラメータを同時に起動するのではなく、各入力をネットワークの関連するサブセットにルーティングします。
「エキスパート混合 (MoE)」とは、モデルがパラメータを「エキスパート」と呼ばれる専門化されたサブネットワークに分割するスパースTransformerアーキテクチャです。学習済みのルーティングメカニズムにより、各入力トークンに対し、全パラメータをすべての計算で実行するのではなく、これらのエキスパートのごく一部のみをアクティブ化します。これにより、推論時には、はるかに小規模なモデルの計算量で、非常に大規模なネットワークの知識容量を保持するモデルとなります。
Kimi K2は、数百の専門家サブネットワークにわたって構成された約1兆個の総パラメータを備えています。推論中、トークンごとにアクティブ化されるのはそのうちの約320億パラメータのみです。これは、推論コストが1Tの高密度モデルではなく、32Bの高密度モデルと同等であることを意味します。DeepSeek R1とMixtralも同じアーキテクチャ原理を使用しており、この規模におけるMoEを実証済みの先行技術として確立しています。
実践的な意味 本番環境でKimi K2を運用するコストは、320億パラメータのデンスモデルを運用する場合とほぼ同等です。1兆パラメータという数値は総知識容量を表すものであり、クエリあたりの計算コストではありません。セルフホストでのデプロイを検討しているチームにとって、関連するハードウェアの基準は1T(1兆)モデルではなく、32B(320億)デンスモデル相当となります。
コンテキストウィンドウと推論仕様
Kimi K2は、128,000トークンのコンテキストウィンドウをサポートしており、これは単一のプロンプトで約96,000から100,000語の入力を意味します。具体的に言うと、長編小説の全文、ソフトウェアリポジトリ全体、あるいは1年分の会議議事録は、Kimi K2の単一コンテキスト内に収めることができます。
この能力は、単なる文書要約の枠を超えて重要です。パッチを記述する前にコードベース全体を読み取る必要があるエージェンティックなワークフローや、レポートを合成する前に複数の文書を取り込むリサーチパイプラインなどは、複数の呼び出しにわたって情報を損失することなく機能させるために、大規模なコンテキストウィンドウに依存しています。
オープンウェイト vs. オープンソース:Kimi K2が実際に公開するもの
Kimi K2はオープンウェイトであり、完全なオープンソースではありません。学習済みモデルの重みは改変されたMITライセンスの下で公開ダウンロード可能ですが、Moonshot AIはトレーニングデータや完全なトレーニングコードを公開していません。
「Kimi K2」に関する多くの記事では、「オープンソース」と「オープンウェイト」が同義であるかのように使われています。しかし、それらは異なります。
オープンウェイト vs. オープンソース:Kimi K2が実際に公開するもの
Kimi K2のオープンウェイト公開で「できること」: Kimi K2のオープンウェイト公開で「想定できない(できない)こと」: Hugging Faceからトレーニング済みのモデルウェイトをダウンロードする 事前学習データセットへアクセスする 自身のハードウェアでローカルに推論を実行する フル・トレーニング・パイプラインを独立して再現する 自身のデータでウェイトをファインチューニングする 規制やコンプライアンスの文脈において、モデルが「完全にオープン」であると主張する 商用製品にモデルをデプロイする(ライセンス条項に従う) 標準的なMITライセンスの条項を超えて、変更されたMITライセンスの制限を無効にする
Kimi K2は、改訂版MITライセンスの下でリリースされています。標準的なMITライセンスは許容度が高く、一般的に商用利用、改変、および再配布が許可されています。「改訂版MIT」ライセンスは、これらの条項以外に条件が追加されている場合があります。商用展開を行う前に、公式のKimi K2ライセンスファイル.)で具体的な条項を確認してください。ライセンス条項は、本記事の公開後に更新される可能性があります。
Kimi K2の思考の仕組み:推論モードの解説
Kimi K2は思考モデルです。これは、プロンプトに対して即座に回答するのではなく、最終的な回答を出す前に詳細な内部推論プロセス(reasoning trace)を生成することを意味します。この動作こそが、デフォルトモードのGPT-4oやClaudeといった標準的な指示追従型モデルとKimi K2を分かつ特徴です。
思考モデルとは何ですか?
定義:思考モデル 思考モデルは、最終的な回答を出す前に、可視化された思考の連鎖(CoT)の推論プロセスを生成します。この拡張された内部推論プロセスは、サブ問題に取り組み、中間的な結論を確認し、回答を確定する前に誤りを修正します。その結果、複数のステップ、数式の導出、コードのデバッグ、または形式論理を伴う複雑なタスクにおいて、測定可能なほど高い精度を実現します。「思考モデル」、「推論モデル」、「思考の連鎖モデル」という用語はすべて、同じ能力のパラダイムを指します。
OpenAIのo1およびo3モデルは、最初に広く認知された思考モデルであり、このカテゴリーを確立しました。DeepSeek R1は、オープンウェイトの分野に同様のパラダイムをもたらしました。Kimi K2もこれと同じカテゴリーのモデルに属します。Moonshot AIのテクニカルレポートによると、多段階の数学的推論をテストするAIME 2025数学ベンチマークにおいて、Kimi K2は約49.5%のスコアを記録し、大学院レベルの科学的推論ベンチマークであるGPQA Diamondでは約75.1%のスコアを記録しています。
K2-Instructにおける思考モード vs 非思考モード
K2-Instructは、Kimi K2ベースの指示追従およびチャット対応版であり、シンキングモードとノンシンキングモードという2つの異なる動作モードをサポートしています。
思考モードは、完全なCoT(思考の連鎖)推論トレースを有効にします。モデルは最終的な回答の前に、中間的な推論ステップを可視化したスクラッチパッドを生成します。複雑なアルゴリズム問題の解決、微細なレースコンディションのデバッグ、多段階の証明の遂行など、レイテンシよりも精度が重視されるタスクで思考モードを使用してください。
非思考モードは、深い推論よりもスピードが重視されるタスクに適しています。事実に基づく質問への回答、ボイラープレートコードの生成、回答に多段階の導出を必要としないドキュメントの要約などがその例です。拡張されたトレース(推論プロセス)がないため、レスポンスがより速く届きます。
具体的な例として、Kimi K2に「2 + 2 は何?」と尋ねると、どちらのモードでも同じ正しい答えが得られます。「500行のPython関数で、バイナリサーチの実装にオフバイワンエラーが報告されている場合、そのバグを特定して修正してください」と尋ねると、思考モードは回答する前に論理をステップバイステップで実行しますが、非思考モードはより高速ですが信頼性の低い結果を生成する可能性があります。APIではモードを切り替えることができます。このトグルを制御するAPIパラメータについては、Kimi K2へのアクセス方法セクションを参照してください。
Kimi K2のトレーニング方法
Kimi K2のトレーニングは、Moonshot AIがモデルの技術レポートで説明しているマルチステージのパイプラインに沿って実施されました。このパイプラインは、大規模な事前学習、強化学習ステージ、カスタムオプティマイザを組み合わせて、最終的なモデルの性能を引き出します。
トレーニングパイプライン
Moonshot AIは、公式技術レポートに記載されている通り、4つの逐次的なステージを通じてKimi K2をトレーニングしました:
- テキストおよびコードの広範なコーパスでの大規模事前学習により、モデルの一般的な知識と言語理解を構築します。
- 厳選された指示追従データでの**教師ありファインチューニング(SFT)**により、モデルに、ユーザーのプロンプトに有用な形式で応答するように教えます。
- ルールベースの報酬を用いた**強化学習(RL)**により、モデルは検証可能なタスクで正解した場合に肯定的なシグナルを受け取り、推論能力とツール使用動作を改善するようにトレーニングされます。
- トレーニング全体でのMuonClipオプティマイザーの適用により、大規模でのトレーニングプロセスを安定化させます。
強化学習(RL)の段階については、簡潔な説明が必要です。出力例を模倣するようにモデルを学習させる標準的な教師ありファインチューニングとは異なり、RLは推論タスクにおいて正しい回答を生成したモデルに報酬を与え、その動作を反復的に調整します。Kimi K2のRLフレームワークはルールベースの報酬を採用しています。つまり、人間のフィードバックによる強化学習(RLHF)だけに依存するのではなく、検証可能なグラウンドトゥルースと照らし合わせて回答を検証します。この違いは技術評価者にとって重要です。ルールベースのRLは、正解が客観的に測定可能であるため、数学やコードのような構造化されたタスクにおいて、推論能力のより一貫した向上をもたらす傾向があるからです。
MuonClip:Moonshot AIによるトレーニングの革新
MuonClipは、Moonshot AIが大規模MoEモデルの学習を安定化させるために特別に開発したカスタムトレーニングオプティマイザーです。Kimi K2に関するほとんどの解説では、MuonClipは軽く触れられる程度にしか言及されていません。そのため、このセクションではより深く掘り下げます。
簡単な言葉で言うと、ニューラルネットワークのトレーニングとは、エラー信号に基づいて数百万(あるいは数兆)ものパラメータを繰り返し調整することです。1兆パラメータのMoEモデルの規模では、その調整は、パラメータの更新が制御不能に増大し「グラディエント爆発」と呼ばれる現象を引き起こすことで、不安定になることがあります。MuonClipは、パラメータの幾何学的特性に基づいてステップサイズを適応させる勾配降下法のバリアントであるMuonオプティマイザと、暴走する値を防ぐために個々のパラメータ更新の最大サイズを上限設定する技術である勾配クリッピングを組み合わせることで、これを解決します。MuonClipという名前は、これら2つのコンポーネントを組み合わせた造語です。
技術的なレベルでは、標準的な大規模言語モデルの学習にはAdamWオプティマイザが使用されます。Moonshot AIのテクニカルレポートによると、MuonClipは大規模なMoEアーキテクチャで一般的に発生する学習の不安定性に対処するため、勾配クリッピングを取り入れることでMuonオプティマイザを改良したものです。Moonshot AIは、このアーキテクチャにおいてMuonClipがAdamWと比較して学習の安定性と最終的なモデル品質を向上させると報告しています。これらはMoonshot AIの主張であり、Kimi K2テクニカルレポート(arXiv:2502.16982 — 引用前にURLを確認してください)に基づいています。公開時点では、独立したサードパーティによるこれらの主張の検証が進行中でした。
実践的な意味 学習の安定性が向上することで、学習プロセスにおいてより信頼性の高い収束が可能になり、その結果として最終的なモデル性能の強化につながります。MuonClipは単なるハイパーパラメータの選択肢ではなく、Moonshot AIはこれを超大規模MoEモデルにおける学習の不安定性という課題に対する研究上の貢献であると位置づけています。この安定性に関する主張が第三者による評価でも裏付けられれば、最先端のオープンウェイトモデルの学習手法における有意義な進歩となります。
Kimi K2 ベンチマーク性能
下記の表は、Moonshot AIの技術レポートに基づき、Kimi K2の6つのベンチマークにおけるスコアをまとめたものです。各ベンチマークの説明では、スコアが実際には何を測定しているのかを解説しています。なぜなら、文脈なしのパーセンテージは、そのモデルを使用すべきかどうかを判断する上で何も教えてくれないからです。
| ベンチマーク | テスト内容 | Kimi K2スコア | 参照スコア |
|---|---|---|---|
| SWE-bench Verified | 実際のソフトウェアリポジトリで対象を絞ったコード変更を行い、現実世界のGitHubの問題を解決する | ~65.8% | DeepSeek R1: ~49.2% |
| GPQA Diamond | 生物学、化学、物理学にわたる大学院レベルの科学的推論 | ~75.1% | GPT-4o: ~53.6% |
| MMLU | 57の科目にわたる幅広い学術的知識 | ~87.4% | DeepSeek R1: ~84.0% |
| AIME 2025 | コンテストレベルの問題を使用した多段階の数学的問題解決 | ~49.5% | DeepSeek R1: ~70.0% |
| LiveCodeBench | トレーニングデータ汚染を削減するため、競技プログラミングコンテストから継続的に更新される問題に対するコーディング能力 | ~53.7% | DeepSeek R1: ~65.9% |
| Tau-bench (Airline) | シミュレートされたカスタマーサービス環境での多段階ツール使用とエージェンティックなタスク完了 | ~54.9% | GPT-4o: ~46.0% |
ベンチマークの数値は、Moonshot AIのテクニカルレポートおよびKimi K2モデルカードに基づいています。これらの数値はリリース時点での自己申告値であり、独立した評価の完了に伴い更新される場合があります。導入を決定する前に、公式のテクニカルレポートで最新のスコアを確認してください。
実務家にとっての Headline な結果は SWE-bench Verified です。このベンチマークは、モデルが実際の GitHub のイシューの説明を受け取り、関連するコードを読み取って、人間によって検証されたリポジトリの問題を実際に修正するパッチを作成できるかどうかをテストします。このベンチマークにおける約 65.8% というスコアにより、Kimi K2 は 2025 年 7 月時点の実用的なソフトウェアエンジニアリングタスクにおいてトップクラスの性能を持つオープンウェイトモデルの 1 つとなり、同ベンチマークにおける DeepSeek R1 の約 49.2% を大きく上回っています。
AIME 2025では、比較が逆転し、DeepSeek R1はKimi K2の約49.5%に対して約70.0%のスコアを記録しました。これは、純粋な数学コンペティション問題においてDeepSeek R1が優位であることを示唆しています。GPQA Diamondの科学的推論においては、Kimi K2の約75.1%がGPT-4oの約53.6%を大幅に上回っています。
実践的な意味 Kimi K2のベンチマークプロファイルは、工学や科学的推論タスクに適した候補であることを示しています。主なユースケースがソフトウェア開発支援や科学的分析である場合、SWE-benchおよびGPQAのスコアが直接的に関連します。純粋な数学競技の問題をベンチマークとするのであれば、現在DeepSeek R1の方がAIME 2025で高いスコアを記録しています。どちらのモデルもすべてのタスクで圧倒しているわけではなく、導入の意思決定においてはそのように捉えるのが正確です。
Kimi K2 対 競合モデル
Kimi K2を主要な競合モデルと比較することで、ベンチマークにおいてどの領域でリードしているか、どの領域で性能が同等か、そして導入の意思決定においてどのトレードオフが重要であるかが明らかになります。以下の比較は、根拠のない一般化を避けるため、特定のベンチマークに限定されています。
Kimi K2 vs. DeepSeek R1
Kimi K2とDeepSeek R1はどちらもオープンウェイトのMoE思考モデルであり、これは最も直接的なアーキテクチャ比較となります。どちらも思考連鎖(chain-of-thought)の推論トレースを生成し、ダウンロード可能なウェイトとして利用可能です。主な違いは、ベンチマークプロファイル、パラメータスケール、トレーニング方法論にあります。
| 項目 | Kimi K2 | DeepSeek R1 |
|---|---|---|
| アーキテクチャ | MoE トランスフォーマー | MoE トランスフォーマー |
| 総パラメータ数 | 約1兆 | 約6,710億 |
| トークンあたりのアクティブパラメータ数 | 約320億 | 約370億 |
| 思考モード | あり (K2-Instruct) | あり |
| SWE-bench Verified | 約65.8% | 約49.2% |
| AIME 2025 | 約49.5% | 約70.0% |
| LiveCodeBench | 約53.7% | 約65.9% |
| MMLU | 約87.4% | 約84.0% |
| トレーニングの革新性 | MuonClip オプティマイザー | GRPO 強化学習 |
ソフトウェアエンジニアリングのタスク(SWE-bench Verified)において、Kimi K2は大幅な証拠金でリードしています。数学競技の問題(AIME 2025)や競技プログラミング(LiveCodeBench)では、DeepSeek R1の方が高いスコアを獲得しています。一般知識(MMLU)については、Kimi K2がわずかにリードしています。どちらのモデルも一律に優れているわけではなく、アプリケーションにおいてどのタスクカテゴリが重要かによって選択は異なります。
DeepSeekの思考プロセスを伴わない高密度指示モデルであるDeepSeek V3は、非推理タスクの比較における標準的なベースラインを提供しています。思考を伴わないモードのKimi K2を指示追従ベンチマークでDeepSeek V3と比較した場合、パフォーマンスは概ね同等ですが、直接的な公平な評価を行うには同等の推論設定を使用する必要があります。
Kimi K2 および DeepSeek R1 は、Meta の Llama 4 と共に、オープンウェイトモデルの最前線に参入しました。Kimi K2 技術レポートの公開時点では、Kimi K2 と Llama 4 の直接的なベンチマーク比較データは利用できませんでした。最新の比較については、現在のベンチマークリーダーボードを参照してください。
Kimi K2 対 Claude Sonnet および GPT-4o
Kimi K2をClaude SonnetやGPT-4oと比較することは、どの思考モデルがより強力かという点ではなく、オープンウェイトモデルが管理型のプロプライエタリAPIを置き換えるのに十分な性能を備えているかどうかという、別の視点での判断を提示するものです。
SWE-bench Verifiedにおいて、Kimi K2は約65.8%のスコアを記録しています。Claude Sonnet 4の具体的なSWE-bench Verifiedのスコアは、執筆時点では第三者機関によって確認されていません。直接比較を行う前に、最新の数値についてはAnthropicが公開しているベンチマークドキュメントを参照してください。Claude Sonnetは、レート制限、セーフティフィルタリング、稼働率保証が組み込まれたマネージドAPIを提供しており、インフラ構築のオーバーヘッドもありません。Kimi K2はオープンウェイトで提供されており、トークンごとのAPIロックインがなく、完全に自社のハードウェア上で実行することが可能です。トークンごとのコストが累積するような大量のリクエストを処理するチームにとって、オープンウェイトモデルをセルフホスティングすることの経済性は、スケールに応じて大幅に向上します。
GPT-4oはOpenAIのマルチモーダル指示追随モデルであり、OpenAIの専用思考モデルであるo1およびo3とは異なります。Kimi K2の思考モードとGPT-4oの標準モードの直接的な比較は、アーキテクチャ上、完全には同等ではありません。GPQAダイヤモンド科学的推論において、公開されているベンチマークデータによると、Kimi K2の約75.1%はGPT-4oの約53.6%を大幅に上回っています。推論およびコーディングタスクにおいて、Kimi K2は、以前はプロプライエタリAPI経由でしかアクセスできなかったパフォーマンスレベルに到達し、その依存なしにデプロイ可能となっています。
このトレードオフは実用的なものです。ClaudeやGPT-4oは、セルフホスト型のオープンウェイトモデルにはデフォルトで備わっていない、管理された信頼性と安全性のインフラストラクチャを提供します。コンプライアンス要件があるチームや、余剰のGPUインフラストラクチャを持たないチームは、その運用上のギャップを評価に考慮すべきです。
Kimi K2 vs. Kimi K3
Kimi K3は、Kimi K2の後にリリースされたMoonshot AIの次世代フラッグシップ推論モデルです。Kimi K2がオープンウェイトMoE推論のベースラインを確立したのに対し、Kimi K3はアーキテクチャとベンチマークのプロファイルをさらに進化させています。K2を導入するか、直接K3に移行するかを検討しているチームにとって、主な比較ポイントはパラメータスケール、ベンチマークのデルタ、および推論コストです。
Kimi K3のアーキテクチャ、ベンチマークパフォーマンス、およびアクセスオプションの詳細については、Kimi K3: Moonshot AIのフラッグシップ推論モデル.)をご覧ください。
Kimi K2のユースケースとエージェント機能
Kimi K2は、3つの主要なユースケースカテゴリ、すなわちソフトウェアエンジニアリングおよびコーディング、数学的・科学的推論、マルチステップのエージェントタスク完了を念頭に設計されました。前項のベンチマークスコアは、これらのカテゴリに直接対応しています。
Kimi K2:エージェントの基盤として
エージェンティックAIとは、各ステップで人間の指示を必要とせずに、ウェブ検索、コード実行環境、ファイルシステム、APIといった外部ツールを呼び出し、複数ステップのタスクを自律的に計画・実行できるシステムのことです。これは、行動を起こす前に人間のプロンプトを待つ標準的なチャットボットとは異なります。
Moonshot AI の技術レポートによると、Kimi K2 は Tau-bench の航空ドメインベンチマークで約 54.9% のスコアを記録しました。Tau-bench は、シミュレーション環境におけるマルチステップのツール利用とエージェントによるタスク完了をテストしており、エージェンティック能力の主張に対する最も直接的なベンチマーク証拠となります。
これが実際にどのようになるか、2つの具体的なワークフローシナリオで説明します。
シナリオ1:ソフトウェアエンジニアリングエージェント。 開発者がKimi K2をGitHubリポジトリに誘導し、報告されたバグについて「高コンカレンシーなリクエストにおいて、認証フローでレースコンディションが発生している」と説明します。Kimi K2は関連するソースファイルを読み込み、レースコンディションを引き起こしているロッキングパターンを特定し、適切なミューテックス処理を導入するパッチを生成した上で、既存のテストスイートを実行してデグレードが発生していないことを検証します。人間がそのプルリクエストを確認し、マージします。モデルは、ステップバイステップの指示なしに、特定・診断・修正・検証のサイクル全体を完遂しました。
シナリオ2:リサーチ統合エージェント。 ここでのアウトプットは、SaaSベンダー5社の料金モデルを構造化した競合分析であり、標準化されたデータと推奨事項セクションが含まれています。これを作成するために、Kimi K2は各ベンダーの公開料金APIまたはドキュメントページに照会を行い、データを一貫したスキーマに標準化し、ベンダー間で異なる料金変数にフラグを立てます。レポートを受け取った商品ストラテジストは、ステークホルダーに配布する前に推奨事項の構成を確認します。手動でのデータ収集は一切行われておらず、エージェントが各取得および統合ステップを自律的に処理しました。
これらのシナリオは、コードベース全体やドキュメントセットをコンテキスト内に保持することを可能にするKimi K2の128,000トークンのコンテキストウィンドウに依存しています。また、単一のタスク内で多段階の意思決定を処理するためのツール利用能力と思考モードの推論にも依存しています。
Kimi K2が得意とするタスクは何ですか?
Moonshot AIの技術レポートによると、Kimi K2はこれら5つのカテゴリーのタスクにおいて最高スコアを記録しています。
- ソフトウェアエンジニアリングとコードパッチ適用: SWEベンチマークVerified ~65.8%、2025年7月現在、オープンウェイトモデルでトップクラスのスコア
- 科学および大学院レベルの推論: GPQAダイヤモンド ~75.1%、同ベンチマークにおけるGPT-4oの公表スコアを大幅に上回る
- 幅広い学術的知識: MMLU ~87.4%、57の科目分野を網羅
- エージェントによるツール使用とタスク完了: TauベンチマークAirline ~54.9%、マルチステップの自律的なタスク完了を測定
- ロングドキュメント分析: 128,000トークンのコンテキストウィンドウにより、単一のプロンプトでフルコードベースまたはフルドキュメントの処理が可能
Moonshot AIが報告した数値によると、DeepSeek R1は現在、数学競技の問題(AIME 2025:約49.5%)や競技プログラミング(LiveCodeBench:約53.7%)の分野において、より高いスコアを記録しています。
Kimi K2へのアクセス方法
Kimi K2は、Hugging FaceのKimi K2-Instructモデルカード、Moonshot AI公式API、OpenRouterの3つのチャネルで利用できます。
BybitでのMOONSHOTトークンの取引:Moonshot AIの成長は暗号資産トレーダーの注目を集めています — Bybitでは、MOONSHOTトークンの取引に関心のある方向けに、MOONSHOTUSDT無期限先物)を提供しています。また、BybitでのMoonshot AIのIPO取引機会.)もご覧ください。
アクセスチャネル概要
| チャネル | メソッドタイプ | 費用 | 最適な用途 |
|---|---|---|---|
| Hugging Face(重みダウンロード) | セルフホスト推論 | ダウンロード無料。インフラストラクチャ費用が別途かかります。 | GPUクラスターを保有し、デプロイメントの完全な制御を求めるチーム |
| Moonshot AI API | マネージドAPI | トークンごとの従量課金(プラットフォーム.moonshot.cnで最新価格をご確認ください) | インフラストラクチャのセットアップなしで迅速なアクセスを求める開発者 |
| OpenRouter | サードパーティAPIアグリゲーター | トークンごとの従量課金(openrouter.aiで最新価格をご確認ください) | 複数のモデルプロバイダー間で統合APIを使用する開発者 |
モデルの重みはHugging Faceから無料でダウンロードできます。Moonshot AIまたはOpenRouter経由のAPIアクセスには、トークンごとのコストがかかります。新しくリリースされたモデルのAPI価格は頻繁に変更されるため、デプロイを決定する前に、各プロバイダーの料金ページで現在の入出力トークンのコストを直接確認してください。本記事の価格情報は、公開時点で入手可能な情報を反映したものです。OpenRouterはサードパーティのアグリゲーションサービスであり、Moonshot AIとは提携していません。
公式Kimi K2技術レポートは、arXiv上のKimi K2技術レポート(arXiv:2502.16982 — 引用前にURLを確認してください)で公開されています。これは、本記事全体で引用されているベンチマーク値およびトレーニング手法の詳細に関する、一次情報源です。
K3およびK2のKimi API価格ティアの全容を把握するには、Moonshot Kimi API 料金 2026:プランと料金ガイド.) をご覧ください。
Hugging Faceからのウェイトのダウンロード
Kimi K2-Instructのウェイトを、Hugging Face上のKimi K2-Instructモデルカード.から直接ダウンロードしてください。
ローカルデプロイメントの開始手順:
- まだお持ちでない場合は、Hugging Faceのアカウントを作成してください。
huggingface.co/moonshotai/Kimi-K2-Instructにアクセスし、モデルカードで最新のドキュメントを確認してください。- Hugging Faceの
transformersライブラリをインストールします:pip install transformers。 huggingface-cli download moonshotai/Kimi-K2-Instructを使用するか、transformersのAutoModel APIを介してウェイトをダウンロードします。- 商用利用を開始する前に、公式Kimi K2ライセンスファイル)でライセンス条項を確認してください。
ローカル推論のハードウェア要件: 総パラメータ数約1兆個のフルプレシジョン Kimi K2 モデルは、大規模なGPUインフラストラクチャを必要とします。BF16フルプレシジョン推論の場合、複数の高メモリGPU(例:8基のH100 80GB または同等品)が必要になると予想されます。量子化されたバリアント(GGUF、AWQ、GPTQ形式)はハードウェア要件を大幅に削減します。デプロイ時点での利用可能な量子化バージョンについては、Hugging Faceのモデルカードおよびコミュニティリポジトリを確認してください。マルチGPUクラスターへのアクセスがないユーザーは、ローカルデプロイを試みるのではなく、上記のAPIアクセスチャネルを使用してください。
Kimi K2 APIの呼び出し
Moonshot AI APIはOpenAI互換のインターフェースに準拠しているため、既存のLLMクライアントライブラリは最小限の変更で済みます。以下に、Moonshot AIのエンドポイントを指定した openai Pythonライブラリの使用例を示します。
以下に示すAPIエンドポイント、モデル識別子、および認証方法は、執筆時点での利用可能なインターフェースを反映しています。使用前に、Moonshot AIのAPIドキュメントで最新情報を確認してください。
from openai import OpenAI
Kimi K2: オープンウェイト思考モデル
Explore Kimi K2, Moonshot AI's open-weight thinking model with 1 trillion parameters, 128k token context, and benchmark-leading software engineering c...
Kimi K2: オープンウェイト思考モデル
Explore Kimi K2, Moonshot AI's open-weight thinking model with 1 trillion parameters, 128k token context, and benchmark-leading software engineering c...
client = OpenAI( api_key="YOUR_MOONSHOT_API_KEY", base_url="https://api.moonshot.cn/v1", # 現在のエンドポイントを確認してください )
Kimi K2: オープンウェイト思考モデル
Explore Kimi K2, Moonshot AI's open-weight thinking model with 1 trillion parameters, 128k token context, and benchmark-leading software engineering c...
response = client.chat.completions.create( model="kimi-k2-instruct", # 現在のモデル識別子を確認してください messages=[ {"role": "user", "content": "ミューテックスとセマフォの違いを説明してください。"} ] ) print(response.choices[0].message.content)
Kimi K2: オープンウェイト思考モデル
Explore Kimi K2, Moonshot AI's open-weight thinking model with 1 trillion parameters, 128k token context, and benchmark-leading software engineering c...
Kimi K2: オープンウェイト思考モデル
Explore Kimi K2, Moonshot AI's open-weight thinking model with 1 trillion parameters, 128k token context, and benchmark-leading software engineering c...
response_thinking = client.chat.completions.create( model="kimi-k2-instruct", messages=[ {"role": "user", "content": "このPython関数をデバッグし、修正内容を説明してください: [ここにコードを貼り付け]"} ], extra_body={"thinking": True}, # 現在のドキュメントでパラメータ名を確認してください ) print(response_thinking.choices[0].message.content)
Moonshot AI公式APIの料金は変更される場合があります。導入の決定を行う前に、Moonshot AIの料金ページで現在の入力・出力トークンのコストを直接ご確認ください。
制約と率直なトレードオフ
Kimi K2のベンチマークスコアは約49.5%(AIME 2025)から約87.4%(MMLU)の範囲に及び、導入の意思決定においては以下のトレードオフが重要となります。
["トレーニングデータとコードは公開されていません。オープンウェイトリリースは、学習済みウェイトのみを提供します。トレーニングの完全な再現性、トレーニングプロセスの学術的な複製、またはトレーニングデータの出所に関する規制上の透明性を必要とする組織は、このリリースだけではそれらの要件を満たすことができません。","ローカルデプロイメントには、相当なGPUインフラストラクチャが必要です。1兆パラメータのMoEモデルにおけるフルプレシジョン推論は、コンシューマーハードウェアでは実現不可能です。マルチGPUクラスターへのアクセスがないチームは、APIアクセスまたは量子化されたバリアントに依存する必要があります。これは出力品質に影響を与える可能性があります。","ベンチマークの数値は、ローンチ時にMoonshot AIによって自己報告されたものです。すべてのベンチマークスコアの独立したサードパーティによる検証は、公開時点では進行中でした。モデルローンチ時の自己報告スコアは、後日の独立評価からいくらかのばらつきを示すことが歴史的にありました。スコアは、決定的に検証されたものではなく、方向性を示す情報として扱ってください。","APIの利用可能性はMoonshot AIのインフラストラクチャに依存します。ウェイトをダウンロードしてローカルで実行するのと異なり、APIベースのアクセスはサードパーティサービスへの依存を生み出します。厳格なアップタイム要件を持つチームは、この運用上の依存関係を計画する必要があります。","改訂されたMITライセンスには、標準的なMITを超える制限が含まれる可能性があります。標準的なMITは許容的ですが、Moonshot AIの改訂版には条件が追加されている場合があります。IPに敏感なデプロイメントを行う組織の法務チームは、ライセンス名だけでなく、実際のライセンスファイルを確認する必要があります。","ローンチ時点では、ネイティブなマルチモーダル機能は確認されていません。Kimi K2はテキストおよびコードモデルです。初期ローンチ後に、追加されたマルチモーダルアップデートについては、最新のモデルカードを確認してください。","セルフホスティング時の安全対策は、デプロイ担当者の責任です。オープンウェイトモデルには、プロプライエタリAPIがデフォルトで適用する管理された安全フィルタリングは含まれていません。Kimi K2をローカルでデプロイするチームは、独自のコンテンツおよび安全レイヤーを実装する必要があります。"]
よくある質問
これらの質問は、2025年7月のローンチ後、「他のユーザーも検索しています」のパターンに基づき、Kimi K2に関する最もよく検索されている内容を反映しています。
Kimi K2とDeepSeek R1の違いは何ですか?
Kimi K2とDeepSeek R1は、どちらもチェーン・オブ・ソート(CoT)推論トレースを生成するオープンウェイトMoE思考モデルです。Kimi K2の総パラメータ数は約1兆であるのに対し、DeepSeek R1は約6710億であり、SWE-bench Verified(約65.8%対約49.2%)およびMMLUでより高いスコアを記録しています。DeepSeek R1はAIME 2025(約70.0%対約49.5%)およびLiveCodeBenchでより高いスコアを記録しています。主なトレーニング上の違いは、Kimi K2がMoonshot AIの研究貢献であるMuonClipオプティマイザーを使用している点です。
Kimi K2はオープンソースですか、それともオープンウェイトですか?
Kimi K2はオープンウェイトであり、完全なオープンソースではありません。学習済みのモデルウェイトは修正MITライセンスの下で一般公開されており、ダウンロード可能ですが、Moonshot AIは事前学習データセットや完全なトレーニングコードを公開していません。オープンウェイトとは、モデルのダウンロード、実行、およびファインチューニングが可能であることを意味しますが、トレーニングプロセスを完全に再現するために必要なすべてのリソースにアクセスできるという意味ではありません。
AIにおける思考モデルとは何ですか?
思考モデルは、最終的な回答を生成する前に、即座に応答するのではなく、中間ステップを処理しながら、拡張された思考連鎖(CoT)推論トレースを生成します。このアプローチは、数学、コードデバッグ、科学的推論などの複雑な多段階タスクにおいて、精度を測定可能に向上させます。OpenAIのo1/o3やDeepSeek R1は、Kimi K2以前の最も認識されている例です。
Kimi K2にはいくつのパラメータがありますか?
Kimi K2は合計約1兆個のパラメータを持っていますが、そのうち推論時にトークンごとにアクティブ化されるのは約320億個です。この違いは重要です。MoE(混合専門家)アーキテクチャはトークンごとにパラメータのサブセットのみをアクティブ化するため、推論コストは1Tのモデルではなく、32Bのデンスモデルのものに相当します。
Kimi K2を開発したのは誰ですか?
Kimi K2は、2023年に設立された北京拠点のAI研究企業であるMoonshot AIによって開発されました。同社はAlibaba、Tencent、Sequoia Chinaなどの投資家から支援を受けており、同様のブランド名を使用する米国拠点の組織とは異なります。
Moonshot AIとは?
ムーンショットAIは、2023年に設立され、北京に本社を置く中国のAI研究企業です。AlibabaやTencentを含む主要な投資家からの支援を受け、同社はロングコンテキスト言語モデルの研究で評判を築きました。そのコンシューマー商品ラインであるKimiチャットアシスタントは、中国で数千万人のユーザーを抱えています。
Kimi K2 はどのようなベンチマークで高いスコアを獲得していますか?
Moonshot AIの技術レポートによると、Kimi K2は、約以下のスコアを記録しています:SWE-bench Verified ~65.8%(ソフトウェアエンジニアリング)、GPQA Diamond ~75.1%(科学的推論)、MMLU ~87.4%(広範な学術知識)、Tau-bench Airline ~54.9%(エージェントによるツール使用)、AIME 2025 ~49.5%(数学的推論)、および LiveCodeBench ~53.7%(競技プログラミング)です。スコアはローンチ時の自己申告によるものです。
Kimi K2をローカルで実行できますか?
はい、Kimi K2はオープンウェイトであり、ウェイトをローカルで実行することが可能です。フル精度での推論には、かなりのGPUインフラストラクチャ(8枚のH100 80GBといった複数の高メモリGPUなど)が必要になります。量子化されたバリアントはハードウェア要件を軽減しますが、出力の品質に影響を及ぼす場合があります。マルチGPUクラスターを所有していない大半のユーザーにとっては、Moonshot AIまたはOpenRouter経由のAPIアクセスが、モデルを利用するための現実的な方法です。
Kimi K2のコンテキストウィンドウは何ですか?
コンテキストウィンドウは128,000トークンで、約96,000~100,000単語に相当します。これにより、1回のプロンプトでロングドキュメント、コードベース全体、または拡張された会話履歴の処理が可能になります。
Kimi K2はコーディングにおいてClaudeより優れていますか?
実際のGitHubイシューの解決能力を測定するSWE-bench Verifiedにおいて、Kimi K2は約65.8%のスコアを記録しています。Claude Sonnet 4の具体的なSWE-bench Verifiedのスコアは本稿執筆時点では独立して確認されていません。最新の数値については、Anthropicが公開しているベンチマークをご確認ください。どちらのモデルが適しているかはデプロイメントの状況によります。Kimi K2はオープンウェイトの柔軟性を備え、トークンごとのロックインがありません。一方、ClaudeはマネージドAPIの信頼性、セーフティフィルタリング、そしてより簡素なインフラ構築を提供します。
AIにおけるMixture of Experts(混合エキスパート)とは?
Mixture of Experts(MoE)は、モデルのパラメータを「エキスパート」と呼ばれる専門化されたサブネットワークに分割し、すべてのパラメータを実行するのではなく、入力トークンごとに、関連するエキスパートのサブセットにのみルーティングするスパースなTransformerアーキテクチャです。これにより、モデルは非常に大規模なネットワークの知識容量を持ちながら、推論時にはより小規模なネットワークの計算量で済むようになります。Kimi K2は、トークンあたり約320億(1兆の総パラメータのうち)をアクティベートします。
MuonClipとは何ですか?そして、なぜそれが重要なのでしょうか?
MuonClipはMoonshot AIによって開発されたカスタム学習オプティマイザで、Muonオプティマイザと勾配クリッピングを組み合わせることで、大規模MoEモデルにおける学習の不安定さを防ぎます。Moonshot AIのテクニカルレポートによると、この規模において標準的なAdamWオプティマイザと比較して学習の安定性が向上しています。学習の安定性が高まることで、より信頼性の高い収束が可能になり、Moonshot AIの報告によれば、最終的なモデル性能も強化されるとのことです。
Kimi K2は無料で利用できますか?
モデルのウェイトはHugging Faceから無料でダウンロードできます。Moonshot AIの公式APIまたはOpenRouter経由でのAPIアクセスにはトークンごとのコストが発生し、プロバイダーによって異なり、変更される可能性があります。ダウンロードしたウェイトをセルフホストする場合、自身のインフラストラクチャ費用を除けば無料です。利用方法を決定する前に、各プロバイダーの料金ページで現在のAPI価格を確認してください。
Kimi K2はどのようなタスクに最適ですか?
Moonshot AIの技術レポートによると、Kimi K2はソフトウェアエンジニアリングとコードパッチ適用 (SWE-bench Verified 約65.8%)、大学院レベルの科学的推論 (GPQA Diamond 約75.1%)、エージェントによる複数ステップのツール使用 (Tau-bench 約54.9%)、広範な学術的知識 (MMLU 約87.4%)、そしてロングドキュメント分析 (128,000トークンのコンテキストウィンドウ)において最も高いパフォーマンスを発揮します。数学コンペティション問題と競技プログラミングは、現在DeepSeek R1の方がスコアが高い分野です。
Kimi K2はどのようにトレーニングされましたか?
Moonshot AI の技術レポートによると、Kimi K2 は 4 つの段階を経てトレーニングされました。(1) テキストおよびコードデータの大規模事前学習、(2) 指示追従データを用いた教師ありファインチューニング、(3) 推論とツールの使用を改善するためのルールベースの報酬を用いた強化学習、そして (4) 大規模でのプロセスを安定化させるための MuonClip オプティマイザのトレーニング全体への適用です。RL ステージでは、人間のフィードバックのみに頼るのではなく、ルールベースの正しさの報酬を使用しています。
あなたに合ったユースケースは? 意思決定フレームワーク
Kimi K2と代替モデルのどちらを選択するかは、3つのデプロイメント変数によって決まります。すなわち、オープンウェイトの柔軟性が必要かどうか、コーディングおよびエージェンティックタスクが主なワークロードであるかどうか、そしてインフラがローカルデプロイメントをサポートできるかどうかです。
ソフトウェアエンジニアリングまたは科学的推論のためのオープンウェイトモデルが必要な場合:Kimi K2のSWE-bench Verifiedスコア約65.8%およびGPQA Diamondスコア約75.1%は、2025年7月現在、利用可能なベンチマークデータに基づくと、それらをそれらのカテゴリにおけるトップクラスのオープンウェイトオプションの1つとして位置づけています。コミットする前に、ご自身の特定のタスクタイプと直接比較して評価してください。
数学コンペティション問題や競技プログラミングに主に利用するオープンウェイトモデルが必要な場合: DeepSeek R1は、AIME 2025(〜70.0%)およびLiveCodeBench(〜65.9%)でのより高いスコアにより、現在の報告ベンチマーク下では、それらの特定のタスクにおいてより有力な選択肢となります。
現在、コーディングや推論タスクのためにAPI経由でClaudeやGPT-4oを利用している場合、Kimi K2はオープンウェイトの代替手段として、複数の主要タスクで同等のベンチマークパフォーマンスを提供します。トレードオフは運用面にあります。マネージドなプロプライエタリAPIは信頼性と安全性のインフラを提供しますが、セルフホストのオープンウェイトモデルでは、そのインフラを自身で構築・保守する必要があります。
組織がトレーニングの完全な透明性または規制データ出所を必要とする場合: Kimi K2のオープンウェイトのみのリリースでは、この要件を満たしていません。トレーニングデータと完全なトレーニングコードは公開されていません。
チームにマルチGPUインフラストラクチャがない場合: ローカル展開ではなく、Moonshot AI APIまたはOpenRouterを使用してAPIアクセスを行ってください。チャネルを選択する前に、各プロバイダーの現在の価格を確認してください。
執筆時点では、Moonshot AIは将来のモデルリリースに関する確定したロードマップを公開していません。公開済みの成果物に基づく同社の研究の焦点は、ロングコンテキスト処理、MoE(混合専門家)のスケーリング、およびエージェント機能の開発にあります。これら以外の将来の見通しに関する記述は、公式に確認されるまでは推測として扱う必要があります。