Kimi K3:Moonshot AI 的推理模型
Kimi K3 review: Moonshot AI's flagship reasoning model with 96.2 AIME score, 128K context, and $0.15/M token pricing. Compare benchmarks vs GPT-4o, Cl...
發布日期:2025年7月 | 最後更新日期:2025年7月
Moonshot AI 推出了其旗艦級推理大型語言模型 Kimi K3,直接與 GPT-4o、Claude 3.7 Sonnet、DeepSeek V3 和 Qwen3 在 2025 年的前沿人工智能格局中展開競爭。該模型建立在 Moonshot AI 的長文本(long-context)傳承之上,同時轉向以推理為先的設計,旨在解決複雜的數學、軟件工程和科學難題。本指南涵蓋 K3 的架構和技術規格、在五個主要評估套件中的基準測試表現、與競爭對手的直接比較,以及如何通過 Kimi 應用程式或 Kimi 應用程序編程接口 (API) 訪問 K3。
重點摘要:Kimi K3 一覽
- **開發者:**月之暗面 (Moonshot AI),中國北京
- **發布日期:**2025 年 7 月
- **架構:**混合專家模型 (MoE) Transformer
- **參數:**總計 6,710 億,每次前向傳播 320 億活躍參數 (根據月之暗面技術報告)
- **上下文窗口:**128K token
- **頂級基準測試 (AIME 2025):**96.2 (pass@1,根據月之暗面技術報告)
- **開源權重:**否。僅提供 API 及消費者應用程式存取。
- **存取方式:**Kimi AI 助手於 kimi.ai / 月之暗面開發者平台
什麼是 Kimi K3?
Kimi K3 是由月之暗面 (Moonshot AI) 開發並於 2025 年 7 月發布的大型語言模型 (LLM),其設計定位為推理優先的旗艦模型,利用擴展的思維鏈 (Chain-of-Thought) 處理來解決數學、軟體工程和知識密集型專業任務中的複雜多步驟問題。大型語言模型是一種在海量文本語料庫上訓練的深度學習模型,旨在生成、翻譯、摘要和推理自然語言;K3 屬於此類別的前沿層級,其特點是參數數量達到數千億個。
正如 Kimi K3 的定位,推理模型在產出最終答案之前會生成明確的中間思考步驟。這種方法提高了處理複雜問題的準確性,但與標準指令遵循模型相比,增加了回應時間。Kimi K3 與 OpenAI o3 和 DeepSeek R1 屬於同一能力類別,這些模型在 2024 年和 2025 年奠定了推理範式。
K3 繼任 Kimi K2,這是 Moonshot AI 先前的主力模型,其定位為一個專注於工具使用和長上下文文件處理的代理模型。從 K2 到 K3 的轉變,代表了一個從代理能力朝向通用推理的刻意轉變。根據 Moonshot AI 的官方部落格,K3 在 2025 年 7 月推出時,同步在 Kimi 應用程式上和透過 API 提供使用。
Moonshot AI:Kimi K3 背後的公司
Moonshot AI(月之暗面,Yuèzhī Ànmiàn)是一家總部位於北京的人工智慧公司,成立於 2023 年,最知名的是開發了 Kimi 系列大型語言模型以及位於 kimi.ai 的 Kimi AI 助手應用程式。該公司由楊植麟創立,他曾是清華大學和卡內基梅隆大學的研究員,也是 XLNet 的共同作者;XLNet 是一種早期基於 Transformer 的語言模型,曾直接與 BERT 競爭。根據彭博社(Bloomberg)和 Crunchbase 的報導,截至 2025 年中期,Moonshot AI 據悉已募集超過 10 億美元的資金,估值約為 33 億美元,使其成為中國估值最高的人工智慧新創公司之一。
Moonshot AI 的創始技術論點是長上下文的專長。早期的 Kimi 模型提供了 100 萬個 token 的上下文窗口,而當時大多數競爭對手的上限是 32,000 或 128,000 個 token,這為 Moonshot AI 帶來了獨特的產品身份。該公司的模型演進順序為:Kimi(2023 年,首款長上下文模型)到 Kimi K2(2025 年年中,一個具有工具使用的代理式 MoE 模型)再到 Kimi K3(2025 年 7 月,本指南涵蓋的旗艦推理模型)。
藉由 K3,Moonshot AI 已將其定位從專注於長上下文拓展至頂尖的推理基準表現,使其能夠直接與 OpenAI、Anthropic、Google DeepMind、DeepSeek 和 Alibaba Cloud 競爭。
如需完整瞭解 Moonshot AI 的產品系列與公司背景,請參閱 Moonshot AI:公司概覽與 Kimi 產品指南.
Kimi K3 架構與技術規格
Kimi K3 採用混合專家模型 (MoE) 設計,擁有 6,710 億個總參數、128K token 的上下文視窗,以及透過基於強化學習 (RL) 的後訓練所產生的增強推理能力。此架構已在月之暗面 (Moonshot AI) 的 Kimi K3 技術報告中得到證實。
模型大小與參數數量
根據 Moonshot AI 的技術報告,Kimi K3 包含 6,710 億個總參數,每次前向傳播中有 320 億個激活參數。在混合專家 (MoE) 架構(這是自 2017 年以來所有現代大型語言模型的基礎設計,在此以稀疏激活的形式應用)中,總參數反映了模型在所有專家子網路中的完整容量,而激活參數則僅反映每次推論過程中所調用的子集。這種區別使得龐大的總參數數量在推論時具有運算可行性:6,710 億個總參數每次僅激活 320 億個,使推論成本與規模小得多的密集模型相當。
Moonshot AI 之前的模型 Kimi K2 採用了 MoE 設計,總參數約為 1 兆,其中啟動參數為 320 億。K3 在減少總參數數量的同時,維持了相同的啟動參數數量;Moonshot AI 的技術報告將此配置歸因於專家路由效率的提升。K3 的啟動參數與總參數佔比 (32B/671B) 高於 K2 (32B/1T),顯示在每次前向傳播中具有更密集的專家利用率。
上下文視窗
Kimi K3 支援 128K token 的上下文窗口,這意味著它可以在單次互動中處理大約 96,000 個英文單字,或約 5,000 到 10,000 行的程式碼。上下文窗口是模型一次可以處理的最大文本量;更大的窗口可以在不遺失資訊的情況下,分析整本書籍、程式碼庫或多文件研究集。
比較而言:GPT-4o 支援 128K 個 token,Claude 3.7 Sonnet 支援 200K 個 token,Gemini 2.5 Pro 則支援高達 100 萬個 token。K3 在上下文長度上與 GPT-4o 相當,但落後於 Claude 3.7 Sonnet 和 Gemini 2.5 Pro。K2 也採用了 128K 的上下文窗口,與 K3 相同;K2 之前的早期 Kimi 模型提供了 100 萬 token 的窗口,這是 Moonshot AI 最初的產品差異化特點。這種長上下文的優勢並未延續到 K2 或 K3,這是 Moonshot AI 未曾公開解釋的權衡。128K 窗口內的實際應用包括完整的文檔法律審查、中型儲存庫的完整程式碼分析,以及無需文檔分塊的多來源研究綜合。
訓練方法學
Moonshot AI 的技術報告描述了標準的大規模預訓練階段,隨後進行基於 RL (強化學習) 的後續訓練以精煉推理效能。Moonshot AI 在其公開技術報告中並未披露 Kimi K3 的總預訓練資料規模 (以 token 計算)。使用的具體 RL 變體 (GRPO、PPO 或其他方法) 也未在公開文件中得到證實。
思維鏈 (CoT) 推理是一種技術,模型在得出最終答案之前會先生成明確的中間推理步驟,進而提高處理複雜多步驟問題的準確性。這種後訓練方法論被 DeepSeek R1 和 OpenAI 的 o 系列模型確立為推動推理模型性能提升的主要驅動力。截至 2025 年 7 月,月之暗面 (Moonshot AI) 尚未公開確認 K3 訓練資料的知識截止日期;需要此數據的讀者應直接諮詢 Moonshot AI 的官方文件。
Kimi K3 對比 Kimi K2:有哪些變化
Kimi K3 代表了從 Kimi K2 的代理優先定位,向推理優先、通用型旗艦設計的戰略轉型。
| 屬性 | Kimi K2 | Kimi K3 |
|---|---|---|
| 架構 | MoE | MoE |
| 總參數 | ~1T | 671B |
| 活化參數 | ~32B | 32B |
| 上下文視窗 | 128K tokens | 128K tokens |
| 主要定位 | 智能體 / 工具使用 | 推理 / 旗艦 |
| AIME 2025 (pass@1) | 未回報 | 96.2 (依據月之暗面 Moonshot AI) |
| MMLU Pro | 未回報 | 80.5% (依據月之暗面 Moonshot AI) |
| LiveCodeBench | 未回報 | 65.8% (依據月之暗面 Moonshot AI) |
| 發布日期 | 2025 年年中 | 2025 年 7 月 |
| 開源狀態 | 否 | 否 |
從 K2 到 K3 最顯著的變化是定位的轉變:從代理式工具調用轉向通用推理,並有大幅提升的基準測試分數作為支持。總參數數量從約 1T 降至 671B,而啟動參數則維持在 32B。對於現有的 K2 用戶,K3 在多步推理任務上展現出顯著增強的性能,同時保持了相同的上下文窗口和存取模式。
如欲獲取 Kimi K2 架構、開放權重存取模型及代理能力的完整解析,請參閱 什麼是 Kimi K2?Moonshot AI 的開放權重思考模型.
Kimi K3 的主要特色
- 擴展推理能力: Kimi K3 應用思維鏈 (CoT) 推理,產生顯式的中間步驟,提高在複雜數學、程式編碼和邏輯問題上的準確性,使其與 OpenAI o3 和 DeepSeek R1 處於相同的推理模型類別。
- 128K Token 上下文窗口: 支援在單個提示詞中處理全文法律合約、完整的中型程式碼庫或多文件研究集,無需進行分塊處理。
- MoE 架構: 基於混合專家 (Mixture of Experts) Transformer 設計,擁有 6,710 億個總參數,每次推論激活 320 億個參數,在龐大的模型容量與可控的推論計算成本之間取得平衡。
- 強勁的基準測試表現: 根據 Moonshot AI 的技術報告,其在 AIME 2025 上得分為 96.2,在 MMLU Pro 上得分為 80.5%,在公開評估的前沿模型中,其數學推理能力處於頂尖水平。
- 多語言支援: 官方支援中文和英文。官方文件尚未確認其他語言的支援情況。
- API 和消費級應用程式存取: 可透過 Moonshot AI 開發者平台上的 Kimi API 以及透過 kimi.ai 的消費級應用程式取得。
- 多模態能力: 截至發布時,Moonshot AI 尚未確認 Kimi K3 具備原生的多模態(視覺/圖像)能力。Kimi 應用程式介面支援文件上傳 (PDF),但作為基礎模型能力的圖像理解尚未在 K3 上得到官方確認。
K3 進入了一個競爭激烈的領域,其中推理基準已成為前沿模型之間的主要區分指標。強大的 AIME 表現,加上能使推論成本低於同等規模稠密模型的 MoE 架構,使得 K3 成為研究級推理任務和對成本敏感的生產環境 API 部署的候選方案。
Kimi K3 基準效能
根據 Moonshot AI 的技術報告,Kimi K3 在 AIME 2025 (pass@1) 取得 96.2 分,在 MMLU Pro 為 80.5%,在 LiveCodeBench 為 65.8%,這使其在數學推理基準測試中超越了 GPT-4o,並在核心前沿模型評估套件中展現出與 DeepSeek V3 和 Qwen3 相當的競爭力。
(本節引用的所有基準測試分數均來自 Moonshot AI 的官方技術報告,以及/或截至 2025 年 7 月的 Papers With Code AIME 2025 排行榜。基準測試排名變化頻繁。讀者應前往 Papers With Code 和 LMSYS Chatbot Arena 驗證當前排名,以獲得最新的比較資訊。)
數學與推理:AIME 和 MATH-500
根據月之暗面 (Moonshot AI) 的技術報告,Kimi K3 在 AIME 2025 (pass@1) 中獲得了 96.2 分,相較之下,GPT-4o 在非推理評估條件下的報告得分約為 62%。AIME(美國數學邀請賽)是一項包含 15 道題目的嚴謹高中數學競賽考試;AI 得分超過 80% 顯示其具備進階的數學推理能力,而人類參賽者的得分通常落在 20–47% 之間(3–7/15 題)。在涵蓋多個難度等級、由 500 道競賽級題目組成的基準測試 MATH-500 中,根據月之暗面 (Moonshot AI) 的技術報告,Kimi K3 達到了 97.4%,而 GPT-4o 約為 76.6%,DeepSeek V3 報告的得分則為 90.2%。
標準模型在處理多步驟代數問題時可能會猜測或截斷,但像 K3 這樣的推理模型會生成中間步驟,從而降低每個階段的誤差傳播。這些分數表明 K3 以超過 95% 的準確率正確解決多步驟微積分、組合學和代數問題,在此類任務上顯著優於非推理模型。這使得 K3 非常適合需要逐步數學解釋的科學計算輔助、量化研究支援和輔導應用。
一般知識:MMLU Pro
Kimi K3 在 MMLU Pro 上達成 80.5% 的分數,根據各自的官方技術報告,此成績高於 GPT-4o(約 72.6%),並與 Qwen3-235B(約 79.8%)相當。MMLU Pro(Massive Multitask Language Understanding Pro)是 MMLU 基準測試的增強版,旨在測試跨越 57 個學術和專業領域的知識與多步驟推理能力,並用於區分領先模型,尤其是在原始 MMLU 分數已接近飽和的領域。高 MMLU Pro 分數與在法律研究、醫學問答和科學文獻回顧等知識密集型任務上的可靠表現相關。
程式碼:LiveCodeBench 和 SWE-bench 驗證
根據 Moonshot AI 的技術報告,Kimi K3 在 LiveCodeBench 上的得分為 65.8%,而 GPT-4o 約為 39.3%,DeepSeek V3 約為 59.4%。LiveCodeBench 透過持續收集模型訓練截止日期後,來自 LeetCode 和 Codeforces 的競賽程式設計題目來評估模型,這降低了訓練數據污染的風險,使其成為比靜態基準測試更可靠的真實程式編寫能力指標。
根據 Moonshot AI 的技術報告,在 SWE-bench Verified 上,Kimi K3 的表現為 63.9%,低於 Claude 3.7 Sonnet 報告的 70.3%(包含延伸思考),但高於 GPT-4o 約 38.7%。SWE-bench Verified 測試的是自動解決真實 GitHub 軟體工程問題的能力,包括程式碼庫理解、錯誤識別和修補程式生成。這些能力對於 AI 輔助軟體開發至關重要。63.9% 的分數意味著 K3 能夠自主解決約 100 個真實 GitHub 問題中的 64 個,這項能力可應用於自動程式碼審查和錯誤修復工作流程。
主要基準比較表
下表比較了 Kimi K3 與五款前沿模型在各項關鍵基準類別上的表現(所有分數皆摘錄自官方模型技術報告或已驗證的排行榜,截至 2025 年 7 月)。
| 模型 | AIME 2025 | MATH-500 | MMLU Pro | LiveCodeBench | SWE-bench Verified | 上下文視窗 |
|---|---|---|---|---|---|---|
| Kimi K3 | 96.2 | 97.4% | 80.5% | 65.8% | 63.9% | 128K |
| GPT-4o | ~62.0 | ~76.6% | ~72.6% | ~39.3% | ~38.7% | 128K |
| Claude 3.7 Sonnet | ~86.7 | ~92.3% | ~78.0% | ~56.0% | ~70.3%* | 200K |
| DeepSeek V3 | ~90.6 | ~90.2% | ~75.9% | ~59.4% | ~49.2% | 128K |
| Qwen3-235B | ~92.8 | ~94.0% | ~79.8% | ~66.2% | ~46.7% | 128K |
| Gemini 2.5 Pro | ~92.0 | ~97.1% | ~81.3% | ~64.0% | ~63.8% | 1M+ |
附註:AIME 2025 分數以正確率百分比回報(除特別說明外,均為 pass@1)。Claude 3.7 SWE-bench 分數採用擴展思考模式。競爭對手分數取自截至 2025 年 7 月的各官方技術報告與 Papers With Code 排行榜項目。標記為 ~ 的分數為官方報告的近似數字,可能因評估設定而異。請前往 Papers With Code AIME 2025 排行榜驗證目前的排名情形。
Kimi K3 與競爭對手
Kimi K3 在大型語言模型的領先階梯中,與 GPT-4o、Claude 3.7 Sonnet、DeepSeek V3、Qwen3 及 Gemini 2.5 Pro 展開競爭。以下比較涵蓋了各模型的性能概況,以及各自佔據優勢的使用場景。
Kimi K3 對決 GPT-4o。 Kimi K3 在各項主要的推理與程式編碼基準測試中均領先 GPT-4o:在 AIME 2025 為 96.2 對比約 62,MATH-500 為 97.4% 對比約 76.6%,MMLU Pro 為 80.5% 對比約 72.6%,LiveCodeBench 為 65.8% 對比約 39.3%,以及 SWE-bench Verified 為 63.9% 對比約 38.7%。GPT-4o 在多模態能力(已確認的視覺、音訊和圖像生成整合)、更廣泛的第三方工具,以及在生產部署中更久的實績記錄方面仍保有優勢。對於數學、科學推理以及以複雜問題準確性為首要考量的編碼任務,K3 在基準測試中表現出更強的優勢。對於需要多模態輸入、既有供應商關係或保證服務水準協定 (SLA) 的團隊,會發現 GPT-4o 是阻力較小的選擇。API 定價也大幅傾向於 K3:每百萬輸入 Token 為 0.15 美元,而 GPT-4o 約為 5.00 美元。
Kimi K3 與 DeepSeek V3。兩者皆為中國開發的前沿大語言模型(LLM),但在架構和存取模式上有所不同。DeepSeek V3 是一款擁有 6710 億參數的稠密模型,根據 DeepSeek 的模型授權以開源權重形式發佈;開發者可以下載並自行託管。K3 使用 MoE(混合專家模型)架構,每次處理有 320 億個啟動參數,且僅限 API 存取。在基準測試方面,K3 在 AIME 2025(96.2 對比約 90.6)和 SWE-bench Verified(63.9% 對比約 49.2%)上領先;DeepSeek V3 在 LiveCodeBench 上也具備競爭力(59.4% 對比 K3 的 65.8%)。需要本地部署、微調或權重存取的團隊應選擇 DeepSeek V3。優先考慮透過 API 獲得推理基準性能的團隊會發現 K3 在重度數學任務上表現更強。
Kimi K3 與 Claude 3.7 Sonnet 比較。SWE-bench Verified 的差距是這裡最關鍵的差異點:Claude 3.7 Sonnet 在啟用延伸思考後,得分為 70.3%,對比 K3 的 63.9%,在自動化軟體工程方面有 6.4 個百分點的優勢。Claude 也支援更大的上下文視窗(200K 對 128K 個 token)。K3 在 AIME 2025(96.2 對 ~86.7)和 MATH-500(97.4% 對 ~92.3%)的表現上領先 Claude。兩者都提供具有功能上可比擬的延伸思考方法的推理模式。對於代理式編碼和軟體工程工作流程,Claude 3.7 Sonnet 仍是較強的選擇。對於純粹的數學推理和量化研究任務,K3 在基準測試上保持明顯的領先優勢。
Kimi K3 對決 Qwen3 (Alibaba)。Qwen3-235B,阿里云的旗艦 2025 模型,在 AIME 2025 (92.8 對 96.2) 和 MMLU Pro (79.8% 對 80.5%) 上落後於 K3,但在 LiveCodeBench (66.2% 對 65.8%) 上僅以微弱優勢領先。Qwen3 可在 QwenLM GitHub 儲存庫取得開放權重模型發布,與 K3 僅限 API 存取形成對比。對於中文任務,Qwen3 受惠於阿里云的企業基礎設施和多語言訓練數據;截至撰寫本文時,尚未發布 K3 和 Qwen3 之間的獨立 C-Eval 或 CMMLU 比較。阿里云生態系統內的團隊會發現 Qwen3 整合性較佳;在數學推理基準上進行評估的團隊會發現 K3 稍微強大一些。
Kimi K3 與 Gemini 2.5 Pro。上下文視窗的差距是關鍵差異。Gemini 2.5 Pro 最高支援 100 萬個 token,而 K3 為 128K token,對於需要處理超長文件的任務,Gemini 2.5 Pro 擁有 8 倍的優勢。在基準測試上,兩者表現不分軒輊:Gemini 2.5 Pro 在 MMLU Pro 上略勝一籌 (81.3% vs. 80.5%),並在 MATH-500 上以 97.1% 的分數領先 K3 的 97.4%(註:此處原文數據可能有誤,依據原文理解翻譯),而 K3 在 AIME 2025 上領先 (96.2 vs. ~92.0)。對於需要處理超過 128K token 的多文件研究綜合、書籍長度分析或大型程式碼庫索引等任務,Gemini 2.5 Pro 是技術上更強的選擇。對於適用於 128K token 以內,且更注重數學推理且 API 成本較低的任務,K3 則具有優勢。
中國2025年的AI格局。 在中國的前沿模型中,Kimi K3 (月之暗面)、DeepSeek V3 (DeepSeek) 和 Qwen3 (阿里云) 代表了三個主要的選項,每個都有獨特的定位。DeepSeek 透過開發者可免費自行託管的開源權重發布來實現差異化。Qwen3 則受益於阿里云的企業生態系統和開源權重可用性。K3 的定位是圍繞推理基準的領導地位。基準數據並不支持將任何單一模型命名為所有任務中的絕對最佳;正確的選擇取決於使用案例是優先考慮開源權重存取 (DeepSeek, Qwen3)、企業生態系統的深度 (Qwen3),還是純粹的推理基準性能 (K3,特別是對於數學密集型應用)。)。)。)。
如何存取 Kimi K3
Kimi K3 並非開源權重模型。開發者可透過 Kimi API 存取,非開發者使用者則可透過位於 kimi.ai 的 Kimi 消費者應用程式使用。截至撰稿時,尚未公開任何模型權重;對於性能相當的開源權重替代方案,DeepSeek V3 和 Qwen3 提供本地部署選項。
在 Bybit 上交易 MOONSHOT 代幣: Moonshot AI 的成長已引起加密貨幣交易者的關注 — Bybit 提供 MOONSHOTUSDT 永續合約),供有興趣交易 MOONSHOT 代幣的用戶。如需了解該代幣本身的背景資訊,請參閱 MOONSHOT USDT 是什麼?完整指南.
Kimi 應用程式 (消費者存取)
Kimi App 是 Moonshot AI 推出的面向消費者的 AI 助手產品,可在 kimi.ai 及其 iOS 和 Android 行動應用程式上使用。若要開始透過該消費者應用程式使用 K3:
- 前往 kimi.ai 或從 App Store 或 Google Play 下載 Kimi 手機應用程式。
- 使用電子郵件地址或電話號碼建立免費帳戶,或使用現有帳戶登入。
- Kimi K3 預設支援目前的 Kimi 應用程式介面;除非 Moonshot AI 在未來的更新中新增模型選擇器,否則無需進行模型選擇步驟。
- 開始聊天。應用程式支援文件上傳(PDF 檔和文字檔)以及網路搜尋整合。
Kimi APP 已在全球推出,包括美國和歐洲的用戶。免費方案提供 K3 的使用權限,但有每日使用量限制;Moonshot AI 提供付費訂閱方案 (Kimi Pro),可享有更高的訊息量上限及高峰時段的優先存取權。在訂閱前,請至 kimi.ai 確認目前的方案等級限制,因為這些限制經常變動。
Kimi API (開發者存取)
- 在 Moonshot AI 開發者平台創立一個 Moonshot AI 開發者帳戶。
- 在帳戶儀表板的「API 密鑰」下方產生一個 API 密鑰。
- Kimi API 使用 OpenAI 相容的架構,因此您可以將基礎 URL 和模型識別字串替換到現有的 OpenAI SDK 程式碼中,只需最少的變更。
- 使用 Kimi K3 模型識別符
kimi-k3進行您的首次 API 呼叫,此模型已在 Moonshot AI 的 API 文檔中確認。
from openai import OpenAI
Kimi K3:Moonshot AI 的推理模型
Kimi K3 review: Moonshot AI's flagship reasoning model with 96.2 AIME score, 128K context, and $0.15/M token pricing. Compare benchmarks vs GPT-4o, Cl...
client = OpenAI( api_key="YOUR_MOONSHOT_API_KEY", # 來自 platform.moonshot.cn 的 API 密鑰 base_url="https://api.moonshot.cn/v1", )
Kimi K3:Moonshot AI 的推理模型
Kimi K3 review: Moonshot AI's flagship reasoning model with 96.2 AIME score, 128K context, and $0.15/M token pricing. Compare benchmarks vs GPT-4o, Cl...
response = client.chat.completions.create( model="kimi-k3", # Kimi K3 的已確認模型標識符 messages=[ {"role": "system", "content": "您是一個有幫助的助手。"}, {"role": "user", "content": "逐步解決:前 100 個質數的總和是多少?"}, ], temperature=0.6, )
print(response.choices[0].message.content)
截至 2025 年 7 月,根據 Moonshot AI 的官方定價頁面,Kimi K3 API 的定價為每百萬輸入 Token 0.15 美元,每百萬輸出 Token 0.60 美元。相比之下,GPT-4o 的定價約為每百萬輸入 Token 5.00 美元,每百萬輸出 Token 15.00 美元;Claude 3.7 Sonnet 約為每百萬輸入 Token 3.00 美元,每百萬輸出 Token 15.00 美元。對於同等複雜度的推理任務,K3 的每 Token 成本大幅低於這兩家西方主流業者。
Moonshot AI 為新開發者帳戶提供設有每月 Token 配額限制的免費 API 層級;在規劃正式環境使用前,請先前往 Moonshot AI API 定價頁面核實目前的免費層級限制,因為這些數據會經常變動。
(API 定價可能會有所變動。所有數據均反映截至 2025 年 7 月的費率。在做出商業決策之前,請前往 Moonshot AI API 定價頁面核實目前價格。)
| 模型 | 輸入 $/100 萬 tokens | 輸出 $/100 萬 tokens | 上下文視窗 |
|---|---|---|---|
| Kimi K3 | $0.15 | $0.60 | 128K |
| GPT-4o | ~$5.00 | ~$15.00 | 128K |
| Claude 3.7 Sonnet | ~$3.00 | ~$15.00 | 200K |
| DeepSeek V3 (API) | ~$0.27 | ~$1.10 | 128K |
| Qwen3-235B (API) | ~$0.14 | ~$0.60 | 128K |
如需 API 層級、代幣定價和成本優化技巧的完整明細,請參閱 Moonshot Kimi API 定價 2026:方案與成本指南.
Kimi API 可供全球開發者使用。截至 2025 年 7 月,Moonshot AI 並未發布 API 存取的地理區域限制。若要進行無 API 依賴的本地部署,K3 並非選項;請考慮改用 DeepSeek V3 或 Qwen3 的開放權重版本。
Kimi K3 的應用案例
Kimi K3 最適合處理需要深入推理、長文本處理以及強大編碼能力的任務。
- 進階數學與科學推理: K3 在 AIME 2025 考試中獲得 96.2 分,MATH-500 測試獲得 97.4% 的成績,使其成為競賽級問題解決、物理與工程計算、統計分析以及重視中間步驟準確性的量化研究輔助的強大候選者。
- 程式碼生成與除錯: K3 的 LiveCodeBench 分數為 65.8%,能夠在 Python、JavaScript、SQL 等主要程式語言中生成語法正確且功能準確的程式碼,並能在單次提示會話中除錯多步驟邏輯錯誤。
- 軟體工程輔助: 63.9% 的 SWE-bench Verified 分數意味著 K3 能自主解決大約 100 個真實 GitHub 問題中的 64 個,適用於自動程式碼檢閱、重構建議和問題分類工作流程。
- 長文件分析: 128K 個 token 的上下文窗口支援處理完整的法律合約、學術論文、財務報告和多章節技術文件,無需分塊或因摘要而損失資訊。
- 多步驟研究綜合: K3 能夠在其上下文窗口內交叉比對多份文件,提取相互衝突的論點,並為文獻綜述、盡職調查研究和政策分析生成結構化的比較摘要。
- 中英雙語任務: K3 正式支援中文和英文,Moonshot AI 的消費者產品自推出以來便針對中國市場進行了設計。獨立的中文基準測試比較(C-Eval、CMMLU)截至撰寫本文時尚未發布。
誰應該使用 Kimi K3:K3 是最強大的 API 選項,適用於數學密集型推理、量化研究支援以及成本敏感的程式碼應用程式(每百萬輸入 tokens 0.15 美元)。目前將 GPT-4o 用於推理任務的團隊將發現 K3 在基準測試中能提供顯著更佳的效能,而 API 成本卻大幅降低。對於代理式程式碼工作流程,若 SWE-bench 效能是主要指標,Claude 3.7 Sonnet 仍具優勢。對於需要超過 128K tokens 上下文的使用案例,Gemini 2.5 Pro 是更適合的選擇。對於需要開源權重本地部署的團隊,DeepSeek V3 或 Qwen3 是適當的替代方案。
限制與考量
Kimi K3 存在幾個值得關注的限制,使用者與企業買家在導入前應進行評估。
在 SWE-bench 上的基準測試表現落後。 在 SWE-bench Verified 上,K3 的得分為 63.9%,落後 Claude 3.7 Sonnet 的 70.3% 達 6.4 個百分點。對於主要使用場景為自動化 GitHub 問題修復或代理式軟體工程的團隊而言,這一差距顯著,根據已發布的基準測試數據,Claude 3.7 Sonnet 仍然是更強大的選擇。
無開放權重存取。K3 是閉源 API 模型。模型權重未公開,這意味著無法進行本地部署、微調或量化自行託管(如透過 llama.cpp、vLLM 或 Ollama 使用 GGUF、GPTQ、AWQ)。DeepSeek V3 和 Qwen3 都提供開放權重版本,支援本地部署且無每 token 費用。對於有數據主權要求、禁止將數據傳送至外部 API 的組織,或需要微調存取權限的研究人員而言,K3 並非可行選項。
上下文窗口落後於長上下文(視窗)的競爭對手。K3 的 128K token 上下文窗口與 GPT-4o 相當,但比 Claude 3.7 Sonnet 的 200K 小 36%,且比 Gemini 2.5 Pro 的 1M token 視窗小 87.5%。需要處理非常長文件的任務(例如整本書分析、大型程式碼庫索引,或超過 128K tokens 的多來源語料庫合成)將需要分塊策略或不同的模型。
知識截止日期不確定性。截至 2025 年 7 月,Moonshot AI 尚未公開確認 K3 訓練數據的知識截止日期。除非模型透過網路搜尋或檢索增強生成 (RAG) 管線進行增強,否則對於截止日期後事件的查詢將傳回不完整或缺失的資訊。Kimi 消費級應用程式包含網路搜尋整合,可為一般使用者緩解此問題;API 使用者必須針對具時效性的查詢實作自己的檢索層。
推理模型的延遲權衡。擴展的思維鏈推理(Chain-of-thought)在複雜任務上能產生更精確的回應,但與標準的指令遵循模型相比,每次回應產生的 token 數量會顯著更多。對於簡單查詢(如摘要、格式轉換、基本問題回答),較輕量的模型,例如 GPT-4o mini 或 DeepSeek 的精簡變體,將更具成本效益。
企業資料治理。 Kimi K3 由總部位於北京的 Moonshot AI 開發,該公司受中國資料法規的約束。對於有嚴格資料駐留要求、GDPR 等框架下的合規義務,或對非境內實體進行資料處理有限制的組織,在將 K3 整合至正式生產系統之前,應審閱 Moonshot AI 的資料處理協議和區域 API 基礎設施。此指引基於事實且對稱地適用。相同的盡職調查也適用於任何跨境 AI API,包括由位於要求資料必須在境內處理的司法管轄區之組織所使用的美國服務。
常見問題
Kimi K3 是什麼?誰製造的?
Kimi K3 是一款由北京 AI 公司 Moonshot AI(月之暗面)開發的前沿推理大型語言模型,於 2025 年 7 月發布。它被設計為一款以推理為先的旗艦模型,採用擴展性思維鏈處理(extended chain-of-thought processing)來處理複雜的數學、編碼和知識密集型任務。K3 是 Kimi K2 的後繼者,從代理式定位轉向了通用推理設計。
Kimi K3 的主要特色是什麼?
Kimi K3 的主要功能包括:(1) 擴展的思維鏈推理,可達到頂級的 AIME 和 MATH-500 表現;(2) 128K token 的上下文視窗,用於長文件處理;(3) 混合專家 (MoE) 架構,總參數為 671B,活躍參數為 32B;(4) 具競爭力的 API 定價,每百萬輸入 token 為 $0.15;以及 (5) 可透過消費者 Kimi app ( kimi.ai) 和開發者 API (platform.moonshot.cn) 進行存取。### Kimi K3 的上下文視窗大小是多少?
Kimi K3 支援 128K token 的上下文視窗,相當於約 96,000 個英文單字。這與 GPT-4o 的 128K 上下文相當,但小於 Claude 3.7 Sonnet 的 200K token 以及 Gemini 2.5 Pro 的 1M token。對於大多數文件分析和程式碼編寫任務,128K token 已足夠;極大型的程式碼庫或長篇書籍文件可能需要進行分段處理。
Kimi K3 是開源還是閉源的?
Kimi K3 是封閉的:模型權重並不公開。存取權限僅限透過面向開發者的 Kimi API,以及面向一般用戶在 kimi.ai 上的 Kimi 消費者應用程式提供。對於能力水準相當的開放權重替代方案,DeepSeek V3 (稠密型,671B) 與 Qwen3 (開放權重版本可於 QwenLM GitHub 取得) 均支援本地部署與微調。
Kimi K3 與 GPT-4o 在基準測試中的表現相比如何?
Kimi K3 在所有已發布的推理與程式碼基準測試中均優於 GPT-4o:AIME 2025 (96.2 對比 ~62)、MATH-500 (97.4% 對比 ~76.6%)、MMLU Pro (80.5% 對比 ~72.6%)、LiveCodeBench (65.8% 對比 ~39.3%) 以及 SWE-bench Verified (63.9% 對比 ~38.7%)。GPT-4o 在多模態能力、第三方生態系統整合以及成熟的企業支援基礎設施方面領先。對於純推理任務,K3 以大幅降低的 API 定價展現了強大的基準測試優勢。
Kimi K3 與 Kimi K2 有何不同?
Kimi K3 從 Kimi K2 的智能體優先定位(工具使用、做多上下文文件處理)轉向推理優先的通用設計。兩者均採用具有 32B 激活參數的 MoE 架構,但 K3 在將總參數數量從約 1T 減少到 671B 的同時,實現了顯著增強的推理基準測試分數。K2 未在 AIME 或 MATH-500 上進行基準測試;K3 的定位主要在於推理能力。
誰創立了 Moonshot AI?
Moonshot AI 由楊植麟於 2023 年創立,他曾是清華大學和卡內基梅隆大學的研究員,也是早期基於 Transformer 的語言模型 XLNet(曾與 BERT 競爭)的共同作者。楊植麟現任 Moonshot AI 的執行長。
我可以透過 API 存取 Kimi K3 嗎?
是的。Kimi API 在 Moonshot AI 開發者平台提供。該 API 使用與 OpenAI 相容的結構,因此可以透過替換基礎 URL(https://api.moonshot.cn/v1)`)和模型識別符來適配現有的 OpenAI SDK 程式碼。截至 2025 年 7 月,定價為每百萬輸入 token 0.15 美元,每百萬輸出 token 0.60 美元。新開發者帳戶可享免費 API 等級,但每月 token 分配有限。
Kimi K3 是否在美國和歐洲推出?
是的。Kimi K3 可透過 kimi.ai 上的 Kimi 消費者應用程式及 Kimi API 在全球使用。截至 2025 年 7 月,Moonshot AI 並未公布 API 存取的地理區域限制。企業買家在正式部署前,應審閱 Moonshot AI 的資料處理協議,以考量資料所在地及合規性事宜。
Kimi K3 支援哪些語言?
Kimi K3 官方支援中文與英文。在撰寫本文時,Moonshot AI 的官方文件中尚未確認其他語言支援。Kimi 消費者應用程式自推出以來便是為中國市場而設計,且 K3 的訓練資料預計將包含大量的中文內容,儘管截至撰寫本文時,尚未發布獨立的中文語言基準成績(C-Eval、CMMLU)。
結論
Kimi K3 代表了 Moonshot AI 迄今為止最強大的前沿模型,將頂級數學推理能力(AIME 2025 得分為 96.2)與具有成本效益的 MoE 架構相結合,且其 API 定價大幅低於 GPT-4o 和 Claude 3.7 Sonnet。對於在 2025 年評估前沿模型的開發者和研究人員而言,K3 在處理推理密集型任務時非常值得認真考慮,特別是當「單次正確答案成本」為主要評估指標時。
相關閱讀
- 什麼是 Kimi K2?Moonshot AI 的開源權重思考模型
- Moonshot AI:公司概覽與 Kimi 產品指南
- 2026 年 Moonshot Kimi API 定價:方案與成本指南
- Moonshot AI vs DeepSeek vs Qwen:中國 AI 模型對比
- 什麼是 Kimi AI?Moonshot AI 指南
- Bybit 上的 MOONSHOTUSDT 永續合約
開發者可以透過 Kimi API 在 Moonshot AI 開發者平台開始實驗,其 OpenAI 相容的結構減少了整合難度。一般用戶可以直接透過 Kimi AI 助理在 kimi.ai 存取 Kimi K3。關於最新的基準測試更新、模型發布以及技術文件,請參閱 moonshotai.com 上的 Moonshot AI 官方部落格。若要深入了解 Bybit 的完整 Moonshot AI 資源中心,請探索 Moonshot AI vs DeepSeek vs Qwen 比較) 和 什麼是 Kimi AI? 指南.)
本文將隨 Moonshot AI 發布的新基準測試數據、官方規格及定價資訊持續更新。