Kimi K2: نموذج التفكير بالأوزان المفتوحة
Explore Kimi K2, Moonshot AI's open-weight thinking model with 1 trillion parameters, 128k token context, and benchmark-leading software engineering c...
Kimi K2 هو نموذج تفكير مفتوح الأوزان أطلقته شركة Moonshot AI في يوليو 2025، وهو مبني على بنية محول مزيج من الخبراء (MoE) مع حوالي 1 تريليون معلمة إجمالية و32 مليار معلمة نشطة لكل رمز مميز. يدعم النموذج الاستنتاج عبر سلسلة الأفكار (CoT)، ونافذة سياق تبلغ 128,000 رمز مميز، وسير عمل استخدام الأدوات الوكيل. يعد Kimi K2 خليفة لنموذج Kimi k1.5، وهو نموذج الاستنتاج طويل السياق السابق لشركة Moonshot AI، ويمثل دخول الشركة إلى فئة نماذج الحدود مفتوحة الأوزان جنباً إلى جنب مع DeepSeek R1 وLlama 4 من Meta.
| السمة | القيمة |
|---|---|
| المطور | Moonshot AI |
| الهيكلية | محول خليط الخبراء (MoE) |
| إجمالي المعلمات | حوالي 1 تريليون |
| المعلمات النشطة لكل رمز | حوالي 32 مليار |
| نافذة السياق | 128,000 رمز (حوالي 96,000–100,000 كلمة) |
| الترخيص | ترخيص MIT المعدل |
| تاريخ الإصدار | يوليو 2025 |
| متغيرات النموذج | Kimi K2 الأساسي، K2-Instruct |
| حالات الاستخدام الأساسية | هندسة البرمجيات، التفكير الرياضي، سير عمل الذكاء الاصطناعي الوكيل |
المحتويات
- من هي Moonshot AI؟
- البنية التقنية لنموذج Kimi K2
- الأوزان المفتوحة مقابل المصدر المفتوح: ما الذي يوفره Kimi K2 فعلياً؟
- كيف يفكر Kimi K2: شرح وضع التفكير الاستنتاجي
- كيف تم تدريب Kimi K2
- أداء Kimi K2 في الاختبارات المعيارية
- Kimi K2 مقابل النماذج المنافسة
- حالات استخدام Kimi K2 والقدرات الوكيلية (Agentic)
- كيفية الوصول إلى Kimi K2
- القيود والمقايضات الواقعية
- الأسئلة الشائعة
- أي حالة استخدام تناسبك؟ إطار عمل لاتخاذ القرار
من هو مونشوت إيه آي؟
Moonshot AI هي شركة أبحاث ذكاء اصطناعي مقرها بكين، تأسست عام 2023، بدعم من شركات مثل علي بابا، وتينسنت، وسيكويا الصين. وتشتهر في الأسواق الغربية بعلامتها التجارية "كيمي" لمنتجات الذكاء الاصطناعي. يُترجم الاسم الصيني للشركة إلى "الجانب المظلم من القمر" باللغة الإنجليزية. تعمل Moonshot AI كواحدة من عدة مختبرات ذكاء اصطناعي ممولة جيدًا في الصين، إلى جانب DeepSeek و Baidu و Alibaba Cloud.
بنت الشركة سمعتها المبكرة على أبحاث السياق الطويل، مطورةً بعض النماذج الأولى القادرة على معالجة كتب كاملة الطول كطلبات فردية. وقد جمع منتجها الاستهلاكي، مساعد الدردشة Kimi، عشرات الملايين من المستخدمين في جميع أنحاء الصين. يمثل Kimi K2 أول نموذج مفتوح الوزن على نطاق رائد يتم إصداره علنًا من Moonshot AI.
تحتل علي بابا مركزًا مزدوجًا؛ فهي مستثمر في Moonshot AI ومنافس مباشر من خلال سلسلة نماذجها Qwen 2.5 الخاصة بها. إن سجل تمويل Moonshot AI وسجل منتجاتها يضعانها كمنظمة بحثية جادة، وليست شركة ناشئة مضاربة.
للحصول على نظرة شاملة حول الخلفية المؤسسية لشركة Moonshot AI وخط منتجاتها الكامل، يرجى الاطلاع على Moonshot AI: نظرة عامة على الشركة ودليل منتج Kimi.
--- ## البنية التقنية لـ Kimi K2
يستخدم Kimi K2 بنية محول تعتمد على نظام "خليط من الخبراء" (MoE) (وهي نفس نوع البنية الأساسية التي يعتمد عليها GPT-4 وClaude)، وهو تصميم يسمح للنموذج بالتوسع ليصل إلى 1 تريليون معامل إجمالي مع الحفاظ على تكاليف استدلال مماثلة لنموذج كثيف بسعة 32 مليار معامل.
كيف يعمل نظام "خليط من الخبراء" في Kimi K2
فكر في "مزيج الخبراء" كمستشفى كبير يضم مئات الأطباء المتخصصين. فعندما يصل مريض، يتولى المتخصص المعني فقط معالجة الحالة، بدلاً من انضمام كل طبيب في المستشفى إلى كل استشارة. يقوم النموذج بتوجيه كل مدخل إلى المجموعة الفرعية ذات الصلة من شبكته بدلاً من تشغيل جميع المعلمات في آن واحد.
تعريف: مزيج الخبراء (MoE)
مزيج الخبراء (Mixture of Experts) هو بنية محولات متفرقة (sparse transformer architecture) حيث يقسم النموذج معاملاته إلى شبكات فرعية متخصصة تسمى "خبراء". تقوم آلية توجيه مُتعلمة بتنشيط مجموعة فرعية صغيرة فقط من هؤلاء الخبراء لكل رمز إدخال، بدلاً من تشغيل جميع المعاملات في كل عملية حسابية. النتيجة هي نموذج يمتلك السعة المعرفية لشبكة كبيرة جدًا، بينما يستهلك قدر الحساب لشبكة أصغر بكثير في وقت الاستدلال.
يمتلك Kimi K2 حوالي تريليون معامل إجمالي منظم عبر مئات الشبكات الفرعية المتخصصة. أثناء الاستدلال، يتم تنشيط حوالي 32 مليار معامل فقط من تلك المعاملات لكل رمز (token). هذا يعني أن تكاليف الاستدلال تقارب تكاليف نموذج مكثف بحجم 32 مليار، وليس نموذج مكثف بحجم 1 تريليون. يستخدم DeepSeek R1 و Mixtral نفس المبدأ المعماري، مما يؤسس مبدأ خليط الخبراء (MoE) كتقنية سابقة مثبتة على هذا النطاق.
ما يعنيه هذا عمليًا تكلف تشغيل Kimi K2 في بيئة الإنتاج ما يعادل تقريبًا ما ستدفعه لتشغيل نموذج كثيف بحجم 32 مليار بارامتر. الرقم الخاص بـ 1 تريليون بارامتر يصف إجمالي سعة المعرفة، وليس تكلفة الحوسبة لكل استعلام. بالنسبة للفرق التي تقيّم النشر المستضاف ذاتيًا، فإن خط الأساس للأجهزة ذي الصلة هو ما يعادل نموذجًا كثيفًا بحجم 32 مليار بارامتر، وليس نموذجًا بحجم 1 تريليون بارامتر.
نافذة السياق ومواصفات الاستدلال
يدعم Kimi K2 نافذة سياق تصل إلى 128,000 رمز مميز (tokens)، وهو ما يعادل تقريباً 96,000 إلى 100,000 كلمة من المدخلات في مطالبة واحدة. ولتوضيح ذلك بمصطلحات ملموسة: يمكن للنص الكامل لرواية طويل، أو مستودع برمجيات بالكامل، أو نصوص اجتماعات لمدة عام كامل أن يتسع ضمن سياق واحد لـ Kimi K2.
هذه القدرة تتجاوز أهميتها مجرد تلخيص المستندات. مسارات العمل الوكيلة التي تتطلب من نموذج قراءة قاعدة شفرة كاملة قبل كتابة رقعة (patch)، أو خطوط أنابيب البحث التي تستوعب مستندات متعددة قبل تجميع تقرير، تعتمد على نوافذ سياق كبيرة لتعمل دون فقدان للمعلومات عبر استدعاءات متعددة.
--- ## الأوزان المفتوحة مقابل المصدر المفتوح: ما الذي يطلقه Kimi K2 فعلياً
يُعد Kimi K2 مفتوح الأوزان، وليس مفتوح المصدر بالكامل. إن أوزان النموذج المدربة متاحة للتحميل العلني بموجب ترخيص MIT معدل، ولكن شركة Moonshot AI لم تصدر بيانات التدريب أو رمز التدريب الكامل.
تستخدم العديد من المقالات حول Kimi K2 مصطلحي "مفتوح المصدر" و "وزن مفتوح" كما لو كانا يعنيان نفس الشيء. وهما لا يعنيان ذلك.
الأوزان المفتوحة مقابل المصادر المفتوحة: ما الذي تطلقه Kimi K2 فعليًا
| مع إطلاق الأوزان المفتوحة لـ Kimi K2، يمكنك: | مع إطلاق الأوزان المفتوحة لـ Kimi K2، لا يمكنك افتراض: |
|---|---|
| تنزيل أوزان النموذج المدربة من Hugging Face | الوصول إلى مجموعة بيانات التدريب المسبق |
| تشغيل الاستنتاج محليًا على أجهزتك الخاصة | إعادة إنتاج مسار التدريب الكامل بشكل مستقل |
| إجراء الضبط الدقيق للأوزان على بياناتك الخاصة | الادعاء بأن النموذج "مفتوح بالكامل" في السياقات التنظيمية أو سياقات الامتثال |
| نشر النموذج في المنتجات التجارية (يخضع لشروط الترخيص) | تجاوز أي قيود في ترخيص MIT المعدل بخلاف شروط MIT القياسية |
تم إصدار Kimi K2 بموجب ترخيص MIT معدل. إن ترخيص MIT القياسي هو ترخيص مرن ويسمح بشكل عام بالاستخدام التجاري والتعديل وإعادة التوزيع. قد يضيف ترخيص MIT "المعدل" شروطاً إضافية تتجاوز تلك البنود. قبل أي نشر تجاري، يرجى التحقق من الشروط المحددة في ملف ترخيص Kimi K2 الرسمي.). قد يتم تحديث شروط الترخيص بعد نشر هذه المقالة.
كيف يفكر Kimi K2: شرح وضع الاستدلال
Kimi K2 هو نموذج تفكير، مما يعني أنه ينشئ مسار استدلال داخلي مطول قبل إنتاج إجابة نهائية، بدلاً من الاستجابة الفورية للمطالبة. وهذا السلوك هو ما يميزه عن نماذج اتباع التعليمات القياسية مثل GPT-4o أو Claude في الوضع الافتراضي.
ما هو نموذج التفكير؟
تعريف: نموذج التفكير يقوم نموذج التفكير بإنشاء أثر استدلالي مرئي لسلسلة الأفكار (CoT) قبل تقديم استجابته النهائية. وتعمل عملية الاستدلال الداخلي الموسعة هذه على معالجة المشكلات الفرعية، والتحقق من الاستنتاجات الوسيطة، وتصحيح الأخطاء قبل الالتزام بالإجابة. والنتيجة هي دقة أعلى بشكل ملموس في المهام المعقدة التي تتضمن خطوات متعددة، أو الاشتقاق الرياضي، أو تصحيح الأخطاء البرمجية، أو المنطق الصوري. وتصف مصطلحات "نموذج التفكير" و"النموذج الاستدلالي" و"نموذج سلسلة الأفكار" جميعها نفس نموذج القدرة الكامن.
كانت نماذج o1 وo3 من OpenAI أول نماذج التفكير المعترف بها على نطاق واسع، مما أدى إلى تأسيس هذه الفئة. وجلب DeepSeek R1 نفس النموذج إلى مساحة الأوزان المفتوحة. وينتمي Kimi K2 إلى نفس الفئة من النماذج. وفي اختبار AIME 2025 للرياضيات، الذي يقيس التفكير الرياضي متعدد الخطوات، سجل Kimi K2 حوالي 49.5%؛ وفي اختبار GPQA Diamond، وهو معيار للاستدلال العلمي على مستوى الدراسات العليا، سجل حوالي 75.1%، وفقاً للتقرير الفني الصادر عن Moonshot AI.
وضع التفكير مقابل وضع عدم التفكير في K2-Instruct
K2-Instruct هو النسخة التي تتبع التعليمات والدردشة من Kimi K2 base، ويدعم وضعين تشغيل مميزين: وضع التفكير ووضع عدم التفكير.
وضع التفكير يُفعّل تتبع الاستدلال الكامل بنمط التفكير المتسلسل. يُنتج النموذج مسودة مرئية لخطوات الاستدلال الوسيطة قبل الإجابة النهائية. استخدم وضع التفكير للمهام التي تكون فيها الدقة أكثر أهمية من زمن الاستجابة: مثل حل مشكلة خوارزمية معقدة، أو تصحيح خطأ سباق دقيق، أو العمل على إثبات متعدد الخطوات.
وضع عدم التفكير" مناسب بشكل أفضل للمهام التي تكون فيها السرعة أهم من التفكير العميق: الإجابة على الأسئلة الواقعية، إنشاء أكواد نمطية، تلخيص المستندات حيث لا يتطلب الجواب استنتاجاً متعدد الخطوات. تصل الاستجابات أسرع دون تتبع مطول.
مثال عملي: إذا وجهت سؤالاً لـ Kimi K2 'ما هو ناتج 2 + 2؟'، فسيعطي كلا الوضعين نفس الإجابة الصحيحة. أما إذا وجهت سؤالاً 'بالنظر إلى دالة Python المكونة من 500 سطر مع وجود خطأ بفارق واحد (off-by-one error) تم الإبلاغ عنه في تنفيذ البحث الثنائي، حدد الخطأ وأصلحه'، فسيعمل وضع التفكير من خلال المنطق خطوة بخطوة قبل الإجابة، بينما قد يعطي وضع عدم التفكير نتيجة أسرع ولكنها أقل موثوقية. تتيح لك واجهة برمجة التطبيقات (API) التبديل بين الأوضاع. راجع قسم كيفية الوصول إلى Kimi K2 لمعرفة معاملات واجهة برمجة التطبيقات التي تتحكم في هذا التبديل.
كيف تم تدريب Kimi K2
تبع تدريب Kimi K2 مسار عمل متعدد المراحل وصفته شركة Moonshot AI في التقرير التقني للنموذج. يجمع هذا المسار بين التدريب المسبق واسع النطاق ومرحلة التعلم المعزز ومحسن مخصص لإنتاج قدرات النموذج النهائية.
مسار التدريب
قامت Moonshot AI بتدريب Kimi K2 عبر أربع مراحل متسلسلة، كما هو موضح في التقرير الفني الرسمي:
- التدريب المسبق واسع النطاق على مجموعة بيانات ضخمة من النصوص والتعليمات البرمجية، مما يبني المعرفة العامة للنموذج وفهمه للغة.
- الضبط الدقيق الخاضع للإشراف (SFT) على بيانات منسقة لاتباع التعليمات، لتعليم النموذج الاستجابة لمطالبات المستخدم بتنسيق مفيد.
- التعلم التعزيزي (RL) بمكافآت قائمة على القواعد، حيث يتم تدريب النموذج على تحسين سلوك الاستنتاج واستخدام الأدوات من خلال تلقي إشارات إيجابية للإجابات الصحيحة في المهام القابلة للتحقق.
- محسن MuonClip المطبق خلال عملية التدريب، مما يساهم في تثبيت عملية التدريب على نطاق واسع.
تستحق مرحلة التعلم التعزيزي (RL) توضيحاً موجزاً. فعلى عكس الضبط الدقيق القياسي الخاضع للإشراف، والذي يعلّم النموذج محاكاة مخرجات نموذجية، يكافئ التعلم التعزيزي النموذج على تقديم إجابات صحيحة في مهام الاستدلال ويعدل سلوكه بشكل متكرر. يستخدم إطار عمل التعلم التعزيزي لـ Kimi K2 مكافآت قائمة على القواعد، مما يعني أنه يتحقق من الإجابات مقابل حقائق مرجعية قابلة للتحقق بدلاً من الاعتماد حصرياً على ملاحظات التفضيل البشري (RLHF). يهم هذا التمييز المقيّمين التقنيين: حيث يميل التعلم التعزيزي القائم على القواعد إلى إنتاج تحسينات أكثر اتساقاً في الاستدلال ضمن المهام المنظمة مثل الرياضيات والبرمجة، لأن الصحة قابلة للقياس بشكل موضوعي.
MuonClip: ابتكار التدريب من Moonshot AI
MuonClip هو مُحسِّن تدريب مخصص تم تطويره بواسطة Moonshot AI خصيصًا لتحقيق استقرار تدريب نماذج MoE واسعة النطاق. معظم تغطيات Kimi K2 تذكره بشكل عابر، ولهذا السبب يتعمق هذا القسم.
بعبارات بسيطة، يتضمن تدريب الشبكات العصبية تعديل ملايين (أو تريليونات) من المعاملات بشكل متكرر بناءً على إشارات الخطأ. على نطاق نموذج MoE (Mixture of Experts) الذي يحتوي على تريليون معامل، يمكن أن تصبح هذه التعديلات غير مستقرة في بعض الأحيان، حيث تنمو تحديثات المعاملات بشكل لا يمكن السيطرة عليه في ظاهرة تسمى "انفجار التدرج" (gradient explosion). يعالج MuonClip هذه المشكلة من خلال الجمع بين مكونين: المحسِّن Muon (وهو صيغة من الانحدار التدرجي (gradient descent) تتكيف مع أحجام الخطوات بناءً على هندسة المعاملات) مع اقتطاع التدرج (gradient clipping)، وهي تقنية تحد من الحد الأقصى لحجم أي تحديث فردي للمعامل لمنع القيم الجامحة. اسم MuonClip هو مزيج من هذين المكونين.
على المستوى التقني: يستخدم التدريب القياسي لنماذج اللغة الكبيرة المحسن AdamW. ووفقاً للتقرير التقني لشركة Moonshot AI، يقوم MuonClip بتعديل محسن Muon من خلال دمج تقنية قص التدرج (gradient clipping) لمعالجة عدم استقرار التدريب الذي يحدث عادةً في معماريات MoE عند التوسع. وتفيد Moonshot AI بأن MuonClip يحسن استقرار التدريب وجودة النموذج النهائية مقارنةً بـ AdamW في هذه المعمارية. هذه هي ادعاءات Moonshot AI، المستمدة من التقرير التقني لـ Kimi K2 (المعرف arXiv:2502.16982 — تحقق من الرابط قبل الاستشهاد به). وكان التحقق المستقل من طرف ثالث لهذه الادعاءات مستمراً وقت النشر.
ما يعنيه هذا عمليًا يؤدي استقرار التدريب الأفضل إلى تقارب أكثر موثوقية أثناء عملية التدريب، مما يترجم بدوره إلى قدرات نموذج نهائية أقوى. MuonClip ليس خيارًا للمعاملات الفائقة (hyperparameter)؛ بل تصوره Moonshot AI كمساهمة بحثية لمشكلة عدم استقرار التدريب في نماذج MoE الكبيرة جدًا. إذا صمدت ادعاءات الاستقرار في ظل تقييم مستقل، فإنها تمثل تقدمًا ذا مغزى في منهجية تدريب نماذج الأوزان المفتوحة الرائدة.
أداء Kimi K2 المعياري
يلخص الجدول أدناه درجات Kimi K2 عبر ستة مقاييس أداء، وفقاً للتقرير الفني لشركة Moonshot AI. يوضح وصف كل مقياس أداء ما تقيسه الدرجة من الناحية العملية، لأن النسبة المئوية بدون سياق لا تقدم أي معلومات حول ما إذا كان ينبغي استخدام النموذج.
| معيار القياس | ما يتم اختباره | درجة Kimi K2 | الدرجة المرجعية |
|---|---|---|---|
| SWE-bench Verified | حل مشكلات GitHub الواقعية من خلال إجراء تغييرات برمجية مستهدفة في مستودعات البرامج الفعلية | ~65.8% | DeepSeek R1: ~49.2% |
| GPQA Diamond | الاستدلال العلمي على مستوى الدراسات العليا في مجالات الأحياء والكيمياء والفيزياء | ~75.1% | GPT-4o: ~53.6% |
| MMLU | المعرفة الأكاديمية الواسعة في 57 موضوعاً | ~87.4% | DeepSeek R1: ~84.0% |
| AIME 2025 | حل المشكلات الرياضية متعددة الخطوات باستخدام مشكلات من مستوى المسابقات | ~49.5% | DeepSeek R1: ~70.0% |
| LiveCodeBench | القدرة على البرمجة في مشكلات يتم تحديثها باستمرار من مسابقات البرمجة التنافسية، مما يقلل من تلوث بيانات التدريب | ~53.7% | DeepSeek R1: ~65.9% |
| Tau-bench (Airline) | استخدام الأدوات متعدد الخطوات وإنجاز المهام الوكيلية في بيئات خدمة العملاء المحاكات | ~54.9% | GPT-4o: ~46.0% |
أرقام قياس الأداء مستمدة من التقرير الفني لـ Moonshot AI وبطاقة نموذج Kimi K2. هذه الأرقام مبلغ عنها ذاتيًا عند الإطلاق وقد يتم تحديثها مع اكتمال التقييمات المستقلة. تحقق من النتائج الحالية مقابل التقرير الفني الرسمي قبل اتخاذ قرارات النشر.
تتمثل نتيجة الـ Headline للممارسين في SWE-bench Verified. يختبر هذا المعيار المرجعي ما إذا كان بإمكان النموذج أخذ وصف لمشكلة حقيقية من GitHub، وقراءة الكود ذي الصلة، وإنتاج رقعة (patch) تعالج المشكلة بالفعل في مستودع تم التحقق منه بشرياً. إن تحقيق نتيجة ~65.8% في هذا المعيار يضع Kimi K2 بين أفضل النماذج مفتوحة الأوزان (open-weight) أداءً في مهام هندسة البرمجيات العملية اعتباراً من يوليو 2025، وبشكل ملحوظ أعلى من نتيجة DeepSeek R1 البالغة ~49.2% في المعيار نفسه.
في اختبار AIME 2025، تنعكس نتائج المقارنة: حيث حقق نموذج DeepSeek R1 حوالي 70.0% مقابل حوالي 49.5% لنموذج Kimi K2، مما يشير إلى أن DeepSeek R1 يتمتع بأفضلية في حل المسائل الرياضية التنافسية البحتة. وفي اختبار الاستدلال العلمي GPQA Diamond، تتجاوز نسبة Kimi K2 البالغة حوالي 75.1% بشكل كبير نسبة GPT-4o البالغة حوالي 53.6%.
ما يعنيه هذا عمليًا يجعل ملف المعايير الخاص بـ Kimi K2 مرشحًا لمهام الاستدلال الهندسي والعلمي. إذا كانت حالة الاستخدام الأساسية لديك هي مساعدة تطوير البرمجيات أو التحليل العلمي، فإن نتائج SWE-bench و GPQA ذات صلة مباشرة. إذا كانت مسائل مسابقات الرياضيات البحتة هي معيارك، فإن DeepSeek R1 يسجل حاليًا درجة أعلى في AIME 2025. لا يهيمن أي من النموذجين على جميع المهام، وهذا هو الإطار الدقيق لاتخاذ قرارات النشر.
--- ## Kimi K2 مقابل الموديلات المنافسة
وضع Kimi K2 مقابل أقرب منافسيه يكشف عن النقاط التي يتفوق فيها النموذج في المقاييس، وحيث يكون الأداء قابلاً للمقارنة، وأي المفاضلات مهمة لقرارات النشر. تقتصر المقارنات أدناه على المقاييس المسماة لتجنب التعميمات غير المدعومة.
Kimi K2 مقابل DeepSeek R1
كلا النموذجين Kimi K2 و DeepSeek R1 هما نموذجا تفكير MoE مفتوحا الأوزان، مما يجعل هذه المقارنة المعمارية الأكثر مباشرة. كلاهما يولد مسارات تفكير متسلسلة. كلاهما متاح كأوزان قابلة للتنزيل. تكمن الاختلافات الرئيسية في ملف التعريف المعياري، ومقياس المعلمات، ومنهجية التدريب.
| السمة | Kimi K2 | DeepSeek R1 |
|---|---|---|
| البنية | محول MoE | محول MoE |
| إجمالي المعلمات | ~1 تريليون | ~671 مليار |
| المعلمات النشطة لكل رمز | ~32 مليار | ~37 مليار |
| وضع التفكير | نعم (K2-Instruct) | نعم |
| SWE-bench (موثق) | ~65.8% | ~49.2% |
| AIME 2025 | ~49.5% | ~70.0% |
| LiveCodeBench | ~53.7% | ~65.9% |
| MMLU | ~87.4% | ~84.0% |
| الابتكار في التدريب | محسن MuonClip | التعلم المعزز GRPO |
في مهام هندسة البرمجيات (SWE-bench Verified)، يتصدر Kimi K2 بفارق هامش كبير. وفي مسائل مسابقات الرياضيات (AIME 2025) والبرمجة التنافسية (LiveCodeBench)، يحقق DeepSeek R1 درجات أعلى. وبالنسبة للمعلومات العامة (MMLU)، يتصدر Kimi K2 بفارق بسيط. لا يوجد نموذج متفوق بشكل مطلق؛ حيث يعتمد الاختيار على فئة المهام التي تهم تطبيقك.
DeepSeek V3، نموذج التعليمات المكثف من DeepSeek الذي لا يعتمد على التفكير، يوفر خط الأساس القياسي لمقارنات المهام التي لا تعتمد على الاستدلال. حيث تتم مقارنة Kimi K2 في وضع عدم التفكير مقابل DeepSeek V3 على معايير اتباع التعليمات، فإن الأداء متقارب بشكل عام، على الرغم من أن التقييمات المباشرة المتكافئة يجب أن تستخدم إعدادات استدلال مكافئة.
ينضم كل من Kimi K2 و DeepSeek R1 إلى طليعة النماذج مفتوحة الأوزان جنبًا إلى جنب مع Llama 4 من ميتا. لم تكن بيانات المقارنة المعيارية المباشرة بين Kimi K2 و Llama 4 متاحة في التقرير الفني لـ Kimi K2 وقت النشر؛ استشر لوحات الصدارة المعيارية الحالية للمقارنات المحدثة.
Kimi K2 مقابل Claude Sonnet و GPT-4o
تضع مقارنة Kimi K2 بكل من Claude Sonnet وGPT-4o قراراً مختلفاً في الحسبان: لا تكمن المسألة في أي نموذج تفكير هو الأقوى، بل فيما إذا كان النموذج مفتوح الأوزان يقدم أداءً كافياً لاستبدال واجهة برمجة تطبيقات (API) مملوكة ومدارة.
على SWE-bench Verified، حصل Kimi K2 على نسبة ~65.8%. لم يتم تأكيد نتيجة Claude Sonnet 4 الخاصة بـ SWE-bench Verified بشكل مستقل وقت كتابة هذه السطور؛ استشر وثائق المقارنة المعيارية المنشورة من Anthropic للحصول على الرقم الحالي قبل إجراء مقارنات جنباً إلى جنب. يوفر Claude Sonnet واجهة برمجة تطبيقات (API) مدارة مع تحديد معدل الطلبات المدمج، وتصفية الأمان، وضمانات وقت التشغيل، ولا تتطلب أي عبء للبنية التحتية. يوفر Kimi K2 أوزانًا مفتوحة، وعدم الارتباط بواجهة برمجة تطبيقات لكل رمز مميز، والقدرة على التشغيل بالكامل على أجهزتك الخاصة. بالنسبة للفرق التي تعالج كميات كبيرة من الطلبات حيث تتراكم تكاليف كل رمز مميز، تتحسن اقتصاديات استضافة نموذج مفتوح الوزن ذاتياً بشكل كبير على نطاق واسع.
يُعد GPT-4o نموذجاً متعدد الوسائط من OpenAI يتبع التعليمات، وهو متميز عن طرازي o1 وo3، وهما نماذج التفكير المخصصة من OpenAI. ولا تعد المقارنة المباشرة بين وضع التفكير في Kimi K2 والوضع القياسي في GPT-4o متكافئة تماماً من الناحية المعمارية. ففي اختبار الاستدلال العلمي GPQA Diamond، تتجاوز نسبة Kimi K2 البالغة ~75.1% بشكل كبير نسبة GPT-4o البالغة ~53.6%، وفقاً لبيانات الاختبارات المعيارية المتاحة للجمهور. وبالنسبة لمهام الاستدلال والبرمجة، يصل Kimi K2 إلى مستويات أداء كانت في السابق لا تتوفر إلا من خلال واجهات برمجة تطبيقات (APIs) خاصة، مع إمكانية نشره دون الحاجة إلى ذلك الاعتماد.
المقايضة عملية: يوفر كل من Claude و GPT-4o بنية تحتية مدارة للموثوقية والسلامة لا تتضمنها النماذج مفتوحة الوزن المستضافة ذاتياً بشكل افتراضي. يجب على الفرق ذات المتطلبات التنظيمية أو التي لا تملك بنية تحتية لوحدات معالجة الرسومات (GPU) جاهزة أن تأخذ هذه الفجوة التشغيلية في الاعتبار عند تقييمها.
Kimi K2 مقابل Kimi K3
يُعد كيمي K3 نموذج الاستدلال الرائد من الجيل القادم لشركة Moonshot AI، والذي تم إصداره بعد كيمي K2. وبينما أرسي كيمي K2 المعيار الأساسي للاستدلال بنظام MoE مفتوح الأوزان، فإن كيمي K3 يطور البنية وملف الاختبارات المعيارية بشكل أكبر. وبالنسبة للفرق التي تقيم ما إذا كانت ستعتمد K2 أو تنتقل مباشرة إلى K3، فإن نقاط المقارنة الرئيسية هي حجم المعاملات، ودلتا الاختبارات المعيارية، وتكلفة الاستنتاج.
للحصول على مراجعة كاملة لمعمارية Kimi K3، وأدائه المعياري، وخيارات الوصول إليه، راجع Kimi K3: نموذج الاستدلال الرائد من Moonshot AI.
حالات استخدام Kimi K2 والقدرات الوكيلية
تم تصميم Kimi K2 بثلاث فئات استخدام أساسية: هندسة البرمجيات والترميز، والاستدلال الرياضي والعلمي، وإكمال المهام الوكيلة متعددة الخطوات. ترتبط نتائج الاختبارات المعيارية في القسم السابق مباشرة بهذه الفئات.
Kimi K2 كعمود فقري وكيل
يصف الذكاء الاصطناعي الوكيل الأنظمة التي يمكنها التخطيط وإكمال المهام متعددة الخطوات بشكل مستقل، واستدعاء أدوات خارجية مثل البحث على الويب، وبيئات تنفيذ الأكواد، وأنظمة الملفات، وواجهات برمجة التطبيقات (APIs) دون الحاجة إلى توجيه بشري في كل خطوة. يختلف هذا عن روبوت المحادثة القياسي، الذي ينتظر طلبًا بشريًا قبل اتخاذ أي إجراء.
يحقق Kimi K2 ما يقرب من 54.9% في مقياس Tau-bench المرجعي لنطاق شركات الطيران، وفقاً للتقرير الفني لشركة Moonshot AI. يختبر Tau-bench استخدام الأدوات متعدد الخطوات وإكمال المهام الوكيلية في بيئات محاكاة، مما يجعله الدليل المعياري الأكثر مباشرة للادعاءات المتعلقة بالقدرات الوكيلية.
يوضح سيناريوان واقعيان لسير العمل كيف يبدو ذلك من الناحية العملية:
السيناريو 1: وكيل هندسة البرمجيات. يقوم أحد المطورين بتوجيه Kimi K2 إلى مستودع GitHub ويصف ثغرة برمجية تم الإبلاغ عنها: "يواجه المستخدمون حالة تسابق (race condition) في تدفق المصادقة عند معالجة طلبات ذات تزامن عالٍ". يقرأ Kimi K2 ملفات المصدر ذات الصلة، ويحدد نمط القفل الذي يتسبب في حالة التسابق، ويُنشئ تصحيحاً (patch) يقدم معالجة مناسبة للـ mutex، ويقوم بتشغيل مجموعة الاختبارات الحالية للتحقق من عدم وجود أي تراجعات. يقوم المراجع البشري بمراجعة طلب السحب (pull request) ودمجه. لقد تعامل النموذج مع دورة (التحديد-التشخيص-الإصلاح-التحقق) الكاملة دون توجيهات خطوة بخطوة.
السيناريو 2: وكيل تجميع الأبحاث. المخرجات هنا هي تحليل تنافسي مهيكل لنماذج التسعير عبر خمسة من مزودي البرمجيات كخدمة (SaaS)، مع بيانات موحدة وقسم للتوصيات. ولإنتاجه، يقوم Kimi K2 بالاستعلام عن واجهة برمجة تطبيقات التسعير العامة أو صفحة التوثيق الخاصة بكل مزود، ويقوم بتوحيد البيانات في مخطط متسق، ويحدد متغيرات التسعير التي تختلف بين المزودين. يقوم خبير استراتيجية المنتج الذي يتلقى التقرير بمراجعة صياغة التوصيات قبل توزيعها على أصحاب المصلحة. لم يتم جمع أي بيانات يدوياً؛ حيث تعامل الوكيل مع كل خطوة من خطوات الاسترداد والتجميع بشكل مستقل.
تعتمد هذه السيناريوهات على نافذة السياق الخاصة بـ Kimi K2 والتي تبلغ 128,000 رمز، مما يمكّنها من استيعاب قاعدة تعليمات برمجية كاملة أو مجموعة وثائق في سياقها. كما تعتمد على قدرتها على استخدام الأدوات ومنطق وضع التفكير الخاص بها لمعالجة اتخاذ القرارات متعددة الخطوات ضمن مهمة واحدة.
ما هي المهام التي يتفوق فيها Kimi K2؟
يحقق Kimi K2 أعلى النتائج في المهام ضمن هذه الفئات الخمس، وفقاً للتقرير التقني لشركة Moonshot AI:
- هندسة البرمجيات وإصلاح الأكواد: SWE-bench Verified بنسبة ~65.8%، وهي من بين أعلى النتائج للنماذج مفتوحة الأوزان اعتباراً من يوليو 2025
- الاستنتاج العلمي وعلى مستوى الدراسات العليا: GPQA Diamond بنسبة ~75.1%، وهي أعلى بكثير من نتيجة GPT-4o المنشورة في نفس معيار التقييم
- معرفة أكاديمية واسعة: MMLU بنسبة ~87.4%، وتغطي 57 مجالاً معرفياً
- استخدام الأدوات الوكالي وإكمال المهام: Tau-bench Airline بنسبة ~54.9%، لقياس إكمال المهام المستقلة متعددة الخطوات
- تحليل المستندات الـطويلة: تتيح نافذة سياق بسعة 128,000 رمز معالجة قاعدة الأكواد الكاملة أو المستند الكامل في أمر واحد
تعد مسائل المسابقات الرياضية (AIME 2025: بنسبة تقارب 49.5%) والبرمجة التنافسية (LiveCodeBench: بنسبة تقارب 53.7%) من المجالات التي يحقق فيها DeepSeek R1 حالياً نتائج أعلى، وذلك بناءً على الأرقام الصادرة عن Moonshot AI.
كيفية الوصول إلى Kimi K2
Kimi K2 متاح عبر ثلاث قنوات: بطاقة نموذج Kimi K2-Instruct على Hugging Face، وواجهة برمجة التطبيقات الرسمية لـ Moonshot AI، و OpenRouter.
تداول رمز MOONSHOT على Bybit: نمو Moonshot AI جذب انتباه متداولي العملات الرقمية — Bybit تقدم عقود MOONSHOTUSDT الدائمة) للمهتمين بتداول رمز MOONSHOT. اطلع أيضًا على فرص تداول الاكتتاب العام الأولي (IPO) لـ Moonshot AI على Bybit.)
نظرة عامة على قنوات الوصول
| القناة | نوع الطريقة | التكلفة | الأفضل لـ |
|---|---|---|---|
| Hugging Face (تنزيل الأوزان) | استدلال مستضاف ذاتيًا | مجاني للتنزيل؛ تُطبق تكاليف البنية التحتية | الفرق التي تمتلك مجموعات وحدات معالجة الرسومات (GPU) وترغب في التحكم الكامل في النشر |
| واجهة برمجة تطبيقات Moonshot AI | واجهة برمجة تطبيقات مدارة | مدفوع لكل رمز مميز (تحقق من الأسعار الحالية على platform.moonshot.cn) | المطورون الذين يرغبون في وصول سريع دون إعداد البنية التحتية |
| OpenRouter | مجمّع واجهات برمجة تطبيقات من طرف ثالث | مدفوع لكل رمز مميز (تحقق من الأسعار الحالية على openrouter.ai) | المطورون الذين يستخدمون واجهة برمجة تطبيقات موحدة عبر العديد من مزودي النماذج |
أوزان النموذج مجانية للتنزيل من Hugging Face. الوصول عبر واجهة برمجة التطبيقات (API) باستخدام Moonshot AI أو OpenRouter يتحمل تكاليف لكل رمز (token). يتغير تسعير واجهة برمجة التطبيقات (API) للنماذج التي تم إطلاقها حديثًا بشكل متكرر؛ تحقق من التكاليف الحالية للرموز (tokens) المدخلة والمخرجة مباشرةً من صفحة التسعير لكل مزود قبل اتخاذ قرارات النشر. تعكس معلومات التسعير في هذه المقالة المعلومات المتاحة وقت النشر. OpenRouter هي خدمة تجميع من طرف ثالث وليست تابعة لـ Moonshot AI.
يتوفر التقرير الفني الرسمي لـ Kimi K2 في التقرير الفني لـ Kimi K2 على arXiv (arXiv:2502.16982 — تحقق من الرابط قبل الاقتباس). وهو المصدر المعتمد لأرقام الاختبارات المرجعية وتفاصيل منهجية التدريب المشار إليها في هذا المقال.
للاطلاع على تفصيل كامل لفئات تسعير Kimi API عبر K3 وK2، راجع أسعار Moonshot Kimi API لعام 2026: دليل الخطط والتكلفة.
تنزيل الأوزان من Hugging Face
قم بتنزيل أوزان Kimi K2-Instruct مباشرة من بطاقة نموذج Kimi K2-Instruct على Hugging Face.
خطوات البدء في النشر المحلي:
- أنشئ حساب Hugging Face إذا لم يكن لديك واحد بالفعل.
- انتقل إلى
huggingface.co/moonshotai/Kimi-K2-Instructوراجع بطاقة النموذج لأحدث الوثائق. - قم بتثبيت مكتبة
transformersالخاصة بـ Hugging Face:pip install transformers. - قم بتنزيل الأوزان باستخدام
huggingface-cli download moonshotai/Kimi-K2-Instructأو عبر واجهة برمجة تطبيقاتtransformersAutoModel. - تحقق من شروط الترخيص في ملف ترخيص Kimi K2 الرسمي) قبل أي نشر تجاري.
متطلبات الأجهزة للاستدلال المحلي: يتطلب نموذج Kimi K2 كامل الدقة الذي يحتوي على حوالي تريليون معلمة إجمالية بنية تحتية كبيرة لوحدات معالجة الرسومات (GPU). بالنسبة للاستدلال بدقة BF16 الكاملة، توقع متطلبات في نطاق وحدات معالجة رسومات متعددة ذات ذاكرة عالية (مثل 8x H100 سعة 80 جيجابايت أو ما يعادلها). تعمل الإصدارات المكممة (بتنسيقات GGUF وAWQ وGPTQ) على تقليل متطلبات الأجهزة بشكل كبير. تحقق من بطاقة نموذج Hugging Face ومستودعات المجتمع لمعرفة النسخ المكممة المتاحة في وقت النشر. يجب على المستخدمين الذين لا تتوفر لديهم إمكانية الوصول إلى عنقود وحدات معالجة رسومات متعددة (multi-GPU cluster) استخدام قنوات الوصول إلى واجهة برمجة التطبيقات (API) المذكورة أعلاه بدلاً من محاولة النشر المحلي.
استدعاء واجهة برمجة تطبيقات Kimi K2
تتبع واجهة برمجة تطبيقات Moonshot AI واجهة متوافقة مع OpenAI، لذا فإن مكتبات العملاء الحالية لنماذج اللغة الكبيرة (LLM) تتطلب تعديلات بسيطة. المثال أدناه يستخدم مكتبة openai بلغة بايثون موجهة إلى نقطة نهاية Moonshot AI.
تعكس نقطة نهاية واجهة برمجة التطبيقات ومعرّف النموذج وطريقة المصادقة أدناه الواجهة المتاحة وقت الكتابة. تحقق من توثيق واجهة برمجة التطبيقات الحالي في توثيق واجهة برمجة تطبيقات Moonshot AI قبل الاستخدام.
from openai import OpenAI
# Initialize client with Moonshot AI's base URL
# احصل على مفتاح واجهة برمجة التطبيقات الخاص بك من المنصَّة moonshot.cn
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.cn/v1", # تحقق من نقطة النهاية الحالية
)
# Non-thinking mode: fast response for routine tasks
# وضع عدم التفكير: استجابة سريعة للمهام الروتينية
response = client.chat.completions.create(
model="kimi-k2-instruct", # تحقق من معرف النموذج الحالي
messages=[
{"role": "user", "content": "اشرح الفرق بين mutex و semaphore."}
]
)
print(response.choices[0].message.content)
# Thinking mode: extended CoT reasoning for complex tasks
# وضع التفكير: تفكير ممتد CoT للمهام المعقدة
# Enable thinking mode via extra_body (verify parameter name in current API docs)
# تمكين وضع التفكير عبر extra_body (تحقق من اسم المعلمة في مستندات واجهة برمجة التطبيقات الحالية)
response_thinking = client.chat.completions.create(
model="kimi-k2-instruct",
messages=[
{"role": "user", "content": "صحح دالة بايثون هذه واشرح الإصلاح: [الصق الكود هنا]"}
],
extra_body={"thinking": True}, # تحقق من اسم المعلمة في المستندات الحالية
)
print(response_thinking.choices[0].message.content)أسعار واجهة برمجة التطبيقات (API) الرسمية لـ Moonshot AI قابلة للتغيير. تحقق من التكاليف الحالية لرموز الإدخال والإخراج مباشرةً من صفحة أسعار Moonshot AI قبل اتخاذ قرارات النشر.
القيود والمقايضات الصريحة
تتراوح نتائج قياس الأداء لـ Kimi K2 بين حوالي 49.5% (AIME 2025) وحوالي 87.4% (MMLU)، وتعتبر المقايضات التالية مهمة لقرارات النشر:
- بيانات التدريب والتعليمات البرمجية ليست متاحة للعامة. يوفر إصدار الأوزان المفتوحة الأوزان المدربة فقط. المؤسسات التي تتطلب قابلية إعادة إنتاج التدريب بالكامل، أو التكرار الأكاديمي لعملية التدريب، أو الشفافية التنظيمية فيما يتعلق بمصدر بيانات التدريب لن تتمكن من تلبية تلك المتطلبات من خلال هذا الإصدار وحده.
- يتطلب النشر المحلي بنية تحتية ضخمة لوحدات معالجة الرسومات (GPU). الاستدلال بالدقة الكاملة على نموذج (MoE) بـ 1 تريليون معلمة غير ممكن على الأجهزة الاستهلاكية. ستحتاج الفرق التي لا تملك وصولاً إلى مجموعات وحدات معالجة الرسومات المتعددة إلى الاعتماد على الوصول عبر واجهة برمجة التطبيقات (API) أو النسخ المكممة (quantized)، مما قد يؤثر على جودة المخرجات.
- أرقام الاختبارات المرجعية هي تقارير ذاتية من Moonshot AI عند الإطلاق. كان التحقق من قِبل طرف ثالث مستقل لجميع درجات الاختبارات المرجعية مستمراً في وقت النشر. تاريخياً، أظهرت الدرجات المبلغ عنها ذاتياً عند إطلاق النموذج بعض التفاوت عن التقييمات المستقلة اللاحقة. يجب التعامل مع الدرجات كمعلومات توجيهية وليست مؤكدة بشكل نهائي.
- يعتمد توفر واجهة برمجة التطبيقات (API) على البنية التحتية لشركة Moonshot AI. على عكس تنزيل الأوزان والتشغيل محلياً، فإن الوصول المستند إلى واجهة برمجة التطبيقات ينشئ اعتماداً على خدمة طرف ثالث. يجب على الفرق التي لديها متطلبات صارمة لوقت التشغيل التخطيط لهذا الاعتماد التشغيلي.
- قد يتضمن ترخيص MIT المعدل قيوداً تتجاوز ترخيص MIT القياسي. ترخيص MIT القياسي هو ترخيص تسامحي، ولكن نسخة Moonshot AI المعدلة قد تضيف شروطاً. يجب على الفرق القانونية في المؤسسات ذات عمليات النشر الحساسة للملكية الفكرية مراجعة ملف الترخيص الفعلي، وليس مجرد اسم الترخيص.
- لم يتم تأكيد وجود قدرات متعددة الوسائط (multimodal) أصلية عند الإطلاق. Kimi K2 هو نموذج للنصوص والتعليمات البرمجية. تحقق من بطاقة النموذج الحالية لمعرفة أي تحديثات متعددة الوسائط تمت إضافتها بعد الإطلاق الأولي.
- تدابير السلامة هي مسؤولية الناشر عند الاستضافة الذاتية. لا تتضمن نماذج الأوزان المفتوحة تصفية السلامة المدارة التي تطبقها واجهات برمجة التطبيقات المملوكة افتراضياً. يجب على الفرق التي تنشر Kimi K2 محلياً تنفيذ طبقات المحتوى والسلامة الخاصة بها.
--- ## الأسئلة الشائعة
تعكس هذه الأسئلة عمليات البحث الأكثر شيوعاً حول Kimi K2، بناءً على أنماط "سؤال الآخرون أيضاً" التي أعقبت الإطلاق في يوليو 2025.
ما الفرق بين Kimi K2 و DeepSeek R1؟
يُعد كل من Kimi K2 وDeepSeek R1 نموذجي تفكير بنظام خليط الخبراء (MoE) ذوي أوزان مفتوحة، حيث يقومان بإنشاء مسارات استدلال لتسلسل الأفكار. يمتلك Kimi K2 ما يقرب من 1 تريليون معلمة إجمالية مقابل حوالي 671 مليار معلمة لنموذج DeepSeek R1، ويحقق درجات أعلى في اختبار SWE-bench Verified (حوالي 65.8% مقابل 49.2%) واختبار MMLU. بينما يحقق DeepSeek R1 درجات أعلى في اختبار AIME 2025 (حوالي 70.0% مقابل 49.5%) واختبار LiveCodeBench. ويكمن الفرق الجوهري في التدريب في استخدام Kimi K2 لمُحسّن MuonClip، وهو مساهمة بحثية من Moonshot AI.
هل Kimi K2 مفتوح المصدر أم مفتوح الأوزان؟
Kimi K2 هي ذات أوزان مفتوحة، وليست مفتوحة المصدر بالكامل. الأوزان المدربة للنموذج قابلة للتنزيل علنًا بموجب ترخيص MIT معدل، لكن Moonshot AI لم تصدر مجموعة بيانات التدريب المسبق أو رمز التدريب الكامل. تعني الأوزان المفتوحة أنه يمكنك تنزيل النموذج وتشغيله وضبطه؛ ولا يعني أن لديك إمكانية الوصول إلى كل ما هو مطلوب لإعادة إنتاج عملية التدريب بالكامل.
ما هو نموذج التفكير في الذكاء الاصطناعي؟
يُنشئ نموذج التفكير تتبعًا ممتدًا لـ "سلسلة الأفكار" (CoT) قبل تقديم الإجابة النهائية، حيث يعمل عبر خطوات وسيطة بدلاً من الاستجابة الفورية. يؤدي هذا النهج إلى تحسين الدقة بشكل ملموس في المهام المعقدة متعددة الخطوات مثل الرياضيات، وتصحيح أخطاء البرمجة، والاستدلال العلمي. وتُعد نماذج o1/o3 من OpenAI و DeepSeek R1 الأمثلة الأكثر شهرة قبل Kimi K2.
كم عدد المعلمات (parameters) التي يمتلكها Kimi K2؟
يمتلك Kimi K2 ما يقرب من 1 تريليون معلمة إجمالية، يتم تنشيط حوالي 32 مليار منها لكل رمز (token) أثناء عملية الاستنتاج. وهذا التمييز مهم: حيث تقارب تكاليف الاستنتاج تكاليف نموذج كثيف بسعة 32 مليار معلمة، وليس نموذجاً بسعة 1 تريليون، لأن معماريات خليط الخبراء (MoE) تنشط فقط مجموعة فرعية من المعلمات لكل رمز.
من طور Kimi K2؟
تم تطوير Kimi K2 بواسطة شركة Moonshot AI، وهي شركة أبحاث في مجال الذكاء الاصطناعي يقع مقرها في بكين وتأسست في عام 2023. تحظى الشركة بدعم مستثمرين من بينهم علي بابا (Alibaba) وتينسنت (Tencent) وسيكويا تشاينا (Sequoia China)، وهي مستقلة تماماً عن أي منظمات تتخذ من الولايات المتحدة مقراً لها وتستخدم علامة تجارية مماثلة.
ما هي Moonshot AI؟
شركة Moonshot AI هي شركة أبحاث صينية في مجال الذكاء الاصطناعي، تأسست في عام 2023 ويقع مقرها الرئيسي في بكين. وبدعم من كبار المستثمرين بما في ذلك Alibaba وTencent، بنت الشركة سمعتها على أبحاث نماذج اللغة ذات السياق طويل. ويمتلك خط منتجاتها الاستهلاكية، مساعد الدردشة Kimi، عشرات الملايين من المستخدمين في الصين.
ما هي المعايير المرجعية التي يحقق فيها Kimi K2 نتائج جيدة؟
وفقًا للتقرير التقني الصادر عن Moonshot AI، يحقق نموذج Kimi K2 تقريبًا النتائج التالية: SWE-bench Verified بنسبة ~65.8% (هندسة البرمجيات)، GPQA Diamond بنسبة ~75.1% (الاستدلال العلمي)، MMLU بنسبة ~87.4% (معرفة أكاديمية واسعة)، Tau-bench Airline بنسبة ~54.9% (استخدام الأدوات بشكل عاملي)، AIME 2025 بنسبة ~49.5% (الاستدلال الرياضي)، و LiveCodeBench بنسبة ~53.7% (البرمجة التنافسية). هذه الدرجات مُعلن عنها ذاتيًا عند الإطلاق.
هل يمكنني تشغيل Kimi K2 محليًا؟
نعم، إن Kimi K2 مفتوح الأوزان ويمكن تشغيل الأوزان محلياً. يتطلب الاستدلال بدقة كاملة بنية تحتية ضخمة لوحدات معالجة الرسومات (وحدات معالجة رسومات متعددة بذاكرة عالية مثل 8x H100 80GB). تُقلل النسخ المكمّمة من متطلبات الأجهزة ولكنها قد تؤثر على جودة المخرجات. بالنسبة لمعظم المستخدمين الذين لا يملكون مجموعة وحدات معالجة رسومات متعددة، فإن الوصول عبر واجهة برمجة التطبيقات (API) من خلال Moonshot AI أو OpenRouter هو المسار العملي لاستخدام النموذج.
ما هو حجم نافذة السياق لـ Kimi K2؟
تصل نافذة السياق إلى 128,000 توكن، ما يعادل تقريبًا 96,000 إلى 100,000 كلمة. يتيح هذا معالجة المستندات الطويلة، أو قواعد الأكواد الكاملة، أو سجلات المحادثات الممتدة ضمن مطالبة واحدة.
هل Kimi K2 أفضل من Claude للبرمجة؟
في اختبار SWE-bench Verified، الذي يختبر حل مشكلات GitHub الحقيقية، سجل نموذج Kimi K2 حوالي 65.8%. لم يتم تأكيد درجة Claude Sonnet 4 المحددة في اختبار SWE-bench Verified بشكل مستقل وقت كتابة هذا التقرير؛ يرجى الرجوع إلى مقاييس الأداء المنشورة من Anthropic للحصول على الرقم الحالي. يعتمد تفضيل نموذج معين على سياق النشر الخاص بك: حيث يوفر Kimi K2 مرونة الأوزان المفتوحة وعدم الارتباط بقيود الدفع لكل رمز (per-token lock-in)، بينما يوفر Claude موثوقية واجهة برمجة التطبيقات المدارة، وفلترة الأمان، وإعداداً أبسط للبنية التحتية.
ما هو نظام خليط الخبراء (Mixture of Experts) في الذكاء الاصطناعي؟
يعد خليط الخبراء (MoE) بنية محولات متفرقة (sparse transformer) تعمل على تقسيم بارامترات النموذج إلى شبكات فرعية متخصصة تسمى "الخبراء"، ثم توجه كل رمز إدخال (token) إلى مجموعة فرعية ذات صلة فقط من هؤلاء الخبراء بدلاً من تشغيل جميع البارامترات. والنتيجة هي نموذج يمتلك القدرة المعرفية لشبكة كبيرة جداً مع استهلاك موارد حوسبة تماثل شبكة أصغر أثناء عملية الاستدلال. يقوم نموذج كيمي K2 (Kimi K2) بتنشيط ما يقرب من 32 مليار من إجمالي بارامتراته البالغة تريليون واحد لكل رمز إدخال.
ما هو MuonClip ولماذا هو مهم؟
يعد MuonClip مُحسِّن تدريب مخصص طورته Moonshot AI، حيث يجمع بين مُحسِّن Muon وتقنية قص التدرج (gradient clipping) لمنع عدم استقرار التدريب في نماذج خليط الخبراء (MoE) واسعة النطاق. ووفقاً للتقرير التقني لشركة Moonshot AI، فإنه يعزز استقرار التدريب مقارنة بمُحسِّن AdamW القياسي في هذا النطاق. ويؤدي الاستقرار الأفضل في التدريب إلى تقارب أكثر موثوقية، وبحسب تقارير Moonshot AI، إلى قدرات أقوى للنموذج النهائي.
هل استخدام Kimi K2 مجاني؟
أوزان النموذج متاحة للتنزيل مجانًا من Hugging Face. الوصول عبر واجهة برمجة التطبيقات الرسمية لـ Moonshot AI أو OpenRouter يتحمل تكاليف لكل رمز مميز تختلف حسب المزود وهي قابلة للتغيير. الاستضافة الذاتية للأوزان التي تم تنزيلها مجانية بخلاف تكاليف البنية التحتية الخاصة بك. تحقق من أسعار واجهة برمجة التطبيقات الحالية على صفحة الأسعار الخاصة بكل مزود قبل الالتزام بطريقة وصول.
ما هي المهام التي يتفوق فيها Kimi K2؟
وفقًا للتقرير الفني لـ Moonshot AI، يحقق Kimi K2 أقوى أداء في: هندسة البرمجيات وتصحيح الأكواد (SWE-bench Verified ~65.8%)، والاستدلال العلمي على مستوى الدراسات العليا (GPQA Diamond ~75.1%)، واستخدام الأدوات متعدد الخطوات التعاوني (Tau-bench ~54.9%)، والمعرفة الأكاديمية الواسعة (MMLU ~87.4%)، وتحليل المستندات الطويلة (نافذة سياق بحجم 128,000 رمز). المسائل التنافسية في الرياضيات والبرمجة التنافسية هي مجالات يسجل فيها DeepSeek R1 حاليًا أعلى.### كيف تم تدريب Kimi K2؟
وفقاً للتقرير الفني لشركة Moonshot AI، فقد تم تدريب Kimi K2 عبر أربع مراحل: (1) مرحلة ما قبل التدريب واسعة النطاق على بيانات النصوص والأكواد البرمجية، (2) الضبط الدقيق الخاضع للإشراف على بيانات اتباع التعليمات، (3) التعلم المعزز بمكافآت قائمة على القواعد لتحسين التفكير واستخدام الأدوات، و(4) تطبيق مُحسِّن MuonClip طوال فترة التدريب لتحقيق استقرار العملية على نطاق واسع. وتستخدم مرحلة التعلم المعزز مكافآت الصحة القائمة على القواعد بدلاً من الاعتماد حصرياً على الملاحظات البشرية.
أي حالة استخدام تناسبك؟ إطار عمل لاتخاذ القرار
يعتمد الاختيار الصحيح بين Kimi K2 والنماذج البديلة على ثلاثة متغيرات للنشر: ما إذا كنت بحاجة إلى مرونة الأوزان المفتوحة، وما إذا كانت مهام البرمجة والمهام القائمة على الوكلاء هي عبء العمل الأساسي لديك، وما إذا كانت بنيتك التحتية تدعم النشر المحلي.
إذا كنت بحاجة إلى نموذج مفتوح الأوزان لهندسة البرمجيات أو الاستدلال العلمي: تضعه درجة Kimi K2 في SWE-bench Verified البالغة حوالي 65.8% ودرجة GPQA Diamond البالغة حوالي 75.1% ضمن أفضل عقود الخيارات مفتوحة الأوزان في تلك الفئات اعتبارًا من يوليو 2025، بناءً على بيانات الاختبارات القياسية المتاحة. قم بتقييمه مباشرة مقابل نوع مهمتك المحددة قبل الالتزام.
إذا كنت بحاجة إلى نموذج مفتوح الأوزان بشكل أساسي لمسائل المسابقات الرياضية أو البرمجة التنافسية: فإن درجات DeepSeek R1 الأعلى في AIME 2025 (حوالي 70.0٪) وLiveCodeBench (حوالي 65.9٪) تجعله الخيار الأقوى لتلك المهام المحددة وفقاً للمعايير المرجعية الحالية المعلنة.
إذا كنت تستخدم حاليًا Claude أو GPT-4o عبر واجهة برمجة التطبيقات (API) لمهام البرمجة أو الاستنتاج: يوفر Kimi K2 أداءً مقارنًا في الاختبارات المعيارية في عدة مهام رئيسية كبديل مفتوح الأوزان (open-weight). وتكمن المفاضلة في الجانب التشغيلي: حيث توفر واجهات برمجة التطبيقات المملوكة والمدارة بنية تحتية للموثوقية والأمان؛ بينما تتطلب النماذج مفتوحة الأوزان المستضافة ذاتيًا أن تقوم ببناء وصيانة تلك البنية التحتية بنفسك.
إذا كانت مؤسستك تتطلب شفافية كاملة في التدريب أو إثبات مصدر البيانات التنظيمية: فإن إصدار Kimi K2 المقتصر على الأوزان المفتوحة لا يلبي هذا المتطلب؛ إذ أن بيانات التدريب ورمز التدريب الكامل غير متاحة للعامة.
إذا كان فريقك يفتقر إلى بنية تحتية متعددة لوحدات معالجة الرسومات (GPU): استخدم واجهة برمجة تطبيقات Moonshot AI أو OpenRouter للوصول عبر واجهة برمجة التطبيقات بدلاً من النشر المحلي. تحقق من الأسعار الحالية لدى كل مزود قبل اختيار قناة.
لم تنشر Moonshot AI خارطة طريق مؤكدة لإصدارات النماذج المستقبلية وقت كتابة هذا النص. تركيز بحث الشركة، بناءً على الأعمال المنشورة، قد تمحور حول معالجة السياق الطويل، وتوسيع نطاق MoE، وتطوير القدرات الوكيلة. يجب التعامل مع أي تصريحات استشرافية أبعد من ذلك على أنها تخمينية حتى يتم تأكيدها رسميًا.