Este artículo fue generado por IA. Por favor, verificá la información importante de forma independiente.

Kimi K3: Modelo de razonamiento de Moonshot AI

Crypto Wiki|Aug 11, 2026|4.5 (500 valoraciones)
Resumen de IA

Kimi K3 review: Moonshot AI's flagship reasoning model with 96.2 AIME score, 128K context, and $0.15/M token pricing. Compare benchmarks vs GPT-4o, Cl...

Publicado: Julio de 2025 | Última actualización: Julio de 2025

Moonshot AI ha lanzado Kimi K3, su modelo insignia de lenguaje de gran tamaño con capacidad de razonamiento, entrando en competencia directa con GPT-4o, Claude 3.7 Sonnet, DeepSeek V3 y Qwen3 en el panorama de la IA de vanguardia de 2025. El modelo se basa en el legado de contexto largo de Moonshot AI, al tiempo que se orienta hacia un diseño centrado en el razonamiento que se enfoca en matemáticas complejas, ingeniería de software y resolución de problemas científicos. Esta guía cubre la arquitectura y las especificaciones técnicas de K3, el rendimiento en pruebas comparativas en cinco de los principales conjuntos de evaluación, comparaciones directas con competidores y cómo acceder a K3 a través de la aplicación Kimi o la Interfaz de programación de aplicaciones (API) de Kimi.


RESUMEN: Kimi K3 de un vistazo

  • Desarrollador: Moonshot AI (月之暗面), Pekín, China
  • Fecha de lanzamiento: Julio de 2025
  • Arquitectura: Transformer de Mezcla de Expertos (MoE)
  • Parámetros: 671B en total, 32B activos por pase hacia adelante (según el informe técnico de Moonshot AI)
  • Ventana de contexto: 128K tokens
  • Mejor benchmark (AIME 2025): 96.2 (pass@1, según el informe técnico de Moonshot AI)
  • Peso abierto: Solo acceso a la API No. y a la aplicación para consumidores.
  • Acceso: Asistente de IA Kimi en kimi.ai / Plataforma de desarrolladores de Moonshot AI

¿Qué es Kimi K3?

Kimi K3 es un gran modelo de lenguaje (LLM) desarrollado por Moonshot AI (月之暗面) y lanzado en julio de 2025, diseñado como un modelo insignia centrado en el razonamiento que utiliza procesamiento de cadena de pensamiento extendido para abordar problemas complejos de varios pasos en matemáticas, ingeniería de software y tareas profesionales intensivas en conocimiento. Un gran modelo de lenguaje es un modelo de aprendizaje profundo entrenado en vastos corpus de texto para generar, traducir, resumir y razonar sobre lenguaje natural; K3 pertenece al nivel de vanguardia de esta clase, caracterizado por recuentos de parámetros en los cientos de miles de millones.

Un modelo de razonamiento, tal como se posiciona Kimi K3, genera pasos de pensamiento intermedios explícitos antes de producir una respuesta final. Este enfoque mejora la precisión en problemas complejos, pero aumenta el tiempo de respuesta en comparación con los modelos estándar de seguimiento de instrucciones. Kimi K3 se sitúa en la misma clase de capacidades que OpenAI o3 y DeepSeek R1, modelos que establecieron el paradigma del razonamiento en 2024 y 2025.

K3 sucede a Kimi K2, el anterior buque insignia de Moonshot AI, que se posicionó como un modelo agentivo centrado en el uso de herramientas y el procesamiento de documentos de contexto largo. La transición de K2 a K3 representa un cambio deliberado de la capacidad agentiva hacia el razonamiento de propósito general. Según el blog oficial de Moonshot AI, K3 estuvo disponible en la aplicación Kimi y vía API simultáneamente en el lanzamiento en julio de 2025.

Moonshot AI: la empresa detrás de Kimi K3

Moonshot AI (月之暗面, Yuèzhī Ànmiàn) es una empresa de inteligencia artificial con sede en Pekín fundada en 2023, conocida principalmente por desarrollar la familia Kimi de modelos de lenguaje de gran tamaño y la aplicación de asistente de IA Kimi en kimi.ai. La empresa fue fundada por Yang Zhilin, antiguo investigador de la Universidad de Tsinghua y de la Universidad Carnegie Mellon y coautor de XLNet, un modelo de lenguaje temprano basado en Transformer que compitió directamente con BERT. Según se informa, Moonshot AI ha recaudado más de 1000 millones de dólares en financiación con una valoración de aproximadamente 3300 millones de dólares a mediados de 2025, de acuerdo con los informes de Bloomberg y Crunchbase, lo que la convierte en una de las startups de IA mejor valoradas de China.

La tesis técnica fundacional de Moonshot AI fue la especialización en contextos largos. Los primeros modelos de Kimi ofrecían ventanas de contexto de 1 millón de tokens en un momento en que la mayoría de los competidores alcanzaban un máximo de 32 000 o 128 000 tokens, lo que otorgó a Moonshot AI una identidad de producto diferenciada. La progresión de los modelos de la empresa abarca: Kimi (2023, primer modelo de contexto largo) hasta Kimi K2 (mediados de 2025, un modelo MoE agéntico con uso de herramientas) y Kimi K3 (julio de 2025, el modelo insignia de razonamiento que se trata en esta guía).

Con K3, Moonshot AI ha ampliado su posicionamiento más allá de la especialización en contextos largos para incluir un rendimiento en benchmarks de razonamiento de primer nivel, situándose en competencia directa con OpenAI, Anthropic, Google DeepMind, DeepSeek y Alibaba Cloud.

Para una visión general completa de la gama de productos y los antecedentes de la empresa de Moonshot AI, consulte Moonshot AI: Visión General de la Empresa y Guía del Producto Kimi.

--- ## Arquitectura y especificaciones técnicas de Kimi K3

Kimi K3 se basa en un diseño de Mezcla de Expertos (MoE) con un total de 671.000 millones de parámetros, una ventana de contexto de 128K tokens y capacidades de razonamiento extendidas producidas mediante un postentrenamiento basado en el aprendizaje por refuerzo (RL). La arquitectura se confirma en el informe técnico de Kimi K3 de Moonshot AI.

Tamaño del modelo y recuento de parámetros

Según el informe técnico de Moonshot AI, Kimi K3 contiene un total de 671.000 millones de parámetros, de los cuales 32.000 millones están activos por cada paso de propagación hacia adelante (forward pass). En una arquitectura de Mezcla de Expertos (MoE) —el diseño fundamental que sustenta todos los modelos de lenguaje de gran tamaño modernos desde 2017, aplicado aquí en su forma de activación dispersa—, los parámetros totales reflejan la capacidad completa del modelo en todas las subredes de expertos, mientras que los parámetros activos reflejan solo el subconjunto utilizado en cada paso de inferencia. Esta distinción hace que los recuentos elevados de parámetros totales sean computacionalmente viables en el momento de la inferencia: los 671B de parámetros totales se activan como solo 32B por paso, manteniendo los costes de inferencia comparables a los de un modelo denso mucho más pequeño.

Kimi K2, el modelo anterior de Moonshot AI, utilizaba un diseño MoE con aproximadamente 1 billón de parámetros totales y 32.000 millones activos. K3 reduce el número total de parámetros mientras mantiene la misma cantidad de parámetros activos, una configuración que el informe técnico de Moonshot AI atribuye a una mejora en la eficiencia del enrutamiento de expertos. La relación entre parámetros activos y totales en K3 (32B/671B) es superior a la de K2 (32B/1T), lo que indica una utilización de expertos más densa por cada pasada hacia adelante (forward pass).

Ventana de contexto

Kimi K3 admite una ventana de contexto de 128 000 tokens, lo que significa que puede procesar aproximadamente 96 000 palabras de texto en inglés o entre 5000 y 10 000 líneas de código en una sola interacción. La ventana de contexto es la cantidad máxima de texto que un modelo puede procesar a la vez; las ventanas de mayor tamaño permiten el análisis de libros enteros, bases de código o conjuntos de investigación de múltiples documentos sin perder información.

Para comparar: GPT-4o admite 128K tokens, Claude 3.7 Sonnet admite 200K tokens y Gemini 2.5 Pro admite hasta 1M tokens. K3 iguala a GPT-4o en longitud de contexto y queda por detrás de Claude 3.7 Sonnet y Gemini 2.5 Pro. K2 también utilizó una ventana de contexto de 128K, igual que K3; los modelos Kimi anteriores a K2 ofrecían ventanas de 1M de tokens, lo que supuso el diferenciador de producto inicial de Moonshot AI. Esa ventaja de contexto Largo no se trasladó a K2 ni a K3, una contrapartida que Moonshot AI no ha explicado públicamente. Las aplicaciones prácticas dentro de la ventana de 128K incluyen la revisión legal de documentos completos, el análisis completo de bases de código para repositorios de tamaño mediano y la síntesis de investigaciones de múltiples fuentes sin fragmentación de documentos.

Metodología de entrenamiento

El informe técnico de Moonshot AI describe una fase estándar de preentrenamiento a gran escala seguida de un postentrenamiento basado en RL para afilar el rendimiento de razonamiento. Moonshot AI no ha revelado la escala total de datos de preentrenamiento (en tokens) para Kimi K3 en su informe técnico público. La variante específica de RL utilizada (GRPO, PPO o algún otro método) tampoco ha sido confirmada en la documentación pública.

El razonamiento de cadena de pensamiento (CoT) es una técnica mediante la cual un modelo genera pasos de razonamiento intermedios explícitos antes de llegar a una respuesta final, mejorando la precisión en problemas complejos de varios pasos. Esta metodología de post-entrenamiento se estableció como el principal impulsor de las mejoras en el rendimiento de los modelos de razonamiento por los modelos R1 de DeepSeek y las series o de OpenAI. A fecha de julio de 2025, Moonshot AI no ha confirmado públicamente la fecha de corte del conocimiento de los datos de entrenamiento de K3; los lectores que necesiten esta cifra deben consultar directamente la documentación oficial de Moonshot AI.

Kimi K3 vs. Kimi K2: qué cambió

Kimi K3 representa un giro estratégico desde el posicionamiento de Kimi K2 centrado en agentes hacia un diseño insignia de propósito general centrado en el razonamiento.

AtributoKimi K2Kimi K3
ArquitecturaMoEMoE
Parámetros totales~1T671B
Parámetros activos~32B32B
Ventana de contexto128K tokens128K tokens
Posicionamiento principalAgente / uso de herramientasRazonamiento / buque insignia
AIME 2025 (pass@1)No reportado96.2 (según Moonshot AI)
MMLU ProNo reportado80.5% (según Moonshot AI)
LiveCodeBenchNo reportado65.8% (según Moonshot AI)
Fecha de lanzamientoMediados de 2025Julio de 2025
Estado de pesos abiertosNoNo

El cambio más significativo de K2 a K3 es el cambio de posicionamiento: del uso de herramientas agénticas al razonamiento de propósito general, respaldado por resultados en benchmarks sustancialmente más sólidos. El número total de parámetros se redujo de aproximadamente 1T a 671B, mientras que los parámetros activos se mantuvieron en 32B. Para los usuarios actuales de K2, K3 aporta un rendimiento sensiblemente superior en tareas de razonamiento de múltiples pasos, manteniendo la misma ventana de contexto y el mismo modelo de acceso.

Para un desglose completo de la arquitectura de Kimi K2, su modelo de acceso de peso abierto y sus capacidades agénticas, consulta What Is Kimi K2? Moonshot AI's Open-Weight Thinking Model.

Características clave de Kimi K3

[{"description":"Kimi K3 aplica razonamiento de cadena de pensamiento (CoT), generando pasos intermedios explícitos que mejoran la precisión en problemas complejos de matemáticas, codificación y lógica, situándolo en la misma clase de modelo de razonamiento que OpenAI o3 y DeepSeek R1.","feature":"Capacidad de razonamiento ampliada"},{"description":"Permite procesar contratos legales completos, bases de código de tamaño mediano completas o conjuntos de investigación multidocumento dentro de una única solicitud, sin necesidad de fragmentación.","feature":"Ventana de contexto de 128K tokens"},{"description":"Construida sobre un diseño Transformer de Mezcla de Expertos con 671 mil millones de parámetros totales y 32 mil millones activos por pasada de inferencia, equilibrando la gran capacidad del modelo con costes de cómputo de inferencia manejables.","feature":"Arquitectura MoE"},{"description":"Obtiene 96,2 en AIME 2025 y un 80,5 % en MMLU Pro según el informe técnico de Moonshot AI, situándolo en el nivel superior de los modelos frontera evaluados públicamente en razonamiento matemático.","feature":"Fuerte rendimiento en benchmarks"},{"description":"Soporta oficialmente el chino y el inglés. El soporte para idiomas adicionales no ha sido confirmado en la documentación oficial.","feature":"Soporte multilingüe"},{"description":"Disponible a través de la API de Kimi en la Plataforma de desarrolladores de Moonshot AI y a través de la aplicación para consumidores en kimi.ai.","feature":"Acceso a API y aplicación para consumidores"},{"description":"En el momento del lanzamiento, Moonshot AI no ha confirmado capacidades multimodales nativas (visión/imagen) para Kimi K3. La interfaz de la aplicación Kimi admite cargas de documentos (PDF), pero la comprensión de imágenes como capacidad del modelo base no ha sido confirmada oficialmente para K3.","feature":"Capacidades multimodales"}]

K3 entra en un campo competitivo donde los benchmarks de razonamiento se han convertido en el principal diferenciador entre los modelos de vanguardia. La combinación de un sólido rendimiento AIME y una arquitectura MoE que mantiene los costes de inferencia más bajos que los modelos densos de tamaño equivalente convierte a K3 en un candidato tanto para tareas de razonamiento de nivel de investigación como para despliegues de API de producción sensibles al coste.


Kimi K3 rendimiento de benchmark

Según el informe técnico de Moonshot AI, Kimi K3 obtiene una puntuación de 96,2 en AIME 2025 (pass@1), un 80,5 % en MMLU Pro y un 65,8 % en LiveCodeBench, lo que lo sitúa por encima de GPT-4o en los bancos de pruebas de razonamiento matemático y en una posición competitiva frente a DeepSeek V3 y Qwen3 en la suite de evaluación de modelos de frontera principales.

(Todas las puntuaciones de los benchmarks citadas en esta sección proceden del informe técnico oficial de Moonshot AI y/o de la clasificación AIME 2025 de Papers With Code a fecha de julio de 2025. Las clasificaciones de los benchmarks cambian con frecuencia. Los lectores deben verificar las posiciones actuales en Papers With Code y LMSYS Chatbot Arena para obtener comparaciones actualizadas).

Matemáticas y razonamiento: AIME y MATH-500

Kimi K3 obtuvo un 96,2 en AIME 2025 (pass@1) según el informe técnico de Moonshot AI, en comparación con la puntuación comunicada de aproximadamente el 62 % de GPT-4o en condiciones de evaluación sin razonamiento. El AIME (American Invitational Mathematics Examination) es un exigente examen de competición de matemáticas para secundaria de 15 problemas; las puntuaciones de IA superiores al 80 % indican una capacidad de razonamiento matemático avanzada, mientras que los competidores humanos suelen obtener puntuaciones en el rango del 20-47 % (3-7/15). En MATH-500, un benchmark de 500 problemas de nivel de competición en múltiples niveles de dificultad, Kimi K3 alcanza el 97,4 % según el informe técnico de Moonshot AI, en comparación con el 76,6 % aproximado de GPT-4o y el 90,2 % comunicado de DeepSeek V3.

Donde un modelo estándar podría adivinar o truncar en un problema de álgebra de varios pasos, un modelo de razonamiento como K3 genera pasos intermedios, reduciendo la propagación de errores en cada etapa. Estas puntuaciones indican que K3 resuelve correctamente problemas de cálculo, combinatoria y álgebra de varios pasos a tasas superiores al 95 %, superando sustancialmente a los modelos no de razonamiento en este tipo de tareas. Esto convierte a K3 en una opción idónea para la asistencia en computación científica, el apoyo a la investigación cuantitativa y aplicaciones de tutoría que requieran explicaciones matemáticas paso a paso.

Conocimiento general: MMLU Pro

Kimi K3 alcanza un 80,5 % en MMLU Pro, por encima de GPT-4o (aproximadamente un 72,6 %) y al mismo nivel que Qwen3-235B (aproximadamente un 79,8 %), según los respectivos informes técnicos oficiales. MMLU Pro (Massive Multitask Language Understanding Pro) es una versión mejorada del benchmark MMLU que pone a prueba el conocimiento y el razonamiento en varios pasos en 57 dominios académicos y profesionales, diseñada para diferenciar entre modelos de frontera donde las puntuaciones originales de MMLU han convergido cerca de la saturación. Las puntuaciones elevadas en MMLU Pro se correlacionan con un rendimiento fiable en tareas intensivas en conocimiento, como la investigación jurídica, la resolución de consultas médicas y la revisión de literatura científica.

Programación: LiveCodeBench y SWE-bench Verified

En LiveCodeBench, Kimi K3 alcanza una puntuación del 65,8 % según el informe técnico de Moonshot AI, frente al aproximadamente 39,3 % de GPT-4o y al aproximadamente 59,4 % de DeepSeek V3. LiveCodeBench evalúa los modelos mediante problemas de programación competitiva recopilados continuamente de LeetCode y Codeforces con posterioridad a las fechas de corte del entrenamiento de los modelos, lo que reduce el riesgo de contaminación de los datos de entrenamiento y lo convierte en un indicador más fiable de la verdadera capacidad de programación que las evaluaciones comparativas estáticas.

En SWE-bench Verified, Kimi K3 alcanza un 63,9 % según el informe técnico de Moonshot AI, por debajo del 70,3 % reportado de Claude 3.7 Sonnet (con pensamiento extendido) pero por encima del aproximadamente 38,7 % de GPT-4o. SWE-bench Verified evalúa la resolución automática de incidencias reales de ingeniería de software en GitHub, lo que requiere comprensión de la base de código, identificación de errores y generación de parches. Estas capacidades son esenciales para el desarrollo de software asistido por IA. Una puntuación del 63,9 % significa que K3 puede resolver de forma autónoma aproximadamente 64 de cada 100 incidencias reales de GitHub, una capacidad aplicable a los flujos de trabajo de revisión de código automatizada y corrección de errores.

Tabla comparativa maestra de benchmarks

La tabla a continuación compara Kimi K3 con cinco modelos de vanguardia en categorías clave de referencia (todas las puntuaciones proceden de informes técnicos oficiales de modelos o de tablas de clasificación verificadas a fecha de julio de 2025).

ModeloAIME 2025MATH-500MMLU ProLiveCodeBenchSWE-bench VerifiedVentana de contexto
Kimi K396,297,4%80,5%65,8%63,9%128K
GPT-4o~62,0~76,6%~72,6%~39,3%~38,7%128K
Claude 3.7 Sonnet~86,7~92,3%~78,0%~56,0%~70,3%*200K
DeepSeek V3~90,6~90,2%~75,9%~59,4%~49,2%128K
Qwen3-235B~92,8~94,0%~79,8%~66,2%~46,7%128K
Gemini 2.5 Pro~92,0~97,1%~81,3%~64,0%~63,8%1M+

Notas: Las puntuaciones de AIME 2025 se indican como porcentaje de aciertos (pass@1 a menos que se especifique lo contrario). La puntuación de Claude 3.7 en SWE-bench utiliza el modo de pensamiento extendido. Las puntuaciones de los competidores proceden de sus respectivos informes técnicos oficiales y de las entradas de la clasificación de Papers With Code a fecha de julio de 2025. Las puntuaciones marcadas con ~ son cifras aproximadas de informes oficiales y pueden variar según la configuración de la evaluación. Consulte la clasificación actual en la tabla de clasificación de AIME 2025 de Papers With Code.


Kimi K3 frente a la competencia

Kimi K3 compite en el nivel de vanguardia de los modelos de lenguaje de gran tamaño junto a GPT-4o, Claude 3.7 Sonnet, DeepSeek V3, Qwen3 y Gemini 2.5 Pro. La siguiente comparativa abarca el perfil de rendimiento de cada modelo y los casos de uso en los que cada uno destaca.

Kimi K3 frente a GPT-4o. Kimi K3 supera a GPT-4o en todos los principales bancos de pruebas de razonamiento y programación: 96,2 frente a ~62 en AIME 2025, 97,4 % frente a ~76,6 % en MATH-500, 80,5 % frente a ~72,6 % en MMLU Pro, 65,8 % frente a ~39,3 % en LiveCodeBench y 63,9 % frente a ~38,7 % en SWE-bench Verified. GPT-4o mantiene ventajas en capacidades multimodales (integraciones confirmadas de visión, audio y generación de imágenes), herramientas de terceros más amplias y una trayectoria más larga en implementaciones de producción. Para matemáticas, razonamiento científico y tareas de programación donde la prioridad es la precisión en problemas complejos, K3 presenta un caso de referencia más sólido. Los equipos que requieran entradas multimodales, relaciones consolidadas con proveedores o ANS (SLA) garantizados encontrarán en GPT-4o la opción con menos fricción. Los precios de la API también favorecen sustancialmente a K3: 0,15 $ por millón de tokens de entrada frente a los aproximadamente 5,00 $ de GPT-4o.

Kimi K3 frente a DeepSeek V3. Ambos son LLM de vanguardia desarrollados en China, pero difieren en arquitectura y modelo de acceso. DeepSeek V3 es un modelo denso de 671 mil millones de parámetros disponible como lanzamiento de pesos abiertos bajo la licencia de modelo de DeepSeek; los desarrolladores pueden descargarlo y alojarlo ellos mismos. K3 utiliza MoE con 32 mil millones de parámetros activos por paso y es solo por API. En benchmarks, K3 lidera en AIME 2025 (96,2 frente a ~90,6) y SWE-bench Verified (63,9 % frente a ~49,2 %); DeepSeek V3 es competitivo en LiveCodeBench (59,4 % frente a 65,8 % para K3). Los equipos que requieran despliegue local, ajuste fino o acceso a los pesos deben elegir DeepSeek V3. Los equipos que prioricen el rendimiento en benchmarks de razonamiento a través de API encontrarán K3 más fuerte en tareas con gran carga matemática.

Kimi K3 vs. Claude 3.7 Sonnet. La brecha en SWE-bench Verified es el diferenciador más relevante aquí: Claude 3.7 Sonnet obtiene una puntuación del 70,3 % (con pensamiento extendido) frente al 63,9 % de K3, lo que supone una ventaja de 6,4 puntos porcentuales en ingeniería de software automatizada. Claude también admite una ventana de contexto mayor (200K frente a 128K tokens). K3 supera a Claude en AIME 2025 (96,2 frente a ~86,7) y MATH-500 (97,4 % frente a ~92,3 %). Ambos modelos ofrecen modos de razonamiento con enfoques de pensamiento extendido funcionalmente comparables. Para flujos de trabajo de ingeniería de software y programación agéntica, Claude 3.7 Sonnet sigue siendo la opción más sólida. Para tareas de investigación cuantitativa y razonamiento matemático puro, K3 mantiene una clara ventaja en los bancos de pruebas.

Kimi K3 frente a Qwen3 (Alibaba). Qwen3-235B, el modelo insignia de Alibaba Cloud para 2025, queda por detrás de K3 en AIME 2025 (92,8 frente a 96,2) y MMLU Pro (79,8 % frente a 80,5 %), mientras que lidera por poco en LiveCodeBench (66,2 % frente a 65,8 %). Qwen3 tiene versiones de peso abierto disponibles en el repositorio de GitHub QwenLM, a diferencia del acceso exclusivo por API de K3. Para tareas en idioma chino, Qwen3 se beneficia de la infraestructura empresarial y los datos de entrenamiento multilingües de Alibaba Cloud; no se han publicado comparativas independientes de C-Eval o CMMLU entre K3 y Qwen3 en el momento de escribir esto. Los equipos dentro del ecosistema de Alibaba Cloud encontrarán Qwen3 mejor integrado; los equipos que evalúen en puntos de referencia de razonamiento matemático encontrarán K3 marginalmente más fuerte.

Kimi K3 frente a Gemini 2.5 Pro. La diferencia de la ventana de contexto es la distinción principal. Gemini 2.5 Pro soporta hasta 1 millón de tokens en comparación con los 128K de K3, una ventaja de 8x para tareas que implican documentos muy largos. En las pruebas de rendimiento, ambos modelos están muy igualados: Gemini 2.5 Pro lidera ligeramente en MMLU Pro (81,3 % vs. 80,5 %) y MATH-500 (97,1 % vs. 97,4 % para K3), mientras que K3 lidera en AIME 2025 (96,2 frente a ~92,0). Para síntesis de investigación multdocumento, análisis de longitud de libro o indexación de grandes bases de código por encima de 128K tokens, Gemini 2.5 Pro es la opción técnicamente más sólida. Para tareas que encajan dentro de 128K tokens y priorizan el razonamiento matemático a un coste de API inferior, K3 tiene la ventaja.

El panorama de la IA en China en 2025. Entre los modelos de frontera chinos, Kimi K3 (Moonshot AI), DeepSeek V3 (DeepSeek) y Qwen3 (Alibaba Cloud) representan las tres Options principales, cada una con un posicionamiento distinto. DeepSeek se ha diferenciado mediante lanzamientos de pesos abiertos (open-weight) que los desarrolladores pueden autohospedar sin costes de inferencia. Qwen3 se beneficia del ecosistema empresarial de Alibaba Cloud y de la disponibilidad de pesos abiertos. K3 se posiciona en torno al liderazgo en pruebas de referencia (benchmarks) de razonamiento. Los datos de los benchmarks no respaldan el nombramiento de un único modelo como definitivamente el mejor en todas las tareas; la elección correcta depende de si el caso de uso prioriza el acceso a pesos abiertos (DeepSeek, Qwen3), la profundidad del ecosistema empresarial (Qwen3) o el rendimiento puro en benchmarks de razonamiento (K3, especialmente para aplicaciones con gran carga matemática).


Cómo acceder a Kimi K3

Kimi K3 no es de pesos abiertos. Es accesible para desarrolladores a través de la API de Kimi y para usuarios no desarrolladores mediante la aplicación de consumo Kimi en kimi.ai. En el momento de escribir esto, no hay pesos de modelos disponibles públicamente; para alternativas de pesos abiertos con niveles de rendimiento comparables, DeepSeek V3 y Qwen3 ofrecen opciones de despliegue local.

Operar con el token MOONSHOT en Bybit: El crecimiento de Moonshot AI ha atraído la atención de los traders de cripto — Bybit ofrece futuros Perpetual MOONSHOTUSDT para aquellos interesados en operar con el token MOONSHOT. Para más información sobre el propio token, consulta ¿Qué es MOONSHOT USDT? Guía completa.

Aplicación Kimi (acceso para el consumidor)

La aplicación Kimi es el producto de asistente de IA orientado al consumidor de Moonshot AI, disponible en kimi.ai y como aplicación móvil en iOS y Android. Para empezar a usar K3 a través de la aplicación para el consumidor:

  1. Ve a kimi.ai o descarga la aplicación móvil de Kimi en el App Store o Google Play.
  2. Crea una cuenta gratuita utilizando una dirección de correo electrónico o un número de teléfono, o inicia sesión con una cuenta existente.
  3. Kimi K3 impulsa la interfaz actual de la aplicación Kimi por defecto; no se requiere ningún paso de selección de modelo a menos que Moonshot AI añada un selector de modelos en una actualización futura.
  4. Comienza a chatear. La aplicación permite subir documentos (archivos PDF y de texto) e integración con búsqueda web.

La aplicación Kimi está disponible a nivel mundial, incluyendo para usuarios en EE. UU. y Europa. El plan gratuito proporciona acceso a K3 con límites de uso diario; Moonshot AI ofrece una suscripción de pago (Kimi Pro) con límites de mensajes más altos y acceso prioritario durante la demanda máxima. Verifique los límites actuales del plan en kimi.ai antes de contratar una suscripción, ya que estos cambian con frecuencia.

Acceso para desarrolladores (API de Kimi)

["1. Crea una cuenta de desarrollador de Moonshot AI en la plataforma de desarrollador de Moonshot AI.","2. Genera una clave API desde el panel de tu cuenta en "Claves API".","3. La API de Kimi utiliza un esquema compatible con OpenAI, por lo que puedes sustituir la URL base y la cadena identificadora del modelo en el código existente del SDK de OpenAI con cambios mínimos.","4. Realiza tu primera llamada a la API utilizando el identificador de modelo Kimi K3 kimi-k3, tal como se confirma en la documentación API de Moonshot AI."]

from openai import OpenAI

Kimi K3: Modelo de razonamiento de Moonshot AI

Crypto Wiki|Aug 11, 2026|4.5 (500 valoraciones)
Resumen de IA

Kimi K3 review: Moonshot AI's flagship reasoning model with 96.2 AIME score, 128K context, and $0.15/M token pricing. Compare benchmarks vs GPT-4o, Cl...

client = OpenAI( api_key="SU_CLAVE_API_DE_MOONSHOT", # Clave API de plataforma.moonshot.cn base_url="https://api.moonshot.cn/v1", )

Kimi K3: Modelo de razonamiento de Moonshot AI

Crypto Wiki|Aug 11, 2026|4.5 (500 valoraciones)
Resumen de IA

Kimi K3 review: Moonshot AI's flagship reasoning model with 96.2 AIME score, 128K context, and $0.15/M token pricing. Compare benchmarks vs GPT-4o, Cl...

response = client.chat.completions.create( model="kimi-k3", # Identificador de modelo confirmado para Kimi K3 messages=[ {"role": "system", "content": "Eres un asistente útil."}, {"role": "user", "content": "Resuelve esto paso a paso: ¿cuál es la suma de los primeros 100 números primos?"}, ], temperature=0.6, )

print(response.choices[0].message.content)


A partir de julio de 2025, el precio de la API Kimi K3 es de 0,15 $ por millón de tokens de entrada y 0,60 $ por millón de tokens de salida, según la página de precios oficial de Moonshot AI. En comparación, GPT-4o tiene un precio aproximado de 5,00 $ por millón de tokens de entrada y 15,00 $ por millón de tokens de salida; Claude 3.7 Sonnet cuesta aproximadamente 3,00 $ por millón de tokens de entrada y 15,00 $ por millón de tokens de salida. K3 cuesta sustancialmente menos por token que ambos competidores occidentales para tareas de razonamiento de complejidad equivalente.

Moonshot AI ofrece un plan gratuito de API con una asignación mensual limitada de tokens para nuevas cuentas de desarrollador; verifica los límites actuales del plan gratuito en la página de precios de la API de Moonshot AI antes de planificar el uso en producción, ya que estas cifras cambian con frecuencia.

*(Los precios de la API están sujetos a cambios. Todas las cifras reflejan las tarifas a fecha de julio de 2025. Verifique los precios actuales en la página de precios de la API de Moonshot AI antes de tomar decisiones comerciales.)*

| Modelo | Entrada $/1M de tokens | Salida $/1M de tokens | Ventana de contexto |
|---|---|---|---|
| Kimi K3 | $0.15 | $0.60 | 128K |
| GPT-4o | ~$5.00 | ~$15.00 | 128K |
| Claude 3.7 Sonnet | ~$3.00 | ~$15.00 | 200K |
| DeepSeek V3 (API) | ~$0.27 | ~$1.10 | 128K |
| Qwen3-235B (API) | ~$0.14 | ~$0.60 | 128K |

Para un desglose completo de los niveles de API, los precios de los tokens y consejos para optimizar costes, consulta [Guía de Planes y Costes de la API Moonshot Kimi 2026](https://www.bybit.com/en/wiki/article/kimi-api-pricing-2026-plans-cost-guide/).

La API de Kimi está disponible para desarrolladores a nivel mundial. Moonshot AI no ha publicado restricciones geográficas sobre el acceso a la API a fecha de julio de 2025. Para el despliegue local sin dependencia de la API, K3 no es una opción; en su lugar, considere los lanzamientos de pesos abiertos de DeepSeek V3 o Qwen3.

---

## Casos de uso de Kimi K3

Kimi K3 es ideal para tareas que se benefician de un razonamiento extendido, el procesamiento de contextos extensos y una sólida capacidad de programación.

[{"description":"La puntuación de K3 en AIME 2025 de 96,2 y la puntuación en MATH-500 de 97,4 % lo convierten en un candidato sólido para la resolución de problemas a nivel de competición, cálculos de física e ingeniería, análisis estadístico y asistencia en investigación cuantitativa donde la precisión de los pasos intermedios es importante.","title":"Matemáticas avanzadas y razonamiento científico:"},{"description":"Con una puntuación de LiveCodeBench del 65,8 %, K3 genera código sintácticamente correcto y funcionalmente preciso en Python, JavaScript, SQL y otros lenguajes principales, y puede depurar errores lógicos de varios pasos dentro de una única sesión de indicación.","title":"Generación y depuración de código:"},{"description":"Una puntuación de SWE-bench Verified del 63,9 % significa que K3 puede resolver de forma autónoma aproximadamente 64 de cada 100 incidencias reales de GitHub, lo que lo hace aplicable a flujos de trabajo de revisión de código automatizada, sugerencias de refactorización y triaje de incidencias.","title":"Asistencia en ingeniería de software:"},{"description":"La ventana de contexto de 128K tokens admite el procesamiento de contratos legales completos, artículos académicos completos, informes financieros y documentos técnicos de varios capítulos sin división ni pérdida de resumen.","title":"Análisis de documentos **Largo**s:"},{"description":"K3 puede cruzar referencias de varios documentos dentro de su ventana de contexto, extraer afirmaciones contradictorias y producir resúmenes comparativos estructurados para revisiones de literatura, investigación de diligencia debida y análisis de políticas.","title":"Síntesis de investigación multi-paso:"},{"description":"K3 admite oficialmente tanto el chino como el inglés, y el producto de consumo de Moonshot AI ha sido diseñado desde su lanzamiento para el mercado chino. Las comparaciones independientes de benchmarks en chino (C-Eval, CMMLU) no se han publicado en el momento de redactar este texto.","title":"Tareas bilingües en chino e inglés:"}]

**Quién debería usar Kimi K3:** K3 es la opción de API más potente disponible para el razonamiento matemático intensivo, el soporte en investigación cuantitativa y las aplicaciones de programación sensibles al coste (a 0,15 $ por cada millón de tokens de entrada). Los equipos que actualmente utilizan GPT-4o para tareas de razonamiento descubrirán que K3 ofrece un rendimiento sustancialmente mejor en las pruebas de rendimiento (benchmarks) a una fracción del coste de la API. Para flujos de trabajo de programación agénticos donde el rendimiento en SWE-bench es la métrica principal, Claude 3.7 Sonnet mantiene la ventaja. Para casos de uso que requieran más de 128 000 tokens de contexto, Gemini 2.5 Pro es la opción más adecuada. Para los equipos que necesiten un despliegue local de pesos abiertos, DeepSeek V3 o Qwen3 son las alternativas apropiadas.

## Limitaciones y consideraciones

Kimi K3 tiene varias limitaciones significativas que los usuarios y los compradores corporativos deben evaluar antes de su adopción.

Benchmarking comparativo en SWE-bench. En SWE-bench Verified, K3 obtiene un 63,9 %, quedando por detrás del 70,3 % de Claude 3.7 Sonnet por 6,4 puntos porcentuales. Para los equipos cuyo caso de uso principal es la resolución automatizada de incidencias en GitHub o la ingeniería de software agentiva, esta diferencia es significativa y Claude 3.7 Sonnet sigue siendo la opción más sólida basándose en los datos de benchmark publicados.

**Sin acceso a pesos abiertos.** K3 es un modelo de API cerrada. Los pesos del modelo no están disponibles públicamente, lo que significa que el despliegue local, el ajuste fino (fine-tuning) y el autoalojamiento cuantizado (GGUF, GPTQ, AWQ a través de llama.cpp, vLLM u Ollama) no son posibles. DeepSeek V3 y Qwen3 ofrecen lanzamientos de pesos abiertos que admiten el despliegue local sin costes por token. Para las organizaciones con requisitos de soberanía de datos que prohíben el envío de datos a API externas, o para los investigadores que requieren acceso al ajuste fino, K3 no es una opción viable.

La ventana de contexto se queda atrás frente a los competidores de contexto Largo. La ventana de contexto de 128.000 tokens de K3 iguala a la de GPT-4o, pero es un 36 % más pequeña que los 200.000 de Claude 3.7 Sonnet y un 87,5 % más pequeña que la ventana de 1 millón de tokens de Gemini 2.5 Pro. Las tareas que requieren el procesamiento de documentos muy largos (análisis de libros completos, indexación de grandes bases de código o síntesis de corpus de múltiples fuentes por encima de los 128.000 tokens) requerirán estrategias de fragmentación (chunking) o un modelo diferente.

Incertidumbre sobre la fecha de corte del conocimiento. Moonshot AI no ha confirmado públicamente la fecha de corte del conocimiento de los datos de entrenamiento de K3 a julio de 2025. Las consultas sobre eventos posteriores al corte devolverán información incompleta o ausente a menos que el modelo se amplíe con búsqueda web o canalizaciones de generación aumentada por recuperación (RAG). La aplicación de consumo Kimi incluye integración de búsqueda web que mitiga esto para los usuarios de consumo; los usuarios de la API deben implementar su propia capa de recuperación para consultas sensibles al tiempo.

**Compensación de latencia en modelos de razonamiento.** El razonamiento de cadena de pensamiento extendido produce respuestas más precisas en tareas complejas, pero genera significativamente más tokens por respuesta que un modelo estándar de seguimiento de instrucciones. Para consultas sencillas (resumen, conversión de formato, resolución de preguntas básicas), un modelo más ligero como GPT-4o mini o una variante destilada de DeepSeek será más eficiente en costes.

**Gobernanza de datos empresariales.** Kimi K3 ha sido desarrollado por Moonshot AI, una empresa con sede en Pekín sujeta a las regulaciones de datos chinas. Aquellas organizaciones con requisitos estrictos de residencia de datos, obligaciones de cumplimiento bajo marcos como el RGPD o restricciones sobre el procesamiento de datos por parte de entidades no nacionales deberían revisar los acuerdos de procesamiento de datos de Moonshot AI y la infraestructura regional de su API antes de integrar K3 en sistemas de producción. Esta orientación se aplica de manera objetiva y simétrica. La misma diligencia debida se aplicaría a cualquier API de IA transfronteriza, incluidos los servicios con sede en EE. UU. utilizados por organizaciones en jurisdicciones con requisitos nacionales de procesamiento de datos.

--- 

## Preguntas frecuentes

### ¿Qué es Kimi K3 y quién lo fabrica?

Kimi K3 es un modelo de lenguaje de gran tamaño de razonamiento de vanguardia desarrollado por Moonshot AI (月之暗面), una empresa de IA con sede en Pekín, y lanzado en julio de 2025. Está diseñado como un modelo insignia centrado en el razonamiento que utiliza un procesamiento de cadena de pensamiento extendida para abordar tareas complejas de matemáticas, programación y tareas intensivas en conocimiento. K3 es el sucesor de Kimi K2, pasando de un posicionamiento agéntico a un diseño de razonamiento de propósito general.

### ¿Cuáles son las características clave de Kimi K3?

Las características principales de Kimi K3 incluyen: (1) razonamiento extendido de cadena de pensamiento que impulsa un rendimiento de primer nivel en AIME y MATH-500; (2) una ventana de contexto de 128K tokens para el procesamiento de documentos largos; (3) una arquitectura de Mezcla de Expertos (MoE) con 671B totales y 32B de parámetros activos; (4) precios de API competitivos a $0.15 por millón de tokens de entrada; y (5) acceso tanto a través de la aplicación Kimi para consumidores en kimi.ai como de la API para desarrolladores en platform.moonshot.cn.

### ¿Cuál es el tamaño de la ventana de contexto de Kimi K3?

Kimi K3 admite una ventana de contexto de 128K tokens, equivalente a aproximadamente 96.000 palabras de texto en inglés. Esto coincide con el contexto de 128K de GPT-4o, pero es menor que los 200K tokens de Claude 3.7 Sonnet y el 1M de tokens de Gemini 2.5 Pro. Para la mayoría de las tareas de análisis de documentos y codificación, 128K tokens es suficiente; las bases de código muy grandes o los documentos de la longitud de un libro pueden requerir fragmentación (chunking).

### ¿Es Kimi K3 de código abierto o cerrado?

Kimi K3 es cerrado: los pesos del modelo no están disponibles públicamente. El acceso se proporciona exclusivamente a través de la API de Kimi para desarrolladores y la aplicación de consumo Kimi en kimi.ai para usuarios generales. Para alternativas de pesos abiertos con niveles de capacidad comparables, tanto DeepSeek V3 (denso, 671B) como Qwen3 (versiones de pesos abiertos disponibles en el GitHub de QwenLM) admiten el despliegue local y el ajuste fino (fine-tuning).

### ¿Cómo se compara Kimi K3 con GPT-4o en las pruebas de rendimiento (benchmarks)?

Kimi K3 supera a GPT-4o en todos los benchmarks publicados de razonamiento y codificación: AIME 2025 (96.2 frente a ~62), MATH-500 (97.4% frente a ~76.6%), MMLU Pro (80.5% frente a ~72.6%), LiveCodeBench (65.8% frente a ~39.3%), y SWE-bench Verified (63.9% frente a ~38.7%). GPT-4o lidera en capacidades multimodales, integraciones de ecosistema de terceros, e infraestructura de soporte empresarial establecida. Para tareas de razonamiento puro, K3 presenta un caso de benchmark sólido a un precio de API sustancialmente menor.

### ¿En qué se diferencia Kimi K3 de Kimi K2?

Kimi K3 pasa del posicionamiento centrado en la agente de Kimi K2 (uso de herramientas, procesamiento de documentos de contexto Largo) a un diseño de propósito general centrado en el razonamiento. Ambos utilizan arquitectura MoE con 32B de parámetros activos, pero K3 reduce el recuento total de parámetros de ~1T a 671B, logrando puntuaciones de referencia de razonamiento sustancialmente más sólidas. K2 no fue evaluado en AIME o MATH-500; K3 se posiciona principalmente en la capacidad de razonamiento.

### ¿Quién fundó Moonshot AI?

Moonshot AI fue fundada en 2023 por Yang Zhilin, exinvestigador de la Universidad de Tsinghua y de la Universidad Carnegie Mellon y coautor de XLNet, un modelo de lenguaje temprano basado en Transformer que compitió con BERT. Yang Zhilin ejerce como CEO de Moonshot AI.

### ¿Puedo acceder a Kimi K3 a través de una API?

Sí. La API de Kimi está disponible en la Plataforma para desarrolladores de Moonshot AI. La API utiliza un esquema compatible con OpenAI, por lo que el código existente del SDK de OpenAI se puede adaptar sustituyendo la URL base (`https://api.moonshot.cn/v1`) y el identificador del modelo. A partir de julio de 2025, los precios son 0,15 USD por millón de tokens de entrada y 0,60 USD por millón de tokens de salida. Un nivel de API gratuito está disponible para nuevas cuentas de desarrollador con una asignación mensual limitada de tokens.

### ¿Está Kimi K3 disponible en EE. UU. y Europa?

Sí. Kimi K3 está disponible a nivel mundial tanto a través de la aplicación para usuarios de Kimi en kimi.ai como de la API de Kimi. Moonshot AI no ha publicado restricciones geográficas sobre el acceso a la API a fecha de julio de 2025. Los clientes corporativos deben revisar los acuerdos de procesamiento de datos de Moonshot AI para tener en cuenta la residencia de los datos y las consideraciones de cumplimiento antes del despliegue en producción.

### ¿Qué idiomas admite Kimi K3?

Kimi K3 es compatible oficialmente con chino e inglés. La compatibilidad adicional con otros idiomas no ha sido confirmada en la documentación oficial de Moonshot AI en el momento de redactar este texto. La aplicación de consumo Kimi se diseñó para el mercado chino desde su lanzamiento, y se espera que los datos de entrenamiento de K3 incluyan un contenido sustancial en idioma chino, aunque las puntuaciones independientes en pruebas de referencia en chino (C-Eval, CMMLU) no se han publicado en el momento de redactar este texto.

## Conclusión

Kimi K3 representa el modelo de frontera más potente de Moonshot AI hasta la fecha, al combinar un razonamiento matemático de primer nivel (96,2 en AIME 2025) con una arquitectura MoE eficiente en costes y unos precios de API sustancialmente inferiores a los de GPT-4o y Claude 3.7 Sonnet. Para los desarrolladores e investigadores que evalúen modelos de frontera en 2025, el K3 merece una consideración seria para tareas que requieran un razonamiento intensivo, especialmente cuando el coste por respuesta correcta es una métrica de evaluación principal.

## Lecturas relacionadas
- [¿Qué es Kimi K2? El modelo de razonamiento de pesos abiertos de Moonshot AI](https://www.bybit.com/en/wiki/article/kimi-k2-open-weight-thinking-model/)
- [Moonshot AI: Visión general de la empresa y guía de productos Kimi](https://www.bybit.com/en/wiki/article/moonshot-ai-company-overview-kimi/)
- [Precios de la API de Moonshot Kimi en 2026: Guía de planes y costes](https://www.bybit.com/en/wiki/article/kimi-api-pricing-2026-plans-cost-guide/)
- [Moonshot AI vs. DeepSeek vs. Qwen: Comparativa de modelos de IA de China](https://www.bybit.com/en/wiki/article/moonshot-ai-vs-deepseek-vs-qwen-2025-comparison/)
- [¿Qué es Kimi AI? Guía de Moonshot AI](https://www.bybit.com/en/wiki/article/what-is-kimi-ai-guide-to-moonshot-ai/)
- [Futuros de MOONSHOTUSDT Perpetual en Bybit](https://www.bybit.com/trade/usdt/MOONSHOTUSDT)

Los desarrolladores pueden empezar a experimentar a través de la API de Kimi en la Plataforma para desarrolladores de Moonshot AI, donde el esquema compatible con OpenAI reduce el esfuerzo de integración. Los usuarios finales pueden acceder a Kimi K3 directamente a través del asistente de IA de Kimi en kimi.ai. Para las últimas actualizaciones de benchmarks, lanzamientos de modelos y documentación técnica, consulte el blog oficial de Moonshot AI en moonshotai.com. Para el centro de recursos completo de Moonshot AI de Bybit, explore la [comparación Moonshot AI vs DeepSeek vs Qwen](https://www.bybit.com/en/wiki/article/moonshot-ai-vs-deepseek-vs-qwen-2025-comparison/)) y la guía [¿Qué es Kimi AI?](https://www.bybit.com/en/wiki/article/what-is-kimi-ai-guide-to-moonshot-ai/).

Este artículo se actualizará a medida que Moonshot AI publique nuevos datos de benchmark, especificaciones oficiales e información de precios.