Mistral AI puso en preview público un modelo que activa menos del 5% de sus propios parámetros en cada token: Mistral Large 4 reparte 49.000 millones de parámetros activos sobre un total de 1,05 billones, un salto de arquitectura frente a la generación anterior de la familia Large.
El lanzamiento quedó documentado el 6 de octubre de 2026 bajo la etiqueta "Public Preview" y la versión interna v26.10, con ventana de contexto de 1 millón de tokens y un codificador de visión de 1.600 millones de parámetros integrado para procesar imágenes junto con texto.
TL;DR
- Mistral AI lanza Large 4: MoE abierto de 1,05 billones de parámetros, 49.000 millones activos.- Suma un codificador de visión de 1.600 millones de parámetros para entender texto e imágenes juntos.- El contexto llega a 1 millón de tokens gracias al enrutamiento granular de expertos (MoE).- Los precios van de $0,68 a $1,36 por millón de tokens de entrada y de $2,09 a $4,18 en salida.- La versión v26.10 ya soporta function calling, salidas estructuradas, batching y agentes con herramientas propias.
Qué es Mistral Large 4
Mistral Large 4 es el modelo insignia de Mistral AI, un sistema de Mixture-of-Experts granular, multimodal y de pesos abiertos que activa 49.000 millones de parámetros de un total de 1,05 billones, con un codificador visual de 1.600 millones de parámetros y contexto de 1 millón de tokens.
La ficha técnica lo cataloga bajo el identificador mistral-large-4 y lo marca como "Open", la etiqueta que Mistral reserva para los lanzamientos que incluyen pesos descargables en lugar de quedar únicamente detrás de una API cerrada.
Qué pasó
Mistral subió la ficha de Large 4 a su documentación con el estado "Public Preview" y la versión v26.10. La página de modelos lista el sistema junto a una variante adicional marcada "+1" que el extracto disponible no detalla, y especifica el soporte por endpoint: /v1/chat/completions y /v1/conversations cubren salidas estructuradas, function calling, respuesta sobre documentos (Document QnA) y prefijos de conversación; /v1/batch habilita procesamiento por lotes; /v1/agents suma agentes con herramientas integradas.
El modelo ocupa el lugar de Large 3 en el tope del catálogo y mantiene la misma ventana de contexto de 1 millón de tokens, pero cambia el reparto interno de cómputo: en vez de activar la totalidad de sus parámetros en cada pasada, enruta cada token hacia un subconjunto de expertos entrenados.
Contexto e historia
Mistral AI construyó su catálogo Large desde 2024 como alternativa europea a los modelos de OpenAI y Anthropic, con la particularidad de publicar pesos descargables para buena parte de su oferta en lugar de limitarse a una API cerrada. La compañía ya había probado la arquitectura Mixture-of-Experts antes, con Mixtral 8x7B como su primer modelo MoE de pesos abiertos a fines de 2023; Large 4 extiende esa apuesta a una escala mucho mayor y con un enrutamiento más granular.
Mistral publica pesos descargables para buena parte de su catálogo Large.
La misma página de documentación lista como "Other Models" a Z.ai GLM 5.3, Z.ai GLM 5.2 y Shieldstral 1.0. La presencia de dos versiones consecutivas de un modelo chino junto al propio catálogo de Mistral sugiere que la empresa posiciona a Large 4 explícitamente contra la oferta abierta china, no solo contra los modelos cerrados de los laboratorios estadounidenses.
Detalles técnicos
La diferencia central de la nueva MoE de Mistral frente a un modelo denso está en cómo decide qué partes de la red usar. En una arquitectura Mixture-of-Experts, el modelo divide sus parámetros en muchos expertos pequeños en lugar de pocos grandes, y un router aprende a enviar cada token solo a un subconjunto de ellos. Que la arquitectura sea "granular" significa, en la práctica, más expertos y más chicos que en una MoE tradicional, lo que le da al router más combinaciones posibles para ajustar el cómputo a cada token.
Esa granularidad explica la brecha entre los 49.000 millones de parámetros activos y el total de 1,05 billones: la mayoría de la red permanece inactiva en cualquier pasada dada, lo que abarata la inferencia frente a correr un modelo denso del mismo tamaño total. El costo de entrenar y almacenar el modelo completo sigue siendo el de 1,05 billones de parámetros; lo que cambia es el cómputo por token en inferencia.
El siguiente diagrama simplifica ese enrutamiento: un token de entrada llega al router, que lo asigna a un grupo acotado de expertos entre los muchos disponibles, y solo esos expertos participan del cálculo de esa posición.
flowchart TD
A["Token de entrada"] --> B["Router de MoE"]
B --> C["Experto 1"]
B --> D["Experto 7"]
B --> E["Experto 23"]
C --> F["Combinacion ponderada"]
D --> F
E --> F
F --> G["Salida del token"]
Sumado a eso, Large 4 integra un codificador de visión de 1.600 millones de parámetros: ese componente procesa imágenes y las traduce a una representación que el resto del modelo puede combinar con el texto, en vez de depender de un modelo de visión separado conectado por fuera del sistema principal.
📌 Nota: "1,05 billones" sigue la convención numérica en español, donde un billón equivale a 10^12, el mismo valor que un "trillion" en inglés. No es un error de traducción ni una exageración del dato original de Mistral.
La ficha de precios de Mistral Large 4 lista dos columnas de costo por millón de tokens, sin que el extracto disponible aclare si corresponden a dos modos de servicio (las pestañas "Speed" y "Performance" aparecen en la misma página) o a dos niveles de contrato:
Tipo de tokenPrecio nivel 1Precio nivel 2Entrada$1,36 /M tokens$0,68 /M tokensEntrada cacheada$0,14 /M tokens$0,07 /M tokensSalida$4,18 /M tokens$2,09 /M tokens
En los tres casos, el nivel 2 cuesta exactamente la mitad del nivel 1, un patrón que encaja mejor con un descuento por volumen o un modo de menor prioridad que con un cambio real en qué modelo responde la consulta.
Para probar el modelo basta apuntar el identificador mistral-large-4 al endpoint de chat completions que la propia ficha técnica lista:
curl https://api.mistral.ai/v1/chat/completions -H "Authorization: Bearer $MISTRAL_API_KEY" -H "Content-Type: application/json" -d '{"model": "mistral-large-4", "messages": [{"role": "user", "content": "Resumi en una linea que es un MoE granular."}]}'
La llamada sigue el mismo formato de /v1/chat/completions que Mistral documenta para el resto de su catálogo: la respuesta llega como un objeto JSON con el campo choices[0].message.content conteniendo el texto generado.
La limitación honesta acá es que el extracto de la documentación no incluye ningún benchmark de calidad: no hay forma de confirmar, con los datos disponibles, si los 49.000 millones de parámetros activos de Large 4 rinden mejor que un modelo denso de tamaño comparable. Los números de arquitectura están confirmados por la propia ficha técnica; el desempeño real queda pendiente de evaluaciones independientes.
Impacto y análisis
La relación entre parámetros activos y totales define el costo real de inferencia de un MoE.
El modelo llega en un momento donde la discusión sobre modelos abiertos pasó de "si publican pesos" a "cuánto cómputo activan por token". La proporción de casi 21 a 1 entre parámetros totales y activos ubica a Mistral en la misma conversación que otros laboratorios que vienen reduciendo la fracción activa de sus MoE para abaratar inferencia sin resignar capacidad total de la red.
Para equipos en LATAM que ya corren modelos de Mistral en producción, el cambio más concreto no es el tamaño del modelo sino el contrato de API: mantener el contexto de 1 millón de tokens y endpoints compatibles con la generación anterior reduce la migración a cambiar el nombre del modelo en la llamada, sin tocar el resto del pipeline de prompts, function calling o agentes.
La comparación implícita contra Z.ai GLM 5.3, GLM 5.2 y Shieldstral 1.0 en la misma página de catálogo también es un dato de posicionamiento: Mistral compite de forma explícita contra los modelos abiertos chinos, no solo contra los modelos cerrados de los laboratorios estadounidenses.
Qué sigue
La ficha de Large 4 todavía está marcada como "Public Preview", un estado que en el historial de Mistral suele preceder a una disponibilidad general semanas o meses después, con ajustes de precio incluidos. El extracto de la documentación menciona una variante adicional ("+1") sin detallarla, y lista a Shieldstral 1.0 entre los "Other Models" de la misma página, lo que deja abierta la posibilidad de un modelo de seguridad o moderación emparejado con el lanzamiento.
📖 Resumen en Telegram: Ver resumen
Probalo vos: pedí acceso a la Public Preview en docs.mistral.ai y apuntá una llamada a /v1/chat/completions con "model": "mistral-large-4" para comparar la latencia contra Large 3 en tu propio caso de uso.
Preguntas frecuentes
¿Cuántos parámetros tiene el nuevo modelo de Mistral AI?
Tiene 1,05 billones de parámetros totales, de los cuales activa 49.000 millones por token gracias a su arquitectura Mixture-of-Experts granular.
¿Qué significa que Large 4 sea de "pesos abiertos"?
Significa que Mistral publica los parámetros entrenados para que cualquiera pueda descargarlos y correrlos en su propia infraestructura, a diferencia de un modelo que solo se usa a través de una API cerrada.
¿Cuánto cuesta usar la nueva MoE de Mistral por API?
La documentación lista entre $0,68 y $1,36 por millón de tokens de entrada, entre $0,07 y $0,14 por tokens de entrada cacheados, y entre $2,09 y $4,18 por millón de tokens de salida, según el nivel de servicio.
¿El sucesor de Large 3 soporta imágenes?
Sí: integra un codificador de visión de 1.600 millones de parámetros que procesa imágenes junto con texto en la misma conversación.
¿Cambió el contexto respecto a la versión anterior de Mistral?
No: la ventana de contexto se mantiene en 1 millón de tokens, el mismo valor que tenía Large 3 según la documentación de Mistral.
Referencias
- Mistral AI Docs: ficha técnica oficial de Mistral Large 4, con precios, funciones soportadas y estado de preview.- Mistral AI Docs: portal de documentación de la API y el catálogo completo de modelos de Mistral AI.- Mistral AI: sitio oficial de la empresa que desarrolla la familia de modelos Large.
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
Top comments (0)