DEV Community

Cover image for Aleph Alpha lanza Kolibri, LLM alemán que activa solo 4,4% de sus parámetros
lu1tr0n
lu1tr0n

Posted on Originally published at elsolitario.org

Aleph Alpha lanza Kolibri, LLM alemán que activa solo 4,4% de sus parámetros

Un modelo que activa apenas el 4,4% de sus propios parámetros en cada token acaba de salir de Alemania con licencia abierta. Se llama Aleph Alpha Kolibri, lo lanzó la compañía alemana Aleph Alpha el 3 de octubre de 2026, y combina 78.100 millones de parámetros totales con una arquitectura de mezcla de expertos entrenada íntegramente en infraestructura europea.

El lanzamiento llega acompañado de un informe técnico de 189 páginas y una licencia Apache 2.0 para los pesos, justo cuando Europa discute cómo competir en inteligencia artificial sin depender de infraestructura estadounidense o china.

TL;DR

  • Aleph Alpha lanzó Kolibri el 3 de octubre de 2026, LLM alemán de 78.100 millones de parámetros.- El modelo activa solo 3.460 millones de parámetros por token (4,4%) gracias a su mezcla de expertos.- Se entrenó con 24 billones de tokens en 768 GPU NVIDIA B200, ubicadas en Alemania y Finlandia.- Su tokenizador UniBPE recorta 11,2% los tokens necesarios para alemán frente al de GPT-5.- La compañía firmó el Código de Buenas Prácticas de Modelos de IA de Propósito General de la UE.

Qué es Aleph Alpha Kolibri

Aleph Alpha Kolibri es un modelo de lenguaje de pesos abiertos en alemán e inglés, con una arquitectura de mezcla de expertos de 78.100 millones de parámetros totales que activa solo 3.460 millones por token, publicado bajo licencia Apache 2.0 y diseñado para cumplir el Reglamento de IA europeo desde su origen.

El nombre no es casual: Kolibri significa colibrí en alemán, un guiño a un modelo cuyo mérito principal es pesar poco en cómputo aunque cargue con una memoria considerable. Según el model card publicado en Hugging Face, el modelo soporta razonamiento en cuatro niveles (ninguno, bajo, medio y alto), llamadas a herramientas, y tiene un corte de conocimiento al 18 de junio de 2026.

Qué pasó

Aleph Alpha, con sede en Heidelberg, presentó Kolibri el 3 de octubre de 2026 junto a un post de lanzamiento, una ficha técnica de 189 páginas y los pesos en Hugging Face. En ese post, la compañía describe el modelo con una palabra que repite varias veces: "sovereign". En sus propias palabras, citadas en el análisis técnico publicado en tej.as, "teams built the model in Germany, trained it on infrastructure in Germany and Finland, under European and German law, with no foreign control".

Esa soberanía tiene dos caras, según el mismo post. La primera es el proceso: equipos alemanes, infraestructura en Alemania y Finlandia, ley europea. La segunda es lo que recibe el cliente: libertad total de despliegue y seguridad de propiedad intelectual, de modo que el cumplimiento normativo queda incorporado por diseño y no depende de un proveedor externo que pueda cambiar o apagar el modelo. Aleph Alpha también firmó el Código de Buenas Prácticas de IA de Propósito General de la Unión Europea, el marco voluntario que acompaña al Reglamento de IA para modelos de uso general.

En la evaluación interna de Aleph Alpha, Kolibri queda por encima de todos los modelos comparables de su tamaño en alemán e inglés. Es un dato que hay que leer con cautela: viene del propio fabricante, no de un benchmark independiente.

Contexto e historia

Aleph Alpha nació en 2019 como una de las apuestas europeas por construir modelos de lenguaje propios, en un ecosistema dominado por laboratorios estadounidenses y, más recientemente, chinos. La compañía ya había lanzado antes la familia Luminous, y Kolibri llega como un salto de arquitectura: de modelos densos a mezcla de expertos, con el foco puesto explícitamente en el cumplimiento regulatorio europeo desde el diseño y no como un parche posterior.

El debate de fondo no es nuevo. Un analista independiente que sigue la escena de IA europea documentó en su análisis que, en una conferencia de 2024, escuchó en Estados Unidos la frase "you regulate, you don't innovate" al mencionar que vivía en Alemania. Kolibri funciona como una respuesta directa a esa crítica: un intento de demostrar que regulación y capacidad técnica no son mutuamente excluyentes.

Soberano no significa aislado. El model card de Kolibri admite que el texto en inglés usado para entrenar se reescribió con Gemma 4 de Google, el alemán con Mistral-NeMo, y que Qwen3-32B etiquetó datos para los filtros de calidad. Aleph Alpha además filtró el sesgo político que, según afirma, midieron en modelos abiertos chinos. La soberanía de Kolibri está en la infraestructura de entrenamiento, la ley aplicable y el control del modelo final, no en que cada byte de datos haya nacido en Europa.

Detalles técnicos

El mecanismo central de el LLM soberano alemán es la mezcla de expertos. Kolibri tiene 50 capas, cada una con 384 expertos más 1 experto compartido por el que pasa cada token. Un router decide, para cada token, a cuáles de los 384 expertos enviarlo: elige 6. Esa combinación de 6 expertos seleccionados más el experto compartido es lo que convierte 78.100 millones de parámetros totales en apenas 3.460 millones de cómputo real por token.
Kolibri se entrenó con 768 GPU NVIDIA B200 en centros de datos de Alemania y Finlandia.
El truco tiene un costo que el propio model card no esconde: "the full model must be held in memory even though only part of it is active at any time". Aunque el modelo computa como uno de 3.460 millones de parámetros, necesita la memoria de uno de 78.100 millones: alrededor de 78 GB en punto flotante de 8 bits (FP8). Es la razón por la que correr Kolibri localmente sigue exigiendo hardware serio, incluso cuando el gasto de cómputo por token es bajo.

flowchart TD
 A["Token de entrada"] --> B["Router"]
 B --> C["Experto compartido"]
 B --> D["6 de 384 expertos seleccionados"]
 C --> E["Salida combinada"]
 D --> E
Enter fullscreen mode Exit fullscreen mode

El segundo mecanismo es el tokenizador. El alemán junta palabras en compuestos largos, y un tokenizador entrenado sobre todo con inglés los corta en pedazos poco útiles. Aleph Alpha entrenó un tokenizador propio, UniBPE, con 128.000 tokens de vocabulario: combina la fusión ascendente de byte-pair encoding (BPE) con una regla de puntuación distinta, el objetivo Unigram, que respeta mejor cómo se construyen las palabras en alemán.

o200k_base (GPT-5): Bund | es | ver | fass | ungs | gericht -> 6 tokens
Kolibri: Bundes | verfassungsgericht -> 2 tokens
Enter fullscreen mode Exit fullscreen mode

Esa palabra es el nombre alemán del Tribunal Constitucional Federal. El tokenizador de GPT-4o y GPT-5 (o200k_base, vía tiktoken de OpenAI) la parte en 6 tokens; el de Kolibri la deja en 2. Según el informe técnico, citado en el análisis de tej.as, UniBPE necesita en promedio 11,2% menos tokens para procesar texto en alemán que el tokenizador de GPT-5, el mejor resultado entre los 9 tokenizadores que compararon.

Kolibri tiene contexto nativo de 262.144 tokens, probado hasta 1.048.576. Para confirmar ese valor sin depender de lo que el runtime de inferencia te deje forzar, conviene revisar directamente el archivo config.json del repositorio en Hugging Face y el campo que fija la longitud máxima de posición: ese número es el límite real de la arquitectura, no el que negocia el servidor que lo expone. Sobre los cuatro niveles de razonamiento, en cambio, no hay forma directa de verificar cuál está activo desde afuera: Aleph Alpha no publicó, a la fecha de este artículo, un endpoint público propio para Kolibri, así que el parámetro que controla el nivel depende de qué motor de inferencia use quien lo sirva.
Nivel de razonamientoCuándo usarloVentajaLimitaciónNingunoRespuestas directas, tareas simplesLatencia mínimaSin razonamiento explícitoBajoPreguntas de uno o dos pasos lógicosEquilibrio costo y velocidadPuede fallar en problemas de varios pasosMedioTareas que requieren descomponer un problemaMejor precisión en tareas complejasMás tokens de salida, mayor costoAltoRazonamiento largo, matemática, planificaciónMáxima precisiónMayor latencia y consumo de cómputo

Impacto y análisis

El sistema de pesos abiertos europeo resuelve un problema concreto para gobiernos y empresas reguladas: una ficha de salud, un diseño de pieza automotriz o un expediente administrativo puede entrar y salir de un servidor propio, bajo ley alemana, sin que un proveedor externo pueda cambiar el modelo bajo los pies del cliente. Para un ministerio o un proveedor del sector automotor europeo, eso pesa más que un punto porcentual de benchmark.

⚠️ Ojo: La comparación que ubica a Kolibri por delante de otros modelos de su tamaño es una evaluación interna de Aleph Alpha, publicada en su propio informe técnico. Todavía no hay benchmarks independientes que confirmen esos resultados.

El costo de memoria, sin embargo, le pone un techo real a esa promesa de soberanía fácil. Un modelo que necesita 78 GB en memoria para activar solo 3.460 millones de parámetros por token no corre en una laptop ni en un servidor modesto: sigue exigiendo GPU de clase centro de datos, aunque el gasto de cómputo por consulta sea bajo. La soberanía de datos no equivale a soberanía de hardware accesible.

También queda la tensión entre el discurso y la práctica de datos. El model card es transparente al admitir que usó Gemma 4 de Google y Mistral-NeMo para reescribir texto de entrenamiento, y Qwen3-32B para etiquetar datos de filtrado. Un modelo que se presenta como garantía de independencia frente a infraestructura no europea usó, en su propio proceso de curación, modelos de Google, Mistral y un laboratorio chino. No invalida el logro técnico, pero sí matiza qué tan limpia es la frontera entre "soberano" y "con ayuda externa".

Qué sigue

Lo que falta ahora es verificación externa. Ningún laboratorio independiente de benchmarks había publicado, al cierre de este artículo, una evaluación de Kolibri que contraste la cifra que reporta Aleph Alpha. Con los pesos ya en Hugging Face bajo Apache 2.0, la comunidad puede correr sus propias pruebas, afinar el modelo con datos propios y, sobre todo, poner a prueba la promesa central: que un modelo entrenado y servido bajo ley europea puede competir con la frontera sin ceder control.

El otro frente a vigilar es la adopción institucional. Firmar el Código de Buenas Prácticas de la UE es un gesto, no un contrato de compra; el dato que importará en los próximos meses es cuántos ministerios o proveedores industriales europeos reemplazan modelos extranjeros por Kolibri en producción, y bajo qué condiciones de infraestructura.
El router de Kolibri envía cada token a solo 6 de sus 384 expertos.
Probalo vos: los pesos y la ficha técnica de Kolibri ya están publicados en Hugging Face bajo licencia Apache 2.0, así que podés revisar el informe de 189 páginas antes de decidir si lo corrés en tu propia infraestructura.

📖 Resumen en Telegram: Ver resumen

Preguntas frecuentes

¿Qué significa que Aleph Alpha Kolibri sea un modelo soberano?

Significa que se entrenó en infraestructura alemana y finlandesa bajo ley europea, y que un cliente puede desplegarlo en sus propios servidores sin que un proveedor externo controle o pueda desactivar el modelo.

¿Cuántos parámetros activa Kolibri por cada token?

Activa 3.460 millones de los 78.100 millones totales, un 4,4%, gracias a que su router envía cada token a solo 6 de 384 expertos más un experto compartido.

¿Qué licencia tiene el LLM soberano alemán?

Los pesos y los archivos de configuración se publicaron bajo licencia Apache 2.0. Aleph Alpha mantiene en privado el código y los métodos de entrenamiento.

¿El sistema de mezcla de expertos de Kolibri necesita menos memoria que un modelo denso equivalente?

No: aunque computa como un modelo de 3.460 millones de parámetros, necesita mantener en memoria los 78.100 millones completos, alrededor de 78 GB en FP8, porque el router puede enviar cualquier token a cualquier experto.

¿Por qué el tokenizador de Kolibri es relevante para hablantes de alemán?

Porque el alemán forma palabras compuestas largas, y el tokenizador UniBPE de Kolibri necesita 11,2% menos tokens que el de GPT-5 para representar el mismo texto en alemán, lo que abarata el procesamiento de ese idioma.

Referencias

  • tej.as: análisis técnico detallado de la arquitectura, el tokenizador y el informe de Kolibri.- Hugging Face: repositorio donde Aleph Alpha publicó los pesos de Kolibri bajo Apache 2.0.- Comisión Europea, Estrategia Digital: marco oficial del Reglamento de IA y el Código de Buenas Prácticas de IA de Propósito General.- Wikipedia: explicación general de la arquitectura de mezcla de expertos (MoE).- Aleph Alpha: sitio oficial de la compañía alemana que desarrolló Kolibri.

📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.

Top comments (0)