DEV Community

Cover image for AMD compra Taalas: chips que graban modelos en silicio a 17.000 tokens/s
lu1tr0n
lu1tr0n

Posted on • Originally published at elsolitario.org

AMD compra Taalas: chips que graban modelos en silicio a 17.000 tokens/s

AMD compró Taalas, una startup de Toronto que en vez de guardar los pesos de un modelo de lenguaje en memoria HBM, los graba directamente en el silicio del chip. Según los primeros benchmarks publicados por la propia empresa, su primer chip sirvió Llama 3.1 8B a 16.960 tokens por segundo, hasta 48 veces más rápido que una GPU de Nvidia en la misma tarea.

El anuncio se hizo el jueves 6 de agosto de 2026, al cierre del mercado, y AMD no reveló el monto de la operación. Para una compañía que compite contra Nvidia por el mercado de inferencia de IA, es la apuesta más radical hasta ahora: abandonar la GPU de propósito general para un nicho específico, servir un modelo ya entrenado, y hacerlo lo más rápido posible.

TL;DR

  • AMD adquirió Taalas, startup de Toronto fundada en 2023, en un acuerdo anunciado el 6 de agosto de 2026 al cierre del mercado, sin monto revelado.- El chip HC1 de Taalas, fabricado en el proceso de 6nm de TSMC y presentado en febrero de 2026, sirve Llama 3.1 8B a 16.960 tokens por segundo.- Esa cifra es 48 veces más rápida que una GPU de Nvidia y 8,5 veces más rápida que un acelerador wafer-scale de Cerebras, según Taalas.- El chip de segunda generación, HC2, llega este verano boreal de 2026 con capacidad para 20.000 millones de parámetros.- AMD planea combinar racks Instinct Helios con aceleradores Taalas en una arquitectura desagregada: GPU para el prompt, Taalas para generar tokens.- Grabar un modelo en silicio cuesta, según Taalas, 100 veces menos que entrenar un modelo de frontera.- El movimiento repite la lógica del acuerdo de Nvidia con Groq por $20.000 millones anunciado en diciembre de 2025.- La limitación central: una vez grabado el modelo, cambiarlo exige un re-spin de fabricación, aunque bastan dos capas de metal nuevas.

Qué pasó

La operación se cerró como una adquisición, no como un fichaje de talento disfrazado de compra (lo que en la jerga de Silicon Valley se conoce como acquihire). AMD absorbe tanto la tecnología como el equipo de Taalas, fundada en 2023 en Toronto. Según The Register, el encaje con AMD tiene una lógica muy concreta: AMD ya tiene el diseño de sistemas a nivel de rack y la relación comercial con los grandes laboratorios de IA que le faltaba a Taalas para llevar su tecnología a producción.

Vamsi Boppana, vicepresidente senior de IA de AMD, resumió la jugada así:

AMD está construyendo una plataforma de IA de pila completa que le da a los clientes la flexibilidad de desplegar la solución de cómputo correcta para cada carga de trabajo de IA. (Vamsi Boppana, SVP de IA de AMD)

La frase es deliberadamente ambigua sobre qué reemplaza a qué. Y esa ambigüedad es la clave de todo el movimiento: Taalas no viene a reemplazar las GPU Instinct de AMD, viene a complementarlas en un tipo de trabajo muy específico, la generación de tokens en inferencia de alto volumen.

Contexto e historia

La comparación que la industria hizo apenas se conoció la noticia fue con el acuerdo de licenciamiento de $20.000 millones que Nvidia firmó con Groq en diciembre de 2025. Ese acuerdo también apuntaba a inferencia premium para agentes de IA, como asistentes de código, donde la latencia importa tanto como el costo. AMD, con Taalas, busca jugar el mismo partido pero con una arquitectura todavía más radical: en vez de un chip de dataflow como el LPU de Groq, un chip que no tiene los pesos del modelo en una memoria separada, sino grabados en su propia estructura física.

Taalas llama a su enfoque MSIC, por model-specific integrated circuit (circuito integrado específico de un modelo). La idea no es nueva en el mundo del hardware, los ASIC llevan décadas fabricándose a medida de una tarea, pero aplicarla a un modelo de lenguaje completo, con miles de millones de parámetros grabados físicamente, es un salto que nadie había llevado a producción real hasta ahora.

💭 Clave: Según Taalas, grabar los pesos de un modelo en silicio cuesta cerca de 100 veces menos que entrenar un modelo de frontera desde cero. Eso es lo que hace viable re-fabricar un chip cada vez que sale un modelo nuevo relevante.
El HC1 de Taalas se fabricó en el proceso de 6nm de TSMC.

Detalles técnicos y rendimiento

Por dentro, un chip de Taalas se divide en dos regiones. La primera es el mask-ROM recall fabric, donde quedan grabados los pesos del modelo de forma permanente durante la fabricación. La segunda es el SRAM recall fabric, una memoria de lectura y escritura donde vive lo que sí cambia en tiempo real: el KV cache de cada conversación y los adaptadores de fine-tuning tipo LoRA.

Esa separación explica el salto de rendimiento. En una GPU convencional, cada token generado implica leer los pesos completos del modelo desde memoria HBM, un cuello de botella de ancho de banda que domina el costo de la fase de generación, a diferencia del prefill, donde el cómputo sí satura la GPU. Al grabar los pesos en el propio silicio, Taalas elimina ese viaje de ida y vuelta a memoria externa.

El chip de prueba HC1 se presentó en febrero de 2026, fabricado en el proceso de 6nm de TSMC. Sirviendo Llama 3.1 8B (un modelo ya viejo para los estándares de 2026, lanzado a mediados de 2024), Taalas reportó 16.960 tokens por segundo, 48 veces más rápido que una GPU de Nvidia y 8,5 veces más rápido que un acelerador wafer-scale de Cerebras en el mismo benchmark. El HC1 no estaba pensado para producción: era la prueba de que el concepto físico funciona.

El segundo chip, el HC2, llega este verano boreal de 2026 con capacidad para 20.000 millones de parámetros por unidad. Ese número parece chico comparado con los modelos de frontera actuales, pero la clave está en la escala horizontal: igual que con las GPU, los pesos de un modelo grande se reparten entre múltiples chips usando paralelismo de pipeline. Con 20.000 millones de parámetros por chip, hacen falta apenas 50 unidades para cubrir un modelo de un billón de parámetros.

Para dar escala: según AMD, servir ese mismo modelo de un billón de parámetros en los sistemas LPX que Nvidia presentó recientemente requeriría varias docenas de GPU además de al menos 2.000 LPU de Groq. Cincuenta chips Taalas contra esa combinación es una diferencia de espacio físico y consumo eléctrico considerable.

flowchart TD
    A["Prompt del usuario"] --> B["GPU AMD Instinct - prefill"]
    B --> C["KV cache inicial"]
    C --> D["Chip Taalas HC2 - generacion de tokens"]
    D --> E["Respuesta en streaming"]
    subgraph Rack Helios
    B
    D
    end
Enter fullscreen mode Exit fullscreen mode

Ese diagrama resume la arquitectura que AMD planea desplegar: racks Instinct Helios haciendo el prefill, la fase donde se procesa el prompt completo y sí conviene una GPU flexible, y chips Taalas encargándose de la generación token por token, donde la latencia y el ancho de banda de memoria son el cuello de botella.

Cómo probarlo hoy

Los chips de Taalas todavía no están disponibles fuera de AMD y sus clientes directos, así que no hay forma de correr un HC1 o un HC2 en tu propia máquina. Lo que sí podés hacer hoy es medir la métrica que hace famosa a Taalas, tokens por segundo, en tu propia GPU, para tener un punto de referencia real antes de creerle a cualquier benchmark de marketing.

Con vLLM podés levantar un servidor de inferencia compatible con la API de OpenAI en minutos:

# Linux / macOS
pip install vllm
python -m vllm.entrypoints.openai.api_server \
  --model meta-llama/Llama-3.1-8B-Instruct \
  --port 8000
Enter fullscreen mode Exit fullscreen mode
# Windows (PowerShell, requiere WSL2 con CUDA)
wsl --install
wsl -- pip install vllm
wsl -- python -m vllm.entrypoints.openai.api_server --model meta-llama/Llama-3.1-8B-Instruct --port 8000
Enter fullscreen mode Exit fullscreen mode

Eso levanta el mismo modelo que Taalas usó en su benchmark de febrero, Llama 3.1 8B, en tu propia GPU. Con este script medís tokens por segundo reales contra ese endpoint:

import time
import requests

prompt = "Explica que es la inferencia de un modelo de lenguaje en dos frases."
inicio = time.time()
respuesta = requests.post(
    "http://localhost:8000/v1/completions",
    json={
        "model": "meta-llama/Llama-3.1-8B-Instruct",
        "prompt": prompt,
        "max_tokens": 256,
    },
)
transcurrido = time.time() - inicio
tokens_generados = respuesta.json()["usage"]["completion_tokens"]
print(f"{tokens_generados / transcurrido:.1f} tokens/segundo")
Enter fullscreen mode Exit fullscreen mode

El número que te va a devolver ese script en una GPU de consumo, casi con seguridad, va a estar muy por debajo de los 16.960 tokens por segundo de Taalas: la comparación sirve para entender la magnitud del salto del que habla AMD, no para reproducirlo.

Si además querés entender el cálculo de paralelismo de pipeline mencionado arriba, este script hace exactamente la cuenta que lleva a los 50 chips por modelo de un billón de parámetros:

def chips_necesarios(parametros_totales_b, parametros_por_chip_b=20):
    # Redondeo hacia arriba: parametros en miles de millones (b = billions)
    return -(-parametros_totales_b // parametros_por_chip_b)

print(chips_necesarios(1000))  # 50 chips HC2 para un modelo de 1 billon de parametros
Enter fullscreen mode Exit fullscreen mode

AMD planea combinar racks Instinct Helios con chips Taalas en el mismo rack.

Impacto y análisis

El movimiento tiene una lectura evidente para los tres grandes laboratorios de modelos: OpenAI, Anthropic y Meta ya son clientes grandes de las GPU Instinct de AMD. Dada esa relación comercial existente, no sería extraño ver una versión de GPT o de Claude corriendo sobre una combinación de chips Taalas e Instinct en el mismo centro de datos, aunque por ahora eso es especulación de la industria y no algo que AMD haya confirmado.

También es plausible un esquema de adopción escalonado: los clientes primero validan un modelo nuevo en GPU Instinct, donde cambiar de versión es tan simple como actualizar un checkpoint, y recién cuando están seguros de que ese modelo va a estar en producción durante meses, migran esa carga a chips Taalas para ganar velocidad y bajar el costo por token.
OpciónCuándo usarlaVentajaLimitaciónGPU (AMD Instinct / Nvidia)Entrenamiento y servir modelos que cambian con frecuenciaFlexible, corre cualquier arquitectura sin refabricar nadaEl ancho de banda de memoria HBM limita la fase de generaciónLPU (Groq)Inferencia de baja latencia para un modelo fijo, sin re-fabricar silicioArquitectura de dataflow determinista, muy buena latencia por tokenNecesita miles de chips encadenados para modelos grandesWafer-scale (Cerebras)Entrenar o servir modelos enormes en un solo sistema físicoEvita el cuello de botella de interconexión entre chips separadosCosto y complejidad de fabricar una oblea completaMSIC (Taalas)Servir en volumen un modelo ya validado y estable en el tiempoHasta 48 veces más tokens por segundo que una GPU en el mismo benchmarkCambiar de modelo exige un re-spin de fabricación del chip
Esa última limitación es el verdadero trade-off de toda la propuesta de Taalas. Una vez que un modelo queda grabado en el silicio, no hay forma de actualizarlo con un simple despliegue de software. Ajustes menores, del tamaño de un adaptador LoRA, sí se pueden aplicar porque viven en la región SRAM regrabable del chip. Pero un cambio de arquitectura o una nueva versión del modelo base necesita volver a pasar por la fábrica.

⚠️ Ojo: Si tu producto depende de actualizar el modelo cada pocas semanas, algo cada vez más común en 2026, un chip Taalas no es la opción correcta. Taalas dice que un re-spin solo exige cambiar dos capas de metal, no rediseñar el chip entero, pero sigue siendo un ciclo de fabricación, no un deploy de software.

Esa tensión, velocidad extrema a cambio de perder la capacidad de iterar el modelo, es la misma que enfrentan hoy los equipos que eligen entre un modelo cerrado y actualizado constantemente, o uno abierto que fijan en una versión estable durante meses. Taalas lleva esa decisión a nivel de hardware.

Qué sigue

El HC2 de Taalas, con sus 20.000 millones de parámetros por chip, es la pieza que falta para saber si esta tecnología sirve más allá de las demos. Su lanzamiento está anunciado para este verano boreal de 2026, y va a ser la primera vez que un chip de este tipo tenga capacidad suficiente para servir un modelo con relevancia comercial real, no solo un Llama 3.1 8B como prueba de concepto.

Lo que va a definir si AMD apostó bien es si alguno de sus clientes grandes de Instinct (OpenAI, Anthropic o Meta) anuncia un despliegue concreto sobre la arquitectura combinada de Helios y Taalas en los próximos meses. Hasta entonces, todo lo que hay son benchmarks de laboratorio y una adquisición que todavía no reveló su precio.

Probalo vos: si tenés una GPU disponible, corré el benchmark de vLLM de la sección anterior contra Llama 3.1 8B y compará tu propio número de tokens por segundo con los 16.960 que reportó Taalas en febrero.

📖 Resumen en Telegram: Ver resumen

Preguntas frecuentes

¿Qué es un MSIC?

Un MSIC (model-specific integrated circuit) es un chip diseñado y fabricado para un modelo de IA en particular, con sus pesos grabados físicamente en el silicio en lugar de guardados en una memoria externa como la HBM.

¿Por qué grabar los pesos en silicio hace que la inferencia sea más rápida?

Porque elimina el viaje de ida y vuelta a memoria externa que domina el costo de la fase de generación de tokens en una GPU convencional. Los pesos ya están físicamente donde se necesitan, en vez de tener que leerse desde HBM en cada paso.

¿Qué pasa si el modelo grabado en el chip queda desactualizado?

Ajustes chicos, del tamaño de un adaptador LoRA, se pueden aplicar sin refabricar nada porque viven en la región SRAM regrabable del chip. Pero una nueva versión del modelo base exige un re-spin: según Taalas, solo hace falta cambiar dos capas de metal, no todo el diseño.

¿Esto reemplaza a las GPU Instinct de AMD?

No según lo que anunció AMD. La idea es una arquitectura desagregada donde las GPU Instinct procesan el prompt (prefill) y los chips Taalas generan los tokens de salida, dentro del mismo rack Helios.

¿Cuánto costó la adquisición de Taalas?

AMD no reveló el monto de la operación. Según reportó The Register, todo indica que se trata de una adquisición completa y no de un acquihire.

¿Quiénes podrían ser los primeros clientes de esta tecnología?

OpenAI, Anthropic y Meta ya son clientes grandes de las GPU Instinct de AMD, lo que los vuelve candidatos naturales para adoptar también los chips de Taalas una vez que el HC2 esté disponible.

Referencias

  • The Register: cobertura original del anuncio de la adquisición de Taalas por parte de AMD.- AMD: sitio oficial de la compañía que adquirió Taalas.- TSMC (Wikipedia): fabricante del proceso de 6nm usado en el chip HC1 de Taalas.- Cerebras Systems (Wikipedia): fabricante de los aceleradores wafer-scale usados como punto de comparación en los benchmarks de Taalas.

📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.

Top comments (0)