NVIDIA acaba de poner en producción un modelo de 30.000 millones de parámetros que promete completar tareas agénticas hasta un 30% más rápido que sus rivales de la misma categoría. Se llama Nemotron 3.5 Lightning y llega acompañado de NeMo Switchyard, una librería open source que decide, paso a paso, qué modelo de IA debe atender cada tarea de un agente.
El lanzamiento apunta directo a un problema que ya golpea a cualquier equipo que corre agentes de IA en producción: usar un solo modelo frontera para todo dispara el costo y la latencia. NVIDIA propone resolverlo con un modelo especializado y liviano, más un router que elige entre él, modelos abiertos y modelos propietarios según la tarea.
TL;DR
- NVIDIA lanzó Nemotron 3.5 Lightning, un modelo MoE de 30.000 millones de parámetros para agentes de IA de alto volumen.
- Lightning ofrece hasta 4x más velocidad de salida y 30% menos tiempo de finalización de tareas agénticas frente a rivales de su clase.
- NVIDIA también liberó NeMo Switchyard, una librería open source que enruta cada paso de un agente al modelo más adecuado.
- Según benchmarks internos de NVIDIA, Switchyard mantiene precisión de frontera y reduce el costo a casi un tercio de usar solo Opus 4.8.
- CrowdStrike, Harvey (con Trajectory), CodeRabbit (con Baseten), Lila Sciences y Fastino Labs ya personalizaron Lightning para sus dominios.
- Lightning corre en RTX PCs, DGX Spark, DGX Station, Jetson, workstations RTX PRO, data centers y la nube.
- NVIDIA lanzó además Nemotron-RL-Agentic-Terminal-Pivot, un dataset de refuerzo agéntico para post-entrenar capacidades de coding.
- El lanzamiento sigue a Nemotron 3 Nano y se apoya en aportes de evaluación e inferencia del Nemotron Coalition.
Introducción
Los agentes de IA que corren de forma continua, los que NVIDIA llama always-on agents, dejaron de depender de un solo modelo. Hoy operan como sistemas de modelos: un modelo de razonamiento de frontera, como Nemotron 3 Ultra o GPT-5.6, planifica y orquesta el flujo de trabajo, mientras modelos más chicos y especializados ejecutan tareas puntuales como revisión de código, uso de herramientas, monitoreo de alertas de seguridad o respuestas de facturación.
Nemotron 3.5 Lightning nace para ese segundo rol. NVIDIA lo describe como el modelo de mayor eficiencia en su categoría para cargas de trabajo agénticas de larga duración, pensado para volumen alto y tareas acotadas, no para razonamiento general.
Qué pasó
NVIDIA amplió su familia Nemotron 3 con Nemotron 3.5 Lightning, un modelo de mixtura de expertos (MoE) de 30.000 millones de parámetros, sucesor directo del lanzamiento de Nemotron 3 Nano. Es completamente personalizable: cualquier organización puede post-entrenarlo con NVIDIA NeMo usando sus propios datos, herramientas y flujos de trabajo para mejorar la precisión en tareas específicas.
Junto a Lightning, NVIDIA liberó NeMo Switchyard, una librería open source de enrutamiento inteligente para herramientas de agentes. Switchyard dirige automáticamente cada request al modelo más capaz y eficiente para ese paso puntual, ya sea open, propietario o de NVIDIA, sin que el equipo de desarrollo tenga que reescribir su aplicación.
El desarrollo de Lightning contó con aportes de la Nemotron Coalition, cuyos miembros aportaron metodologías de evaluación, software de inferencia y datasets. NVIDIA también publicó Nemotron-RL-Agentic-Terminal-Pivot, un dataset de aprendizaje por refuerzo agéntico usado para post-entrenar las capacidades de agentes de coding del modelo.
Lightning es un MoE de 30B pensado para tareas agénticas de alto volumen, no para razonamiento general.
Contexto e historia
La familia Nemotron no nació con Lightning. NVIDIA la viene construyendo como su apuesta de modelos abiertos frente a los sistemas cerrados, publicando tanto los pesos como, cuando la licencia lo permite, los datos y técnicas de entrenamiento, algo que habilita trazabilidad, auditoría y que terceros puedan entrenar sus propios modelos a partir de ese trabajo.
Este lanzamiento llega en un momento donde la industria ya asumió que ningún modelo único gana en todos los frentes: hay modelos mejores para código, otros para razonamiento, otros livianos y pensados para correr localmente por privacidad y eficiencia. Depender de un solo modelo por defecto implica pagar de más o perder calidad; enrutar a mano entre varios modelos se vuelve trabajo de integración que frena cualquier despliegue. Switchyard busca sacar esa decisión de las manos del equipo de desarrollo y automatizarla.
Detalles técnicos y rendimiento
Nemotron 3.5 Lightning es un modelo mixture-of-experts (MoE) de 30.000 millones de parámetros. Según NVIDIA, entrega hasta 4 veces más velocidad de salida, lo que se traduce en una finalización de tareas agénticas un 30% más rápida frente a otros modelos de su misma clase. Los benchmarks de PinchBench, citados por NVIDIA, muestran a Lightning completando tareas agénticas más rápido que rivales comparables sin perder precisión de nivel frontera.
Del lado del router, NVIDIA reporta que NeMo Switchyard mantiene precisión de nivel frontera mientras reduce el costo de completar una tarea a casi un tercio de lo que costaría resolverla usando Opus 4.8 en solitario, según benchmarks internos de NVIDIA. Eso importa porque el costo de un agente no depende solo del precio por token del modelo: depende de cuántos pasos del flujo terminan pasando por el modelo más caro cuando no hacía falta.
Modelo / rolFunción en el sistemaDónde correCuándo usarlo
Nemotron 3 Ultra / GPT-5.6Orquestador y planificador de fronteraData center / cloudPlanificar el flujo completo del agente
Nemotron 3.5 LightningEspecialista de alto volumen (MoE 30B)RTX PC, DGX Spark, DGX Station, Jetson, RTX PRO, data center, cloudTareas puntuales: revisión de código, uso de herramientas, alertas, facturación
NeMo SwitchyardRouter entre modelos abiertos, propios y de NVIDIASe despliega junto a la app del agenteCuando el agente combina varios modelos y hay que optimizar costo, latencia y calidad
Quién ya lo está usando
Varios equipos ya personalizaron Lightning para sus propios dominios: CrowdStrike lo adaptó para ciberseguridad, Harvey lo integró junto con Trajectory para servicios legales, y CodeRabbit lo ajustó con Baseten para revisión de código. Lila Sciences lo está usando para mejorar el razonamiento en tareas agénticas de ciencias físicas y de la vida, y Fastino Labs reporta las mejores precisiones que consiguió hasta ahora para desarrollo de software, finanzas y salud tras personalizar el modelo.
💭 Clave: Lightning no compite con los modelos de razonamiento de frontera. Está pensado para el volumen: la tarea repetitiva que un agente ejecuta miles de veces por día, donde la velocidad y el costo por request importan más que la capacidad de planificación.
Cómo empezar
Hay dos caminos prácticos para probar Nemotron 3.5 Lightning hoy: consumirlo vía la API catalog de NVIDIA, o correrlo local con un contenedor NIM. El primero sirve para prototipar rápido; el segundo para los casos donde la latencia o la privacidad exigen mantener la inferencia dentro de tu propia infraestructura.
Para probarlo vía API, sin instalar nada, alcanza con una key del catálogo de NVIDIA y una llamada compatible con el formato de OpenAI:
curl https://integrate.api.nvidia.com/v1/chat/completions \
-H "Authorization: Bearer $NVIDIA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "nvidia/nemotron-3.5-lightning",
"messages": [
{"role": "user", "content": "Resumi este ticket de soporte en 3 bullets."}
],
"max_tokens": 512
}'
El campo model de la respuesta confirma qué modelo real atendió el request; es el primer chequeo cuando después metés Switchyard en el medio y querés verificar que enrutó donde correspondía.
Para correrlo local (RTX PC, DGX Spark o data center propio), el patrón es el mismo que con cualquier microservicio NIM de NVIDIA: bajar el contenedor con tu NGC API key y levantarlo con GPU. Windows (PowerShell con Docker Desktop), macOS y Linux comparten el mismo comando vía Docker:
# Linux / macOS (bash) y Windows (PowerShell con Docker Desktop)
docker login nvcr.io --username '$oauthtoken' --password $NGC_API_KEY
docker run --rm --gpus all \
-e NGC_API_KEY=$NGC_API_KEY \
-p 8000:8000 \
nvcr.io/nim/nvidia/nemotron-3.5-lightning:latest
Con el contenedor arriba, el endpoint queda expuesto en http://localhost:8000/v1/chat/completions con el mismo formato de la llamada anterior, solo cambiando la URL base.
💡 Tip: Si tu agente ya llama a un modelo fijo por su nombre, no hace falta reescribir esa lógica para meter Switchyard: el router se coloca delante y decide a qué modelo reenviar cada request, manteniendo la misma interfaz.
Impacto y análisis
El punto central de este lanzamiento no es Lightning por sí solo: es la combinación de un modelo barato de correr con un router que decide cuándo usarlo. Eso cambia la conversación de "qué modelo elijo" a "cómo armo un sistema de modelos", que es exactamente el problema que enfrentan los equipos que ya tienen agentes corriendo 24/7 en producción.
Switchyard elige el modelo según calidad, latencia y costo, sin que el agente cambie su código.
El flujo típico de un sistema con Switchyard delante de un agente se ve así:
flowchart TD
A["Agente / app"] --> B["NeMo Switchyard"]
B --> C["Nemotron 3.5 Lightning"]
B --> D["Modelo de frontera (ej. Opus 4.8)"]
B --> E["Otro modelo abierto o propio"]
C --> F["Tarea de alto volumen"]
D --> G["Tarea que exige razonamiento profundo"]
E --> H["Tarea con requisito de privacidad local"]
Un ejemplo de configuración de routing con Switchyard, priorizando costo salvo que la tarea esté marcada como crítica, podría verse así:
routes:
- match:
task_type: "code_review"
target: "nvidia/nemotron-3.5-lightning"
priority: cost
- match:
task_type: "incident_triage"
severity: "critical"
target: "anthropic/opus-4.8"
priority: quality
- match:
task_type: "billing_faq"
target: "nvidia/nemotron-3.5-lightning"
priority: latency
La lógica es simple pero el efecto compuesto: si el 80% de los pasos de un agente son tareas repetitivas de bajo riesgo, sacarlas del modelo más caro y mandarlas a un modelo de 30B optimizado para eso reduce el costo total sin tocar la calidad donde de verdad importa.
La otra cara de la moneda es que un router agrega una pieza más al sistema que puede fallar o decidir mal. Si las reglas de enrutamiento están mal calibradas, una tarea que necesitaba razonamiento profundo puede terminar en el modelo liviano y devolver una respuesta de peor calidad sin que nadie lo note hasta que el error ya se propagó. Por eso NVIDIA insiste en que el router es tuneable: cada organización define sus propias prioridades de calidad, latencia y costo en vez de aceptar un enrutamiento genérico.
⚠️ Ojo: Meter un router entre el agente y los modelos no es gratis en complejidad operativa: hay que monitorear qué modelo respondió cada request y auditar cuándo el router se equivocó de prioridad, no solo cuánto ahorró.
Qué sigue
NVIDIA dice estar trabajando con socios del ecosistema para llevar el enrutamiento inteligente a las herramientas y plataformas que los desarrolladores ya usan. Uno de esos socios, Boomi, evaluó Switchyard en cinco capacidades de enrutamiento distintas como parte de esa integración temprana.
Para los equipos que ya corren agentes propios, el próximo paso lógico es evaluar cuánto de su tráfico actual hacia un modelo frontera podría resolverse con un especialista más chico sin perder calidad medible, y usar esa proporción para dimensionar el ahorro real antes de mover producción.
📖 Resumen en Telegram: Ver resumen
Probalo vos: pedí una key gratuita en el catálogo de NVIDIA y hacé la primera llamada a Nemotron 3.5 Lightning con el curl de arriba en menos de cinco minutos.
Preguntas frecuentes
¿Qué es Nemotron 3.5 Lightning?
Es un modelo de mixtura de expertos (MoE) de 30.000 millones de parámetros de NVIDIA, diseñado para tareas agénticas de alto volumen dentro de sistemas de agentes de IA que corren de forma continua.
¿Qué es NeMo Switchyard?
Es una librería open source de NVIDIA que enruta automáticamente cada paso de un agente al modelo más adecuado, ya sea abierto, propietario o de NVIDIA, según prioridades de calidad, latencia o costo definidas por cada organización.
¿Nemotron 3.5 Lightning es un modelo abierto?
Sí. Es completamente personalizable y puede post-entrenarse con NVIDIA NeMo usando datos, herramientas y flujos propios de cada organización.
¿Dónde puedo correr Lightning?
Corre en NVIDIA RTX PCs, DGX Spark, DGX Station, Jetson, workstations RTX PRO, data centers y la nube, según las necesidades de privacidad, latencia y escala del despliegue.
¿Cuánto ahorra usar Switchyard frente a un solo modelo?
Según benchmarks internos de NVIDIA, Switchyard mantiene precisión de nivel frontera mientras reduce el costo de completar una tarea a casi un tercio de lo que costaría resolverla solo con Opus 4.8.
¿Qué empresas ya personalizaron Lightning?
CrowdStrike, Harvey (junto con Trajectory), CodeRabbit (junto con Baseten), Lila Sciences y Fastino Labs ya lo adaptaron para sus propios dominios: ciberseguridad, servicios legales, revisión de código, ciencias físicas y de la vida, y desarrollo de software, finanzas y salud respectivamente.
Referencias
- NVIDIA Blog: anuncio oficial de Nemotron 3.5 Lightning y NeMo Switchyard.
- GitHub: NVIDIA/NeMo: repositorio del framework usado para post-entrenar modelos Nemotron.
- NVIDIA API Catalog: catálogo donde se pueden probar los modelos Nemotron vía API.
- Wikipedia: Mixture of experts: explicación de la arquitectura MoE que usa Lightning.
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
Top comments (0)