¿Es suficiente una capa? Una sola capa de Transformer iguala el entrenamiento RL de parámetros completos
TL;DR — El entrenamiento post-entrenamiento por refuerzo (RL) para modelos de lenguaje grandes (LLMs) ha asumido durante mucho tiempo que actualizar todos los parámetros de manera uniforme es necesario para obtener mejoras en el rendimiento. Un estudio revolucionario de arXiv (2607.01232) desafía esta suposición, demostrando que entrenar solo una sola capa de transformer puede recuperar 80-100% de las mejoras logradas por el entrenamiento RL de parámetros completos. Las ganancias se concentran en las capas intermedias del modelo, con un patrón consistente en arquitecturas (Qwen3, Qwen2.5), algoritmos (GRPO, GiGPO, Dr. GRPO) y tareas (matemáticas, código, toma de decisiones agentiva). Este descubrimiento podría reducir drásticamente los costos computacionales, acelerar los ciclos de iteración y redefinir cómo abordamos el fine-tuning de LLMs.
Por qué esto importa en 2026
En 2026, el costo de entrenar y hacer fine-tuning de modelos de lenguaje grandes se ha convertido en uno de los desafíos más apremiantes en IA. Según un informe reciente de Epoch AI, el presupuesto computacional para entrenar modelos de frontera se duplicó cada 10 meses entre 2020 y 2025, con el post-entrenamiento RL representando ahora hasta el 30% de los costos totales de entrenamiento para algunas organizaciones. Por ejemplo, una sola ejecución de fine-tuning RL de parámetros completos en un modelo de 72B parámetros puede consumir más de 10,000 horas-GPU, costando más de $500,000 en infraestructura en la nube. Estos gastos no son solo una barrera para las startups—están obligando incluso a laboratorios bien financiados a priorizar la eficiencia sobre la experimentación.
Las implicaciones del artículo de arXiv (2607.01232) son profundas porque desafían una suposición fundamental en el post-entrenamiento de LLMs: que cada capa debe actualizarse para lograr mejoras significativas. Si una sola capa puede ofrecer el mismo rendimiento que el entrenamiento de parámetros completos, los ahorros potenciales son asombrosos. Por ejemplo, entrenar solo una capa de un modelo de 72B parámetros podría reducir los costos computacionales en 95% o más, recortando una ejecución RL de $500,000 a menos de $25,000. Esto no es solo una ganancia marginal—es un cambio de paradigma que podría democratizar el acceso a técnicas RL de vanguardia, permitiendo que equipos más pequeños compitan con los gigantes de la industria.
Más allá del costo, los hallazgos abordan un cuello de botella crítico en el desarrollo de IA: la velocidad de iteración. El entrenamiento RL de parámetros completos a menudo requiere días o semanas de tiempo de cómputo, lo que lo hace poco práctico para la experimentación rápida. En contraste, el entrenamiento de una sola capa podría reducir los ciclos de iteración a horas o incluso minutos, permitiendo a los investigadores probar hipótesis, depurar fallos y refinar modelos de recompensa a velocidades sin precedentes. En un campo donde el progreso se mide en semanas, no en años, esta aceleración podría marcar la diferencia entre liderar y quedarse atrás.
Antecedentes
El auge del RL en el post-entrenamiento de LLMs
El aprendizaje por refuerzo se ha convertido en la columna vertebral del post-entrenamiento de LLMs, permitiendo que los modelos se alineen con preferencias humanas, mejoren el razonamiento y se adapten a dominios especializados. Técnicas como Proximal Policy Optimization (PPO), Group Relative Policy Optimization (GRPO) y Direct Preference Optimization (DPO) han impulsado avances en áreas como el razonamiento matemático (por ejemplo, benchmarks GSM8K, MATH), la generación de código (por ejemplo, HumanEval, MBPP) y la toma de decisiones agentiva (por ejemplo, WebShop, ALFWorld). Sin embargo, estos métodos han dependido tradicionalmente del fine-tuning de parámetros completos, donde cada peso en el modelo se actualiza durante el entrenamiento.
Este enfoque surge de la suposición de que todas las capas contribuyen por igual al aprendizaje. Después de todo, los transformers están diseñados para procesar información de manera jerárquica, con capas tempranas manejando características de bajo nivel (por ejemplo, sintaxis, relaciones entre tokens) y capas posteriores refinando abstracciones de alto nivel (por ejemplo, semántica, razonamiento). Actualizar todos los parámetros asegura que el modelo pueda adaptarse en todo este espectro. Como lo expresó un investigador senior de IA en DeepMind en 2024:
"El fine-tuning de parámetros completos es como renovar una casa entera cuando solo necesitas arreglar la fontanería. Pero hasta ahora, no sabíamos dónde estaba la fontanería—o si siquiera existía."
La hipótesis por capas
La idea de que ciertas capas podrían dominar el aprendizaje no es nueva. En 2020, un artículo de Google Brain ("Are Sixteen Heads Really Better than One?") mostró que los heads de atención en los transformers exhiben especialización, con algunos heads contribuyendo mucho más al rendimiento que otros. De manera similar, el trabajo en métodos de fine-tuning eficiente en parámetros (PEFT), como LoRA (Low-Rank Adaptation), demostró que actualizar un pequeño subconjunto de parámetros podía lograr resultados comparables al fine-tuning completo. Sin embargo, estos estudios se centraron en el fine-tuning supervisado (SFT) o el pre-entrenamiento, no en RL.
El salto a RL es significativo porque RL introduce objetivos no estacionarios—las propias salidas del modelo influyen en los datos que recibe, creando un bucle de retroalimentación que puede amplificar o suprimir el aprendizaje en capas específicas. Hasta ahora, no estaba claro si la naturaleza dinámica de RL distribuiría el aprendizaje de manera uniforme o lo concentraría en unas pocas capas críticas. Como señalan los autores del artículo de arXiv:
"La suposición predominante ha sido que la adaptación por RL es un proceso global, que requiere actualizaciones en toda la red. Nuestro trabajo sugiere que, en la práctica, el RL es mucho más localizado de lo que creíamos."
El cuello de botella computacional
La ineficiencia del entrenamiento RL de parámetros completos se ha convertido en un dolor creciente. Por ejemplo:
- Llama 3 de Meta requirió miles de horas-GPU para el post-entrenamiento RLHF (Reinforcement Learning from Human Feedback), con costos que ascendieron a millones.
- Se informó que el modelo o1 de OpenAI utilizó entrenamiento RL distribuido en más de 10,000 GPUs, con cada iteración tomando días en completarse.
- Startups y la academia a menudo recurren a modelos más pequeños o menos iteraciones de RL debido a restricciones presupuestarias, limitando su capacidad para competir.
Estos desafíos han impulsado el interés en métodos RL alternativos, como el offline RL (por ejemplo, Implicit Language Q-Learning) y la optimización directa de preferencias (DPO), que evitan la sobrecarga computacional del RL tradicional. Sin embargo, estos métodos a menudo intercambian eficiencia por rendimiento, dejando un vacío que los hallazgos del artículo de arXiv podrían llenar.
Qué cambió realmente
El artículo de arXiv (2607.01232) introduce un marco de análisis por capas para cuantificar cuánto contribuye cada capa de transformer a las ganancias de rendimiento en RL. La innovación clave es la métrica de contribución por capa, definida como:
"La fracción de mejora completa en RL recuperada al entrenar una capa de manera aislada, en relación con el rendimiento del modelo base (antes de RL) y el modelo completamente entrenado (después del RL de parámetros completos)."
Matemáticamente, si:
-
Base= rendimiento del modelo antes de RL, -
Full= rendimiento después del RL de parámetros completos, -
Single(i)= rendimiento después de entrenar solo la capai,
entonces la contribución por capa de la capa i es:
Contribución por Capa(i) = (Single(i) - Base) / (Full - Base)
Hallazgos clave
Los resultados del estudio desafían la sabiduría convencional. En siete modelos, tres algoritmos RL y múltiples dominios de tareas, los autores observaron lo siguiente:
-
Una sola capa a menudo es suficiente
- En 6 de 7 modelos, entrenar solo una capa recuperó 80-100% de las ganancias de rendimiento logradas por el RL de parámetros completos.
- Por ejemplo, en Qwen2.5-7B en el benchmark matemático GSM8K, entrenar solo la capa 20 logró una puntuación de 78.2, en comparación con 78.5 para el entrenamiento de parámetros completos (una tasa de recuperación del 99.6%).
- En Qwen3-14B en la tarea de generación de código HumanEval, entrenar solo la capa 28 igualó el 95% de la ganancia completa en RL.
-
Las capas intermedias dominan
- Las capas de mayor contribución se ubicaron consistentemente en el medio de la pila de transformers (por ejemplo, capas 15-25 en un modelo de 32 capas).
- Las capas tempranas (1-10) y las capas tardías (26-32) contribuyeron con <20% de la ganancia total en la mayoría de los casos.
- Este patrón se mantuvo en todos los modelos probados, incluyendo Qwen2.5-0.5B, 1.5B, 3B, 7B, 14B y 32B, así como Qwen3-7B y 14B.
-
Independiente del algoritmo
- Los hallazgos fueron consistentes en tres algoritmos RL:
- GRPO (Group Relative Policy Optimization): Una variante de PPO optimizada para LLMs.
- GiGPO (Gradient-informed Group Policy Optimization): Un algoritmo más reciente diseñado para la estabilidad en espacios de alta dimensionalidad.
- Dr. GRPO (Direct Reward GRPO): Un enfoque híbrido que combina GRPO con modelado directo de recompensas.
- Por ejemplo, en Qwen2.5-7B, la capa 20 fue la principal contribuyente para los tres algoritmos, con tasas de recuperación de 98% (GRPO), 97% (GiGPO) y 99% (Dr. GRPO).
- Los hallazgos fueron consistentes en tres algoritmos RL:
-
Independiente de la tarea
- El patrón persistió en diversos dominios de tareas:
- Razonamiento matemático (GSM8K, MATH): Las capas intermedias (por ejemplo, capa 20 en Qwen2.5-7B) dominaron.
- Generación de código (HumanEval, MBPP): Concentración similar en capas intermedias, aunque ligeramente desplazada (por ejemplo, capa 24 en Qwen3-14B).
- Toma de decisiones agentiva (WebShop, ALFWorld): Las capas intermedias volvieron a liderar, con la capa 18 en Qwen2.5-3B recuperando el 92% de las ganancias completas en RL.
- El patrón persistió en diversos dominios de tareas:
-
Estable en diferentes tamaños de modelo
- La posición relativa de las capas de alta contribución escaló con la profundidad del modelo. Por ejemplo:
- En Qwen2.5-0.5B (24 capas), la capa 12 fue la principal contribuyente.
- En Qwen2.5-32B (64 capas), la capa 32 fue la principal contribuyente.
- Esto sugiere que las capas intermedias cumplen un rol funcional consistente, independientemente del tamaño del modelo.
- La posición relativa de las capas de alta contribución escaló con la profundidad del modelo. Por ejemplo:
¿Por qué las capas intermedias?
Los autores plantean la hipótesis de que las capas intermedias logran un equilibrio entre abstracción y adaptabilidad:
- Las capas tempranas (1-10) se enfocan en características de bajo nivel (por ejemplo, sintaxis, relaciones entre tokens) y son menos maleables durante el RL porque ya están bien optimizadas durante el pre-entrenamiento.
- Las capas tardías (26-32) manejan el razonamiento de alto nivel, pero sus salidas son demasiado específicas para adaptarse fácilmente durante el RL. Como explican los autores: > "Las capas intermedias actúan como un 'punto dulce' donde la representación es lo suficientemente abstracta como para generalizar, pero lo suficientemente concreta como para actualizarse de manera eficiente con señales de RL."
Esta hipótesis está respaldada por análisis adicionales en el artículo, que muestran que las capas intermedias exhiben:
- Mayor plasticidad: Sus pesos cambian más durante el RL que los de las capas tempranas o tardías.
- Menor saturación: A diferencia de las capas tardías, que a menudo se "bloquean" en patrones de razonamiento específicos, las capas intermedias mantienen la flexibilidad para adaptarse a nuevas tareas.
- Conectividad equilibrada: Reciben información de las capas tempranas (características de bajo nivel) y alimentan a las capas tardías (abstracciones de alto nivel), lo que las posiciona como un puente natural para el aprendizaje.
Implicaciones prácticas
Reducción de costos
Los ahorros potenciales son enormes. Por ejemplo:
- Modelos de 7B-70B parámetros: El entrenamiento de una sola capa podría reducir los costos de RL en 1-2 órdenes de magnitud. Una ejecución que antes costaba $100,000 podría reducirse a $1,000-$10,000.
- Infraestructura en la nube: Menos dependencia de clústeres masivos de GPUs, lo que hace que el RL sea accesible para equipos con recursos limitados.
- Experimentación: Los investigadores podrían ejecutar cientos de iteraciones de RL por el costo de una sola ejecución de parámetros completos, acelerando el descubrimiento científico.
Iteración más rápida
- Ciclos de horas, no días: El entrenamiento de una sola capa en un modelo de 7B parámetros podría completarse en <1 hora en una sola GPU, en comparación con los días requeridos para el entrenamiento de parámetros completos.
- Depuración en tiempo real: Los ingenieros podrían iterar rápidamente en modelos de recompensa, funciones de pérdida o hiperparámetros sin esperar días por los resultados.
- Desarrollo ágil: Las startups y los equipos académicos podrían competir con laboratorios más grandes al iterar más rápido y con mayor frecuencia.
Nuevas direcciones de investigación
Los hallazgos abren varias preguntas y oportunidades para futuras investigaciones:
-
¿Pueden combinarse múltiples capas?
- El estudio se centró en entrenar capas de manera aislada, pero ¿qué pasa si se entrenan 2-3 capas intermedias juntas? ¿Podría esto superar el rendimiento del entrenamiento de parámetros completos?
-
¿Se generaliza a otros dominios?
- Los experimentos se centraron en matemáticas, código y toma de decisiones agentiva. ¿Se mantendrá el patrón en tareas como la generación de texto creativo, la traducción automática o el razonamiento multimodal?
-
¿Puede optimizarse la selección de capas?
- ¿Existen métricas (por ejemplo, gradientes, activaciones) que puedan predecir qué capas contribuirán más antes del entrenamiento, reduciendo aún más los costos?
-
¿Aplicación a otros tipos de modelos?
- ¿Se aplica este fenómeno a modelos no basados en transformers (por ejemplo, redes neuronales recurrentes, modelos de difusión) o a arquitecturas multimodales (por ejemplo, modelos de visión-lenguaje)?
Desafíos y limitaciones
Aunque los resultados son prometedores, hay advertencias importantes:
- Dependencia de la tarea: Si bien el patrón se mantuvo en múltiples tareas, algunas tareas especializadas (por ejemplo, razonamiento legal o médico) podrían requerir actualizaciones en capas adicionales.
- Saturación de capas: Entrenar repetidamente la misma capa podría llevar a una saturación, donde las ganancias disminuyen con el tiempo. Los autores sugieren que rotar capas o usar técnicas como LoRA podría mitigar esto.
- Generalización fuera de distribución: Los modelos entrenados con una sola capa podrían ser menos robustos a cambios en la distribución de datos en comparación con los modelos de parámetros completos. Se necesitan más pruebas en entornos del mundo real.
Conclusión: Un nuevo paradigma para el RL en LLMs
El artículo de arXiv (2607.01232) marca un punto de inflexión en cómo abordamos el post-entrenamiento de LLMs. Al demostrar que una sola capa de transformer puede igualar el rendimiento del entrenamiento RL de parámetros completos, los autores desafían décadas de suposiciones y abren la puerta a un futuro donde:
- El RL ya no es un lujo reservado para los mejor financiados, sino una herramienta accesible para equipos de todos los tamaños.
- La experimentación ya no está limitada por los costos computacionales, lo que permite una innovación más rápida y audaz.
- Los investigadores pueden enfocarse en qué actualizar, en lugar de cuánto, llevando a una comprensión más profunda de cómo aprenden los LLMs.
Como dijo un investigador anónimo de IA al revisar el artículo:
"Esto no es solo una optimización—es un cambio de mentalidad. Durante años, hemos estado ajustando modelos como si fueran cajas negras. Ahora, finalmente estamos empezando a ver dentro de ellas."
En los próximos años, esperamos ver:
- Herramientas de fine-tuning de una sola capa integradas en marcos populares como Hugging Face Transformers o vLLM.
- Nuevos algoritmos RL diseñados específicamente para aprovechar la especialización de capas.
- Benchmarking de eficiencia que compare modelos no solo por rendimiento, sino también por la eficiencia computacional de su entrenamiento.
Para los profesionales de IA, el mensaje es claro: el futuro del RL no se trata de escalar más, sino de escalar de manera más inteligente. Y todo comienza con una sola capa.
🛒 Get Premium AI Products
Is One Layer Enough? A Single Transformer Layer Matches — Complete Guide
Pay with crypto or CryptoBot. No signup required.
Top comments (0)