El 23 de agosto de 2026, Paul Graham publicó en X una respuesta de una sola frase que acumuló más de 642.800 reproducciones y 11.000 me gusta en menos de 24 horas: si tuviera 17 años, dejaría de lado las aplicaciones y aprendería a construir LLMs desde cero, entrenando los modelos más potentes que le permitiera el hardware al que pudiera acceder.
La respuesta generó un intercambio con Yann LeCun, científico reconocido por sus aportes al deep learning, que propuso una ruta distinta: entender por qué un LLM puede escribir un ensayo pero no limpiar un cuarto, y usar esa pregunta para buscar arquitecturas que vayan más allá de los transformers. El choque entre ambas posturas importa para cualquier desarrollador que hoy decide entre usar una API de IA o meterse a entender cómo funciona por dentro.
TL;DR
- Paul Graham publicó el 23 de agosto de 2026 un tuit que superó las 642.800 reproducciones y 11.000 me gusta en menos de 24 horas.- Graham afirma que a los 17 años aprendería a construir LLMs desde cero y los entrenaría con el mejor hardware disponible.- Aclaró en el hilo que NO fundaría una startup a los 17: primero construiría una base de conocimiento profundo sobre LLMs.- Yann LeCun respondió con una postura opuesta: estudiar por qué un LLM no puede limpiar un cuarto, más allá de los transformers.- El intercambio reabre el debate entre dominar la arquitectura actual o buscar arquitecturas nuevas más allá de los LLMs.- nanoGPT y llm.c, proyectos de Andrej Karpathy, permiten entrenar un modelo tipo GPT desde cero con pocos cientos de líneas.- El paper 'Attention Is All You Need' (2017) sigue siendo la base técnica de todo LLM moderno, incluido GPT y Claude.- Para desarrolladores LATAM, el punto de partida realista son GPUs accesibles como Colab, Kaggle o vast.ai, no clusters propios.
Qué pasó
Todo arrancó con una pregunta simple que alguien le hizo a Paul Graham: qué haría si tuviera 17 años hoy. Su respuesta, publicada el 23 de agosto de 2026 en X, fue directa: aprendería a construir LLMs desde cero y entrenaría los modelos más potentes que pudiera con el hardware al que tuviera acceso. El tuit acumuló 642.800 reproducciones, 450 respuestas, 614 reposteos, 11.000 me gusta y 5.000 guardados en menos de un día, un nivel de alcance inusual incluso para alguien con la audiencia de Graham.
Dieciséis horas después amplió la idea en un segundo tuit: lo que NO haría es intentar fundar una startup a los 17. En sus palabras, construiría primero la base de conocimiento para fundar algo después, porque las ideas de negocio que surgen de entender los LLMs a fondo son categóricamente mejores que las que puede tener un adolescente con el conocimiento general que tenía él a esa edad.
La réplica más comentada llegó de Yann LeCun, que planteó el problema desde otro ángulo: intentaría entender por qué los LLMs pueden escribir ensayos pero no pueden limpiar una habitación, y usaría esa brecha como guía para estudiar en la universidad y el posgrado. Su propuesta apunta a arquitecturas y métodos que puedan aprender a actuar en el mundo físico con la misma rapidez con la que un LLM aprende patrones de texto, algo que los transformers actuales no resuelven bien.
Contexto e historia
Graham no es un académico de IA: es cofundador de Y Combinator y uno de los ensayistas más leídos del mundo de las startups, con textos como How to Start a Startup que marcaron a una generación de fundadores. Que su consejo para alguien de 17 años en 2026 sea aprender a construir LLMs desde cero en vez de programar aplicaciones o directamente fundar una empresa es un giro notable respecto a su propio discurso histórico, centrado en lanzar productos rápido y conseguir usuarios.
Yann LeCun, por su parte, es científico jefe de IA en Meta y uno de los tres investigadores que ganaron el Premio Turing 2018 por sentar las bases del deep learning moderno, junto a Geoffrey Hinton y Yoshua Bengio. Es también uno de los críticos más constantes de los límites de los LLMs actuales: sostiene desde hace años que el aprendizaje autorregresivo de texto no alcanza para construir sistemas con razonamiento físico o planificación real, y ha promovido públicamente arquitecturas alternativas centradas en modelos del mundo.
El contraste entre ambos no es solo una diferencia de opinión entre dos figuras influyentes: refleja una tensión real dentro de la comunidad de IA en 2026 sobre si la próxima década de progreso viene de escalar transformers o de buscar algo distinto.
Construir un LLM desde cero implica tokenizador, embeddings y atención.
Detalles técnicos y rendimiento
Cuando Graham dice "construir LLMs desde cero" no se refiere a usar una API, sino a implementar cada pieza del proceso: un tokenizador, una tabla de embeddings, capas de atención y un bucle de entrenamiento con descenso de gradiente. La referencia más citada para hacerlo en la práctica es nanoGPT, de Andrej Karpathy, un repositorio que reproduce la arquitectura de GPT-2 en pocos cientos de líneas de Python y PyTorch, y su versión aún más minimalista llm.c, que hace lo mismo en C puro sin depender de ningún framework.
El punto de partida de cualquier LLM es convertir texto en números. Un tokenizador de caracteres es la versión más simple posible:
# tokenizador de caracteres minimo, base de cualquier LLM desde cero
texto = open("corpus.txt", encoding="utf-8").read()
caracteres = sorted(set(texto))
stoi = {ch: i for i, ch in enumerate(caracteres)}
itos = {i: ch for ch, i in stoi.items()}
codificar = lambda s: [stoi[c] for c in s]
decodificar = lambda ids: "".join(itos[i] for i in ids)
datos = codificar(texto)
print(f"vocabulario: {len(caracteres)} simbolos, corpus: {len(datos)} tokens")
Esto convierte cada carácter del corpus en un entero. Los LLMs de producción usan tokenizadores por subpalabras (BPE), pero el principio, mapear símbolos a índices, es el mismo. Con esos índices como entrada, el siguiente bloque es el corazón de la arquitectura transformer: la autoatención causal.
import torch
import torch.nn as nn
class BloqueTransformer(nn.Module):
def __init__(self, dim_embedding=384, n_cabezas=6, contexto=256):
super().__init__()
self.atencion = nn.MultiheadAttention(dim_embedding, n_cabezas, batch_first=True)
self.norma1 = nn.LayerNorm(dim_embedding)
self.mlp = nn.Sequential(
nn.Linear(dim_embedding, 4 * dim_embedding),
nn.GELU(),
nn.Linear(4 * dim_embedding, dim_embedding),
)
self.norma2 = nn.LayerNorm(dim_embedding)
mascara = torch.triu(torch.ones(contexto, contexto), diagonal=1).bool()
self.register_buffer("mascara_causal", mascara)
def forward(self, x):
t = x.shape[1]
atn, _ = self.atencion(x, x, x, attn_mask=self.mascara_causal[:t, :t])
x = self.norma1(x + atn)
x = self.norma2(x + self.mlp(x))
return x
Este bloque es el ladrillo que se apila 6, 12 o hasta 96 veces según el tamaño del modelo. La máscara causal obliga a que cada token solo pueda "ver" los tokens anteriores, la propiedad que convierte a un transformer en un modelo autorregresivo como GPT, capaz de predecir el siguiente token uno a la vez. Esta misma idea, formalizada en el paper Attention Is All You Need de 2017, es la base técnica que comparten GPT, Claude y prácticamente todo LLM moderno.
RutaCuándo usarlaVentajaLimitaciónUsar una API (OpenAI, Anthropic)Construir un producto rápido sin tocar pesos del modeloCero infraestructura, resultados inmediatosNo enseña cómo funciona el modelo por dentroFine-tuning de un modelo abiertoAdaptar un LLM existente (Llama, Qwen) a un dominio propioRequiere mucho menos cómputo que entrenar desde ceroSigue dependiendo de decisiones de arquitectura ajenasConstruir desde cero (nanoGPT, llm.c)Aprender la arquitectura transformer a fondo, como sugiere GrahamEntendimiento profundo de tokenización, atención y entrenamientoExige GPU propia, tiempo y tolerancia a depurar gradientes
flowchart TD
A["Texto crudo"] --> B["Tokenizador BPE o caracteres"]
B --> C["Embeddings + posicion"]
C --> D["Bloques Transformer atencion y MLP"]
D --> E["Capa de salida logits"]
E --> F(("Prediccion del siguiente token"))
⚠️ Ojo: entrenar un LLM competitivo con GPT-5 o Claude no es viable con una sola GPU casera: la diferencia está en la escala de datos y cómputo, no solo en el código del modelo.
Cómo empezar/probarlo
El camino más corto para poner en práctica el consejo de Graham es clonar nanoGPT y entrenar un modelo pequeño sobre un corpus de juguete como tinyshakespeare. Los pasos son los mismos en Windows, macOS y Linux una vez que hay Python 3 y PyTorch instalados:
# Windows (PowerShell), macOS y Linux: mismos comandos con python3 en Unix
git clone https://github.com/karpathy/nanoGPT.git
cd nanoGPT
pip install torch numpy transformers datasets tiktoken wandb tqdm
# preparar el dataset de ejemplo (tinyshakespeare)
python data/shakespeare_char/prepare.py
# entrenar un modelo pequeño en CPU o GPU local
python train.py config/train_shakespeare_char.py --device=cpu --compile=False
En una laptop sin GPU el entrenamiento es lento pero funciona; en una GPU T4 gratuita de Google Colab o Kaggle Notebooks el mismo experimento baja de horas a minutos. Para modelos más grandes, servicios como vast.ai o RunPod alquilan GPUs por hora sin comprometer hardware propio, la ruta más realista para un desarrollador en LATAM que quiere experimentar sin comprar una tarjeta de $2.000.
Para confirmar que el entrenamiento realmente está aprendiendo, el script de nanoGPT imprime la pérdida (loss) cada cierto número de iteraciones: si baja de forma sostenida (por ejemplo de 4.5 a 1.8 en las primeras mil iteraciones sobre tinyshakespeare), el modelo está ajustando sus pesos correctamente. Generar texto de muestra con python sample.py --out_dir=out-shakespeare-char es la forma más directa de verificar que el modelo produce algo coherente con el corpus de entrenamiento.
💡 Tip: podés entrenar una versión pequeña de nanoGPT sobre tinyshakespeare gratis en una GPU T4 de Google Colab en menos de una hora, sin pagar nada.
Impacto y análisis
El tuit de Graham, más allá del alcance viral, pone en palabras una duda concreta que enfrentan muchos desarrolladores junior: si conviene volverse experto en usar APIs de IA para construir productos rápido, o invertir tiempo en entender la arquitectura transformer a fondo. Su argumento es que las mejores ideas de negocio de la próxima década van a salir de quienes entienden los LLMs por dentro, no de quienes solo saben llamarlos por API.
La respuesta de LeCun agrega un matiz importante: construir LLMs desde cero hoy significa reproducir una arquitectura de 2017 que ya está bien entendida, no necesariamente estar en la frontera de la investigación. Su apuesta personal, ligada a los modelos de mundo que ha defendido públicamente desde hace años, es que el próximo salto de capacidad no va a venir de escalar transformers sino de arquitecturas que aprendan de la interacción física con el entorno, no solo de texto.
Ninguna de las dos posturas es incompatible con la otra en la práctica: entender cómo funciona un transformer por dentro (tokenización, atención, entrenamiento) es la base necesaria para después poder cuestionar sus límites o proponer algo distinto, que es exactamente lo que LeCun sugiere hacer en la universidad. La diferencia real está en el orden y en el objetivo: Graham apunta a fundar algo con ese conocimiento, LeCun apunta a investigar más allá de él.
Qué sigue
El intercambio no cambia nada de forma inmediata en la industria, pero sí es un indicador de hacia dónde miran dos figuras influyentes en 2026: uno hacia la aplicación práctica de LLMs para fundar negocios, otro hacia la investigación de arquitecturas que superen sus límites actuales. Es esperable que ambas conversaciones sigan alimentando el crecimiento de recursos educativos abiertos como nanoGPT y llm.c, que ya son referencia estándar en cursos universitarios y bootcamps de machine learning.
Para un desarrollador que recién empieza, la conclusión práctica es menos dramática que el debate en X: tener la base técnica de cómo funciona un LLM (tokenización, atención, entrenamiento) es útil sin importar si el objetivo final es fundar una startup con esa base o investigar qué viene después de los transformers.
📖 Resumen en Telegram: Ver resumen.
Probalo vos: cloná nanoGPT y corré python train.py config/train_shakespeare_char.py hoy mismo para ver un LLM entrenándose desde cero en tu propia máquina.
Preguntas frecuentes
¿Qué significa exactamente "construir un LLM desde cero"?
Implementar cada componente del modelo (tokenizador, embeddings, bloques de atención, bucle de entrenamiento) en vez de usar una API o un modelo ya entrenado. Proyectos como nanoGPT y llm.c muestran el proceso completo en código legible.
¿Necesito una GPU cara para empezar?
No para un modelo pequeño de práctica. Google Colab y Kaggle Notebooks ofrecen GPUs gratuitas suficientes para entrenar un modelo tipo GPT sobre un corpus chico como tinyshakespeare en menos de una hora.
¿Qué es nanoGPT y quién lo hizo?
Es un repositorio open source de Andrej Karpathy (excientífico de OpenAI y Tesla) que reproduce la arquitectura de GPT-2 en pocos cientos de líneas de PyTorch, pensado como material educativo reproducible.
¿Por qué Yann LeCun no está de acuerdo con Paul Graham?
LeCun sostiene que los LLMs actuales, pese a escribir texto con fluidez, no resuelven bien tareas de razonamiento físico o planificación en el mundo real, y propone estudiar arquitecturas más allá de los transformers en vez de perfeccionar las actuales.
¿Sirve este consejo si ya no tengo 17 años?
Sí: la base técnica (tokenización, atención, entrenamiento) es la misma sin importar la edad. Lo que cambia es el horizonte de tiempo disponible para invertir en aprenderla antes de aplicarla a un proyecto concreto.
¿Dónde puedo aprender la arquitectura transformer paso a paso?
El paper original Attention Is All You Need, el código de nanoGPT y la documentación de PyTorch sobre atención multi-cabeza son el punto de partida más directo.
Referencias
- Tuit original de Paul Graham en X: la publicación del 23 de agosto de 2026 sobre qué haría a los 17 años.- nanoGPT en GitHub: implementación educativa de un modelo tipo GPT-2 en PyTorch.- Attention Is All You Need (arXiv, 2017): el paper que introdujo la arquitectura transformer.- Documentación de PyTorch sobre MultiheadAttention: referencia técnica del módulo de atención usado en el ejemplo.
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
Top comments (0)