
📺 Vídeo de estudio recomendado hoy: https://www.youtube.com/watch?v=ETZfkkv6V7Y
El camino hacia una inteligencia de nivel humano: por qué los LLM no son la respuesta
La inteligencia artificial actual, aunque impresionante, carece de la comprensión del mundo físico que posee incluso un gato doméstico. Yann LeCun, jefe de IA en Meta y premio Turing, sostiene que para alcanzar una inteligencia verdadera debemos abandonar el paradigma de la predicción de palabras y movernos hacia modelos que aprendan observando la realidad.
Pregunta central: ¿Cómo podemos construir máquinas que razonen, planifiquen y entiendan el mundo físico más allá de las limitaciones estadísticas de los modelos de lenguaje actuales?
Puntos clave
- Los modelos de lenguaje autorregresivos (LLM) están “condenados” debido a la acumulación exponencial de errores en la predicción de secuencias.
- Existe una disparidad masiva de datos: un niño de cuatro años ha procesado mucha más información visual que todo el texto disponible en internet.
- La solución reside en la Arquitectura Predictiva de Incrustación Conjunta (JEPA) y en el aprendizaje no generativo.
- Debemos transitar de la IA reactiva (Sistema 1) a una IA impulsada por objetivos e inferencia por optimización (Sistema 2).
⏱️ Tiempo de lectura: aprox. 8 minutos · Te ahorra unos 48 minutos frente a ver el vídeo.
¿Quieres tomar notas mientras ves el vídeo? Haz clic en la imagen de abajo y deja que AI Notebook extraiga los puntos clave por ti 👇
El colapso de la profecía del lenguaje
La trampa de la autorregresión y la paradoja de Moravec
Los modelos de lenguaje actuales funcionan prediciendo el próximo token en una secuencia, un proceso puramente estadístico que, según LeCun, tiene un defecto fatal. Al ser un proceso divergente, cualquier pequeña probabilidad de error se acumula exponencialmente a medida que la respuesta crece. Esto significa que, por diseño, los LLM siempre tenderán a la alucinación o al sinsentido en tareas largas; no es un problema que se solucione simplemente con más datos, sino una limitación matemática de la arquitectura autorregresiva.
A pesar de que estos sistemas pueden aprobar el examen de abogacía o resolver integrales, fallan estrepitosamente en tareas que un niño de diez años realiza sin esfuerzo, como recoger la mesa o llenar el lavavajillas.
Esta es la paradoja de Moravec: lo que es difícil para los humanos (ajedrez, cálculo) es fácil para las máquinas, pero lo que es trivial para nosotros (sentido común físico) es casi imposible para la IA actual. La razón es simple: el mundo físico es infinitamente más complejo que el lenguaje y requiere una comprensión causal que no se encuentra en las bibliotecas de texto.

💡 Profundizando
Q: ¿Por qué LeCun dice que los LLM están “condenados”?
A: Porque la probabilidad de que una secuencia larga sea correcta decae exponencialmente con su longitud debido a la acumulación de errores independientes.
Q: ¿Qué es la “AMI”?
A: Advanced Machine Intelligence (Inteligencia de Máquina Avanzada), un término que prefiere sobre AGI porque considera que la inteligencia humana no es “general”, sino especializada.
Q: ¿Cuánta información consume un niño frente a una IA?
A: Un niño de 4 años ha visto 10^14 bytes de datos sensoriales, una cantidad órdenes de magnitud superior a todo el texto que un LLM pueda leer en 100,000 años.
Arquitectura para una mente sintética
De modelos generativos a modelos de mundo
Para que una IA sea verdaderamente inteligente, necesita un “modelo de mundo” interno que le permita predecir las consecuencias de sus acciones antes de ejecutarlas. LeCun propone una arquitectura cognitiva compuesta por varios módulos: percepción, memoria a corto plazo, modelo de mundo y un configurador. La clave aquí es que la IA no debería simplemente reaccionar a un estímulo, sino utilizar la inferencia por optimización para encontrar una secuencia de acciones que minimice un costo o alcance un objetivo específico.
Este enfoque se basa en los “Modelos Basados en Energía” (EBM), donde el sistema busca el estado de menor energía, es decir, la configuración más compatible entre lo que sabe y lo que desea lograr.
Es un cambio radical de paradigma: pasamos de redes neuronales que simplemente transforman una entrada en una salida, a sistemas que “piensan” resolviendo un problema de optimización interno antes de actuar. Esto permitiría a las máquinas realizar planificación jerárquica, descomponiendo una meta compleja —como viajar de Nueva York a París— en subtareas manejables, algo que ningún modelo de IA actual puede hacer de forma autónoma.

💡 Profundizando
Q: ¿Cuál es la diferencia entre Sistema 1 y Sistema 2 en IA?
A: El Sistema 1 es instintivo y rápido (redes neuronales clásicas); el Sistema 2 es deliberativo y requiere planificación mediante optimización.
Q: ¿Qué hace el “Modelo de Mundo”?
A: Predice el estado futuro del entorno basándose en una hipótesis de acción, permitiendo al sistema “simular” mentalmente.
Q: ¿Por qué es necesaria la planificación jerárquica?
A: Porque permite gestionar la incertidumbre a diferentes escalas de tiempo, desde el control muscular milimétrico hasta la logística de un viaje internacional.
JEPA: El fin de la IA Generativa
Predicción en el espacio de representaciones
LeCun es tajante: debemos abandonar la IA Generativa (GenAI) si queremos alcanzar la inteligencia de nivel humano. El problema de intentar predecir cada píxel de un video es que el mundo es intrínsecamente impredecible en sus detalles finos. Si intentas predecir el futuro exacto de un video, obtendrás una imagen borrosa porque el sistema promedia todas las posibilidades. La solución es JEPA (Joint Embedding Predictive Architecture).
En lugar de predecir píxeles, JEPA predice “representaciones abstractas”. Es como si el sistema aprendiera a ignorar el movimiento irrelevante de las hojas de un árbol para concentrarse en que el árbol sigue ahí y es un obstáculo.
Para entrenar estos sistemas sin que colapsen —un problema donde la red decide que todas las representaciones sean iguales para que la predicción sea “fácil”— LeCun utiliza métodos de regularización como VicReg. Esta técnica obliga a las representaciones a ser variadas y a no estar correlacionadas, maximizando el contenido de información sin necesidad de ejemplos negativos costosos. El resultado son sistemas que aprenden física intuitiva, como entender que un objeto no debe flotar, simplemente observando videos de la realidad.

💡 Profundizando
Q: ¿Por qué las predicciones generativas de video suelen ser borrosas?
A: Porque el sistema no puede saber el detalle exacto del futuro y matemáticamente opta por la media de todas las posibilidades, lo que resulta en falta de nitidez.
Q: ¿Qué significa “colapso” en una red neuronal?
A: Es cuando la red aprende una solución trivial (como dar siempre la misma respuesta) para minimizar el error, perdiendo toda utilidad.
Q: ¿Cómo ayuda VicReg a la IA?
A: Mantiene la varianza de las variables alta y decodifica las correlaciones, forzando a la red a extraer características informativas y únicas del mundo.
Conclusiones clave
El futuro de la inteligencia artificial no reside en escalar los modelos actuales con más GPUs y más texto, sino en un cambio fundamental de arquitectura. Debemos alejarnos de la obsesión por lo generativo y lo probabilístico para abrazar modelos basados en energía que puedan razonar y planificar. La verdadera frontera es el aprendizaje autosupervisado a partir de video, permitiendo que las máquinas adquieran el “sentido común” que hoy solo poseen los animales y humanos.
Si logramos que las máquinas aprendan modelos de mundo eficientes, no solo tendremos mejores asistentes virtuales, sino robots capaces de interactuar con nuestro entorno físico de forma segura y autónoma. Este camino requiere que la comunidad científica regrese a los fundamentos de la teoría de control y la optimización, herramientas que serán el motor de la próxima gran revolución en la IA.
Preguntas y Respuestas
Q1: ¿Por qué LeCun propone abandonar el Aprendizaje por Refuerzo (RL)?
A1: Porque el RL es extremadamente ineficiente en términos de muestras; requiere millones de intentos para aprender algo sencillo, mientras que un modelo de mundo permite aprender con muy poca interacción.
Q2: ¿Qué es el “sentido común” en términos de IA?
A2: Es la capacidad de predecir las propiedades básicas del mundo físico, como la gravedad, la inercia y la permanencia de los objetos, algo que se aprende por observación.
Q3: ¿Es peligrosa la IA de nivel humano?
A3: LeCun argumenta que si diseñamos sistemas impulsados por objetivos con “barreras de seguridad” (costos) integradas en su optimización, serán más seguros y controlables que los LLM actuales.
Q4: ¿Cuál es el papel del código abierto en este desarrollo?
A4: Es vital. LeCun cree que la infraestructura básica de la IA debe ser abierta para garantizar que sea diversa, segura y que no esté controlada por un pequeño grupo de empresas.
Q5: ¿Puede un LLM aprender a conducir un coche?
A5: No de forma segura. Conducir requiere un modelo predictivo del mundo físico y una toma de decisiones en tiempo real que el razonamiento basado en tokens no puede gestionar con fiabilidad.
Q6: ¿Qué consejo da LeCun a los estudiantes de doctorado?
A6: Que no trabajen en LLMs, ya que las grandes empresas tienen demasiada ventaja en ese campo; en su lugar, deben investigar modelos de mundo y planificación.
