your system language is:English

ARC Prize 2025: Estrategia de The Architects con LLMs

Cover

📺 Vídeo de estudio recomendado hoy: https://www.youtube.com/watch?v=CcoGi47qD-w


El Secreto tras “The Architects”: Cómo los Campeones de ARC Potencian LLMs con Difusión y Perspectiva

El equipo ganador del ARC Prize 2024 regresa al podio en 2025 con una evolución radical de su arquitectura de razonamiento. En esta entrevista, revelan cómo pasaron de modelos secuenciales a sistemas de difusión enmascarada capaces de corregirse a sí mismos en tiempo real.

Pregunta central: ¿Es posible que un modelo de lenguaje aprenda a razonar de forma espacial mediante el refinamiento iterativo y la combinación de perspectivas matemáticas?

Puntos clave

  • Transición de LLMs autorregresivos a modelos de difusión enmascarada (arquitectura Lada).
  • Implementación de codificaciones posicionales 2D “Golden Gate” para capturar la geometría de las cuadrículas.
  • Aplicación del método “Product of Experts” para filtrar soluciones correctas desde múltiples ángulos.
  • Uso de muestreo recursivo y mezcla de tokens para lograr la convergencia de la respuesta final.

⏱️ Tiempo de lectura: aprox. 5 minutos · Te ahorra unos 34 minutos frente a ver el vídeo.

¿Quieres tomar notas mientras ves el vídeo? Haz clic en la imagen de abajo y deja que AI Notebook extraiga los puntos clave por ti 👇

AI Notebook


Evolución del Enfoque: De 2024 a la Difusión Enmascarada

Superando las limitaciones del texto unidimensional

El equipo “The Architects”, tras su victoria en 2024, decidió no dormirse en los laureles y enfrentó el desafío de 2025 con una mentalidad experimental profunda. Aunque inicialmente reutilizaron su código optimizado para asegurar el liderato, pronto identificaron que las limitaciones intrínsecas de los LLMs autorregresivos —su naturaleza lineal y falta de visión espacial— requerían un cambio total hacia modelos de difusión.

La difusión enmascarada permite al modelo generar y refinar múltiples piezas de la solución de forma simultánea, en lugar de predecir palabra por palabra.

Para lograr esto, adoptaron una arquitectura llamada Lada, una variante de Llama que utiliza tokens de máscara para permitir que el modelo “piense” en el espacio de la cuadrícula de manera no lineal. Este enfoque transformó el problema de una simple predicción secuencial a un proceso de refinamiento de imagen, donde el modelo puede proponer una solución temporal y luego iterar sobre sus propios aciertos y errores hasta alcanzar la coherencia visual necesaria.

Functional flowchart showing the transition from 1D autoregressive token generation to a 2D Masked Diffusion LLM process where multiple tokens are refined simultaneously.

💡 Profundizando

Q: ¿Por qué abandonar el modelo que ya les dio la victoria el año pasado?
A: Porque el modelo autorregresivo estándar tiene problemas graves con el razonamiento 2D y no puede “volver atrás” para corregir un error cometido al inicio de la secuencia.

Q: ¿Qué ventaja real ofrece el modelo “Lada”?
A: Permite generar cientos de tokens a la vez y refinarlos, facilitando que el modelo cree una solución temporal y la mejore progresivamente.


Geometría y Razonamiento: El “Golden Gate” de ARC

Codificación posicional para un mundo bidimensional

Uno de los cambios más técnicos y efectivos de este año fue la modificación de cómo el modelo entiende dónde está cada píxel en la cuadrícula. Los modelos tradicionales ven los datos como una fila larga de información, lo que destruye las relaciones espaciales verticales o diagonales, por lo que el equipo implementó una codificación posicional 2D avanzada.

Utilizaron la técnica “Golden Gate”, donde el espaciado entre los ángulos de visión sigue la proporción áurea.

Este sistema permite que cada neurona del modelo pueda “mirar” en prácticamente cualquier dirección de la imagen, ya sea arriba, abajo o en ángulos complejos. Gracias a esto, el modelo dejó de tratar los acertijos de ARC como simples problemas de texto y empezó a interpretarlos como estructuras geométricas con simetría y patrones espaciales integrados.

Diagram of Golden Gate positional encoding showing 2D grid tokens with vectors pointing in multiple directions (X, Y, and diagonals) based on the golden ratio.

💡 Profundizando

Q: ¿Qué es la codificación “Golden Gate”?
A: Es un sistema de vectores de posición que utiliza la razón áurea para que el modelo pueda atender a cualquier dirección espacial de manera eficiente.

Q: ¿Ayudó esto a mejorar la puntuación de forma drástica?
A: Proporcionó una mejora constante sobre la línea base, permitiendo que el modelo comprendiera mejor las rotaciones y simetrías en los datos de entrenamiento.


El Poder de la Recurrencia y el Producto de Expertos

Cuando el modelo se convierte en su propio juez

El equipo descubrió, casi por accidente en las últimas semanas, que el modelo podía alimentarse de sus propios resultados para mejorar. Al mezclar tokens de colores con tokens de máscara y reinyectar esa información en el sistema unas 30 o 40 veces, el modelo lograba converger hacia una solución que antes parecía imposible de alcanzar mediante un solo intento.

Esta técnica de muestreo recursivo no fue planeada desde el inicio, sino que surgió al observar cómo el modelo interpretaba las “mezclas de incertidumbre”.

Complementaron esto con el “Product of Experts”, una idea clásica de Geoffrey Hinton que el equipo redescubrió. En lugar de simplemente sumar probabilidades, multiplican las puntuaciones del modelo desde diferentes perspectivas; si una solución parece incorrecta desde un solo ángulo, su probabilidad cae drásticamente, permitiendo que solo las respuestas verdaderamente robustas sobrevivan al proceso de filtrado final.

Architecture diagram showing a recursive feedback loop where a generated grid is mixed with mask tokens and fed back into the LLM for 30-40 iterations until convergence.

💡 Profundizando

Q: ¿Cómo funciona el “Product of Experts” en la práctica?
A: El modelo evalúa un candidato desde varias perspectivas; si falla en una sola, el producto de las probabilidades se hunde, eliminando errores que una suma ignoraría.

Q: ¿El modelo fue entrenado específicamente para ser recursivo?
A: No, fue una capacidad emergente que descubrieron al experimentar con la entrada de tokens mixtos durante la fase de inferencia en Kaggle.


Conclusiones clave

El éxito de “The Architects” en el ARC Prize 2025 demuestra que ganar no se trata solo de tener más potencia de cálculo, sino de entender profundamente la naturaleza del problema. Su transición hacia la difusión y las codificaciones 2D refleja una tendencia necesaria en la IA: movernos del procesamiento de lenguaje puro hacia arquitecturas que respeten la estructura del mundo físico y visual.

A pesar de que el entrenamiento de datos sintéticos no ofreció los resultados esperados, su enfoque en la robustez del muestreo y el filtrado matemático (Product of Experts) les permitió mantenerse en la cima frente a equipos con recursos masivos. La comunidad de ARC se beneficia enormemente de este tipo de investigaciones abiertas, que sirven como base para los futuros desafíos en la búsqueda de la Inteligencia General Artificial.


Preguntas y Respuestas

Q1: ¿Quiénes integran el equipo “The Architects”?
A: Jan Tsov, Daniel Fransson y David Hartman, investigadores y estudiantes de doctorado de la Universidad de Mainz, Alemania.

Q2: ¿En qué consiste su nueva arquitectura “Lada”?
A: Es una modificación de Llama diseñada para la difusión enmascarada, permitiendo al modelo predecir y corregir bloques enteros de píxeles simultáneamente.

Q3: ¿Qué es el enfoque “Product of Experts”?
A: Es un método matemático donde se multiplican las probabilidades de diferentes predicciones para penalizar fuertemente cualquier solución que sea inconsistente en alguna de sus perspectivas.

Q4: ¿Cómo manejaron las restricciones de computación de Kaggle?
A: Optimizamos el código con decodificación especulativa y prefix caching para que los modelos de difusión pudieran realizar múltiples iteraciones dentro del tiempo límite.

Q5: ¿Qué papel jugaron los datos sintéticos este año?
A: David creó generadores de juegos tipo “Arcade” para aumentar los datos, pero aunque fueron interesantes, no mejoraron la puntuación tanto como el ajuste fino de la arquitectura.

Q6: ¿Por qué la recurrencia fue tan importante al final?
A: Porque permitió que el modelo refinara su propia incertidumbre, convergiendo en la solución correcta tras pasar la misma salida por la entrada unas 40 veces.

Q7: ¿Qué consejo dan a los nuevos participantes?
A: Empezar a enviar soluciones a Kaggle temprano para entender la infraestructura y no subestimar el poder de iterar sobre las soluciones de código abierto de otros equipos.

Leave a Reply

Your email address will not be published. Required fields are marked *

Related Posts