
📺 Vídeo de estudio recomendado hoy: https://www.youtube.com/watch?v=IHikLL8ULa4
¿Por qué la IA “entiende” de repente? Descifrando el misterio del Grokking
El fenómeno del grokking parece magia: un modelo de IA entrena durante horas memorizando datos sin aprender nada útil y, de repente, “hace clic” para alcanzar una precisión perfecta. Este artículo desglosa cómo la interpretabilidad mecanicista permite abrir la caja negra y observar los engranajes matemáticos que giran durante ese momento de revelación.
Pregunta central: ¿Qué ocurre realmente dentro de una red neuronal cuando pasa de la memorización bruta a la comprensión de las reglas lógicas subyacentes?
Puntos clave
- El grokking es una transición de fase donde la generalización surge tras una larga meseta de memorización aparente.
- Los modelos no aprenden a sumar de forma tradicional, sino que desarrollan algoritmos basados en trigonometría y rotaciones en el círculo unidad.
- La generalización no es un salto súbito, sino un proceso interno continuo que puede medirse antes de que se refleje en la precisión.
- La regularización, como el weight decay, es el motor crítico que obliga al modelo a preferir soluciones simples y generalizables sobre la memorización.
⏱️ Tiempo de lectura: aprox. 8 minutos · Te ahorra unos 35 minutos frente a ver el vídeo.
¿Quieres tomar notas mientras ves el vídeo? Haz clic en la imagen de abajo y deja que AI Notebook extraiga los puntos clave por ti 👇
El misterio del “clic” algorítmico
El grokking ocurre típicamente en tareas matemáticas simples, como la suma modular. Imagina entrenar a un modelo con solo el 30% de una tabla de sumar; al principio, el modelo simplemente memoriza esos ejemplos específicos, fallando estrepitosamente en cualquier dato nuevo. Sin embargo, si continúas el entrenamiento mucho más allá del punto de “ajuste perfecto” en el entrenamiento, la precisión en los datos de prueba salta repentinamente de cero al 100%.
Este comportamiento desafía la intuición clásica del aprendizaje automático.
Normalmente esperaríamos que un modelo que ya ha memorizado sus datos de entrenamiento dejara de aprender o empezara a sobreajustarse negativamente, pero aquí ocurre lo contrario. El modelo descubre una estructura latente en los datos que es mucho más eficiente que la memorización pura. Es un recordatorio de que las redes neuronales no son solo bases de datos estadísticas, sino sistemas dinámicos que buscan la solución de menor energía —o en este caso, de menor complejidad—.

💡 Profundizando
Q: ¿Es el grokking lo mismo que el “double descent”?
A: No exactamente, aunque son parientes. El double descent suele depender del tamaño del modelo o de la cantidad de datos, mientras que el grokking es una función puramente del tiempo de entrenamiento sobre el mismo conjunto de datos estático.
Q: ¿Por qué el optimizador Adam es tan relevante aquí?
A: Adam tiene “memoria” de los gradientes pasados a través de sus hiperparámetros beta. Si los gradientes cambian drásticamente durante el descubrimiento del algoritmo, una memoria demasiado larga puede retrasar la caída de la pérdida de prueba durante miles de pasos.
Q: ¿Se puede lograr grokking sin regularización?
A: Es extremadamente difícil. La regularización (como el weight decay) actúa como una presión evolutiva que penaliza los pesos grandes y complejos típicos de la memorización, forzando al modelo a encontrar el “algoritmo elegante”.
La geometría oculta: Rotaciones y círculos
Al abrir el modelo de una sola capa entrenado para suma modular, los investigadores descubrieron algo fascinante: el modelo no estaba “contando”. En su lugar, proyectaba los números en un círculo unidad mediante funciones trigonométricas. Para sumar $A + B$, el modelo simplemente rotaba un vector la distancia correspondiente a $A$ y luego otra distancia correspondiente a $B$.
La aritmética modular es, por definición, circular.
Si sumas en base 113, al llegar a 114 vuelves al 1. El modelo entiende esto de forma nativa transformando los números en ángulos. Al usar frecuencias de Fourier, el modelo puede representar esta circularidad sin preocuparse por los errores de acarreo o la magnitud de los números, lo que demuestra una sofisticación matemática que nadie le programó explícitamente.
Esta solución es “Galaxy Brained”. Es un algoritmo que un humano podría haber diseñado, pero que la red neuronal encontró por sí misma simplemente intentando reducir su norma de pesos. Los pesos necesarios para representar una rotación circular son mucho más pequeños y estables que los pesos necesarios para memorizar miles de entradas individuales en una tabla de búsqueda.

💡 Profundizando
Q: ¿Por qué el modelo usa trigonometría en lugar de lógica lineal?
A: Porque la lógica lineal es ineficiente para representar la naturaleza periódica del módulo. Las ondas senoidales y cosenoidales son la base natural para cualquier operación que “de la vuelta” al llegar a un límite.
Q: ¿Cómo se detectó este algoritmo internamente?
A: Mediante transformadas de Fourier aplicadas a los pesos de la red. Se observaron picos claros en frecuencias específicas que correspondían exactamente a las rotaciones necesarias para resolver el problema.
Medidas de progreso: Visualizando lo invisible
Uno de los mayores aportes de esta investigación es la creación de “medidas de progreso”. Estas métricas permiten ver que el modelo está aprendiendo el algoritmo correcto mucho antes de que la precisión mejore. Existen dos fases críticas identificadas: la formación del circuito y la fase de limpieza.
Durante la meseta de pérdida, el modelo está en una lucha interna.
Por un lado, tiene un “circuito de memorización” que funciona pero es pesado. Por otro, está construyendo lentamente un “circuito de generalización” basado en el algoritmo trigonométrico. La métrica de Excluded Loss muestra que el modelo empieza a depender del circuito algorítmico mucho antes de que el usuario vea resultados en el test set.
Finalmente, ocurre la “limpieza”. El circuito de generalización se vuelve tan eficiente que el modelo decide descartar por completo la memorización para reducir su complejidad total. En ese instante, la precisión de prueba se dispara. El grokking no es un salto cuántico de ignorancia a conocimiento, sino el momento en que una solución superior finalmente gana la carrera armamentista interna.

💡 Profundizando
Q: ¿Qué es la “Restricted Loss”?
A: Es una métrica donde eliminamos artificialmente el circuito de memorización y medimos qué tan bien lo haría el modelo solo con su incipiente lógica algorítmica. Sorprendentemente, esta métrica es suave y predecible.
Q: ¿Podemos predecir cuándo ocurrirá el grokking?
A: Todavía no con precisión absoluta, pero estas medidas de progreso sugieren que en el futuro podríamos extrapolar las curvas para saber si un modelo eventualmente “entenderá” la tarea o si está perdiendo el tiempo.
Conclusiones clave
El estudio del grokking a través de la interpretabilidad mecanicista nos enseña que las redes neuronales no son cajas negras impenetrables, sino sistemas que prefieren la elegancia matemática cuando se les presiona adecuadamente. Lo que percibimos como una epifanía súbita de la IA es, en realidad, la culminación de un proceso de optimización lento y constante donde una solución general y simple termina desplazando a la memorización ruidosa.
Aunque estos experimentos se realizan en modelos de juguete, las implicaciones para la seguridad y el entrenamiento de grandes modelos lingüísticos (LLM) son profundas. Si el aprendizaje de capacidades complejas o comportamientos emergentes sigue esta dinámica de “transición de fase”, entender las señales internas de progreso será vital para anticipar cuándo un modelo está a punto de adquirir una nueva habilidad, ya sea deseada o peligrosa.
La ciencia de la interpretabilidad está pasando de simplemente “mirar los pesos” a realizar una verdadera ingeniería inversa de algoritmos aprendidos. Este camino promete convertir la alquimia del entrenamiento de modelos en una disciplina de ingeniería mucho más predecible y transparente.
Preguntas y Respuestas
Q1: ¿Por qué el grokking ocurre solo con pocos datos?
A1: Si tienes demasiados datos, la generalización es la ruta más rápida desde el principio. Si tienes muy pocos, la memorización es siempre más barata. El grokking ocurre en el “punto Ricitos de Oro” donde la generalización es ligeramente mejor pero más difícil de encontrar inicialmente.
Q2: ¿Qué papel juega el ruido en este proceso?
A2: El ruido inicial y la inicialización aleatoria pueden determinar qué frecuencias de Fourier descubre el modelo primero, lo que explica por qué diferentes semillas aleatorias tardan tiempos muy distintos en hacer grok.
Q3: ¿Podría un modelo grokear conceptos éticos o de seguridad?
A3: Es una posibilidad teórica. Si un comportamiento (como la honestidad) es más “simple” de representar algorítmicamente que una red compleja de mentiras, el modelo podría grokear esa simplicidad bajo la presión de la regularización.
Q4: ¿Cómo afecta el tamaño del modelo al grokking?
A4: Los modelos más grandes (sobreparametrizados) tienden a memorizar más rápido, lo que a menudo hace que el proceso de grokking sea más dramático, ya que tienen más espacio para “esconder” el circuito de memorización mientras construyen el generalizable.
Q5: ¿Es útil el grokking en la práctica industrial actual?
A5: No directamente, ya que preferimos modelos que generalicen desde el paso uno. Sin embargo, entenderlo nos ayuda a diagnosticar por qué ciertos modelos fallan en tareas lógicas a pesar de tener una pérdida de entrenamiento baja.
Q6: ¿Qué es lo más sorprendente del algoritmo de rotación descubierto?
A6: Que el modelo utiliza múltiples frecuencias a la vez. No solo rota en un círculo, sino que utiliza varios “armónicos” para asegurar que la suma modular sea robusta y precisa, similar a cómo funciona el procesamiento de señales en ingeniería.
