
📺 Vídeo de estudio recomendado hoy: https://www.youtube.com/watch?v=aiR7F4jqjXY
Modelos que nunca dejan de aprender: La visión de Ngram sobre la memoria en IA
¿Y si el secreto para una IA verdaderamente útil no fuera una ventana de contexto más grande, sino una memoria que vive profundamente en los pesos del modelo? Don Biederman y Jesse Lin, fundadores de Ngram, proponen un futuro donde el pre-entrenamiento nunca termina y los modelos evolucionan diariamente junto con los datos privados de cada empresa.
Pregunta central: ¿Cómo podemos superar las limitaciones del RAG y el diseño de prompts mediante el aprendizaje continuo y la internalización de contextos específicos en los pesos de la red neuronal?
Puntos clave
- El aprendizaje continuo y la memoria son dos caras de la misma moneda: aprender cosas nuevas e integrarlas profundamente.
- La dependencia excesiva de la “ingeniería de contexto” (RAG) es costosa, ineficiente y limita la capacidad asociativa de los modelos actuales.
- La neurociencia sugiere que la memoria debe ser selectiva y “con pérdida” para permitir la formación de conceptos abstractos y pensamientos complejos.
- El futuro de la IA no es un único modelo gigante para todos, sino una red de modelos personalizados y especializados para cada equipo o individuo.
⏱️ Tiempo de lectura: aprox. 7 minutos · Te ahorra unos 38 minutos frente a ver el vídeo.
¿Quieres tomar notas mientras ves el vídeo? Haz clic en la imagen de abajo y deja que AI Notebook extraiga los puntos clave por ti 👇
Más allá del RAG: El modelo como empleado veterano
El fin de los “prompts” monstruosos y la búsqueda de la memoria interna
Ngram nace con una premisa radical: no ven el mundo a través de la lente del pre-entrenamiento o post-entrenamiento, sino que sus modelos están siempre en fase de entrenamiento.
Actualmente, las empresas intentan dar contexto a la IA mediante “ingeniería de contexto”, lo que resulta en prompts masivos de miles de tokens que el modelo debe procesar una y otra vez, desperdiciando una cantidad ingente de cómputo y dinero en cada consulta.
Lo que Ngram propone es entrenar modelos específicos por equipo que internalicen los procesos, la cultura y el conocimiento de la empresa, de la misma forma que un empleado humano que lleva años en la compañía no necesita consultar un manual cada vez que toma una decisión.
Esta internalización ocurre a nivel de pesos mediante técnicas de ajuste con adaptadores (como LoRA), permitiendo que la IA desarrolle “instinto” sobre el dominio específico en lugar de simplemente buscar en una base de datos externa.

💡 Profundizando
Q: ¿Por qué no es suficiente con una ventana de contexto gigante?
A: Porque buscar y re-leer millones de tokens es extremadamente costoso y difícil para el modelo; la verdadera inteligencia requiere asociaciones que solo ocurren cuando el conocimiento está integrado.
Q: ¿Qué herramientas técnicas utiliza Ngram para este aprendizaje continuo?
A: Utilizan una combinación de ajuste de adaptadores (LoRA), destilación en política (on-policy distillation) y filtrado de datos para convertir interacciones crudas en señales de entrenamiento útiles.
Q: ¿Es esto un “RAG-killer” (asesino del RAG)?
A: En gran medida sí, especialmente para tareas repetitivas o conocimientos estructurales que no deberían consumirse como contexto externo en cada pasada de inferencia.
La Neurociencia de la IA y el valor de olvidar
El misterio de la memorización frente al aprendizaje de habilidades
Don Biederman, con formación en neurociencia, argumenta que la separación entre “aprender hechos” y “aprender algoritmos” es una falsa dicotomía que el aprendizaje profundo ha fusionado de forma mágica.
La memoria humana es intrínsecamente “con pérdida” porque la inteligencia depende de comprimir lo que es importante y descartar el ruido, un proceso que permite la abstracción necesaria para el pensamiento profundo.
Si una IA necesita buscar cada dato básico antes de razonar, su capacidad de pensamiento complejo se ve limitada, de la misma forma que un humano no puede resolver ecuaciones complejas si tiene que buscar cómo sumar en cada paso.
Internalizar ciertos datos en los pesos permite que el modelo use su capacidad de cómputo para asociaciones de alto nivel en lugar de gastarla en la simple recuperación de información básica que debería ser instintiva.
💡 Profundizando
Q: ¿Es malo que los modelos memoricen que la capital de Francia es París?
A: No necesariamente, ya que se necesita recordar conceptos básicos para componer pensamientos más abstractos, aunque el reto es decidir qué datos merecen ocupar capacidad neuronal.
Q: ¿Cómo se decide qué información debe ser “internalizada” en los pesos?
A: Es un problema abierto, pero la clave está en filtrar datos que tengan valor a largo plazo y descartar lo efímero, como el número de habitación de un hotel donde estuviste hace un año.
El futuro: Un modelo propio para cada individuo
De la IA genérica a la inteligencia personalizada y privada
El paradigma de los grandes laboratorios de frontera es crear un modelo único, cada vez más inteligente, que sirva para todo el mundo, pero Ngram apuesta por una fragmentación necesaria.
Muchos de los datos que realmente hacen útil a una IA son privados, específicos de una empresa o incluso contradictorios con la forma en que otras personas prefieren trabajar, lo que hace imposible un modelo genérico perfecto.
En lugar de un gran cerebro central, Ngram visualiza un mundo donde cada equipo en Notion, Microsoft o Harvey tiene su propio adaptador que evoluciona con cada clic, documento y conversación.
Esta visión transforma la IA de ser una herramienta estadística a ser una verdadera “interfaz neuronal” con los datos, donde la estructura de archivos se reemplaza por un estado mental del modelo que conoce la información de forma asociativa.
💡 Profundizando
Q: ¿Funcionará esto con modelos cerrados como GPT-4?
A: Es más sencillo con modelos de código abierto porque se requiere acceso a los pesos (“white-box access”), aunque es posible colaborar con proveedores de modelos cerrados.
Q: ¿Podremos llevarnos nuestra “memoria de IA” de un trabajo a otro?
A: Es una posibilidad fascinante; llevar un conjunto de habilidades digitales sanitizadas sin violar la propiedad intelectual de la empresa anterior, similar a como los humanos llevan su experiencia.
Q: ¿Cuál es el mayor beneficio inmediato de este enfoque?
A: La reducción drástica de costes de inferencia, ya que el modelo no necesita leer los mismos archivos una y otra vez en cada consulta de la empresa.
Conclusiones clave
El aprendizaje continuo no es solo una mejora incremental, sino un cambio fundamental en cómo interactuamos con la inteligencia artificial. Al mover el conocimiento desde la ventana de contexto hacia los pesos del modelo, pasamos de una herramienta que “lee sobre nosotros” a una que “nos conoce”.
La eficiencia del KV Cache actual es un obstáculo físico para la IA a gran escala; comprimir ese conocimiento en redes neuronales específicas para cada equipo es la única forma de escalar la utilidad sin que los costes de computación colapsen el sistema.
Finalmente, la integración de la IA en el flujo de trabajo diario permitirá que, por primera vez, el tiempo que invertimos en enseñar a una máquina se traduzca directamente en una mejora tangible de su rendimiento, creando un ciclo de retroalimentación donde la IA se vuelve más capaz cuanto más la usamos.
Preguntas y Respuestas
Q1: ¿Por qué Ngram dice que sus modelos están “siempre entrenando”?
A1: Porque creen que el aprendizaje no debe detenerse tras el post-entrenamiento; los modelos deben digerir constantemente los nuevos datos y el feedback de los usuarios para evolucionar su contexto interno.
Q2: ¿Cuál es el problema con el almacenamiento de archivos tradicional para una IA?
A2: El problema no es guardar la información, sino cómo “interpelarla”; los sistemas de recuperación actuales carecen de la intuición necesaria para saber qué buscar, algo que solo se logra con memoria integrada en los pesos.
Q3: ¿Cómo afecta la neurociencia al diseño de Ngram?
A3: Se inspira en cómo el cerebro humano usa representaciones “difusas” para formar conexiones y abstracciones, en lugar de ser un almacén de datos perfecto pero rígido como un ordenador tradicional.
Q4: ¿Qué es el “momento ChatGPT de la memoria”?
A4: Sería el punto donde un usuario nota que su IA es visiblemente más inteligente y capaz que el día anterior gracias a lo aprendido durante la jornada, comportándose como un becario que realmente progresa.
Q5: ¿Por qué el lenguaje ha superado a la visión en el progreso de la IA?
A5: Existe la teoría de que en los ordenadores todo es electrónico y está al mismo nivel, a diferencia de la biología donde la visión tiene una tasa de bits y un procesamiento masivo que el lenguaje no puede igualar.
Q6: ¿Ngram busca reemplazar por completo a los grandes modelos de lenguaje (LLM)?
A6: No, su objetivo es actuar como una capa de inteligencia y memoria que se acopla a los mejores modelos del mercado para hacerlos expertos en dominios específicos.
Q7: ¿Qué papel juegan los “sueños” en la visión de Ngram para la IA?
A7: Ven los sueños como un espacio donde el modelo puede retirarse de la interacción real para experimentar con sus capacidades, consolidar lo aprendido y probar situaciones hipotéticas.
