your system language is:English

Ingeniería de Contexto con Lance Martin: Guía para Agentes

Cover

📺 Vídeo de estudio recomendado hoy: https://www.youtube.com/watch?v=_IlTcWciEC4


El arte de la ingeniería de contexto: Construyendo agentes de IA que escalan

La explosión de los agentes de IA ha traído consigo un desafío inesperado: gestionar la inundación de datos que fluye entre las herramientas y el modelo. No basta con conectar funciones en un bucle; el éxito depende de alimentar al LLM con la información precisa en el momento exacto.

Pregunta central: ¿Cómo optimizar el flujo de información en agentes para maximizar el rendimiento y minimizar costes sin saturar la ventana de tokens?

Puntos clave

  • El “Offloading” de contexto permite descargar datos pesados a sistemas externos, devolviendo solo resúmenes al agente.
  • La búsqueda agéntica simple (usando archivos llm.txt) a menudo supera a la indexación vectorial compleja en tareas de codificación.
  • La “Lección Amarga” aplicada a agentes sugiere que las estructuras rígidas de hoy serán los cuellos de botella del mañana.
  • El aislamiento multi-agente es esencial para evitar conflictos de decisión y gestionar la pérdida de información en tareas largas.

⏱️ Tiempo de lectura: aprox. 8 minutos · Te ahorra unos 55 minutos frente a ver el vídeo.

¿Quieres tomar notas mientras ves el vídeo? Haz clic en la imagen de abajo y deja que AI Notebook extraiga los puntos clave por ti 👇

AI Notebook


Ingeniería de contexto y el reto de los agentes

Más allá del Prompt Engineering

Los agentes no son simplemente bucles de llamadas a herramientas; son sistemas dinámicos donde el flujo de información define la frontera entre el éxito y el fracaso rotundo.

Lance Martin explica que, a diferencia de los modelos de chat tradicionales donde el mensaje del usuario es la entrada principal, los agentes gestionan una corriente constante de datos provenientes de múltiples interacciones con herramientas. Si simplemente volcamos cada respuesta en la historia del chat, saturamos rápidamente la ventana de contexto, elevamos los costes de forma exponencial y degradamos el rendimiento del modelo debido a fenómenos como la “podredumbre” del contexto (context rot). En su experiencia construyendo herramientas de investigación profunda, un agente ingenuo podía consumir fácilmente 500,000 tokens en una sola carrera, costando varios dólares por ejecución.

Andrej Karpathy definió recientemente la ingeniería de contexto como el desafío técnico de alimentar a un LLM con el contexto justo para el siguiente paso de razonamiento. Esta disciplina se ha vuelto vital para evitar que los procesos de IA se vuelvan prohibitivamente caros o ineficientes, obligando a los desarrolladores a pensar como gestores de memoria de un sistema operativo.

Functional flowchart showing the flow of data in a naive agent vs. a context-engineered agent, highlighting summarization steps and external storage offloading

💡 Profundizando

Q: ¿Cuál es la diferencia principal entre prompt engineering y context engineering?
A: El prompt engineering se centra en las instrucciones; la ingeniería de contexto gestiona todo el ciclo de vida de los datos que fluyen hacia el modelo, especialmente las respuestas de las herramientas.

Q: ¿Qué es el “context rot”?
A: Es la degradación del rendimiento del modelo (alucinaciones o pérdida de instrucciones) que ocurre cuando el contexto se vuelve excesivamente largo, incluso si está dentro de la ventana de tokens.

Q: ¿Por qué los agentes son más propensos a este problema?
A: Porque acumulan el historial de cada llamada a herramienta, lo que hace que la ventana crezca linealmente hasta volverse inmanejable.


Estrategias de optimización: Offloading y recuperación

El archivo como memoria externa

Una de las técnicas más potentes para mantener la agilidad del agente es el concepto de “offloading” o descarga de contexto a sistemas de archivos externos.

En lugar de devolver el contenido completo de una página web o un archivo de código al historial de mensajes, el sistema escribe esos datos en el disco o en el estado del agente y devuelve solo un resumen compacto y estructurado. Esto permite que el agente “sepa” que la información existe y dónde encontrarla, pero sin cargar con el peso de miles de tokens crudos en cada paso subsiguiente del bucle.

En cuanto a la recuperación de información, existe un debate fascinante entre el RAG clásico (indexación vectorial) y lo que Lance llama “búsqueda agéntica”. Mientras que algunos sistemas utilizan pipelines complejos de búsqueda semántica y re-ranking, otros como Claude Code apuestan por herramientas de archivos básicas donde el agente explora el sistema de forma manual. Martin descubrió en sus benchmarks que proporcionar un archivo llm.txt con descripciones de alta calidad de los documentos es extremadamente efectivo, permitiendo al agente decidir qué archivos leer sin necesidad de una base de datos vectorial compleja.

El aislamiento multi-agente también juega un papel crucial en esta arquitectura de eficiencia. Al dividir una tarea masiva en sub-agentes especializados, se limita el contexto que cada unidad debe procesar, lo que reduce drásticamente el ruido y evita que decisiones contradictorias “envenenen” el historial de la conversación principal.

Diagram comparing a classic RAG pipeline (embedding -> vector store -> retrieval) versus Agentic Search (agent -> tool call -> file system exploration)


La Lección Amarga en la arquitectura de agentes

Por qué menos estructura es más

La “lección amarga” de Rich Sutton nos enseña que, a largo plazo, el escalado del cómputo y los métodos generales siempre vencen a las características diseñadas manualmente por humanos.

Hyung Won Chung, investigador de IA, argumenta que a menudo añadimos estructuras rígidas y flujos de trabajo deterministas para compensar las debilidades de los modelos actuales. Sin embargo, a medida que los LLMs mejoran exponencialmente, esas mismas estructuras se convierten en cuellos de botella que impiden aprovechar las nuevas capacidades de razonamiento. Lance experimentó esto personalmente: su primer sistema de investigación profunda evitaba las llamadas a herramientas porque eran poco fiables en 2024, pero tuvo que reconstruir todo el sistema dos veces para eliminar esas restricciones cuando los modelos se volvieron lo suficientemente capaces.

Esta filosofía influye directamente en el debate sobre los frameworks de IA. Martin defiende el uso de herramientas de orquestación de bajo nivel como LangGraph, que proporcionan bloques básicos (nodos y bordes) fáciles de desmontar, en lugar de abstracciones de “agente” de caja negra que ocultan la lógica y son difíciles de optimizar cuando el modelo subyacente evoluciona.

Graph illustrating the Bitter Lesson: Performance vs Compute, showing structured approaches winning at low compute but general scaling approaches dominating as compute increases


Conclusiones clave

La ingeniería de contexto representa la madurez del desarrollo con LLMs, pasando de simples experimentos a sistemas de producción económicamente viables. Al tratar el contexto como un recurso escaso que debe ser gestionado mediante resúmenes, descargas a disco y recuperación inteligente, los desarrolladores pueden construir agentes que realizan cientos de tareas sin degradar su precisión.

El futuro de la IA no reside en crear flujos de trabajo cada vez más complejos, sino en diseñar sistemas lo suficientemente flexibles para que, a medida que los modelos mejoren, podamos retirar la estructura humana y dejar que la escala haga el trabajo pesado. La simplicidad, apoyada en una gestión de contexto magistral, es la verdadera ventaja competitiva.


Preguntas y Respuestas

Q1: ¿Qué es el offloading de contexto exactamente?
A1: Es la práctica de guardar los resultados de las herramientas en un almacenamiento externo (como el disco o una base de datos) y pasar solo una referencia o resumen al LLM para ahorrar tokens.

Q2: ¿Por qué es arriesgado resumir el contexto de un agente?
A2: Porque la compresión puede ser “con pérdida” (lossy); si el resumen omite un detalle crucial, el agente podría tomar decisiones erróneas que no puede corregir al no tener los datos originales a la vista.

Q3: ¿Qué ventaja tiene un archivo llm.txt sobre una base de datos vectorial?
A3: Es mucho más fácil de mantener, permite que el agente use su capacidad de razonamiento para elegir qué leer basándose en descripciones y evita la sobrecarga de gestionar embeddings.

Q4: ¿Cómo ayuda el “humano en el bucle” a la memoria del agente?
A4: Las correcciones que hace un humano a un agente (como cambiar el tono de un correo) pueden capturarse como “recuerdos” de preferencias que el agente utiliza para actualizar sus instrucciones futuras automáticamente.

Q5: ¿Es mejor usar un solo agente potente o varios sub-agentes?
A5: Para tareas de lectura masiva como investigación, los sub-agentes paralelos funcionan bien; para tareas de escritura compleja como programar, los sub-agentes pueden entrar en conflicto si no están extremadamente coordinados.

Q6: ¿Qué recomienda Lance Martin sobre los frameworks?
A6: Prefiere frameworks de bajo nivel que gestionen el estado y el checkpointing sin ocultar la lógica tras abstracciones rígidas, permitiendo “desenrollar” el sistema fácilmente.

Q7: ¿Qué es el “envenenamiento del contexto”?
A7: Ocurre cuando un modelo comete un error o alucinación que queda registrado en el historial; ese error influye en las siguientes respuestas, llevando al agente por un camino equivocado de forma persistente.

Leave a Reply

Your email address will not be published. Required fields are marked *

Related Posts