your system language is:English

Pi-0: Modelos fundacionales para robots generalistas

Cover

📺 Vídeo de estudio recomendado hoy: https://www.youtube.com/watch?v=5mY71rGXAkM


Inteligencia Física: El camino hacia los robots generalistas con Pi-0

La robótica está viviendo su “momento GPT”, alejándose de sistemas rígidos para abrazar modelos que aprenden del mundo físico. Sergey Levine, cofundador de Physical Intelligence, detalla cómo su modelo Pi-0 está rompiendo las barreras de la especialización mediante una arquitectura que fusiona visión, lenguaje y acción.

Pregunta central: ¿Es posible crear un modelo fundacional único que permita a cualquier robot realizar tareas complejas, desde doblar ropa hasta limpiar una cocina, sin necesidad de reprogramarlo desde cero?

Puntos clave

  • Transición de robots especializados a modelos fundacionales generalistas (VLA).
  • La arquitectura de Pi-0 combina el modelo Gemma con un “experto en acciones” basado en difusión.
  • La importancia crítica de incluir datos “mediocres” para que el robot aprenda a recuperarse de errores.
  • El nuevo tokenizador FAST permite comprimir acciones y acelerar el entrenamiento hasta cuatro veces.

⏱️ Tiempo de lectura: aprox. 7 minutos · Te ahorra unos 45 minutos frente a ver el vídeo.

¿Quieres tomar notas mientras ves el vídeo? Haz clic en la imagen de abajo y deja que AI Notebook extraiga los puntos clave por ti 👇

AI Notebook


El fin de la robótica especializada

De silos de investigación a modelos fundacionales

La robótica tradicional ha sido, hasta ahora, un esfuerzo de ingeniería fragmentado y extremadamente costoso. Cada nueva aplicación, ya sea un brazo para almacén o un coche autónomo, requería prácticamente fundar una empresa o un laboratorio de investigación nuevo debido a la falta de transferencia de conocimientos entre tareas.

Sergey Levine sostiene que el gran avance actual es la posibilidad de crear modelos que sirvan como base para una enorme gama de aplicaciones. Al igual que los modelos de lenguaje pasaron de tareas específicas a ser asistentes generales, la robótica busca un cerebro común que entienda el sentido común físico y semántico del entorno.

Este cambio de paradigma permite que un robot no solo ejecute una trayectoria, sino que comprenda conceptos complejos. Si una máquina encuentra un cartel de “suelo resbaladizo”, un modelo fundacional moderno puede procesar esa información semántica y reaccionar inteligentemente, algo imposible para los sistemas diseñados bajo el enfoque antiguo de programación rígida.

Functional flowchart comparing "Traditional Robotics Pipeline" (Siloed, Task-specific, Manual Programming) vs "Foundation Model Robotics" (General Data, Unified VLA Model, Multi-task Output)

💡 Profundizando

Q: ¿Por qué ha sido tan difícil aplicar el éxito de la IA a la robótica hasta ahora?
A: Principalmente por la falta de un “internet de datos robóticos”; mientras que el texto y las imágenes sobran en la red, los datos de interacción física deben ser creados o recolectados manualmente.

Q: ¿Qué piezas tecnológicas han permitido este avance reciente?
A: La combinación de modelos de visión y lenguaje (VLM) con avances en aprendizaje por refuerzo y la capacidad de crear modelos transferibles entre diferentes tipos de robots.

Q: ¿Cuál es el objetivo final de Physical Intelligence?
A: Crear robots generalistas como los de la ciencia ficción, capaces de adaptarse a cualquier tarea física mediante modelos que procesan el mundo de forma similar a como lo hace un humano.


La receta de Pi-0: Arquitectura y Datos

La unión de la visión y el “córtex motor”

El modelo Pi-0 no es simplemente un modelo de lenguaje con ojos; es un sistema que debe traducir conceptos abstractos en movimientos espaciales precisos. Levine explica que, aunque los Transformers son excelentes para el texto, la representación de movimientos fluidos y diestros requiere herramientas distintas como los modelos de difusión.

Para solucionar esto, Pi-0 utiliza un modelo de visión y lenguaje (basado en Gemma) que actúa como el “córtex visual” del sistema. A este se le acopla un “experto en acciones” más pequeño y veloz que procesa las activaciones internas del modelo principal para generar fragmentos de trayectorias continuas en tiempo real.

Esta estructura híbrida permite al robot realizar tareas tan delicadas como doblar ropa recién sacada de una cesta. El sistema no sigue una receta fija, sino que genera acciones de forma asíncrona a 50 Hz, permitiendo una reactividad fluida ante cualquier cambio en el entorno o interferencia humana durante la tarea.

Architecture diagram showing Gemma VLM on the left, an 'Action Expert' (Diffusion-based) on the right, with arrows showing multimodal input (images/text) and continuous action outputs (joint angles)

💡 Profundizando

Q: ¿Por qué se utilizan modelos de difusión para las acciones en lugar de solo texto?
A: Porque describir movimientos precisos con palabras es ineficiente; la difusión maneja mejor la información espacial continua necesaria para la destreza manual.

Q: ¿Cómo influye la calidad de los datos en el entrenamiento?
A: Sorprendentemente, usar solo datos perfectos es contraproducente, ya que el robot no aprende a reaccionar cuando algo sale mal; los datos de “baja calidad” enseñan recuperación.

Q: ¿Qué es el “post-entrenamiento” en este contexto?
A: Es una fase donde se usan entre 2 y 20 horas de datos de expertos para pulir una tarea específica, sobre una base de 10,000 horas de pre-entrenamiento general.


Tokenización FAST y el futuro del razonamiento

Comprimiendo el movimiento físico

Uno de los descubrimientos más recientes del equipo de Physical Intelligence es que la forma en que se representan las acciones para el modelo influye drásticamente en su capacidad de aprendizaje. Inspirándose en la compresión JPEG, desarrollaron el tokenizador FAST, que representa los movimientos en el dominio de la frecuencia.

Al comprimir las acciones de esta manera, lograron que cada “token” de movimiento contenga una cantidad equilibrada de información. El resultado fue asombroso: los modelos empezaron a entrenarse cuatro veces más rápido, logrando una comprensión mucho más profunda de las instrucciones en lenguaje natural y una mejor generalización.

Gracias a esta eficiencia, han podido transferir habilidades a robots humanoides de terceros con relativa facilidad. En pruebas externas, el modelo fue capaz de realizar tareas en entornos y robots completamente nuevos para él (zero-shot), algo que suele ser el talón de Aquiles de la robótica académica tradicional.

Functional bar chart comparing "Training Time to Convergence" between "Naive Tokenization" and "FAST Tokenization", showing a 4x reduction in time/compute

💡 Profundizando

Q: ¿Qué es exactamente el tokenizador FAST?
A: Es un método que aplica principios de compresión de datos continuos para convertir trayectorias físicas en tokens que el modelo puede procesar eficientemente.

Q: ¿Cómo ayuda esto a la generalización?
A: Al aprender más rápido y mejor, el modelo puede correlacionar mejor las instrucciones lingüísticas con los movimientos, incluso en robots que no vio durante el pre-entrenamiento.

Q: ¿Qué importancia tiene el código abierto en este proyecto?
A: PI ha liberado pesos y herramientas para que la comunidad académica y entusiasta pueda experimentar y descubrir nuevos casos de uso, acelerando la innovación en el sector.


Conclusiones clave

El trabajo de Sergey Levine y Physical Intelligence marca un hito en la búsqueda de la autonomía robótica real. Al tratar el movimiento físico como un problema de datos y compresión, similar al lenguaje, están desbloqueando capacidades que antes requerían años de programación manual.

La transición hacia modelos generalistas permitirá que el hardware robótico sea finalmente útil en entornos no estructurados como hogares y oficinas. Ya no se trata de si un robot puede doblar una camiseta, sino de qué tan rápido puede aprender a realizar cualquier labor doméstica mediante la observación y el razonamiento físico.


Preguntas y Respuestas

Q1: ¿Qué tan grande es el modelo Pi-0 en términos de parámetros?
A1: El modelo completo tiene aproximadamente 3.3 mil millones de parámetros, un tamaño elegido por ser lo suficientemente ligero para ejecutarse en tiempo real y lo bastante grande para retener conocimiento de escala internet.

Q2: ¿Puede el robot seguir instrucciones complejas y multi-paso?
A2: Actualmente es el foco de investigación. El objetivo es que puedas decirle “limpia la mesa pero deja los platos ahí porque habrá una fiesta”, requiriendo razonamiento semántico avanzado.

Q3: ¿Se utilizó simulación para recolectar los datos de Pi-0?
A3: En este prototipo, todos los datos provienen de teleoperación humana en el mundo real, aunque Levine no descarta que los modelos fundacionales faciliten el uso de datos sintéticos en el futuro.

Q4: ¿Qué tan costoso es el hardware necesario para ejecutar estos modelos?
A4: Aunque los robots usados pueden costar entre 15k y 20k USD, los precios están bajando. El software es agnóstico y puede funcionar en brazos más económicos como los de la iniciativa Le Robot de Hugging Face.

Q5: ¿Qué sucede si el robot se encuentra con un objeto que nunca ha visto?
A5: Gracias al pre-entrenamiento con datos masivos de internet y la diversidad de sus 10,000 horas de datos robóticos, el modelo puede extrapolar comportamientos y manejar objetos desconocidos con sorprendente éxito.

Q6: ¿Cuál es la diferencia entre pre-entrenamiento y post-entrenamiento en robótica?
A6: El pre-entrenamiento da al robot una base de “cultura general física”, mientras que el post-entrenamiento (fine-tuning) lo especializa en la estrategia óptima para una tarea específica como el ensamblaje de cajas.

Q7: ¿Qué es el “Embodied Chain of Thought” (Cadena de Pensamiento Encarnada)?
A7: Es una técnica donde el robot verbaliza internamente los pasos necesarios (“veo un plátano amarillo, mi mano está sobre él, debo bajarla”) antes de ejecutar la acción, lo que mejora drásticamente el éxito en tareas nuevas.

Leave a Reply

Your email address will not be published. Required fields are marked *

Related Posts