El Compilado Hilos Temas Archivo RSS

Hilos · 3 noticias en 3 días

τ_0-VLA: el paper de robótica más votado de la semana pone al planificador a pensar más cuando la decisión importa

Noticias
3
Briefings
3
Empieza
Última
  1. Técnicas y repos

    SkillGate: por qué el RL por resultado no puede enseñarle a un agente qué skill leer, y cómo arreglarlo (19/08)

    Sigue de lo de anteayer, donde el paper de UC San Diego mostraba que la recuperación de skills es el cuello de botella real; este ataca el mismo problema desde el entrenamiento. Los autores identifican una falla estructural que bautizan selector credit starvation: bajo una ventaja transmitida a nivel de secuencia, los pocos tokens que nombran la skill elegida cargan una porción de la pérdida que se desvanece, y el crédito que heredan tiene el signo cada vez más equivocado a medida que las trayectorias se alargan. Traducido: una elección correcta se castiga cada vez que la ejecución posterior falla, y las tres propiedades empeoran monótonamente con el horizonte. SkillGate parte el soporte de tokens en dos canales de crédito disjuntos —el crédito por resultado llega solo a los tokens de ejecución, y una ventaja action-local separada llega exactamente a los tokens que nombran la skill, positiva solo cuando la única lectura de la trayectoria es la correcta. Sobre cinco benchmarks agénticos con 16 candidatos, lleva una política de 9B del 40,8% al 53,2% de éxito por intento, recorta dos tercios la exposición a candidatos engañosos y lee menos skills. Hay código y pesos publicados. arXiv 2608.18852 · GitHub · Hugging Face

    arXiv 2608.18852 GitHub Hugging Face Hugging Face GitHub

  2. Hardware y robótica

    EXIMO: DeepMind pone un VLM a planificar para que el VLA aprenda tareas nuevas sin cientos de horas de teleoperación (21/08)

    Es la otra respuesta al mismo problema que atacaba GEN-1.5 anteayer con una sola demo: cómo afinar políticas robóticas sin recolectar datasets de teleoperación carísimos, y sin caer en un RL que para tareas de horizonte largo es notoriamente ineficiente en muestras. EXIMO trabaja en tres etapas. En explore, un modelo de visión-lenguaje actúa como planificador, piensa y parte los problemas largos en tramos cortos para el VLA; juntos recolectan un dataset orquestado sobre las tareas nuevas. En imitate, el VLA se afina con esos datos. En optimize, un RL residual off-policy termina de ajustar la política, esquivando los problemas que trae hacer RL directo sobre un modelo de miles de millones de parámetros. Los autores ablacionan las tres etapas y reportan mejoras grandes en eficiencia de muestras y rendimiento final frente a los métodos existentes. arXiv 2608.19891 · Hugging Face

    arXiv 2608.19891 Hugging Face Google DeepMind Hugging Face

  3. Hardware y robótica

    τ_0-VLA: el paper de robótica más votado de la semana pone al planificador a pensar más cuando la decisión importa

    Con 519 upvotes en Hugging Face, es el modelo fundacional de robots del Shanghai Innovation Institute y ataca un problema estructural de los VLA jerárquicos: la política de alto nivel decide el próximo subtarea con un solo forward pass, sin ningún mecanismo para gastar más cómputo en las decisiones difíciles o consecuentes. τ_0-VLA reformula la generación de subtareas como un problema de inferencia escalable en cómputo, guiado por un modelo del mundo: en cada paso la política de alto nivel usa memoria de ejecución para proponer una subtarea y, cuando hace falta, busca entre alternativas antes de comprometerse; después una política de bajo nivel la ejecuta sobre varios cuerpos robóticos distintos. Se entrenó sobre 40.115 horas de datos reales heterogéneos con co-entrenamiento multimodal, y los autores reportan que asignar más cómputo en tiempo de inferencia mejora sustancialmente la precisión de predicción del próximo subtarea, tanto en dominio como bajo cambio de distribución, y que esa mejora se traduce en más éxito en lazo cerrado en tareas de manipulación de horizonte largo. Es, en los hechos, llevar el "pensar más antes de responder" del lado del texto al lado del control. arXiv 2608.16885 · Web del proyecto · Hugging Face

    arXiv 2608.16885 Web del proyecto Hugging Face Hugging Face

El hilo se arma solo en cada build: junta noticias de días distintos que nombran a la misma entidad y repiten vocabulario que casi no aparece en el resto del archivo. Nadie lo edita a mano, así que puede dejar afuera una noticia o sumar una de al lado.