El Compilado Hilos Temas Archivo RSS

Hilos · 5 noticias en 10 días

EnvHarness: en vez de generar entornos nuevos, envolver los que ya existen con plugins que apuntan a las fallas del agente (21/08)

Noticias
5
Briefings
5
Empieza
Última
  1. Técnicas y repos

    ClawGym II: hacer RL sobre el agente entero sin abrir el harness, con Claude Code y OpenClaw como entorno (17/08)

    El framework de la Renmin University y colaboradores trata al harness como caja negra: aísla cada tarea con su harness en sandboxes efímeros para hacer rollouts concurrentes en masa, mete un proxy de serving en el límite del modelo para capturar todas las llamadas, y reorganiza esas llamadas en árboles de prefijos para reconstruir las trayectorias multi-turno. Sobre esa estructura adaptan PPO y GRPO. Con Qwen3-30A3B el Pass@1 en ClawGym-Bench sube 9,98 puntos vía OpenClaw y 14,81 vía Claude Code, y se mantiene estable a lo largo de 200 a 400 pasos de optimización, con ganancias también en JobBench y OfficeQA. Lo más aprovechable es el "mix-harness training": un solo modelo optimizado en simultáneo contra harnesses distintos, en vez de uno por herramienta. Publicaron código de SFT y RL, 13,5K tareas, 24,5K trayectorias y tres checkpoints abiertos de 4B, 8B y 30A3. arXiv 2608.16798 · GitHub

    arXiv 2608.16798 GitHub GitHub Claude Claude Code

  2. Técnicas y repos

    SPADE hace que un mismo modelo escriba los entornos de entrenamiento y aprenda en ellos, apuntando justo al límite de su propia capacidad (20/08)

    El framework de self-play —firmado entre otros por Luke Zettlemoyer, Yejin Choi y Natasha Jaques— parte a un solo LLM en dos roles: un Diseñador de Entornos que escribe entornos completos de horizonte largo como código ejecutable con interfaz tipo Gym (reset()/step()), y un Agente de Razonamiento que aprende adentro. Como cada entorno es multiturno y con estado, la misma interfaz cubre tanto razonamiento puro como uso agéntico de herramientas en varios pasos. La señal que hace funcionar todo es el arrepentimiento del agente, estimado como la diferencia entre su recompensa con y sin pistas privilegiadas: optimizando eso, el diseñador aprende a generar entornos difíciles pero no irresolubles. Dos detalles resultaron críticos y valen para cualquiera que arme generación sintética: anclar al diseñador en documentos muestreados de un corpus grande de preentrenamiento, y darle memoria acumulada de los entornos que ya creó. Escalando a 30B, supera a la mejor línea base de entorno fijo en 5,3 puntos promedio sobre ocho benchmarks retenidos, y en uso de herramientas suma 5,7 en BFCL-v4 multiturno y 13,9 en ACEBench-Agent. Código publicado. arXiv 2608.19197 · GitHub

    arXiv 2608.19197 GitHub GitHub

  3. Técnicas y repos

    SemaPLC solo da una tarea por terminada cuando un PLC real ejecuta el código, y ahí la diferencia con los baselines se vuelve abismal (19/08)

    El paper del Midea AI Research Center trepó al tercer puesto de HF Daily Papers con 110 votos, y su idea es simple y dura: en vez de parar cuando el modelo juzga adecuada su propia salida, el harness declara la tarea completa solo cuando lo confirman chequeos externos registrados sobre la especificación, la compilación y el comportamiento en un runtime vivo. Sobre 117 tareas de POU independientes saca la mejor tasa de aprobación verificada estricta en los siete modelos probados, con 72,6% promedio. Pero el número que importa está en la pista de contexto de proyecto, con 65 tareas cuya lógica generada tiene que compilar y correr adentro de un proyecto real: en comportamiento estático todos los métodos quedan dentro de 10 puntos entre sí, y en comportamiento dinámico —desplegando la lógica generada y la de referencia en un PLC real y comparando trazas ejecutadas— los baselines van de 22,4 a 31,4 contra 52,2 de SemaPLC. Que la evaluación estática no distinga nada y la dinámica separe todo es un resultado transferible más allá de los PLCs. Y llega justo después del aviso de EE.UU. sobre exploits escritos con IA contra PLCs Siemens: el mismo hardware, en los dos lados del mostrador. Código publicado. arXiv 2608.18565 · GitHub

    arXiv 2608.18565 GitHub GitHub

  4. Técnicas y repos

    EnvHarness: en vez de generar entornos nuevos, envolver los que ya existen con plugins que apuntan a las fallas del agente (21/08)

    Primer puesto de HF Daily Papers con 237 votos, y es de Google. El diagnóstico de partida: los entornos con los que aprenden los agentes son hechos a mano y estáticos, ciegos a las debilidades del agente y rápidamente obsoletos a medida que mejora; los métodos de generación de entornos que aparecieron para arreglar eso necesitan pipelines por dominio, dependen de verificadores caros o poco confiables, y terminan produciendo entornos igual de estáticos. EnvHarness es una capa programable de componentes plug-in que envuelve un entorno estático y le cambia el comportamiento sin tocar la lógica de abajo, operando por interfaces estándar, de modo que cada entorno reformado conserva su verificador original. EnvRigger automatiza el proceso: trata a la política como caja negra, observa sus trayectorias de ejecución, sintetiza componentes que apuntan a las fallas diagnosticadas y los valida con rollouts frescos. Sobre cinco benchmarks en cuatro dominios saca hasta 9,0 puntos de mejora en instancias reservadas con 9,8% menos pasos de ejecución, y da mejor señal de optimización para RL, habilitando coevolución continua de política y entorno. Código y web publicados. arXiv 2608.19880 · GitHub · Web

    arXiv 2608.19880 GitHub Web Google GitHub

  5. Técnicas y repos

    JIT-Agent entrena un modelo que fabrica el harness a medida de la tarea, y le saca +20 puntos a GLM-5.2 sin tocar el modelo base

    La premisa continúa el argumento que viene ganando terreno hace semanas —la capacidad del agente no la determina solo el modelo— y le agrega el paso siguiente: si el harness (gestión de memoria, estrategia de planificación, protocolo de acciones, orquestación de herramientas y skills) domina la contribución del modelo, entonces diseñarlo a mano, tarea por tarea, no escala. Los autores formalizan el harness como un artefacto componible y generable por máquina bajo un protocolo fijo de cuatro módulos, y entrenan un modelo para que lo sintetice al vuelo para cualquier LLM agéntico de estantería, lo repare cuando la ejecución se cae, y se autoevolucione destilando señales de rendimiento de un archivo creciente de configuraciones previas. Con JIT-Agent de asistente, DeepSeek-V4-Flash supera a GPT-5.6 en DeepSearchQA (+9,1) y OdysseyBench (+4,3), y GLM-5.2 gana hasta 20,2 puntos. Los harnesses generados compiten de igual a igual con runtimes maduros como OpenCode y Claude Code. Hay código y dataset publicados. arXiv 2608.25593 · GitHub · Sitio del proyecto

    arXiv 2608.25593 GitHub Sitio del proyecto GitHub GPT Claude Claude Code

El hilo se arma solo en cada build: junta noticias de días distintos que nombran a la misma entidad y repiten vocabulario que casi no aparece en el resto del archivo. Nadie lo edita a mano, así que puede dejar afuera una noticia o sumar una de al lado.