Hilos · 3 noticias en 8 días
Co-RL: entrenar razonamiento sin etiquetas poniendo a varios modelos distintos a recompensarse entre sí (18/08)
- Noticias
- 3
- Briefings
- 3
- Empieza
- Última
-
Co-RL: entrenar razonamiento sin etiquetas poniendo a varios modelos distintos a recompensarse entre sí (18/08)
El problema que ataca es que los mejores resultados de RL para razonamiento todavía dependen de recompensa verificable con ground-truth, cada vez más cara y más escasa a medida que las capacidades superan lo que un humano evalúa de forma confiable. El self-rewarding clásico baja esa dependencia pero refuerza los sesgos propios, achica la diversidad de respuestas y termina en homogeneización y colapso. Co-RL entrena simultáneamente varios modelos desacoplados, sin compartir un solo parámetro, con recompensas derivadas de sus pares; la clave está en la diversidad de la cohorte —familias heterogéneas, tamaños distintos, muestras reformuladas—, que reduce los errores correlacionados que alimentan el bucle auto-reforzante. Los resultados: entre 3,0% y 8,6% de mejora promedio en siete benchmarks de texto para LLMs, y entre 2,3% y 7,2% en cuatro multimodales para VLMs, igualando o superando a métodos supervisados sin tocar una sola etiqueta. Código publicado. arXiv 2608.17253 · GitHub
-
ParaTempo baja 22-32% la latencia del razonamiento paralelo sin entrenar nada, y el código está publicado
El problema es que el razonamiento paralelo mejora precisión explorando varios caminos de solución, pero el costo crece con la profundidad y la cantidad de ramas, y las señales que se usan para podar —consenso de respuesta final, confianza a nivel token, sondeos intermedios aislados— llegan tarde o son demasiado ruidosas. La propuesta es una sola señal: "confianza temporal", una medida local de cada rama sobre qué tan nítidamente los sondeos recientes convergen a una respuesta dominante. De ahí sale todo el control: se podan las ramas de baja confianza, se retiran temprano las que ya se comprometieron con su respuesta, el cómputo liberado se reasigna abriendo ramas nuevas, y la generación se corta globalmente cuando el voto ponderado se concentra. Sin sincronización entre trayectorias. En benchmarks de razonamiento matemático y científico baja la latencia promedio 21,8-32,2% y el uso total de tokens 18,1-30,3% manteniendo precisión competitiva. Es training-free, así que se prueba sobre un modelo existente. arXiv 2608.16425 · GitHub
-
TTPO entrena el modelo en tiempo de test sin una sola etiqueta y empata al equivalente supervisado (27/08)
El problema que ataca es concreto: tanto RL como la autodestilación on-policy necesitan ground truth, y eso vuelve imposible el entrenamiento en tiempo de test. El hallazgo del que cuelga todo es que el fallo de las pseudo-etiquetas por voto mayoritario es asimétrico: los rollouts que discrepan del voto suelen estar mal aunque el voto en sí sea correcto. Sobre eso arman un objetivo asimétrico —destilan los rollouts que coinciden y penalizan con RL agrupado los que discrepan—, con selección a nivel token que baja el peso de las posiciones ya convergidas y penaliza solo los errores confiados. Sin etiquetas, iguala a la autodestilación supervisada en cinco benchmarks de nivel competencia; Qwen3-1.7B pasa de 38,0% a 45,2%, y sin modo thinking las ganancias van de +25,2% a +36,4%. Es de la Universidad de Zhejiang con Alibaba, y el código está publicado. arXiv 2608.27448 · GitHub
El hilo se arma solo en cada build: junta noticias de días distintos que nombran a la misma entidad y repiten vocabulario que casi no aparece en el resto del archivo. Nadie lo edita a mano, así que puede dejar afuera una noticia o sumar una de al lado.