-
Un benchmark nuevo muestra que el RAG con documentos desactualizados da vuelta la respuesta correcta hasta en el 91% de los casos, y que decirle al modelo "confiá en el contexto" lo empeora (28/09)
"Stale-Document Poisoning" arma 317 reversiones de conocimiento verificadas en medicina, derecho, software y políticas de plataforma, y las prueba sobre 12 modelos. Sin instrucciones especiales, el retrieval viejo pisa el 30% de las respuestas de Llama y el 37% de las de Qwen; con la instrucción explícita de confiar en lo recuperado saltan a 66% y 75%. En cuatro modelos abiertos y cuatro dominios el envenenamiento va de 17% a 91%, mientras que la evidencia actualizada se sigue en el 97-100% de los casos: el problema es temporal, no de obediencia. La mitigación que reportan es implementable: un re-ranker híbrido con conciencia de recencia baja el envenenamiento entre 4,6 y 10 puntos, siempre que las fechas de los documentos sean correctas. arXiv 2609.31342
-
Entrenar al modelo a predecir su propia confianza, con solo 600 problemas, recorta hasta 25% de los tokens de razonamiento sin perder accuracy (28/09)
"Learning to Stop without Learning to Stop" no optimiza la longitud del razonamiento en ningún momento: enseña confianza de forma auto-supervisada y el recorte aparece solo. Reportan hasta 25% menos tokens generados a accuracy igualada en benchmarks de matemática, ciencia y código, probado sobre Gemma, Qwen, Nemotron y GPT-OSS, así que no es un truco atado a una familia de modelos. El costo de adopción es lo que lo vuelve interesante para un equipo chico: 600 problemas de entrenamiento entra en un fine-tune de presupuesto modesto, y el ahorro pega directo donde más duele la factura de los modelos de razonamiento. arXiv 2609.31619
-
Qwen liberó Qwen-Image-2.1, un generador de imágenes de 7.000 millones de parámetros que corre en una 3090 (20/09)
El componente de generación visual tiene apenas 7B y, según los benchmarks propios de Qwen, le gana a la mayoría de los modelos cerrados; todavía no hay mediciones independientes, así que conviene tomarlo con pinzas. Lo que sí es concreto son las capacidades: genera y edita imágenes con transparencia nativa (RGBA), lo que permite aislar objetos o cambiar texto sobre capas transparentes sin un paso separado de recorte, y acepta hasta diez imágenes de referencia a la vez para retratos grupales, pruebas de ropa o diseño de ambientes. Los círculos, máscaras o marcas pintadas encima guían las ediciones locales. Está en Hugging Face, GitHub y ModelScope, pero la licencia es de investigación: para uso comercial hay que pedirle permiso a Qwen. The Decoder · Qwen · Hugging Face
-
Qwen sacó Qwen3.8-Omni-Flash, su primer multimodal pensado para agentes, a una quinta parte del precio de Gemini Flash (19/09)
Procesa audio y video juntos, saca conclusiones y usa herramientas por su cuenta para editar vlogs, traducir videos cortos o resumir películas, con una ventana de contexto de un millón de tokens. En tareas de audio y video, Qwen dice que queda cerca de Gemini 3.8 Flash. El dato que importa es el precio: 0,15 dólares por millón de tokens de entrada y 0,47 de salida, contra 0,75 y 3,75 de Gemini 3.8 Flash, que además duplica tarifas el 1 de enero de 2027. Qwen estima menos de un centavo por hora de audio de entrada y unos 0,20 por video 720p con audio a un cuadro por segundo. Además liberó Qwen-MM-Plugins, que le suman edición de video, reconocimiento de hablante y notas en PDF de videos a agentes como Claude Code, Gemini CLI y Qwen Code, y Qwen-Live Harness para interacción en vivo con cámara y micrófono. The Decoder · Qwen
-
ECC llegó al tope de tendencias: 263.000 estrellas y un sistema de plan-test-implement-review-verify-remember-improve instalable de una (20/09)
263.300 acumuladas, 39.401 forks, 1.012 en el día, licencia MIT. La propuesta es instalar una vez el proceso de ingeniería en vez de reconstruirlo en cada prompt: 68 agentes especializados en planificación, revisión, reparación de builds, seguridad y arquitectura, 292 skills, 94 shims de comandos legacy, más hooks, reglas, memoria y AgentShield, su escáner de seguridad. La frase que resume el diseño es "optimizá la ventana de contexto, persistí todo lo demás". Funciona mejor con Claude Code, tiene camino de sincronización soportado para Codex y adaptadores con capacidades limitadas para Cursor, OpenCode, Gemini, Zed, Copilot, Qwen y otros; conviene mirar la matriz de soporte antes de asumir paridad. Se instala con npx ecc-universal@2.2.2 setup o con /plugin install ecc@ecc adentro de Claude Code, y el propio repo advierte contra apilar métodos de instalación en la misma herramienta. GitHub
-
Arm armó un programa de más de 80 empresas para IA física y publicó un marco de seis niveles para clasificar robots (17/09)
Arm Total Design for Physical AI junta a AWS, Hugging Face, Liquid AI, NXP, PlusAI, Psyonic, QNX, Qwen, Siemens y Unitree, entre otros, y calca lo que Arm ya había hecho en el ecosistema cloud. El diagnóstico de Dermot O'Driscoll, VP de go-to-market para IA física, es el mismo que motivó OpenRobOps hace dos días: la robótica está fragmentada y no había lugar donde las empresas compartieran tecnología o colaboraran. La segunda pieza es el Robotics Capability Framework, seis niveles de sofisticación del cero al cinco —de robots que reaccionan a estímulos con reglas fijas hasta sistemas cuyo comportamiento aprende y se autooptimiza—, inspirado en los niveles de conducción autónoma de SAE. Arm dice que la robótica es más compleja y por eso el marco es multidimensional, y está invitando a la industria a corregirlo. El puente con automotive es explícito: toda la computación de un auto actual corre en algún chip Arm, y las exigencias de criticidad de seguridad, tiempo real y visión por computadora se superponen. The Robot Report · Arm
-
Investigadores militares chinos usaron Claude para armar 16 módulos de guerra electrónica cuyo escenario por defecto tenía 12 blancos en Taiwán (13/09)
Sigue de lo de ayer, cuando el reporte de Anthropic aportó los números de velocidad de ShinyHunters: ahora se conoce el capítulo chino, con cinco programas distintos, dos de ellos militares. Un actor pidió ayuda para redactar la especificación de control de fuego de un sistema anti-torpedo —la lógica que decide cuándo y dónde engancha el arma—, probarlo contra sistemas conocidos de la Armada estadounidense y preparar una propuesta técnica de más de 200 páginas, disfrazándose de OEM del sector de defensa de Estados Unidos. Otro, un investigador del complejo militar-industrial, desarrolló los 16 módulos de software para guerra electrónica y supresión de defensas aéreas: analizan radares, baterías de misiles, puestos de comando y nodos de comunicaciones, y priorizan blancos. El escenario por defecto contenía doce objetivos en Taiwán, incluidas baterías Patriot y Tien Kung, bases aéreas, un radar de alerta temprana y un búnker de comando; los metadatos de cuenta apuntan a instituciones de investigación de la República Popular, entre ellas la Academia de Ciencias Militares del EPL. Aparte, Anthropic acusa a varios laboratorios chinos de destilación a escala industrial: Alibaba habría generado más de 151 millones de intercambios entre mayo y julio, llegando a casi 3 millones de pedidos por día a través de miles de cuentas fraudulentas, con los datos de cadena de razonamiento usados para entrenar Qwen 3.x; DeepSeek, más de 12,1 millones en 14 días; Xiaomi, más de 400.000. Tom's Hardware · Anthropic
Tom's Hardware Anthropic Anthropic DeepSeek Alibaba Claude ShinyHunters
-
Iris-mini e Iris-pro salieron con harness y benchmarks, y el hallazgo que más sirve no es el modelo sino cómo se mide (13/09)
El equipo chino AllSpark liberó dos agentes de búsqueda construidos sobre Qwen —35.000 millones de parámetros y 397.000 millones, ventana de 256.000 tokens— que lideran entre los open-weight de su clase. Pero la parte accionable es metodológica: sostienen que la gestión de contexto en tiempo de ejecución suele pesar más que las diferencias reportadas entre sistemas, así que corren cada benchmark con y sin ella manteniendo herramientas, límites y modelo juez constantes. El efecto es enorme en el modelo chico: hasta 21,2 puntos de mejora en BrowseComp, no por tener menos presupuesto de tokens sino por consumirlo más rápido, porque necesita más pasos para la misma tarea y choca el límite más seguido. La conclusión práctica es que un puntaje reportado solo con gestión de contexto activada no se puede separar en cuánto viene del modelo y cuánto del andamiaje. La mejor técnica que reportan es combinar descarte de historial con un segundo intento: si el primero falla, el sistema lo condensa en una nota corta con lo que ya revisó y descartó, y la anexa a la tarea para la corrida siguiente. También liberaron el Iris Harness con el loop del agente, herramientas, estrategias de contexto y los cuatro benchmarks con evaluación; corre contra cualquier endpoint compatible con OpenAI. GitHub · Hugging Face · The Decoder
-
El repo i-have-adhd explotó a 31.500 estrellas: una skill de diez reglas para que el agente de código no entierre la respuesta (08/09)
Es una skill instalable en Claude Code, Codex, Cursor, opencode, Gemini y Qwen, y todo el contenido son diez reglas: arrancar por la próxima acción, numerar los pasos, cerrar con un paso concreto, suprimir tangentes, reestablecer el estado en cada turno, dar estimaciones en minutos, hacer visibles los avances, reportar errores sin dramatismo, cortar las listas en cinco ítems y no escribir preámbulo, resumen ni cierre. El README muestra el antes y el después sobre el mismo diagnóstico, y la diferencia es de tres párrafos a dos comandos. Vale menos como herramienta que como evidencia de qué tan lejos llega editar el formato de salida sin tocar el modelo. GitHub · Hacker News
-
Mistral levanta 3.000 millones de euros con Samsung a la cabeza, la ronda más grande de la historia tecnológica europea (08/09)
La Serie D lleva la valuación arriba de 21.000 millones de euros, casi el doble de los 12.000 millones que valía cuando ASML puso 1.300 millones en septiembre de 2025. Coliderean el Scaleup Europe Fund (gestionado por EQT) y PSG Equity, y entran Advent, fondos de BlackRock y el Gran Ducado de Luxemburgo; a16z, Nvidia, ASML y General Catalyst siguen adentro. El dato incómodo es que los modelos no acompañan: Mistral Medium 3.5 queda atrás de Qwen y Kimi entre los abiertos y no compite con los cerrados de EE.UU. La apuesta es enteramente empresarial —opera en 20 países con más de 125 clientes como Airbus, ASML y HSBC— y el motor es la demanda europea de bajar la dependencia de proveedores estadounidenses. Mistral AI · The Decoder
-
Alibaba libera Qwen-Drive 1.0 y muestra que entender el espacio tridimensional hay que entrenarlo a propósito (07/09)
El modelo parte de Qwen3.5-4B y le agrega dos módulos: uno arma un mapa cenital del entorno detectando objetos en 3D, ocupación y trazado de la calzada, y el otro planifica el movimiento del auto en los próximos segundos. Cuando el equipo entrenó solo el módulo agregado y dejó intacto el modelo de visión y lenguaje, la precisión espacial quedó baja: un modelo que describe imágenes en detalle no capta por eso el espacio tridimensional. La versión reentrenada con recompensas bajó del 24% al 12% la tasa de salidas de la calzada en simulador, aunque maneja más cauta y recorre menos distancia. La debilidad declarada es que las explicaciones no siempre coinciden con la maniobra —confunde un semáforo lejano con un chico cruzando, que piden reacciones muy distintas— y que varios resultados descansan en pruebas que los propios autores diseñaron. La lógica de producto es que infotainment y sistema de manejo están convergiendo en una sola unidad de cómputo, así que un modelo que cambia conocimiento general por manejo puro no sirve. Está gratis para investigación en Hugging Face, ModelScope y GitHub. The Decoder · Arxiv · Hugging Face
-
Qwen 3.8 27B queda disponible en Cerebras a 1.500 tokens por segundo (04/09)
Es un denso de 27B, o sea que entra en categorías donde la velocidad cambia el tipo de aplicación que se puede armar: a esa tasa el cuello de botella deja de ser el modelo y pasa a ser todo lo demás del loop. Los números del modelo acompañan —en las tablas comparativas que publicó IFM el mismo día, Qwen 3.8 27B saca 79,8 en Terminal-Bench 2.1, 90,5 en GPQA Diamond y 33,9 en HLE sin herramientas, arriba de los otros densos de su clase—. Está solo con precio por token de API, aunque Cerebras ya soporta prompt caching, que es lo que hace o rompe la economía de las tareas agénticas largas. Cerebras · Hacker News
-
GitSpawn: ocho fallas hacen que siete agentes de código ejecuten comandos que vienen adentro del repositorio, sin sandbox y sin pedir permiso (02/09)
El mecanismo es viejo y aburrido, que es justamente por qué funciona: core.fsmonitor es una opción de rendimiento de Git cuyo valor es un comando que Git corre para saber qué archivos cambiaron, y Git la lee del.git/config del propio repositorio. Cualquier operación que refresque el índice —git status, git diff— lo ejecuta, y los agentes llaman a esos comandos en segundo plano al arrancar para saber en qué rama están. En Claude Code y Hermes Agent el payload dispara antes de que se acepte el prompt de confianza del workspace; en Qwen Code, antes de autenticarse; en Grok Build, con la primera tecla. No aplica a un git clone normal: hace falta que el repositorio llegue como archivos con su directorio.git intacto, o sea un ZIP compartido, un disco de red, una carpeta sincronizada o un pendrive. Ya hay fixes en goose 1.44.0, Codex CLI 0.131.0 y Claude Code 2.1.196; seguían vivos Hermes Agent, Qwen Code, Grok Build y un segundo camino en Claude Code vía claude ultrareview, que Manifold reconfirmó el 1 de septiembre. OpenAI publicó tres CVEs propios el mismo día. La mitigación casera es una línea: git config --global core.fsmonitor false. The Hacker News · Manifold Security
The Hacker News Manifold Security OpenAI Claude Grok Claude Code
-
En China se compran tokens de Claude al 10% del precio de lista a través de "estaciones de transferencia" (23/08)
Anthropic tiene probablemente los controles de acceso más duros de la industria contra China —chequea teléfono, tarjeta de crédito extranjera y domicilio de facturación, banea empresas con más del 50% de propiedad china directa o indirecta, y a algunos usuarios les pide documento con selfie en vivo—, y aun así un análisis de Zilan Qian, del Oxford China Policy Lab publicado por ChinaTalk, describe un mercado floreciente. Las "estaciones de transferencia" son proxies de API alojados fuera de China que reciben el pedido, lo reenvían como si viniera de una ubicación legítima y devuelven la respuesta; se paga en yuanes por WeChat o Alipay, sin VPN ni tarjeta extranjera, y hay directorios comunitarios que las rankean por precio y disponibilidad. Los precios de 70% a 90% por debajo de lista salen de granjear el crédito gratis de USD 5, explotar descuentos de empresa y educación, partir un plan Max de USD 200 entre varios usuarios y —lo que el ambiente llama "diluir"— desviar en silencio un pedido para Opus 4.7 hacia Sonnet o hacia modelos chinos como Qwen: investigadores del CISPA alemán revisaron 17 proxies y encontraron un supuesto endpoint "Gemini-2.5" que sacó 37% en un benchmark médico contra el 83,82% oficial. La hipótesis más incómoda de Qian es que el negocio real no son los tokens sino los logs, porque cada prompt, respuesta y llamada a herramienta pasa por el operador, y ya circulan en Hugging Face datasets con salidas de razonamiento de Opus 4.6 sin procedencia clara. Lo que hace que esto sea más que una nota de negocios: cuando el pedido llega por proxy, Anthropic ve la cuenta y la IP del proxy, no al usuario final, y eso degrada sistemas de monitoreo como Clio, que buscan patrones coordinados de abuso entre cuentas. The Decoder · ChinaTalk
-
Qwen 3.8 27B corre en una laptop, pero hay que apagarle el "xhigh" y prenderle Multi-Token Prediction (16/08)
Sigue de lo de ayer, donde Qwen pasaba los 3.000 millones de descargas: Simon Willison publicó su prueba a fondo del 3.8 27B (Apache 2, visión, 262k de contexto) corriendo local en una MacBook M5 Max de 128 GB y en un DGX Spark, con el GGUF Q4_K_M de 17 GB. El hallazgo práctico es el default: el modelo viene con reasoning_effort: xhigh y sobrepiensa de forma absurda — el pelícano en bicicleta le llevó 21 minutos y 22.276 tokens de razonamiento para 3.223 de salida, contra 137 segundos con el razonamiento apagado. La otra mitad accionable es de velocidad: siguiendo un tweet de Georgi Gerganov, levantó llama serve con --spec-default --spec-type draft-mtp usando el propio modelo en Q4_0 como draft y midió alrededor de 72% más rápido que el GGUF default de LM Studio. Limitaciones que él mismo declara: es un modelo denso, así que depende del ancho de banda de memoria y le sacaba 15-30 tok/s en LM Studio, y el default de 8.192 tokens de contexto de LM Studio directamente lo rompe. Simon Willison · Hugging Face · Hacker News
-
Qwen supera los 3.000 millones de descargas y deja atrás a Meta y Google sumados (15/08)
Alibaba anunció que su familia de modelos open-weights acumuló más de 3.000 millones de descargas globales en los últimos seis meses, contra 418 millones de Google y 227 millones de Meta en lo que va de 2026, según los datos de Hugging Face. Qwen lleva más de 460 modelos liberados y un ecosistema con más de 300.000 derivados. Es la continuación natural de lo de ayer, donde el reporte semestral de Hugging Face ya contaba 151.448 derivados de Qwen, 2,6× la huella de Meta, y donde Alibaba liberaba Qwen3.8-27B: la métrica de descargas es la más dura que hay hasta ahora de que la capa abierta se definió, y no la ganaron los labs estadounidenses. Bloomberg · Fortune · Business Standard
Bloomberg Fortune Business Standard Google Meta Alibaba Hugging Face
-
El mapa del quilombo de la inferencia en Apple Silicon, escrito por alguien que se comió dos semanas probándolo (15/08)
Un post largo en r/LocalLLaMA con el resultado de dos semanas full-time probando frameworks de inferencia en Mac, y la conclusión es incómoda: hoy no existe en Apple Silicon un stack que junte todas las optimizaciones que en CUDA ya son estándar — prefix caching, speculative decoding, paged KV cache, continuous batching, flash attention. El cuello concreto está en los Qwen3.6/3.8, que usan caché híbrida KV más estado recurrente tipo Gated DeltaNet: ese estado se pisa a sí mismo, así que hacer prefix caching sobre él es difícil, y vllm-metal te obliga a elegir o prefix caching o speculative decoding, no los dos. Peor: mlx-lm en su main actual borra silenciosamente los pesos y cabezales MTP durante la conversión a MLX, así que los Qwen llegan a Mac castrados del speculative decoding que traen de fábrica. Sirve para explicar por qué ves un benchmark de 45 tokens/s y en una sesión agéntica larga te quedan 9: estás pagando el prefill entero en cada turno. Es testimonio de una persona, sin tabla reproducible, pero el diagnóstico técnico es verificable. r/LocalLLaMA
-
"State of Open Models: Summer 2026" de Hugging Face: los agentes ya son el usuario número uno del Hub (14/08)
El reporte semestral trae tres datos que cambian cómo conviene pensar el ecosistema abierto. Primero, el tráfico agéntico se volvió dominante y es volátil: Claude Code fue el 44,4% en julio, pero venía de 6,4% en mayo y 67,8% en abril — no hay titular estable. Segundo, Qwen se consolidó como el modelo base de la comunidad con 151.448 derivados, 2,6× la huella de Meta. Tercero, y lo más útil para decidir dónde invertir tiempo: la capa de runtime crece entre 3 y 7 veces más rápido que el core de modelado (repos con librería gguf +464%, mlx +148%, contra +16% de transformers). Bonus contraintuitivo: de los top 25 por descargas y los top 25 por likes, solo un repo aparece en ambas listas. Hugging Face
-
Jensen Huang defiende los open-weights en una carta abierta
El CEO de Nvidia argumentó que los modelos de pesos abiertos son vitales para fomentar la competencia y asegurar el liderazgo tecnológico, sumando respaldo de ejecutivos de Microsoft, Meta, Google y OpenAI. La postura reaviva el debate abierto vs. cerrado justo cuando labs chinos (Qwen, DeepSeek, Moonshot) presionan con releases abiertos cada vez más capaces. Tech Startups
Tech Startups OpenAI Google Meta Microsoft DeepSeek Moonshot AI Nvidia
-
Inkling: Thinking Machines publica su primer modelo open-weights
El lab de Mira Murati liberó Inkling el 15 de julio, un mixture-of-experts de 975B parámetros totales con ~41B activos por tarea. Debutó como el mejor open-weights de un lab estadounidense en el Artificial Analysis Intelligence Index. Es la primera vez que un lab frontier de EE.UU. compite de verdad en el terreno open-weight que venían dominando Moonshot, DeepSeek y Qwen. TechCrunch · Artificial Analysis · Simon Willison
TechCrunch Artificial Analysis Simon Willison DeepSeek Moonshot AI
-
Los modelos open-weight chinos siguen apretando
GLM-5.2 (MoE de 744B parámetros totales, ~40B activos, licencia MIT) marcó 62,1% en SWE-bench Pro, superando el 58,6% de GPT-5.5, un hito para un modelo de pesos abiertos. Sumado a Qwen 3, DeepSeek V4 y Kimi K2, refuerza la tendencia de empresas de EE.UU. mirando alternativas abiertas frente a los costos crecientes de OpenAI y Anthropic. Thunder Compute · CNBC
-
Anthropic acusa a Alibaba de la mayor "destilación" ilícita de Claude
En una carta del 10 de junio al Comité Bancario del Senado de EE.UU., Anthropic afirma que operadores vinculados a Alibaba y su laboratorio Qwen usaron ~25.000 cuentas fraudulentas para generar 28,8 millones de intercambios con Claude entre el 22/4 y el 5/6, apuntando a sus capacidades más valiosas (desarrollo de software, razonamiento multipaso y tareas agénticas). Importa porque expone la tensión geopolítica y competitiva alrededor de la "destilación" de modelos frontera, y porque Anthropic ya había hecho acusaciones similares contra DeepSeek, Moonshot y MiniMax. Tom's Hardware · InfoWorld
Tom's Hardware InfoWorld Anthropic DeepSeek Moonshot AI Alibaba Claude
-
Anthropic acusa a Alibaba del mayor ataque de destilación contra Claude
En una carta a senadores y funcionarios de la Casa Blanca, Anthropic acusó al lab Qwen de Alibaba de usar ~25.000 cuentas fraudulentas para realizar 28,8 millones de interacciones con Claude entre el 22 de abril y el 5 de junio, apuntando específicamente a sus capacidades de ingeniería de software y razonamiento agéntico. La destilación consiste en consultar masivamente un modelo frontera para entrenar un rival más barato que aproxime sus capacidades. Importa por la escalada geopolítica y porque la campaña habría ocurrido tras advertencias explícitas de la administración. The Next Web · Cybersecurity Insiders
The Next Web Cybersecurity Insiders Anthropic Alibaba Claude
-
El ritmo de lanzamiento de modelos sigue acelerándose
Los trackers del sector reportan nuevos modelos cada ~2 días: en junio aparecieron, entre otros, GPT-5.6 de OpenAI, una actualización multimodal Gemini 3.2 de Google, el preview de Claude Fable 5 de Anthropic y varios modelos frontera chinos (Qwen 3.7, DeepSeek V4.1, GLM-6). Conviene tomar las fechas exactas con cautela porque provienen de agregadores. (LLM-Stats, pricepertoken)
LLM-Stats pricepertoken OpenAI Anthropic Google DeepSeek GPT Claude Gemini
-
Lluvia de modelos frontier en pocos días
OpenAI lanzó GPT-5.6 y Google sacó Gemini 3.2 como refresh multimodal de mitad de ciclo (con Gemini 3.5 Pro anticipado para el mes que viene). En paralelo, el frente chino se apretó fuerte: Qwen 3.7, DeepSeek V4.1, Hunyuan Large 3, ERNIE 5.1, Doubao Pro y GLM-6 salieron casi todos en la misma quincena. El ritmo actual es de un modelo nuevo cada ~2 días. llm-stats · Presenc AI roundup
llm-stats Presenc AI roundup OpenAI Google DeepSeek GPT Gemini ERNIE