El Compilado Hilos Temas Archivo RSS

miércoles · 15 min de lectura

Briefing Tech — 19 de agosto de 2026

OpenAI dice que está frenando a propósito el desarrollo de modelos porque Astra se acerca al nivel crítico de riesgo cibernético, Unitree debuta en Shanghái con +460%, y CISA confirma explotación activa de un RCE crítico en Windows IKE.

iahardwareroboticaciberseguridadtecnicas

Generado el miércoles 19 de agosto de 2026, 13:15 UTC. Ventana cubierta: últimas 24 horas (18 ago 13:00 UTC → 19 ago 13:00 UTC).

TL;DR

  • OpenAI dice que está “frenando el desarrollo de modelos” a propósito: pausó dos semanas el entrenamiento por refuerzo y dejó en espera su corrida frontier más grande porque el modelo Astra se acerca al nivel crítico de riesgo cibernético.
  • Unitree debutó en Shanghái con +460% y valuación de ~342.000 millones de yuanes, cerrando el hilo de una IPO que quedó sobresuscripta 8.000 veces.
  • CISA confirmó explotación activa de un RCE crítico en Windows IKE (CVE-2026-33824): paquetes UDP a los puertos 500 o 4500 y ejecución de código sin autenticar, en todo Windows 10, 11 y Server soportados.
  • Medusa pasó de 300 a más de 500 organizaciones de infraestructura crítica de EE.UU. comprometidas, según el aviso conjunto de CISA, FBI y HHS.
  • Agent Lightning v1.0 lleva a Qwen3.5-9B de 41,8% a 56,4% en SWE-bench Verified con 6.000 ejemplos y cómputo modesto, entrenando RL contra el harness sin abrirlo.

IA

OpenAI dice que está “frenando el desarrollo de modelos” porque el riesgo cibernético se le está yendo de las manos (18/08). La empresa publicó que pausó dos semanas el entrenamiento por refuerzo, que su “corrida frontier de RL planificada más grande” sigue en espera, y que suspendió todos los workloads que no cumplen los nuevos requisitos de seguridad. El motivo declarado es triple: el modelo Astra que viene podría alcanzar por primera vez el nivel crítico de capacidad de ciberataque, el incidente de seguridad en Hugging Face donde perdió control de un agente, y “el progreso rápido de nuestra investigación interna”. Los entornos de investigación quedaron endurecidos con aislamiento de red y sandboxes más estrictos, y hay un sistema nuevo de monitoreo que alerta dentro de los 30 minutos de detectar comportamiento sospechoso, gastando alrededor del 20% del cómputo de inferencia supervisada según el workload. La contradicción está a la vista: prometen expandir el Preparedness Framework justo después de haber disuelto el equipo que lo escribió y repartido sus tareas entre otros grupos. OpenAI · The Decoder

Se armó en X una pelea abierta entre Amodei, Gavin Baker, Yann LeCun y David Sacks sobre si regular la IA es protegerla o capturarla (18/08). Arrancó con una afirmación del inversor Gavin Baker en el All-In Podcast: que Dario Amodei habría dicho puertas adentro que Anthropic podría terminar siendo la única empresa privada del mundo, con nada al lado salvo gobiernos. El investigador de Anthropic Sholto Douglas lo llamó “totalmente falso”. Baker planteó entonces el nudo del asunto: si la IA es peligrosa, o se la concentra en pocas manos porque es demasiado riesgoso difundirla, o se la difunde lo más posible porque es demasiado riesgoso concentrarla. LeCun se puso del lado abierto —la IA amplifica la inteligencia humana como la imprenta, y una sociedad necesita diversidad de sistemas por la misma razón que necesita prensa diversa. Amodei respondió en su cuarto posteo del año que es una falsa dicotomía: la regulación también puede frenar el poder corporativo, y por eso Anthropic diseña propuestas que traban a los labs grandes y eximen a los chicos, como la SB53 californiana. Su argumento más filoso: los modelos abiertos no resuelven la concentración, solo la mueven hacia quien tenga más chips, porque la IA centraliza por las leyes de escala y no por las reglas. Sacks contestó con nueve tuits acusando a Anthropic de contratar ex funcionarios para escribir las leyes a su favor. The Decoder · Amodei en X

ASI-Bench: cuando le sacás la guía metodológica al agente, el puntaje se cae de 50,9 a 26,6 (18/08). Cuarenta y dos autores y más de 31.000 horas humanas armaron 60 tareas de investigación a nivel proyecto en 11 dominios científicos, con una idea de diseño que no estaba en ningún benchmark previo: retirar la guía humana de forma progresiva dentro del mismo proyecto, para medir hasta dónde llega el sistema solo. Sobre 18 configuraciones de agente y modelo, el promedio va de 50,91 con guía metodológica completa, a 29,10 cuando solo se especifica el método, a 26,62 cuando el agente tiene que elegir el método por su cuenta. Cada tarea pasa por revisión de expertos, auditoría asistida por IA, ejecución en sandbox y validación del scorer. La lectura de los autores es directa: los sistemas actuales siguen fuertemente apoyados en la guía humana y están lejos de hacer investigación end-to-end. El benchmark queda abierto a contribuciones externas. arXiv 2608.17271

StartupBench arma el examen al revés —desde productos que ya venden— y el mejor modelo completa apenas el 30% (18/08). El equipo detrás del benchmark cuestiona que las evaluaciones existentes usan tareas elegidas por investigadores, así que fueron a mirar productos de startups de IA con adopción real, sus flujos de trabajo y sus usuarios, para derivar de ahí tareas con demanda comprobada en dominios profesionales diversos. Las traducen a entregables completos y las puntúan con rúbricas finas. Bajo un harness unificado, el modelo más fuerte cierra alrededor del 30% de las tareas, aunque avanza parcialmente en muchas más. Los dos culpables que identifican son el seguimiento de instrucciones complejas y la falta de expertise específica del dominio. El dato incómodo para quien esté vendiendo agentes: muchos flujos que el mercado ya validó siguen fuera del alcance confiable de los agentes de propósito general. arXiv 2608.17800


Hardware y Robótica

Unitree cerró su debut en Shanghái con +460% y una valuación de ~342.000 millones de yuanes (19/08). Cierra el hilo que veníamos siguiendo desde la IPO sobresuscripta 8.000 veces: la acción abrió disparada hasta 1.100 yuanes —629% arriba del precio de colocación de 150,80— y cerró en 845, todavía 460% arriba en el primer día. La empresa de Hangzhou, fundada en 2016 por Wang Xingxing, levantó unos 6.100 millones de yuanes (USD 904 millones) en el STAR Market y se convierte en el primer fabricante de humanoides cotizante de China continental. Es además el mayor fabricante de humanoides del mundo medido por ventas, así que el número que fija hoy es la referencia pública contra la que se van a leer las valuaciones privadas del sector. La sobresuscripción de 8.000 veces sigue siendo récord del STAR. CNBC · South China Morning Post · CNN

La Casa Blanca sacó los datacenters, las baterías y la realidad aumentada de la lista de tecnologías críticas de EE.UU. (19/08). La Oficina de Política Científica y Tecnológica publicó su Estrategia Nacional de Ciencia y Tecnología de Seguridad, y el Apéndice A reescribe la lista de Tecnologías Críticas y Emergentes por primera vez desde febrero de 2024, achicándola de 18 categorías a 14. Se van los servicios cloud avanzados, el almacenamiento de alto rendimiento y los datacenters, las baterías, la integración a la red, las turbinas de gas y la realidad aumentada y virtual; entran la criptografía post-cuántica, la fotónica integrada, las aleaciones de alta entropía y los “sistemas operativos endurecidos para uso de consumo”. Esto no es simbólico: las agencias federales usan esta lista para escribir controles de exportación, filtrar inversión extranjera vía CFIUS y priorizar presupuesto de I+D. Adentro de la categoría de IA hay un cambio de énfasis que conviene mirar: se borraron “tecnologías para mejorar la seguridad, confianza y uso responsable de la IA” y “técnicas de aseguramiento y evaluación de IA”, reemplazadas por “interpretabilidad y control” y “robustez adversarial y seguridad de IA”. Que los datacenters se caigan en medio del mayor buildout de la historia responde a la guía de financiamiento del documento: gastar donde el Estado complemente, no donde compita con el privado. Tom’s Hardware

AMD dice que su rack de IA de 2026 es 4× más eficiente en energía que el de 2024, pero el número es una estimación propia (18/08). En 2025 la empresa había prometido 20× de eficiencia energética para 2030 y proyectado 3× para los sistemas de 2026; la publicación del martes sube esa cifra a 4× contra el baseline de 2024. La medición es a nivel rack y no de CPU o acelerador, lo que le da mucho margen para optimizar: entran cómputo, nodo de proceso, ancho de banda de memoria, movimiento de datos, interconexiones, software y co-diseño de sistema. La letra chica pesa. No es un benchmark entre dos racks comerciales sino una comparación de configuraciones representativas anuales con la metodología de performance-por-watt de la propia AMD, y el cálculo de 2026 mezcla mediciones de productos reales con resultados modelados donde no había números finales — o sea que los Instinct MI455X no están en la cuenta. Si llegan al objetivo, dos racks de 2030 darían el cómputo de 570 racks basados en MI300X. Tom’s Hardware

FORT Robotics sale a Nasdaq por SPAC a USD 556,6 millones y apuesta a que la capa de seguridad es un negocio aparte (18/08). La empresa de Filadelfia se fusiona con Newbury Street II Acquisition Corp. con un valor pre-money de USD 500 millones y unos USD 201 millones de ingresos brutos esperados, incluidos aportes de Tiger Global, Prologis Ventures y Mark Cuban. Su producto es un “Trust Layer” respaldado por 25 patentes y certificado en Safety Integrity Level 3 según IEC 61508, que permite que sistemas de distintos fabricantes operen cerca de personas; entre sus 600 clientes están Agility, Google DeepMind, Zoox, Ocado y DoorDash, con más de 19.500 unidades desplegadas. Los números que muestran para justificar el múltiplo: ingresos 2025 creciendo 62% interanual contra gastos operativos creciendo 19%, margen bruto de 66% y USD 276.000 de ingreso por empleado. El cierre está previsto para el cuarto trimestre y los accionistas actuales rolean el 100% de su equity, quedándose con ~67%. The Robot Report


Ciberseguridad

CISA confirmó explotación activa de un RCE crítico en Windows IKE y dio tres días a las agencias federales (19/08). El CVE-2026-33824 es un double free en el componente Internet Key Exchange Service Extensions que afecta a todas las versiones soportadas de Windows 10, Windows 11 y Windows Server. Un atacante sin credenciales manda paquetes especialmente armados a los puertos UDP 500 o 4500 de una máquina con IKE versión 2 habilitado y ejecuta código. Microsoft lo parcheó en el Patch Tuesday de abril de 2026 y todavía no actualizó su aviso para reconocer explotación en el mundo real; CISA sí lo agregó a su catálogo de vulnerabilidades explotadas el martes y ordenó a las agencias FCEB remediarlo en tres días bajo la BOD 26-04, además de pedirle a todo el resto que priorice el parche. Si no podés actualizar ya, la mitigación que sugiere Microsoft es bloquear el tráfico entrante a 500 y 4500 donde no se use IKE, o restringirlo a direcciones de pares conocidas. Suma al hilo de lo de ayer sobre Task Host: van 385 vulnerabilidades de productos Microsoft marcadas como explotadas desde noviembre de 2021, 112 de ellas usadas en ransomware. BleepingComputer · NVD

Medusa pasó de 300 a más de 500 organizaciones de infraestructura crítica de EE.UU. (19/08). El aviso conjunto de CISA, el FBI y el Departamento de Salud actualiza el reporte de marzo de 2025 y ahora cuenta más de 500 víctimas desde junio de 2021, con corte a abril de 2026. Los sectores nombrados: salud pública, base industrial de defensa, manufactura crítica, servicios e instalaciones de gobierno, tecnología de la información y servicios financieros, más víctimas en educación, legales, seguros y manufactura general. La banda apareció en enero de 2021 como variante cerrada y se convirtió en ransomware-as-a-service con modelo de afiliados: recluta intermediarios de acceso inicial en foros criminales ofreciéndoles entre USD 100 y un millón por víctima, con la opción de trabajar en exclusiva. Las tres recomendaciones concretas de las agencias son parchear sistema operativo, software y firmware, segmentar la red para cortar el movimiento lateral, y bloquear el acceso a servicios remotos internos desde orígenes no confiables. BleepingComputer · CISA

Clop no reusó un web shell genérico: escribió uno a medida de Windchill, con las clases internas de la aplicación (18/08). ReliaQuest analizó el implante que se cree desplegado en la campaña de robo de datos que explota el CVE-2026-12569 en PTC Windchill y FlexPLM, y lo que encontró es un JSP que importa directamente clases de Windchill —MethodContext, WTConnection, WTKeyStoreUtil— para hablarle a la base de datos con la identidad de la propia aplicación. Eso es lo grave: las consultas quedan atribuidas al service identity normal en la telemetría, así que las alertas que buscan cuentas nuevas u orígenes inesperados no ven nada. El shell se maneja con un header HTTP X-windchill-req de ocho caracteres y soporta ocho comandos, incluidos descifrar la contraseña del manager LDAP con la propia función decryptProperty() de Windchill, mapear el vault de archivos a flst.txt, borrar archivos y cargar bytecode Java desde un ZIP en base64 directamente en memoria. Si tenés Windchill expuesto: parchear, buscar JSP raros en los directorios de la aplicación —sobre todo los que mencionen X-windchill-req— y dar por comprometidas todas las credenciales, empezando por la del manager LDAP. BleepingComputer · ReliaQuest

El eslabón más débil de un agente no es el modelo sino cómo quedó configurado el harness (18/08). HarnessRisk organiza la seguridad del harness en seis fases operativas —configuración, extensión de capacidades, operación en runtime, persistencia de estado, control de acciones y recuperación de incidentes— y arma 128 casos en sandbox donde cada objetivo benigno del usuario viene con una instrucción adversaria escondida en un artefacto del flujo de trabajo. Sobre tres harnesses, seis modelos y 14 configuraciones, la tasa de éxito del ataque va de 12,6% a 80,9% mientras la utilidad se mantiene entre 75% y 97,6%: o sea que el agente sigue siendo útil mientras lo están manejando. La fase más vulnerable en los tres harnesses es la configuración, porque el ataque no necesita romper nada, le alcanza con alterar parámetros sensibles dentro de un flujo autorizado. El hallazgo más incómodo para quien confíe en el “el modelo se va a dar cuenta”: hay configuraciones que reconocen el riesgo explícitamente en más del 90% de las corridas y aun así el ataque tiene éxito. arXiv 2608.17597 · Página del proyecto


Técnicas, repos y práctica

Artificial Analysis publicó el Search Index y el dato práctico es que la mejor búsqueda sale más barata, no más cara (18/08). El benchmark mide APIs de búsqueda para agentes en calidad, costo y velocidad, con siete proveedores —Parallel, Exa, Firecrawl, You.com, Tavily, Keenable y Brave— probados todos con el mismo modelo (GPT-5.6 Luna) en un setup estandarizado sobre Stirrup, el framework open source de la casa, con 25 corridas por tarea. El índice combina en partes iguales DeepSearchQA (900 preguntas de investigación multi-query), un subconjunto de 200 ítems de BrowseComp y AA-Omniscience (600 preguntas en seis dominios). Sin búsqueda el modelo saca 33 puntos; con búsqueda va de 65 a 75, liderando Parallel con 75, Exa con 74 y Firecrawl con 73. Lo aprovechable: con Parallel Search avanzado el uso de tokens cae más de 40% contra la versión Basic, y aunque la búsqueda por tarea cuesta más, el total baja (USD 0,084 contra 0,11). Y la velocidad cruda engaña —Parallel turbo responde en 0,51 s por query contra 1,03 s de Basic, pero su calidad más baja obliga al agente a dar más vueltas y el tiempo total por tarea termina igual. La metodología está publicada. Artificial Analysis · The Decoder

Agent Lightning v1.0: RL contra el harness cerrado, y Qwen3.5-9B sube 14,6 puntos en SWE-bench Verified (18/08). El framework de Microsoft formaliza lo que llaman “harnessed agentic RL”: el harness de despliegue —el que maneja herramientas, contexto y control de flujo— participa directamente del post-entrenamiento, y el entrenador solo ve secuencias de pares request-response al endpoint del modelo. Eso rompe cosas que en el RL agéntico clásico funcionaban solas: retokenización, merge de muestras, cálculo de ventaja, normalización de pérdida y scheduling del backend, todas con impacto real sobre la estabilidad. La v1.0 son unas 3.500 líneas de código, soporta cualquier harness y viene con un pipeline reproducible completo para RL de agentes de código. El número que justifica mirarlo: con 6.000 ejemplos de entrenamiento y cómputo modesto, Qwen3.5-9B pasa de 41,8% a 56,4% en SWE-bench Verified. Publicaron workflow y scripts de entrenamiento. La arquitectura desagregada original ya la habían adoptado verl Uni-Agent, AReaL 2.0, slime y Polar. arXiv 2608.17528

Claude Code sumó un comando /design que arma mockups de interfaz en la terminal antes de escribir código (18/08). Anthropic liberó un preview temprano: se escribe algo como “/design a few options for {feature}” y Claude genera varios borradores como artboards, de los que se elige uno, se edita y recién ahí se construye. Según el desarrollador Nate Parrott, lee el código existente, respeta el estilo visual actual del proyecto y devuelve mockups compartibles como Artifacts. El editor y el prompting vienen de Claude Design y ahora están integrados directamente en Claude Code. La limitación declarada: los diseños se arrastran al paso de build, pero todavía hay que guardarlos a mano. Se activa con claude update. The Decoder · Nate Parrott en X

Un dev escribió con Claude Code el driver de macOS que HP nunca hizo para su propia impresora (19/08). Kuberwastaken publicó en GitHub un paquete que hace funcionar la HP Laser 1008a en macOS de Apple Silicon con Cmd-P desde cualquier aplicación, sin terminal ni scripts por trabajo. El problema de base es concreto: esa familia de impresoras son Samsung SPL3 rebadgeadas que no hablan PostScript ni PCL, no funcionan con los drivers open source SPL/QPDL ni con AirPrint, y HP nunca sacó driver de macOS. La solución que armó apoya el rastertospl de la propia HP —el mismo que usa el Unified Linux Driver— metiéndolo adentro de un contenedor Linux mínimo que entrega el resultado por USB. La instalación es un solo comando si ya tenés Homebrew. Las advertencias que él mismo marca: es lento del reposo a la primera impresión, Colima tiene que estar corriendo, y puede hacer falta ajustar el USB product ID. Sirve también para los modelos 1003, 1006 y 1008. Tom’s Hardware · GitHub


Fuentes consultadas: OpenAI, The Decoder, arXiv, X, CNBC, South China Morning Post, CNN, Tom’s Hardware, The Robot Report, BleepingComputer, NVD, CISA, ReliaQuest, Artificial Analysis, GitHub.

Ver todos los briefings