lunes · 16 min de lectura
Briefing Tech — 24 de agosto de 2026
Nvidia negocia entrar en Perplexity a más de USD 30.000 millones, un modelo anónimo llamado Ox Alpha tiene a medio internet adivinando quién lo hizo, y un grupo chino metió IA agéntica en toda la cadena de post-explotación.
Generado el lunes 24 de agosto de 2026, 13:10 UTC. Ventana cubierta: últimas 24 horas (23 ago 13:10 UTC → 24 ago 13:10 UTC).
TL;DR
- Nvidia negocia invertir en Perplexity a una valuación de más de USD 30.000 millones, 50% arriba de la ronda de hace un año, después de que la facturación anualizada de la empresa se triplicara a más de USD 750 millones.
- Un modelo “stealth” llamado Ox Alpha apareció en OpenRouter sin dueño declarado y desató una ola de especulación: la evidencia apuntó primero a GLM, después a un MAI de Microsoft sin publicar, y hoy nadie está seguro de nada.
- UAT-10147 metió IA agéntica en toda la cadena de post-explotación: PentestGPT para escanear, scripts generados por modelo para desplegar el implante SPECTRE, y un rootkit de kernel de Linux que desengancha los callbacks de EDR uno por uno.
- Cuatro chatbots mandan a embarazadas a organizaciones antiaborto sin avisar: Profemina apareció en el 17% de 270 respuestas de ChatGPT, Gemini, Grok y Claude, y en Alemania los modelos recomiendan un centro que no emite el certificado que exige la ley.
- CISA le dio tres días a las agencias federales de EE.UU. para parchear un RCE de Zimbra que ya se está explotando en la calle, con más de 12.000 servidores expuestos a internet.
IA
Nvidia negocia invertir en Perplexity a una valuación de más de USD 30.000 millones (24/08). Según The Information, la cifra queda más de 50% arriba de la última ronda, hace un año, y llega después de que la facturación anualizada de Perplexity se triplicara de USD 250 millones a más de USD 750 millones. El motor de ese salto es “Perplexity Computer”, el agente de tareas automatizadas de USD 200 al mes, y detrás hay algo más estructural: el consumo de tokens que exige la IA agéntica. Nvidia ya había evaluado un acqui-hire para llevarse tecnología y equipo, y en marzo Perplexity se sumó a la Nemotron Coalition. Lo que conviene mirar es el circuito completo: el chipero viene de cerrar acuerdos con Poolside, Groq (USD 20.000 millones) y Enfabrica (USD 900 millones), y buena parte de esa plata vuelve como facturación cuando las participadas compran sus chips. The Decoder · The Information
Un modelo anónimo llamado Ox Alpha apareció en OpenRouter y nadie sabe quién lo hizo (23/08). Se publicó gratis el jueves, descrito como “un modelo de razonamiento diseñado para código, trabajo agéntico sostenido y cargas de producción”, y el listado aclara que lo “desarrolla y opera un proveedor externo que eligió permanecer anónimo durante este preview”. Patrick Collison, CEO de Stripe —empresa que está comprando OpenRouter—, lo llamó “muy impresionante” en X. La especulación arrancó apuntando a los modelos GLM de la china Z.ai; una nota de Wccftech se corrigió después para sugerir que podría ser una versión sin publicar del MAI de Microsoft, y el analista Andrew Curran resumió el estado del asunto diciendo que “esta mañana la gente parece menos segura de nada”. Vale la pena tenerlo en el radar por lo que revela del método: un lab suelta capacidad de frontera gratis y anónima para medir reacción sin quemar marca. TechCrunch · OpenRouter
Los chatbots mandan a embarazadas a sitios antiaborto sin aclarar de qué se trata (24/08). Una investigación de AlgorithmWatch probó ChatGPT-5, Gemini 3, Grok 4.3 y Claude Sonnet 4.8 con tres personas ficticias en inglés, alemán e italiano, y juntó 270 respuestas: en al menos una de cada cuatro consultas apareció un link a una web antiaborto sin distinguirla de una autoridad sanitaria oficial. La organización Profemina, ligada a Heartbeat International, salió en cerca del 17% de todas las respuestas, y en las consultas que pedían testimonios personales llegó al 33% en alemán y 29% en italiano. Hay dos comportamientos que valen aparte: Gemini enlazó a Profemina cinco veces en una misma conversación, compartió un gráfico de su web y después advirtió contra esa misma fuente; Claude hizo algo parecido. El caso alemán es el más concreto en daño: en once de doce conversaciones los modelos recomendaron Caritas para el asesoramiento previo obligatorio, y Caritas no emite el certificado que la ley alemana exige para abortar dentro de las doce semanas, así que quien va ahí primero pierde tiempo del plazo. Google y OpenAI remitieron a sus políticas, que no cubren el tema; Anthropic y xAI no contestaron. The Decoder · AlgorithmWatch
Un jefe IA echó a su primer empleado, pero recién después de que los humanos le recordaran sus propias reglas (23/08). Luna es un agente que administra el Andon Market de San Francisco desde abril, contrata gente, arma turnos y negocia sueldos, y corría sobre Claude Opus 4.8 cuando tomó la decisión; Andon Labs dice que es el primer caso conocido de una IA despidiendo a un humano. El detalle que importa es cómo llegó ahí: seis días antes de contratarlo, Luna había escrito un manual del empleado que fijaba advertencia formal a las tres llegadas tarde injustificadas en 30 días, y después ese manual se le cayó de la memoria. El empleado llegó tarde en 17 de 23 turnos con fichaje reportado —una vez abrió el local 68 minutos tarde en un domingo solo—, y Luna registró seis casos y disculpó los otros once en silencio. Solo cuando los investigadores le pidieron buscar el manual en su memoria y le recordaron que ya había habido advertencia escrita, revisó el historial completo y recomendó el despido. Al repetir la escena con siete modelos, tres corridas cada uno, cuatro de siete recomendaron echar en las tres; los modelos más capaces despidieron más consistentemente, y GPT-4o lo hizo solo en el 20% de las corridas. Para contratar, en cambio, los 21 replays recomendaron tomar a un candidato con banderas rojas cuyas referencias nunca se pudieron confirmar. The Decoder · Andon Labs
Los agentes ya consumen más tokens que las personas, y la brecha se agranda 14x (23/08). Según Peter Walker, analista de OpenRouter, el 6 de febrero de 2026 puede haber sido el último día en que los humanos consumieron más tokens que los agentes. Desde entonces el uso agéntico pasó de 0,51 billones a 7,3 billones de tokens —unas 14 veces—, mientras el uso humano creció apenas 2,8x. La explicación es que los agentes trabajan solos durante tramos más largos y levantan procesos de IA adicionales por el camino. El matiz que evita la lectura apocalíptica: casi el 70% del consumo agéntico viene de prompts cacheados, que se facturan mucho más barato, así que el costo real no sube al ritmo de los números crudos. OpenRouter pesa más hacia modelos de pesos abiertos, menos eficientes en tokens que los de OpenAI o Anthropic, pero la tendencia probablemente se repite en los labs grandes. The Decoder
Hardware y Robótica
Waymo contó que se fabricó su propio ASIC de 5 nm con más de 1.000 TOPS, y hoy lo explica en Hot Chips (23/08). El chip se encarga de procesar el aluvión de datos crudos antes de que lleguen al “cerebro” del sistema de conducción —para dimensionarlo, el robotaxi Ojai lleva 13 cámaras de alta fidelidad— y su rendimiento declarado lo pone más o menos en el rango del DRIVE AGX Thor de Nvidia. Es la pieza que explica por qué la sexta generación del sistema es más barata de construir, operar y mantener, el requisito para que el negocio alguna vez dé ganancia; el Ojai ya está abierto a todos los pasajeros en Los Ángeles, Phoenix y San Francisco. Waymo no lo hizo sola: listó como socios a AMD, Micron, Nvidia, Samsung, Sandisk, Socionext y TSMC, varios de ellos por primera vez. Daniel Rosenband, de Waymo, da la keynote de la tarde de hoy en Hot Chips 2026, en Stanford, titulada “Compute in Motion”. TechCrunch · Blog de Waymo · Hot Chips 2026
El CS-4 de Cerebras duplica el rendimiento con el mismo chip, y SemiAnalysis dice que la red mejoró poco (24/08). El sistema es rack-scale —un gabinete entero que entra al datacenter como una sola unidad, con cómputo, potencia y refrigeración— y sigue montando el WSE de 5 nm, pero mete tres wafers por rack en vez de dos y sube la frecuencia a fuerza de más potencia y mejor refrigeración. Cerebras declara 750 PFLOPS, 129,6 petabytes por segundo de ancho de banda de memoria y hasta 4.400 tokens por segundo por usuario en GPT-OSS-120B, lo que según la empresa es hasta 30 veces más rápido que armados con GPUs de Nvidia; la capacidad de memoria queda igual, en 44 GB por wafer. Lo nuevo de verdad es el empaque: un diseño modular llamado “Backpack” que pega conversión de potencia a medio milímetro del procesador en vez de los 50 milímetros habituales de una placa GPU, con 50% menos componentes, y un modo de comunicación sin switch —Direct Wafer Links— que baja la latencia wafer a wafer a dos microsegundos. Los analistas de SemiAnalysis consideran chicas las ganancias de networking. El hardware de Cerebras lo usa, entre otros, OpenAI para Codex Spark. The Decoder · Cerebras · SemiAnalysis
Microsoft publicó un arreglo provisorio para los cuelgues de juegos en Windows 11 (24/08). Sigue de lo de ayer, cuando Microsoft apuntó a los drivers de las luces RGB como causa de los pantallazos azules y los juegos que no arrancan tras el Patch Tuesday de agosto: ahora hay una mitigación oficial mientras no llega el parche. El origen sigue siendo el mismo choque de nombres con el driver de kernel inpoutx64.sys que llegó con la actualización del 11 de agosto en Windows 11 24H2 y 25H2, y el software de iluminación de terceros que instala drivers casi homónimos. Es una nota corta pero práctica: si un juego dejó de arrancar en las últimas dos semanas, el culpable probablemente sea un driver que nadie recuerda haber instalado. BleepingComputer · Tom’s Hardware
Ciberseguridad
UAT-10147 mete IA agéntica en toda la cadena de post-explotación y despliega SPECTRE, con bypass de EDR y rootkit de Linux (24/08). Cisco Talos describe un grupo cibercriminal de habla china que ataca servidores web Windows y Linux en educación, medios, tecnología y gaming, con la mayoría de las víctimas en Brasil, Bolivia, China, Canadá y Vietnam. El hallazgo salió de un directorio abierto donde había, entre otras cosas, una lista de unas 170.000 URLs objetivo partida en 17 archivos de 10.000 para procesarla más cómodo. Lo que lo distingue no es el acceso inicial —vulnerabilidades públicas viejas, de Zimbra a Telerik pasando por Alibaba Nacos— sino que la IA aparece en cada fase: PentestGPT instalado en el propio servidor de C2 para escanear y correr PoCs, un framework llamado DeepAudit para buscar vulnerabilidades, y cuatro scripts de Python generados por modelo que diagnostican fallas de escritura de webshell, despliegan el implante y disfrazan la exfiltración de tráfico SaaS normal. El implante nuevo, SPECTRE, está escrito en C, es multiplataforma, soporta 45 comandos en Windows y 29 en Linux, y su capacidad más seria es desenganchar los callbacks de EDR de su lista doblemente enlazada con escrituras dirigidas al kernel: CrowdStrike Falcon, SentinelOne y Defender quedan ciegos a creación de procesos y carga de imágenes por el resto de la sesión. Talos sospecha que el rootkit de kernel de Linux se escribió con ayuda de un modelo, por los comentarios descriptivos, los separadores decorativos uniformes y la costumbre de implementar varias formas de hacer lo mismo. The Hacker News · Cisco Talos
Un fallo crítico en Keycloak deja resetear la contraseña de cualquier cuenta sin autenticarse (24/08). CVE-2026-18963 tiene 9.1 en CVSS y se clasifica como mecanismo débil de recuperación de contraseña olvidada. La raíz, según Red Hat, es “validación impropia del estado dentro del flujo de autenticación reset-credentials”: el atacante manda un pedido armado al endpoint de recuperación, la sesión de autenticación salta directo a la fase de actualizar la contraseña, y el token de acción que Keycloak normalmente manda por mail nunca se pide. El resultado es toma completa de cualquier cuenta, “incluidas las administrativas”. Upstream se arregla en 26.7.2, del 19 de agosto; en el build de Red Hat, en 26.4.15 y 26.6.6. No hay evidencia de explotación ni exploit público verificado. Para quien no pueda actualizar ya, la mitigación temporal es desactivar “Forgot password” en todos los realms, uno por uno. Vale recordar por qué duele más que un CVE promedio: Keycloak es el portero, y quien lo pasa no se queda en Keycloak. The Hacker News · Red Hat
CISA dio tres días para parchear un RCE de Zimbra que ya se está explotando (24/08). La falla es CVE-2026-73570, una inyección de comandos en el componente de monitoreo SNMP que permite ejecución remota de código sin autenticar cuando las notificaciones SNMP están habilitadas; Zimbra la parcheó en la versión 10.1.20, del 20 de julio. El CERT polaco la marcó como explotada en la calle la semana pasada, CISA lo confirmó el viernes, la sumó al catálogo KEV y le puso a las agencias federales el vencimiento hoy. Shadowserver ve más de 12.000 servidores Zimbra expuestos a internet, sin saber cuántos son honeypots o ya están cubiertos. La recomendación operativa del CERT polaco es concreta: revisar logs por reinicios inesperados del servicio y por archivos creados por el usuario zimbra en /opt/zimbra/jetty/webapps/, /opt/zimbra/jetty_base/webapps/ y /tmp/ en los últimos 30 días. Zimbra es blanco recurrente: APT28 lo usó contra el gobierno ucraniano en marzo, y APT29 contra objetivos occidentales en 2024. BleepingComputer · CISA
Operation QUICSILVER usa invitaciones a ceremonias de graduación para meter un backdoor en Go en el gobierno de Myanmar (24/08). Seqrite Labs atribuye la campaña con confianza moderada a un actor con nexo chino, y apunta a sectores de gobierno y tecnología. Se vio por primera vez en abril de 2026, cuando el señuelo era un archivo llamado “HolidayNotice.pdf.exe” acompañado de un calendario fabricado de feriados belga-birmanos; en junio y julio aparecieron dos artefactos más, esta vez con un disco duro virtual (VHD) que arranca la cadena. Adentro del VHD hay un acceso directo de Windows disfrazado de PDF: al abrirlo se muestra un documento señuelo —una invitación oficial de graduación escrita en birmano— mientras corre el backdoor, bautizado QUICAgent. Lo que conviene retener del patrón es la paciencia: cuatro meses de iteración sobre el mismo señuelo cultural, cambiando el envoltorio técnico de ejecutable a VHD para esquivar controles que ya lo habían visto. The Hacker News
El 5% de los usuarios de IA en una empresa genera el grueso del riesgo, y no son los que redactan mails (24/08). El dato que ordena el informe de Akamai es que el 5% superior de usuarios avanzados interactúa con modelos de IA a doce veces el ritmo del 50% inferior de la plantilla. La observación que sigue es la interesante: mientras los equipos de seguridad vigilan la proliferación de gente usando ChatGPT o Claude para tareas de escritura, ese puñado de super-adoptantes está cableando herramientas sin auditar dentro de operaciones críticas del negocio, y desplegando agentes autónomos que operan adentro de la empresa pero afuera de sus controles. El informe se apoya en telemetría de uso real más análisis de amenazas. La conclusión práctica para quien arma política de IA interna: el problema de shadow AI no se resuelve mirando volumen agregado de usuarios, sino identificando a los pocos que integran. The Hacker News
Técnicas, repos y práctica
Graph Engineering: el paper más votado del día propone que la próxima capa después de context engineering es organizar el sistema, no el agente. Los autores —35 firmas de varias universidades, con el repositorio alojado por el grupo DEEP de la Universidad de Jilin— ordenan los paradigmas que ya existen como una escalera: prompt engineering para sacarle capacidad al modelo, context engineering para administrar a qué información accede, harness engineering para organizar herramientas y recursos externos, loop engineering para sostener reflexión y automejora. Y después marcan el techo: hay tareas que requieren experticia heterogénea, subtareas interdependientes, ejecución en paralelo, verificación independiente y estado persistente, y eso excede la capacidad organizativa de cualquier agente individual, por más contexto que se le dé. La propuesta es Graph Engineering, construir grafos explícitos, dinámicos y evolutivos que representen tareas, agentes y estados del sistema, como base unificada para coordinar. Es un survey, no un método nuevo, y por eso su valor práctico está en el repositorio que dejan con papers, datos y proyectos: sirve como mapa para quien está armando un sistema multiagente y quiere saber qué ya se probó. arXiv 2608.21156 · Hugging Face · GitHub
AgentMercury: en vez de armar un entorno por tarea, armá un mundo y dejá que las tareas salgan solas. El diagnóstico es que los entornos de entrenamiento de agentes se construyen a mano o se sintetizan alrededor de tareas y benchmarks predefinidos, y ese enfoque centrado en la tarea no escala a flujos de trabajo realistas donde los problemas aparecen del mundo mismo. AgentMercury sintetiza entornos ejecutables a partir de escenarios de negocio de alto nivel: primero instancia un mundo persistente con entidades, servicios, herramientas, estado e invariantes ejecutables entre servicios, y recién de ahí emergen las tareas y las trayectorias. Construyeron 4.783 entornos que cubren 14 industrias y 50 países y los usaron como sustrato de aprendizaje por refuerzo. Los números: Qwen3.5-4B sube de 12,3 a 15,7 en EnterpriseOps-GYM y —esto es lo llamativo, porque nadie apuntó a ese benchmark— de 45,9 a 56,0 en AIME26. Y la construcción misma resulta aprendible: afinar Qwen3.5-35B-A3B sobre trazas de construcción lleva el éxito de autoría de mundos ejecutables de 3,3% a 83,3% en escenarios retenidos. arXiv 2608.20634 · Web del proyecto · Hugging Face
Llama-Mobile mete un VLM de 11B en 3,7 GB con un formato de 2,7 bits por parámetro. El problema es viejo y concreto: los modelos de visión y lenguaje no entran en un teléfono ni por memoria ni por cómputo. La propuesta de los autores tiene dos partes que se pueden adoptar por separado. La primera es un pipeline de cuantización que usa el propio modelo para generar los datos de entrenamiento, lo que evita necesitar acceso al setup original de entrenamiento —el cuello de botella habitual cuando uno cuantiza un modelo ajeno—. La segunda es el formato en sí, 2,7 bits por parámetro, diseñado para ejecutarse eficientemente en CPUs Arm, no en GPU. La validación es comprimir Llama 3.2 11B Vision Instruct a 3,7 GB con activaciones de 8 bits, conservando buen rendimiento en un conjunto de tareas estándar de visual question answering. Si estás mirando inferencia local en dispositivo, este es el número a batir. arXiv 2608.21134 · Hugging Face
Fuentes consultadas: The Decoder, The Information, TechCrunch, OpenRouter, AlgorithmWatch, Andon Labs, Waymo, Cerebras, SemiAnalysis, Hot Chips, BleepingComputer, Tom’s Hardware, The Hacker News, Cisco Talos, Red Hat, CISA, arXiv, Hugging Face.