El Compilado Hilos Temas Archivo RSS

sábado · 19 min de lectura

Briefing Tech — 22 de agosto de 2026

DeepSeek suma visión a su modelo Flash y roza a Opus 4.8 en agentes, la crisis de memoria hunde 39% la venta de consolas en EE.UU., y 9.300 claves de AWS filtradas siguen vivas: 526 son claves root de empresas.

iahardwareroboticaciberseguridadtecnicas

Generado el sábado 22 de agosto de 2026, 13:10 UTC. Ventana cubierta: últimas 24 horas (21 ago 13:10 UTC → 22 ago 13:10 UTC).

TL;DR

  • DeepSeek liberó V4-Flash-Vision-Exp, que agrega visión al Flash de texto y se acerca a Opus 4.8 en los benchmarks de agente de la propia empresa, con techo de 384 tokens por imagen.
  • La crisis de memoria llegó a la góndola de consolas: las ventas en EE.UU. cayeron 39% en unidades en julio y el precio promedio subió 16% hasta USD 542.
  • 9.300 claves de AWS expuestas desde 2022 siguen activas, 526 de ellas root de empresas, y Hugging Face es la mayor fuente individual de filtraciones.
  • Un paper del UK AI Security Institute muestra que el score único de seguridad de un modelo se puede inflar bloqueando más, y que diez preguntas bien elegidas alcanzan para reproducir un benchmark entero.
  • EnvHarness, de Google, envuelve entornos estáticos con plugins que apuntan a las debilidades del agente y saca hasta 9 puntos de mejora con 9,8% menos pasos.

IA

DeepSeek libera V4-Flash-Vision-Exp y se acerca a Opus 4.8 en benchmarks de agente multimodal (21/08). El modelo experimental le agrega comprensión de imágenes a V4-Flash sin perder el rendimiento de texto en razonamiento y conocimiento del mundo, y en los benchmarks internos de la empresa queda cerca de Opus 4.8 y a veces lo pasa. El posicionamiento es explícito hacia flujos de trabajo de agentes visuales: describir imágenes, extraer texto de capturas, analizar diagramas, todo combinado con uso de herramientas. Lo práctico está en los límites: cada imagen cuesta como máximo 384 tokens sin importar la resolución original, entran hasta 600 imágenes por request, y hay una Files API nueva y gratuita para subir un archivo una vez y referenciarlo por ID en varias llamadas. Funciona con Chat Completions y Responses de OpenAI y con el endpoint Messages de Anthropic, y la versión 0.1.1 del Harness de DeepSeek ya lo soporta de fábrica. Los precios siguen la tarifa de V4-Flash. The Decoder · DeepSeek API Docs

Los modelos del mundo que ignoran lo que la gente cree predicen la acción equivocada (22/08). Un paper nuevo acusa a toda la generación actual —Sora, Genie 3, JEPA, Marble— de modelar solo la capa física: objetos, posiciones, movimiento, oclusión. El ejemplo que lo resume: si a alguien le guardan la taza en un armario mientras no mira, un modelo puramente físico ve la escena bien y predice mal la acción siguiente, porque no representa dónde esa persona cree que está la taza. El marco Mental World Modeling agrega variables mentales —creencias, atención, metas, intenciones, emociones, normas— y parte cada acción en un portador físico y una carga mental: el mismo gesto de deslizar una taza puede ser disculpa, engaño o cuidado. MENTIS, la implementación de referencia sin entrenamiento adicional, sube el F1 de 63,3 en respuesta directa a 87,9, contra 98,5 humano. El dato que ataja la objeción obvia: no alcanza con muestrear más, porque GPT-4.1 con el marco (84,9) le gana a GPT-5.6-Sol con self-consistency (83,6). El cuello de botella restante está en simular la transición de estado, no en describir el estado actual. The Decoder · GitHub

La oposición a los centros de datos pasó de 42% a 75% en un solo año (21/08). La encuesta de Heatmap News repitió la misma pregunta a lo largo del año: hoy 75% de los estadounidenses se opone a que construyan un centro de datos cerca suyo, y 61% se declara “fuertemente en contra”. Hace un año la opinión estaba casi partida, 43% a favor contra 42% en contra, y la primera mayoría ajustada apareció recién en febrero. El periodista Robinson Meyer lo llama “un giro rápido y masivo”. Los números coinciden a grandes rasgos con una Gallup de mayo, que daba 71% de oposición y 48% de rechazo fuerte, y las tres preocupaciones principales son el costo local de la electricidad, el uso de agua y el uso de la tierra. Los centros de datos ya pesan más que el racismo o Israel como tema de campaña en EE.UU. The Decoder · Heatmap News

Florida quiere que un tribunal declare a ChatGPT “molestia pública” y OpenAI pelea para sacar el caso del jurado estatal (21/08). La demanda de 83 páginas y diez cargos entró en un tribunal de circuito de Highlands County el 1 de junio, se apoya solo en ley de Florida, nombra a Sam Altman personalmente y pide jurado. OpenAI la trasladó a la justicia federal el 2 de julio argumentando que un cargo apoyado en la ley federal COPPA arrastra toda la acción; el estado pidió devolverla el 10 de julio calificando la maniobra de “preposterous”, y la jueza federal Aileen Cannon lleva siete semanas sin resolver. El precedente que le da peso es Nuevo México contra Meta, que consiguió mantener su caso estatal fuera de la justicia federal y este mes ganó una orden de USD 567 millones por molestia pública sobre una penalidad de jurado de 375 millones. Florida pide penalidades civiles de hasta USD 10.000 por violación deliberada, el doble del tope de Nuevo México, cuyo jurado encontró 75.000 violaciones. Los demás cargos incluyen negligencia, responsabilidad estricta por defecto de diseño y falta de advertencia. Tom’s Hardware


Hardware y Robótica

La crisis de memoria hundió 39% las ventas de consolas en EE.UU. y el precio promedio saltó a USD 542 (22/08). Sigue de lo de ayer, donde el flash empresarial cotizaba 18,6 veces el disco por terabyte: ahora el mismo problema aparece en la góndola. Los datos de Circana que publicó el analista Mat Piscatella dan una caída de 39% en unidades en julio contra el año anterior, con el precio promedio pagado subiendo 16%. Es la primera vez que Circana ata la caída a los aumentos causados por la crisis de RAM y componentes. PS5 bajó 6% en unidades pero subió 29% en dólares por el aumento de USD 100 de abril; Xbox Series cayó 18% tras el tercer aumento en dos años, y Switch 2 se derrumbó 51% con su propia suba de USD 50 recién el 1 de septiembre. Nintendo vio subir 41% el costo de RAM de la consola a fines del año pasado, y el CEO de Xbox, Asha Sharma, dijo que en 2027 la empresa pagará cinco veces más por memoria y almacenamiento que dos años atrás. En total se vendieron unas 520.000 consolas contra 850.000 hace un año, y el gasto en juegos físicos cayó a USD 85 millones, el julio más bajo desde que hay registro en 1995. Tom’s Hardware

LG Display reemplaza las máscaras metálicas del OLED por fotolitografía y promete 1,6x de brillo y 2,4x de vida útil (21/08). FLiPP —FMM-less Innovative Pixel Patterning— saca del proceso las Fine Metal Masks que hacen de stencil para depositar los OLED sobre el vidrio, y usa en cambio luz UV sobre una capa de fotorresistencia, como en la fabricación de semiconductores: se deposita el material de un color, se endurecen químicamente las zonas que corresponden a ese subpíxel y un baño disuelve el resto. Sin la máscara ocupando lugar, los subpíxeles se acercan entre sí y el “aperture ratio” mejora hasta 55%, lo que se traduce en paneles 1,6 veces más brillantes, 2,4 veces más duraderos y con 13% menos de consumo. El argumento de costo es igual de fuerte: con el stencil solo un 30% del material llega al vidrio, y FLiPP aprovecha 64% más de la lámina madre en paneles de laptop. LG dice que sirve para pantallas de 1 a 100 pulgadas en cualquier resolución y va a invertir 3 billones de wones —unos USD 2.150 millones— para producir a fines de 2027, arrancando por laptops y monitores. El contrapeso: el eLEAP de Japan Display fue el pionero de la fotolitografía sin máscara y Visionox tiene su propia versión para el año que viene. Tom’s Hardware

Supermicro echó empleados tras investigar el contrabando de USD 2.500 millones en GPUs a China (21/08). La investigación la hicieron un estudio jurídico externo y un perito contable independiente, y concluyó que ni la empresa ni sus ejecutivos actuales participaron del esquema; sí admitió que su programa de cumplimiento no alcanzaba y que varios empleados hicieron cosas que ameritaban el despido. El caso arrancó con el arresto del cofundador Yih-Shyan “Wally” Liaw junto al ejecutivo Ruei-Tsang Chang y el broker Ting-Wei Sun, acusados de conspirar para violar el Export Controls Reform Act enviando a China, entre 2024 y 2025, servidores con GPUs Nvidia por USD 2.500 millones. Vale leerlo junto a la desmentida de Nvidia sobre las LPUs para China de ayer: el control de exportaciones tiene un frente formal, el de los SKU y los umbrales, y otro informal, el de las cajas mal etiquetadas y las sociedades de paso. Las acciones de Super Micro habían caído 33% cuando se conocieron los cargos en marzo. Tom’s Hardware · Fortune

EXIMO: DeepMind pone un VLM a planificar para que el VLA aprenda tareas nuevas sin cientos de horas de teleoperación (21/08). Es la otra respuesta al mismo problema que atacaba GEN-1.5 anteayer con una sola demo: cómo afinar políticas robóticas sin recolectar datasets de teleoperación carísimos, y sin caer en un RL que para tareas de horizonte largo es notoriamente ineficiente en muestras. EXIMO trabaja en tres etapas. En explore, un modelo de visión-lenguaje actúa como planificador, piensa y parte los problemas largos en tramos cortos para el VLA; juntos recolectan un dataset orquestado sobre las tareas nuevas. En imitate, el VLA se afina con esos datos. En optimize, un RL residual off-policy termina de ajustar la política, esquivando los problemas que trae hacer RL directo sobre un modelo de miles de millones de parámetros. Los autores ablacionan las tres etapas y reportan mejoras grandes en eficiencia de muestras y rendimiento final frente a los métodos existentes. arXiv 2608.19891 · Hugging Face

RayNeo saca unos anteojos de IA sin cámara y sin parlante, apostando todo al texto sobre el campo visual (22/08). Los iO Glasses proyectan texto con una guía de onda verde de 97% de transparencia y unos 1.300 nits, y la ausencia de cámara es la decisión de diseño, no una carencia: no filma, no saca fotos. Lo que hacen es escuchar las conversaciones, resumirlas, extraer ítems de acción y sugerir entradas de calendario que se confirman con un movimiento de cabeza; también traen modo teleprompter y traducción de voz a texto en 40 idiomas. Cuatro micrófonos y un sensor de conducción ósea levantan la voz en ambientes ruidosos, y un LED se enciende cuando el micrófono está activo. De fábrica corren RayNeo AI y Gemini 3.1 Flash Lite, y una suscripción de USD 9,99 por mes agrega ChatGPT 5.1, Gemini 2.5 Pro, Claude y DeepSeek. La pega que conviene marcar: todos los modelos de esa lista ya están desactualizados. The Decoder · RayNeo


Ciberseguridad

9.300 claves de AWS filtradas desde 2022 siguen activas, y 526 de ellas son claves root de empresas (21/08). Truffle Security viene rastreando la exposición hace cuatro años y publicó el recuento: de 431.875 secretos de AWS encontrados en repositorios, historial de Git, datasets, imágenes de Docker, registries y logs de CI salieron 64.024 claves únicas correspondientes a 50.654 cuentas. De las que se pudieron reverificar, el 88% seguía autenticando al 10 de agosto. Lo grave está en el subconjunto corporativo: 817 claves ligadas a empresas, 526 root y 242 asociadas a usuarios IAM con la política AdministratorAccess, o sea control total sobre casi todos los servicios y recursos de la cuenta. La antigüedad mediana de las claves con fecha conocida es de 1.831 días —cinco años— y la más vieja llevaba 17,4 años; solo el 13,7% tenía una clave más nueva del mismo usuario, señal de que casi nadie las rotó. Hugging Face es la mayor fuente individual con 8.482 exposiciones únicas, y de esas el 17,9% son root. Un detalle que duele: de 2.754 cuentas legibles, apenas 262 tenían alerta de presupuesto configurada, así que un cryptominer ajeno correría sin que nadie se entere. BleepingComputer · Truffle Security

SynkLoader se hace pasar por la mesa de ayuda en Teams y roba la contraseña con una pantalla de bloqueo falsa (21/08). El atacante suplanta al help desk de la empresa y convence a la víctima de instalar un “PowerShell Cleaner” en .MSI alojado en Microsoft Azure, lo que le da al link un aire de confianza. El instalador extrae un script de PowerShell y un ZIP con el framework de Python, un script malicioso, librerías precompiladas y varias DLL falsas que imitan runtimes de Microsoft; el nombre viene de esa mezcla de Python, PowerShell, C# y C++, a veces tres lenguajes en un solo módulo. Marcus Hutchins, de Expel, montó un honeypot contra el C2 y catalogó los módulos: perfilado del sistema, persistencia por tarea programada al login y todos los días a las 10, un proxy reverso para llegar a la red interna, shell interactiva, VNC con control de mouse y teclado, y PhishLocker, la pantalla de bloqueo falsa de Windows 11. La contraseña sirve para entrar al entorno corporativo desde la máquina infectada y saltear las listas de IP permitidas. Que el malware mida el tamaño del Active Directory sugiere ransomware. La defensa de bolsillo: Alt+Tab deja al descubierto la pantalla falsa, que no es más que una aplicación GUI a pantalla completa sin bordes. BleepingComputer · Expel

CISA les da dos semanas a las agencias federales para parchear dos fallas de TrueConf Server que ya se explotan (21/08). TrueConf Server es la plataforma de mensajería y videoconferencia corporativa que, a diferencia de Zoom o Teams, corre adentro de la red local de la organización. La peor de las dos, CVE-2026-72529, es una falta de autenticación: un atacante remoto sin credenciales que se conecte al puerto 4307/TCP puede invocar una función crítica no documentada y ejecutar un script arbitrario en el servidor. La segunda, CVE-2026-72530, es una inyección de código de alta complejidad que permite escapar del entorno aislado de TrueConf y ejecutar comandos en el sistema operativo de abajo. CISA sumó ambas a su catálogo KEV el jueves con fecha límite del 3 de septiembre. Según Kaspersky, el grupo hacktivista Head Mare las viene explotando desde al menos julio de 2026 para reemplazar los instaladores del cliente por versiones con backdoor, apuntando a organizaciones rusas de transporte, energía, IT y desarrollo de software; en abril, Check Point ya había reportado otro 0-day de TrueConf usado en la “Operation True Chaos”, atribuida a actores chinos. Dos campañas distintas usando el mismo vector: el instalador del cliente. BleepingComputer · CISA

Anthropic pone Mythos 5, su modelo más capaz, a escanear código ajeno en busca de vulnerabilidades (21/08). Claude Security, la herramienta que revisa bases de código y propone parches, ahora corre sobre Mythos 5 y está en beta pública para clientes Enterprise; los escaneos se cobran como uso normal de tokens y cada hallazgo viene con categoría CWE, severidad y un arreglo sugerido, pero un humano tiene que aprobar cada parche. Anthropic además está enchufando Mythos 5 en productos de seguridad de terceros que protegen hospitales, servicios públicos y bancos, donde el usuario final nunca habla con el modelo y solo ve el resultado. El detalle que explica la maniobra es que Mythos es justamente el modelo que la empresa no distribuye ampliamente por lo bueno que es en tareas de ciberseguridad —fue el primero en superar todas las simulaciones de ciberataque de la agencia británica de seguridad de IA—, así que el despliegue está diseñado para que la capacidad llegue a los defensores sin abrirle la puerta a los atacantes. Encaja con el giro de política de datos de ayer: la detección de ciberataques hechos con IA sigue siendo el eje de todo lo que Anthropic hace en este frente. The Decoder · Anthropic


Técnicas, repos y práctica

EnvHarness: en vez de generar entornos nuevos, envolver los que ya existen con plugins que apuntan a las fallas del agente (21/08). Primer puesto de HF Daily Papers con 237 votos, y es de Google. El diagnóstico de partida: los entornos con los que aprenden los agentes son hechos a mano y estáticos, ciegos a las debilidades del agente y rápidamente obsoletos a medida que mejora; los métodos de generación de entornos que aparecieron para arreglar eso necesitan pipelines por dominio, dependen de verificadores caros o poco confiables, y terminan produciendo entornos igual de estáticos. EnvHarness es una capa programable de componentes plug-in que envuelve un entorno estático y le cambia el comportamiento sin tocar la lógica de abajo, operando por interfaces estándar, de modo que cada entorno reformado conserva su verificador original. EnvRigger automatiza el proceso: trata a la política como caja negra, observa sus trayectorias de ejecución, sintetiza componentes que apuntan a las fallas diagnosticadas y los valida con rollouts frescos. Sobre cinco benchmarks en cuatro dominios saca hasta 9,0 puntos de mejora en instancias reservadas con 9,8% menos pasos de ejecución, y da mejor señal de optimización para RL, habilitando coevolución continua de política y entorno. Código y web publicados. arXiv 2608.19880 · GitHub · Web

Un score único de seguridad no mide una sola cosa, y un modelo lo puede inflar bloqueando más (22/08). El paper, con participación del UK AI Security Institute, aplica teoría de respuesta al ítem —la maquinaria de los tests psicométricos— a ocho benchmarks de seguridad, con respuestas de hasta 192 modelos sobre más de 5.000 preguntas. Los ocho no miden “seguridad”: miden tres cosas casi independientes entre sí, cuán estricto es el modelo al rechazar, cuán veraz responde, y cómo maneja contenido que es inocuo o peligroso según el contexto. El choque más incómodo es entre HarmBench, que premia rechazar pedidos dañinos, y OR-Bench-Hard, que castiga la cautela excesiva con pedidos inocuos: promediar los dos tapa el trade-off y premia al modelo que bloquea todo. El segundo hallazgo es de costo: casi todas las preguntas son peso muerto porque las pasan o las fallan todos, y tres tests de 25 preguntas bien elegidas cubren las tres dimensiones; con selección adaptativa alcanzan unas diez preguntas por benchmark, un recorte de 97% a 99% que hace viable chequear seguridad después de cada fine-tune o cuantización. El tercero es un detector de sandbagging —el modelo que se hace el tonto cuando sospecha que lo están evaluando— por patrón de respuestas: acierta entre 80% y 100% de los casos con 1 de cada 10 falsos positivos, y sube a 94-97% cruzando contra el historial del propio modelo. De yapa sirve para auditar si tu proveedor cambió el modelo por atrás: identificó 13 de 14 modelos distintos entre 16 endpoints solo por cómo responden. The Decoder · arXiv 2608.05086

SWE-bench Science: el mejor agente no llega al 50% arreglando software científico, y el conocimiento del dominio no siempre ayuda (21/08). El benchmark del equipo OpenMOSS junta 119 tareas de 98 repositorios de GitHub en 20 dominios científicos, organizadas en tres paradigmas —guiadas por issue, exploratorias de experto e integración de ingeniería—, y el mejor resultado es Claude Code con Opus-5 (max) por debajo de 50% de pass@1. El argumento de por qué importa: cuando el software es parte del instrumento científico, un bug no rompe solo el programa, contamina la evidencia sobre la que se apoya una conclusión. Los autores catalogan cuatro mecanismos de falla recurrentes: déficit de conocimiento o abstracción científica, exploración mal orientada o arreglo superficial, cobertura incompleta del arreglo o de la integración, y fallas para generalizar más allá de los casos observados. La ablación es lo más útil: quitar la guía científica explícita dejando el contexto de repositorio muestra que el conocimiento no es uniformemente beneficioso —bien anclado acota la reparación y mejora promedio y eficiencia de tokens, mal alineado induce anclaje y no mejora el arreglo exacto. La suite de tests privada, que vive en la imagen del verificador y nunca ve el agente, es lo que impide aprobar editando aserciones: un modelo pasó las 119 reproducciones públicas y solo 35 de las privadas. arXiv 2608.19799 · GitHub · Leaderboard

FlashPrefill V2 lleva la atención dispersa de prototipo a backend de SGLang, con hasta 47x sobre FlashAttention-2 (21/08). El cuello de botella que ataca es el prefill: la complejidad cuadrática de la atención pega más fuerte justo en la fase intensiva en cómputo. La primera versión ya recortaba ese costo con descubrimiento instantáneo de patrones y umbral dinámico por máximo, pero era un prototipo algorítmico lejos de producción, y esta versión avanza en tres frentes. Primero, un término de corrección por la media que suprime el error de aproximación y mantiene la degradación manejable incluso con sparsity extrema. Segundo, el operador rediseñado con acceso a memoria PackGQA, warp specialization y pingpong pipelining, alineado con FlashAttention-3/4 y con soporte de inferencia FP8. Tercero —y esto es lo que lo vuelve adoptable— soporte nativo de KV cache paginado y continuous batching, para entrar como backend de atención en frameworks modernos como SGLang. Sobre H20 de Nvidia, de los aceleradores de inferencia más desplegados, reporta hasta 47,26x y 27,19x sobre FlashAttention-2 a 128K de contexto en FP8 y BF16, y todavía 30,49x en FP8 contra un baseline denso alineado con FA3/4. Código publicado. arXiv 2608.19758 · GitHub

Netflix reemplazó miles de features hechas a mano por texto plano y un LLM afinado, y midió la diferencia con usuarios reales (22/08). GenRec convierte el comportamiento del usuario —reproducciones, duración, pulgares, agregados a la lista, abandonos— en una especie de diálogo en lenguaje natural, en vez de codificarlo como vectores numéricos densos, y deja que el modelo detecte solo los patrones de género o los cambios de interés. El entrenamiento va en dos fases: un modelo open-weight sin nombrar se afina sobre datos de Netflix para entender el catálogo, y una segunda ronda lo convierte en ranker, con actualizaciones más frecuentes. Corre sobre vLLM en un modo donde lee la entrada una vez y puntúa todos los candidatos en una sola pasada sin generar texto, y un componente aparte se asegura de que solo puntúe títulos que existen de verdad. Los números son chicos pero medidos: 1,6% mejor calidad de ranking offline con unas 40 veces menos ejemplos etiquetados en la segunda fase, y en un A/B de cuatro semanas sobre el 10% del tráfico, +0,115% en la métrica corta de home y +0,006% en la métrica núcleo de largo plazo, ambas significativas. Lo transferible es el diagnóstico: el trabajo se corrió de inventar features a decidir qué señales entran al prompt y cuánto de cada una, y el modelo base envejece rápido —con dos semanas encima, el aporte del post-entrenamiento específico salta de 35-50% a 80%. Netflix lo llama “un paso temprano pero prometedor” y no piensa reemplazar el sistema actual todavía. The Decoder · Netflix Tech Blog


Fuentes consultadas: The Decoder, DeepSeek, Heatmap News, Tom’s Hardware, Fortune, RayNeo, BleepingComputer, Truffle Security, Expel, CISA, Anthropic, arXiv, Hugging Face, GitHub, Netflix Tech Blog.

Ver todos los briefings