martes · 18 min de lectura
Briefing Tech — 18 de agosto de 2026
El DOJ investiga a Andreessen Horowitz por directorios cruzados, un mod por software desbloquea 64 GB de VRAM en las viejas GPU mineras de Nvidia, y el ataque a la cadena de suministro de LiteLLM llega a 2.038 repositorios.
Generado el martes 18 de agosto de 2026, 13:30 UTC. Ventana cubierta: últimas 24 horas (17 ago 13:00 UTC → 18 ago 13:00 UTC).
TL;DR
- El Departamento de Justicia investiga a Andreessen Horowitz por tener socios sentados a la vez en los directorios de Databricks y Fivetran, dos competidoras directas: la causa apunta al fondo entero, no a una persona.
- Un mod por software desbloqueó 64 GB de VRAM en la CMP 170HX, la vieja GPU minera de Nvidia, y el precio en el mercado usado se cuadruplicó en horas.
- La memoria subió 500% en doce meses: un kit de 128 GB de DDR5 cuesta hoy USD 3.399, diez veces su mínimo histórico.
- El ataque a la cadena de suministro de LiteLLM tiene 2.038 repositorios afectados y 898 organizaciones de GitHub, entre ellas Microsoft, IBM, Nvidia, PayPal y Deloitte.
- Cuando un agente comprime su contexto, tira el 83% de las reglas que le puso el usuario — incluida “no mandes mails sin mi aprobación”, según un estudio de Penn State.
IA
El DOJ investiga a Andreessen Horowitz por tener socios en los directorios de dos competidoras directas (18/08). Bloomberg reportó que el Departamento de Justicia tiene abierta una causa antimonopolio contra a16z porque el cofundador Ben Horowitz está en el directorio de Databricks y el socio Martin Casado en el de Fivetran, dos empresas de datos que compiten entre sí. La norma es de 1914 y prohíbe los “interlocking directorates” justo por esto: la misma gente sentada en dos mesas puede pasarse información sensible. Lo distinto acá es que la investigación apunta al fondo como institución y no a un individuo, porque son varios los directores cruzados; bajo Biden estos casos se cerraban con una renuncia y listo. El contexto incomoda: a16z maneja unos USD 90.000 millones, tiene participación en OpenAI, SpaceX y ElevenLabs, sus fundadores donaron millones a un grupo pro-Trump en 2024 y presionaron con éxito para desarmar reglas de seguridad de IA que afectaban a su propio portafolio. Casado además estaba en el directorio de dbt Labs, que Fivetran compró en junio con visto bueno del propio DOJ. The Decoder · Bloomberg
OpenAI lanzó una versión de ChatGPT para adolescentes de 13 a 17 años, con detección de edad por comportamiento (18/08). La variante trae límites más duros en suicidio, autolesiones, trastornos alimentarios y contenido sexual, y tiene prohibido simular que siente emociones. Con la tarea escolar no entrega la respuesta hecha: devuelve repreguntas para que el chico llegue solo. Lo llamativo es cómo decide a quién le toca: OpenAI no verifica la edad de forma directa sino que evalúa más de 2.000 señales de comportamiento —horarios habituales de login, entre otras— para marcar usuarios menores de 18 y activarles la versión restringida automáticamente. Llega bajo presión judicial creciente: varias familias demandaron a la empresa después de que sus hijos vieran contenido dañino y se lastimaran o murieran, y Florida fue el primer estado en demandarla, en junio. AP · New York Times · The Decoder
Anthropic multiplicó por siete sus ingresos y pasó los USD 65.000 millones de tasa anualizada (18/08). El número sale del reporte periódico a inversores, con datos hasta fin de julio de 2026, y lo publicó Bloomberg citando fuentes al tanto. El salto es de siete veces contra un año atrás, y llega justo cuando la empresa evalúa salir a bolsa tan temprano como el otoño boreal a una valuación de USD 1 billón, potencialmente antes que OpenAI. El crecimiento no es un lujo sino una obligación: el gasto en infraestructura que la empresa ya comprometió depende de que la curva siga. La proyección interna que trascendió es de USD 190.000 a 200.000 millones de ingresos para 2028, lo que da la dimensión de lo que hay que sostener. The Decoder
Anthropic cobra 4,4 veces el precio promedio por token en Vercel y los desarrolladores lo pagan igual (18/08). Los datos de julio del AI Gateway de Vercel muestran que Anthropic se lleva el 65,1% del gasto con apenas el 30% de los tokens, o sea que factura mucho más por uso que cualquier competidor. Fable 5 trepó al 13,2% del gasto del gateway, segundo detrás de Opus 4.8, y nueve de cada diez equipos que lo usaron en julio eran clientes nuevos — lectura que contradice el dato de Ramp, que había leído el bajo uso de Fable como señal de que el modelo está caro para el mercado corporativo. En el agregado, el volumen de tokens creció 59% y el gasto 37%, con el precio promedio por token cayendo 13,6% porque las empresas migran a escalones más baratos. Vale la advertencia obvia: tanto Vercel como Ramp ven una tajada del mercado, no el mercado. The Decoder · Vercel
Una pieza en JAMA pide que los reguladores no escriban “humano en el loop” en las reglas médicas (18/08). La firman Ezekiel Emanuel, bioeticista de UPenn, y entre otros Neal Khosla, CEO de la telemedicina con IA Curai Health — conflicto de interés que conviene tener a la vista antes de leer el argumento. Sostienen que desde 2024 la IA sola iguala o supera al médico en las cinco tareas centrales del razonamiento clínico, y citan números: ChatGPT o3 puso el diagnóstico correcto primero en el 60% de 377 casos complejos contra 15,9% de veinte internistas, y GPT-4 solo sacó 92% en razonamiento diagnóstico contra 76% de los médicos que tenían acceso al mismo modelo. El punto filoso lo apoyan en un metaanálisis de 106 experimentos en Nature Human Behaviour: cuando el sistema es mejor que la persona, el humano que supervisa deja de ser red de seguridad y pasa a ser fuente de error. Los propios autores marcan los límites —casi toda la evidencia viene de simulaciones de tareas aisladas, no de atención real, y los sistemas autónomos fallan de maneras que un médico no, como alucinar o quedarse sin internet. The Decoder · JAMA
Hardware y Robótica
Desbloquearon por software 64 GB de VRAM en las viejas GPU mineras de Nvidia y el precio se cuadruplicó en horas (18/08). Sigue el hilo de la crisis de memoria de ayer, donde un taller japonés vendía upgrades de VRAM a USD 25 el giga: ahora apareció CMP Unlocker, un mod que restaura la memoria que Nvidia había capado por firmware en la CMP 170HX, llevándola de 8 GB a 64 GB —aunque solo los 40 GB están confirmados como estables por reportes de usuarios. El truco existe porque la 170HX usa el mismo silicio GA100 de 7 nm que la A100 y trae los seis stacks de HBM2e físicamente presentes en el package: Nvidia los desactivaba por software, junto con cómputo y líneas PCIe. El exploit es enteramente por software, se apoya en el paper de Jon Pry sobre cómo saltear el microprocesador de seguridad Falcon, y de paso restaura SMs y sube el bus de PCIe 1.0 x4 a PCIe 2.0 x4. La 170HX salió a USD 4.300 en plena fiebre cripto, se conseguía a unos USD 250 en eBay y saltó arriba de USD 1.000 apenas se supo del hack, contra los ~USD 3.500 de una A100 de 40 GB. Tom’s Hardware
La memoria subió 500% en doce meses: un kit de 128 GB de DDR5 cuesta USD 3.399, diez veces su mínimo histórico (17/08). Tom’s Hardware cruzó su tracker con PCPartPicker y el cuadro no admite matices: DDR5-6400 de 128 GB a USD 3.399 contra USD 329 de mínimo histórico, DDR5-6000 de 32 GB a USD 392 contra USD 72. Interanual, un kit DDR5-5600 de 2x32 GB pasó de USD 191 a USD 1.118 (+485%), y el DDR4 tampoco zafa: los 2x32 GB a 3200 MT/s treparon 177% porque los que quedaron en AM4 y LGA1700 salieron a comprar todos juntos. ComputerBase mide +345% en Europa contra septiembre de 2025, con discos y SSD arriba de +125%. Lo que explica que esto no se acomode pronto: los hiperescaladores ya reservaron casi toda la capacidad global de DRAM de 2027 pagando adelantos en efectivo, y el CEO de SK hynix, Kwak Noh-jung, avisó que 2027 será el peor año de oferta en la historia de la industria, con demanda desbordada hasta 2030. Tom’s Hardware
Granite Rapids llega por fin a las workstations: Intel rompe tres años de estancamiento con la familia Xeon 600 (17/08). ServeTheHome publicó el review del Xeon 658X de 24 núcleos, primer silicio nuevo de Intel para estaciones de trabajo en más de tres años. La familia jubila el branding Xeon W-2xxx/W-3xxx, usa núcleos Redwood Cove en nodo Intel 3 y llega hasta 86 núcleos contra los 60 del tope anterior; la caché L3 pasa de 112,5 MB a 336 MB, la memoria de DDR5-4800 a DDR5-6400 con MRDIMM-8000 desde los 28 núcleos, el ancho de banda de 307 GB/s a 410-512 GB/s y las líneas PCIe Gen5 de 112 a 128, con socket nuevo LGA4710. El propio material de Intel admite el desbalance: +9% en single-thread contra +61% en multi-thread. La letra chica está en la segmentación —los SKU de 16 núcleos o menos quedan capados a 80 líneas PCIe y cuatro canales de memoria, así que hay que poner unos USD 1.199 por el de 18 núcleos para tener la plataforma completa. ServeTheHome
Persona AI apuesta a que el primer laburo rentable de un humanoide es soldar en un astillero (17/08). Nic Radford, ex jefe del programa Valkyrie de la NASA, y Jerry Pratt, ex CTO de Figure, le explicaron a IEEE Spectrum por qué descartaron depósitos, automotrices y el hogar. El argumento es de “last-mover advantage”: van por mano de obra calificada y cara, no por la no calificada donde compite todo el mundo. La soldadura naval encaja rara vez bien con un robot porque se suelda tan rápido como se funde el metal —un centímetro por segundo de techo—, la calidad depende de movimientos repetidos a escala milimétrica justo donde el humano se aburre, y un barco necesita cientos de kilómetros de soldadura lineal, la más simple del catálogo. Tienen dos socios coreanos, HD Hyundai —el astillero más grande del mundo— y POSCO, y el pitch no es reemplazar gente sino cubrir un backlog que hoy está frenado por falta de soldadores: “aunque nuestro robot fuera más caro que un humano, seguiría siendo valioso”, dice Radford. Eligieron bípedo y no base con ruedas porque en un astillero al aire libre hay que pasar por encima de largueros todo el tiempo. IEEE Spectrum
Diligent empieza a desplegar Moxi 2.0 con 10× de cómputo a bordo y un world model entrenado en AWS (17/08). El rollout arrancó en Endeavor Health Edward Hospital, Providence Saint John’s y el Children’s Hospital Los Angeles, con cinco años de operación en más de 25 hospitales como insumo de diseño. Los saltos concretos: 10× de cómputo a bordo con un módulo Nvidia A2000, percepción 10 a 15 veces más rápida, hasta 18 horas de operación diaria y carga 30% más veloz. La plataforma se desarrolló con Nvidia Isaac Sim y partes de los world models Cosmos —incluido el tokenizador de lidar 3D—, el “Robotic World Model” se entrena en Amazon SageMaker HyperPod, y toda la autonomía y seguridad corre a bordo con fallback celular de T-Mobile para las zonas muertas del WiFi hospitalario. El caso testigo: en Los Ángeles la flota pasó de dos a tres robots, acumuló más de 40.000 entregas equivalentes a 16.000 horas de trabajo y subió la utilización más de 10% solo en el segundo trimestre. Es el primer anuncio grande de Diligent desde que Serve Robotics la compró en enero por USD 29 millones. The Robot Report
Ciberseguridad
El ataque a la cadena de suministro de LiteLLM llegó a 2.038 repositorios y 898 organizaciones de GitHub (17/08). Resecurity consiguió el archivo de 150 GB del robo y publicó el mapa de daño del backdoor SANDCLOCK, que el grupo TeamPCP plantó comprometiendo credenciales de mantenedor de LiteLLM y publicando las versiones maliciosas 1.82.7 y 1.82.8 en PyPI alrededor de marzo de 2026 — o sea, meses de ventana. La lista de dueños afectados incluye a Microsoft, Azure, IBM, Nvidia, PayPal (Zettle), Deloitte, Bosch, S&P Global, Elevance Health y Kroger, y lo que se llevó no son datos de clientes sino identidad de CI/CD: claves de infraestructura cloud, tokens de acceso a repos, credenciales SSH, secretos de Kubernetes y API keys de OpenAI y Anthropic. Lo que hace grave este caso puntual es dónde estaba parado LiteLLM: es el gateway open source que unifica llamadas a más de 100 proveedores de modelos, así que comprometerlo multiplica el radio de explosión sobre toda la pila de IA de la víctima. Si tenés LiteLLM en algún pipeline, la tarea de hoy es rotar todo: claves privadas de GitHub App, PAT, credenciales de AWS/GCP/Firebase, tokens de ECR y JFrog, claves SSH y contraseñas de firma. Security Affairs · Resecurity
Lo de McDonald’s era un lote de nueve: el mismo vendedor ofrece 3,64 millones de registros sacados de Azure (17/08). Continúa el ítem de ayer sobre el 1,7 millón de registros de empleados de McDonald’s: resultó ser apenas el más reciente de una serie que “TheHatman” viene publicando desde el 31 de julio. El resto del catálogo: TCS con más de 800.000, Vodafone con 425.000, HCL con 250.000, InterContinental con 185.000, Kyndryl con 170.000, Gap con 80.000, Hexaware con 20.000 y Wyndham con 9.000, todos directorios de empleados extraídos de tenants de Azure/Entra con nombres, mails, cargos, teléfonos, IDs y cuentas de servicio. El vector que declara el atacante es password spray más fatiga de MFA — nada exótico, y por eso mismo incómodo. TCS lo desmintió ante la bolsa india y Gap habló de datos viejos y no sensibles, pero Hudson Rock analizó los volcados y los da por auténticos con alta confianza: traen dominios activos, estructuras .onmicrosoft.com y nombres de administradores globales, que es exactamente el material que hace falta para armar spearphishing dirigido. BleepingComputer
CISA confirma que las bandas de ransomware ya explotan la falla de Windows Task Host (18/08). El CVE-2025-60710 es una escalada de privilegios en Task Host —el componente que corre procesos basados en DLL en segundo plano— que Microsoft parcheó en noviembre de 2025 y que CISA había marcado como explotada activamente el 13 de abril. El viernes actualizó su catálogo KEV para agregarle la etiqueta de uso en ransomware, sin publicar detalles de las campañas, y Microsoft todavía no actualizó su aviso para reconocer explotación en el mundo real. Afecta a Windows 11 y Windows Server 2025, y un atacante local con permisos de usuario común termina con privilegios SYSTEM. El número que conviene mirar de costado: desde noviembre de 2021 CISA lleva 383 vulnerabilidades de productos Microsoft marcadas como explotadas activamente, y 112 de ellas terminaron usándose en ataques de ransomware. BleepingComputer · NVD
Microsoft empieza a sacar WMIC de Windows 11 después de diez años de avisos (18/08). Las notas de las builds beta 26220.9202 y 28020.2731 confirman la remoción del Windows Management Instrumentation Command-line, que además ya viene eliminado por defecto en instalaciones nuevas de 24H2 y 25H2 y dejó de ofrecerse como Feature on Demand. El motivo es de manual: WMIC es un LOLBIN clásico del catálogo LOLBAS, usado por ransomware para borrar las Shadow Volume Copies antes de cifrar, por malware para enumerar y desinstalar antivirus, y para agregarle exclusiones a Defender y evadir detección. Solo cae el componente legacy — WMI sigue intacto, y Microsoft empuja a PowerShell, la API COM de WMI o librerías .NET. Si tenés scripts de administración viejos, este es el momento de auditar cuáles llaman a wmic antes de que una actualización te los rompa. BleepingComputer
Técnicas, repos y práctica
Cuando el agente comprime el contexto, tira el 83% de las reglas que le pusiste, y un modelo de 9B lo arregla (18/08). Investigadores de Penn State midieron sistemáticamente qué se pierde en la “compaction”, esa compresión que resume el historial para liberar espacio, y el resultado es peor de lo que uno supone: solo el 17% de las restricciones de sesión sobrevive en promedio. Las que se caen primero son justamente las órdenes del usuario que no son parte de la tarea —“confirmá conmigo antes de hacer cambios”, “no mandes mails sin mi aprobación”—, porque los compresores están diseñados para preservar objetivo, estado y próximos pasos. Con el contexto completo el cumplimiento de la regla va de 59% a 71%; después de comprimir cae a poco más que el nivel de no haber puesto la regla nunca, y ni un prompt escrito específicamente para conservarlas pasa del 40% de retención. La solución que proponen es plug-and-play y no requiere entrenamiento: un módulo chico sobre Qwen3.5-9B que lee cada input del usuario, detecta las restricciones, las junta en una lista aparte y la pega al final del resumen — 95,6% de retención en trayectorias de agente, 95,1% en investigación larga y 90,3% en chat multi-turno. Publicaron la suite de evaluación COMPINT y el extractor. arXiv 2608.11242 · GitHub · The Decoder
vLLM-Omni suma Distributed Layerwise Offload y corre un modelo de difusión de 124 GB con 12 GB de HBM (17/08). Es para el lado de video y difusión, no para LLMs: apunta a servir DiT de 200B y más. La técnica combina cuatro cosas: carga con meta-device y mmap sobre la page cache del sistema, sharding de pesos con reconstrucción por AllGather, doble buffer de prefetch —solo dos capas viven en HBM a la vez— y multi-concurrencia DP. Los números medidos: el pico de memoria de host en arranque en frío baja de 178 GB a 47 GB, y con Cosmos3-Super (64B, 124 GB en BF16) sobre 4× B300 y cuatro pedidos concurrentes rinde 1,39× el throughput de HSDP+USP4 usando 12,62 GiB de HBM contra 42,00 GiB, con hashes SHA256 idénticos byte a byte. Se prende con vllm serve <modelo> --omni --enable-distributed-layerwise-offload --data-parallel-size 4, y hay un --dlo-no-use-allgather para cuando la sincronización cuesta más que la memoria que ahorra. Las limitaciones están declaradas y conviene leerlas: pide vLLM 0.27.0 con vLLM-Omni v0.27.0rc1 —en 0.26.0 el camino DLO+DP rechaza todos los pedidos—, el AllGather suma 150 ms fijos por paso, y el modo preferido cambia según la topología, porque en DP8×SP1 conviene rank-local. vLLM Blog
ClawGym II: hacer RL sobre el agente entero sin abrir el harness, con Claude Code y OpenClaw como entorno (17/08). El framework de la Renmin University y colaboradores trata al harness como caja negra: aísla cada tarea con su harness en sandboxes efímeros para hacer rollouts concurrentes en masa, mete un proxy de serving en el límite del modelo para capturar todas las llamadas, y reorganiza esas llamadas en árboles de prefijos para reconstruir las trayectorias multi-turno. Sobre esa estructura adaptan PPO y GRPO. Con Qwen3-30A3B el Pass@1 en ClawGym-Bench sube 9,98 puntos vía OpenClaw y 14,81 vía Claude Code, y se mantiene estable a lo largo de 200 a 400 pasos de optimización, con ganancias también en JobBench y OfficeQA. Lo más aprovechable es el “mix-harness training”: un solo modelo optimizado en simultáneo contra harnesses distintos, en vez de uno por herramienta. Publicaron código de SFT y RL, 13,5K tareas, 24,5K trayectorias y tres checkpoints abiertos de 4B, 8B y 30A3. arXiv 2608.16798 · GitHub
Tu métrica de atención depende de una convención que casi nadie declara, y podar la cabeza equivocada te infla la perplejidad 100× (18/08). Papamichalis y Ruane atacan un detalle metodológico con consecuencias muy concretas: cada fila de la matriz de atención es una distribución de probabilidad, y en modelos entrenados casi toda la masa cae en un token “sink”, normalmente el primero. Comparar filas con coseno, divergencia Jensen-Shannon o entropía depende de si uno conserva ese sink o lo tira y renormaliza, decisión que los papers rara vez explicitan. Sobre diez modelos de cinco familias, entre 17% y 47% de los veredictos sobre qué par de cabezas se parece más se dan vuelta según la convención elegida, y la estructura más visible en un pipeline estándar de clustering de cabezas de BERT termina siendo un artefacto. Tratando las filas como datos composicionales, la distancia de Aitchison separa el término de sink del de contenido, y ahí aparece que buena parte del “colapso de entropía” que se mide durante el entrenamiento es el sink creciendo y no la atención afinándose: 30% de la caída a 70M de parámetros, 95% a 1B, 79% a 1,4B. El dato que le importa a quien esté podando cabezas: usar el canal equivocado puede inflar la perplejidad más de cien veces. arXiv 2608.14712
Un modelo acierta el 38% de un examen sin ver la pregunta: cómo auditar si tu benchmark de opción múltiple está roto (18/08). Ovcharov midió sobre UA-JudgeExam, 11.990 ítems de cuatro opciones con claves oficiales de la comisión de calificación de jueces de Ucrania, y encontró que Claude Haiku 4.5, mostrándole solo las opciones y ninguna pregunta, acierta 0,383. La fuga está concentrada: 11,8% de los ítems se responden a ciegas en las ocho permutaciones posibles de opciones, contra 0,2 ítems esperables por azar, y no es memorización textual —buscar en 280.059 ediciones de legislación ucraniana recupera apenas 0,128. Filtrando esos ítems quedan 8.128, y GPT-5.6, que no participó de la selección, todavía responde 0,515 con la pregunta tapada. Al puntuar doce modelos y restarle a cada uno su sesgo de posición, solo dos conservan exceso real: GPT-5.6 con +0,265 y Sonnet 4.6 con +0,081; sin esa corrección, Llama 3.1 8B “puntúa” 0,292 a ciegas simplemente respondiendo A en el 92% de los ítems. Dos advertencias del autor que valen para replicarlo: nada de esto se ve en una muestra de 400 ítems, y reescribir los distractores se pasa de rosca y deja el examen por debajo del azar, igual de explotable. arXiv 2608.15428
Fuentes consultadas: The Decoder, Bloomberg, AP, New York Times, JAMA, Vercel, Tom’s Hardware, ServeTheHome, IEEE Spectrum, The Robot Report, Security Affairs, Resecurity, BleepingComputer, NVD, arXiv, GitHub, vLLM.