El Compilado Hilos Temas Archivo RSS

sábado · 17 min de lectura

Briefing Tech — 29 de agosto de 2026

OpenAI le corta el acceso a Cursor tras la compra por SpaceX, Anthropic saca un MCP para hardware físico y ShinyHunters dice haberle robado a McKesson 284 millones de registros de pacientes.

iahardwareroboticaciberseguridadtecnicas

Generado el sábado 29 de agosto de 2026, 13:17 UTC. Ventana cubierta: últimas 24 horas (28 ago 13:17 UTC → 29 ago 13:17 UTC).

TL;DR

  • OpenAI termina su contrato con Cursor con efecto al 12 de noviembre, después de que SpaceX comprara la empresa: la cláusula usada es de cambio de control y el argumento, textual, “It boils down to trust”.
  • Anthropic presentó el Model Hardware Standard, un MCP para brazos robóticos e instrumental de laboratorio: en Carnegie Mellon integraron cuatro dispositivos en ocho horas contra las semanas de un setup de proveedor.
  • ShinyHunters dice haber sacado 1 TB y 284 millones de registros de pacientes de McKesson vía vishing contra cuentas de Okta, y pidió un rescate de USD 55,2 millones que la empresa nunca respondió.
  • Un investigador de Anthropic mostró IA que mejora su propio alineamiento: los sistemas automatizados superaron 10 de 10 benchmarks de comportamiento desalineado, a USD 4 la hora contra USD 150 de un humano.
  • Capital para lo físico: a16z levantó un fondo de USD 1.100 millones para hardware y Lambda tomó USD 1.000 millones de deuda para comprar GPUs y alquilárselas a Microsoft.

IA

OpenAI le corta el acceso a Cursor después de que SpaceX la comprara, y lo justifica con el historial de Musk rompiendo contratos (29/08). El contrato termina el 12 de noviembre de 2026, el plazo máximo de preaviso que permite el acuerdo, y la cláusula invocada es la de rescisión por cambio de control. “It boils down to trust”, resumió Thibault Sottiaux, de OpenAI, que aclaró que el corte apunta a Musk y no al ecosistema de herramientas de coding: los usuarios van a poder seguir usando modelos GPT en Cursor con su propia API key y las extensiones de IDE de OpenAI siguen funcionando. Los antecedentes que enumera OpenAI son dos: Musk cortó en diciembre de 2022 el acceso al feed completo de Twitter —una licencia de unos USD 2 millones al año que se usaba para entrenar ChatGPT— y admitió en juicio haber entrenado Grok con salidas de modelos de otros labs. Michael Truell, cofundador de Cursor, minimizó el impacto: los modelos de OpenAI son alrededor del 5% del tráfico de IA de la herramienta. Hay precedentes en la otra dirección: Anthropic bloqueó a Windsurf en junio de 2025 cuando trascendió el interés de compra de OpenAI, y en agosto de 2025 le revocó la API a OpenAI por usar Claude en benchmarks internos. The Decoder · OpenAI

Un investigador de Anthropic publicó la primera muestra concreta de IA que mejora su propio alineamiento (28/08). El paper se llama “Automated Researchers Can Reliably Mitigate Alignment Failures” y lo lidera Chen Yueh-Han, del programa de fellows. Dados diez benchmarks de comportamientos desalineados específicos, el sistema automatizado mejoró en los diez sin degradar el rendimiento general. El ciclo replica el método de investigación humano: busca en la literatura, propone un método, entrena el modelo con ese método durante 30 minutos y repite subiendo el benchmark, conservando lo que funciona y descartando lo que no. Los dos números que importan están en el propio paper: “el mejor método del AAR le gana a lo que proponen humanos con experiencia, en promedio en menos de seis horas”, y el costo es de unos USD 4 por hora de inferencia contra los USD 150 por hora que Anthropic le paga a sus investigadores. La limitación que reconocen es circular: el sistema solo sirve en la medida en que los benchmarks reflejen los objetivos reales de alineamiento, y mantener y ampliar esos benchmarks sigue siendo trabajo humano. TechCrunch · Anthropic

El Co-Scientist de Google DeepMind pasó de proponer hipótesis a manejar el instrumental y escribir los papers (28/08). El sistema multiagente sobre Gemini ahora arma planes experimentales, programa, genera protocolos legibles por máquina, controla equipos, analiza resultados y redacta manuscritos, con módulos de verificación que cruzan cada afirmación numérica contra los logs de ejecución del código. Lo validaron en tres disciplinas: en ciencia de materiales sintetizó tres películas delgadas semiconductoras al primer intento con Gemini 3 Deep Think controlando el equipo directamente, bajando el desarrollo de recetas de días a minutos; en biología armó sola una pipeline que predice patrones de colonias de E. coli modificadas; y en computación diseñó sin intervención humana “Agent_H”, una arquitectura médica que le gana a seis modelos frontera en benchmarks de salud, aunque en la evaluación de tres médicos certificados sobre nueve categorías solo mostró ventaja significativa en una. El dato que conviene mirar es el del estudio doble ciego con 30 expertos y 450 revisiones sobre 150 papers autónomos: con los módulos de fiabilidad activos el sistema fabricó resultados clave en el 4% de los casos, sin ellos en el 46%, y el sistema de comparación en el 90%. Samuel Schmidgall, autor principal, avisa que todavía falta “un largo camino”. The Decoder · arXiv 2608.26701

Las empresas de pesos abiertos son el blanco de compra más caliente del Valle, con una adopción real del 6% (28/08). Sigue de la compra de Hugging Face por Nvidia: TechCrunch encadena esos USD 13.000 millones con el acuerdo de USD 6.000 millones de Nvidia por Poolside, cuyos empleados en su mayoría pasan a la fabricante de chips, y con la compra de OpenRouter por parte de Stripe por más de USD 7.000 millones hace dos semanas. La lógica de Nvidia sería dejar de depender de los hyperscalers y los labs de frontera justo cuando OpenAI y Google fabrican sus propios chips de inferencia: su familia Nemotron nunca despegó, y comprar el mayor espacio de desarrollo de modelos abiertos de Estados Unidos le da una masa de usuarios para empujar hacia sus chips. El contraste es que la adopción empresarial sigue siendo chica —6% según datos de gasto de Ramp, 2% entre ingenieros encuestados por Jellyfish— y concentrada en inferencia repetitiva de alto volumen, por control y configurabilidad más que por costo. Lin Qiao, CEO de Fireworks, dice que su empresa procesa 40 billones de tokens por día, más que las APIs de Gemini o de OpenAI. TechCrunch


Hardware y Robótica

Anthropic presentó el Model Hardware Standard, que quiere ser el MCP del hardware físico (29/08). Es una especificación que le da a los agentes una interfaz única para leer datos y controlar microscopios, brazos robóticos e instrumental de laboratorio, con un driver MHS por dispositivo que lo vuelve descubrible en un formato común e incluye datos que el software solo no captura —el peso de un brazo, sus límites de seguridad—, cargables en lenguaje natural. Los workflows se pueden guardar como scripts convencionales que después corren sin modelo de lenguaje en el loop. Los números de los pilotos: en Carnegie Mellon conectaron liquid handler, lector de placas, brazo robótico y varias cámaras repartidas en tres computadoras con interfaces incompatibles, y armar los drivers más la orquestación llevó unas ocho horas contra las varias semanas de un setup de proveedor; en la empresa de computación cuántica QuEra, Claude desarrolló un programa de control que devuelve un láser a estado estable tras una perturbación, con 695 de 700 intentos exitosos en una prueba a ciegas. El fracaso también está documentado: en Genentech, al formarse burbujas en una solución viscosa, Claude siguió reiniciando el proceso en el mismo recipiente y empeoró todo hasta que un humano le explicó la causa física. Sale como research preview con HHMI Janelia, open source más adelante, y ya hay soporte en construcción de AWS, Doosan Robotics, QIAGEN, Tecan, Universal Robots, Hugging Face y Raspberry Pi. Anthropic · The Decoder

Lambda tomó USD 1.000 millones de deuda privada para comprar GPUs de Nvidia y alquilárselas a Microsoft (28/08). La operación la armó JP Morgan Chase y es deuda de corto plazo, lo que da a entender que la neocloud apuesta a desplegar los chips rápido, facturar y repagar. Es el último eslabón de una seguidilla: en mayo cerró una línea de crédito garantizada de USD 1.000 millones y esta misma semana un préstamo de USD 926 millones para financiar GB300 destinadas a un despliegue contratado con la propia Nvidia. Estaría además negociando una ronda pre-IPO de USD 3.000 millones, después de levantar USD 1.500 millones en noviembre a una valuación post-money de USD 5.430 millones según PitchBook. El número que ubica todo lo demás: bancos y tecnológicas llevan levantados más de USD 400.000 millones en deuda ligada a IA en lo que va de 2026, según datos compilados por Bloomberg. TechCrunch

a16z levantó un fondo de USD 1.100 millones llamado Machine Age para “acelerar la construcción física de la IA” (28/08). La firma que se hizo conocida apostando al software ahora arma un vehículo dedicado a hardware: chips, memoria, centros de datos y robots. En el posteo enumeran qué les falta financiar —sistemas más rápidos y eficientes, memoria más barata y de mayor ancho de banda a lo largo de toda la jerarquía, interconexiones más escalables entre nodos, dispositivos de borde eficientes en energía, y todo el despliegue de refrigeración, materiales, electricidad e inmuebles que eso arrastra—. Leído junto a la deuda de Lambda y a la escasez de memoria de la que se viene hablando toda la semana, es la misma tesis desde el lado del equity: el cuello de botella ya no es el modelo. TechCrunch

EXL completó la compra de iMerit, la empresa que etiqueta los datos de la IA física (28/08). Sigue de lo de ayer, cuando iMerit aparecía como el socio que le digirió a Carbon Robotics los 150 millones de ejemplos etiquetados de su modelo fundacional de plantas: ahora la compró EXL, la firma de servicios de Nueva York fundada en 1999 y con unos 68.000 empleados. iMerit nació en 2012, tiene base en San José y aporta la plataforma Ango Hub y una red global de expertos de dominio para anotación multimodal en robótica, movilidad autónoma y salud; Radha Ramaswami Basu, su fundadora y CEO, pasa a EXL como vicepresidenta ejecutiva. El argumento de Basu resume por qué esto es una compra de robótica y no de BPO: “a medida que la IA se mueve a robótica y sistemas autónomos en el borde, el éxito depende menos de la escala del modelo y más de la calidad de los datos”. La lectura de mercado que hace Rohit Kapoor, CEO de EXL, es que el valor se está corriendo de construir modelos a volverlos usables y auditables, con la evaluación y el RL como capacidades fundacionales y no periféricas. The Robot Report

Locus Robotics compró Nexera y su tecnología de agarre NeuraGrasp para atacar el 30% de picks que la succión no resuelve (28/08). Locus, cuyos AMR ya asistieron en más de 6.000 millones de picks, había entrado al picking robótico en marzo de 2025 con Array, un manipulador móvil con brazo guiado por visión y pinza de ventosas estándar. Roy Belak, ex CEO de Nexera y hoy SVP de robotic grasping en Locus, sostiene que la succión resuelve entre el 60% y el 70% de los casos en almacenes y que todo el problema está en el resto; NeuraGrasp combina succión y pinza para cubrir esa brecha, aunque advierte que el pinch grasping puede ir de “marginalmente confiable” a “muy poco confiable”. El detalle de ingeniería que explica el timing es que Array ya tenía suministro de aire y de energía, lo que permitió meter la tecnología de Nexera sobre la hora: “si nos perdíamos esa ventana por un año más, probablemente habría sido muy difícil hacer esos cambios”. Belak identifica dos frenos para el sector —el desarrollo de IA y un sentido del tacto robusto— y es explícitamente escéptico sobre los datos sintéticos: “no creo que los datos simulados vayan a ayudar mucho con este problema”. The Robot Report


Ciberseguridad

McKesson reconoció una brecha y ShinyHunters dice haberle sacado 1 TB y 284 millones de registros de pacientes (28/08). La distribuidora farmacéutica y de salud descubrió el incidente el 25 de agosto y lo informó en un Form 8-K ante la SEC, donde aclara que todavía no determinó que sea material. Según el grupo, la entrada fue por vishing contra varios empleados: comprometieron sus cuentas de single sign-on de Okta y desde ahí los entornos de Salesforce y Snowflake, usando el dominio mckesson[.]claims, que encaja con una campaña de dominios empresa[.]claims documentada por ReliaQuest para hacerse pasar por mesas de ayuda internas. Dicen haber sacado alrededor de 1 TB entre el 21 y el 25 de agosto —y aclaran que los 284 millones son líneas o registros crudos, no personas únicas—, con nombres, direcciones, fechas de nacimiento, números de seguridad social, IDs de paciente, números de Medicaid, historias clínicas, medicación, alergias y hasta datos de pacientes fallecidos y terminales. El pedido de rescate fue de USD 55.236.150 con 72 horas de plazo, y afirman que McKesson nunca respondió. Todo lo atribuido al grupo son afirmaciones sin verificación independiente; lo que sí está confirmado por la empresa es el acceso no autorizado y la posible degradación intermitente del servicio. Se suma a la ola de ShinyHunters contra salud que ya alcanzó a Medtronic, DentaQuest, iRhythm, OneMedical y AdaptHealth. BleepingComputer

PaperCut sacó un segundo parche de emergencia porque el primero se podía saltear de varias formas (28/08). Sigue de lo de ayer: recién ahora hay CVEs. CVE-2026-81578 es un bypass de autenticación de 8.8 en la interfaz web de administración, donde peticiones remotas no autenticadas contra funciones administrativas disparan acciones del backend antes de que terminen las validaciones de acceso; CVE-2026-82078 es una falla crítica de 9.4 de carga dinámica insegura de clases en las utilidades de conexión a base de datos, que carga drivers según nombres configurables sin validarlos contra una allowlist y permite ejecutar bytecode Java arbitrario con el contexto de seguridad del proceso del servidor. Encadenadas dan RCE sin autenticar. watchTowr, que reprodujo las fallas, encontró múltiples bypasses del parche original y un bypass de autenticación adicional; el Release 2 suma endurecimiento trabajado con Huntress y watchTowr. Hay parche para las versiones 24, 25 y 26 en Windows, Linux y macOS, y quien esté en 23 o anterior tiene que actualizar; también hay que actualizar Site Servers y servidores secundarios o de impresión. Print Deploy y Mobility Print no están afectados. BleepingComputer

Un fallo de severidad máxima en GiveWP deja ejecutar comandos en el servidor de cualquier WordPress con el plugin de donaciones (28/08). Es CVE-2026-82222, afecta hasta la versión 4.16.7.1 y el plugin tiene más de 100.000 instalaciones. La cadena que arma Patchstack tiene tres eslabones: un helper inseguro para deserializar datos PHP, un flujo de procesamiento de donaciones que guarda objetos serializados controlados por el atacante, y una gadget chain en librerías empaquetadas con el plugin que puede invocar comandos del sistema. La parte que anula la única defensa aparente es que el exploit necesita cuenta, pero GiveWP expone una acción de registro no autenticada (give_action=user_register) que nunca consulta la opción users_can_register de WordPress: se crea cuenta aunque el registro esté deshabilitado. Después se guarda el objeto malicioso en el perfil, se inyecta en wp_give_sessions mandando una donación armada —“el servidor escribe el objeto gadget antes de devolver un HTTP 500”, explica George Johnstone, de Patchstack— y basta pedir cualquier página del front-end con la cookie para que se ejecute. Está arreglado en la 4.16.7.2, del 27 de agosto, que además borra payloads ya almacenados. La acción de registro sigue ignorando la configuración de WordPress, aunque ya no sirve para ejecutar código. BleepingComputer


Técnicas, repos y práctica

PILOT mete un supervisor que corrige al agente mientras corre, y baja 43% los tokens de salida (28/08). El problema que ataca es que casi todos los métodos de auto-mejora procesan la experiencia recién cuando terminó la ejecución, así que no pueden redirigir la corrida activa ni validar en el acto lo que aprendieron. PILOT es un harness supervisor-worker con dos mecanismos acoplados: live steering, donde un supervisor separado redirige o aborta al worker durante la ejecución, y live self-evolution, que destila los procedimientos y modos de falla que aparecen en la corrida en skills y memoria reutilizables. Con dos backbones congelados y tres benchmarks, queda primero en cinco de seis configuraciones; en Terminal-Bench 2.0 le saca hasta 9,8 puntos porcentuales a los harnesses comparables, y en el escenario de auto-mejora gana 14,6 puntos con GLM-5.1 y 12,4 con Kimi-K2.6. Los números de eficiencia son los que lo vuelven adoptable: los tokens de salida promedio caen 42,9% y 47,4%, y las evaluaciones exitosas por millón de tokens de salida suben 110,3% y 134,0%. arXiv 2608.26530

Google DeepMind estrena la primera evaluación doble ciego de un modelo frontera, con criptografía en el medio (28/08). El piloto lo corre con el Singapore AI Safety Institute sobre un modelo de la línea Gemini Flash Lite, y ataca la contaminación de benchmarks: si el modelo ya vio las preguntas durante el entrenamiento, el puntaje no mide nada. Hasta ahora había que elegir entre dos males —el evaluador entregaba sus prompts y el proveedor veía las preguntas de antemano, o el proveedor entregaba los pesos y arriesgaba su propiedad intelectual—, y se resolvía con protocolos de zero-logging y salvaguardas contractuales; el caso reciente que cita The Decoder es la evaluación demorada de ARC-AGI para Fable 5 de Anthropic por la política de retención de 30 días. La implementación usa Confidential Space, del portfolio de confidential computing de Google Cloud, que verifica criptográficamente que el evaluador nunca ve los pesos y Google nunca ve los prompts. Donde más pesaría es en evaluaciones de ciberseguridad y en tests de agencias gubernamentales, que hoy no pueden auditar modelos avanzados sin ceder soberanía de datos. Reporte técnico de DeepMind · The Decoder

CritICL usa los errores de los modelos chicos como ejemplos in-context para mejorar a los grandes, sin generar de nuevo ni verificador externo (28/08). El hallazgo del que cuelga todo es que los modos de falla de los LLM tienen patrones estructurados a lo largo de las distintas escalas de una misma familia. En vez de tratar las fallas como salidas indeseables, CritICL recoge los modos de falla de los modelos más débiles y los mete en la inferencia como ejemplos in-context basados en críticas. Hay dos variantes: CritICL-dynamic, que predice de forma adaptativa los modos de falla específicos de cada entrada y recupera las críticas correspondientes, y CritICL-static, que usa un perfil global de fallas para dar una guía estable. Reportan que le gana consistentemente al in-context learning estándar y que empata o supera a los métodos de test-time scaling con muchas menos generaciones y menor costo en tokens, que es el argumento práctico: es una alternativa barata al best-of-n. El código está publicado. arXiv 2608.27455 · GitHub

El lente ACE ordena qué hace buenos a los datos de agentes, que no es tener más (28/08). Es un survey con marco propio, útil para quien esté generando trayectorias para entrenar agentes. Primero representa el dato agéntico como un objeto factorizado (E, q, τ, v) —especificación de entorno, señal de tarea, realización de la interacción y verificador opcional— y organiza los paradigmas de generación por su ancla primaria y su estructura de dependencias. Después formula la generación como diseño de distribución con restricciones bajo el lente Accuracy-Complexity-divErsity: la exactitud establece el soporte factible de datos consistentes y anclados a ejecución, la complejidad ubica la masa de aprendizaje relativa a la capacidad del aprendiz declarado, y la diversidad controla cobertura y redundancia. Lo que muestra la literatura revisada es un corrimiento hacia exactitud verificada por ejecución, complejidad relativa al aprendiz y diversidad más allá de la variación superficial o el tamaño del dataset. La conclusión es la que conviene tener a mano al armar un pipeline: el desafío no es generar más datos, sino asignar continuamente experiencia válida, informativa y no redundante a medida que agentes y entornos cambian. arXiv 2608.27260

LAION liberó el Big Video Dataset: 10 millones de horas de video abierto para investigación (29/08). Salió de 1.300 millones de URLs de video encontradas en CommonCrawl, de las que bajaron 80 millones de videos; de ahí extrajeron 55 millones de clips con descripciones de video y audio autogeneradas, más 300 millones de imágenes fijas. La mayoría viene de YouTube y está en inglés. Según el paper, los modelos entrenados con BVD le sacan hasta 2,1 puntos porcentuales a modelos comparables entrenados con InternVid en benchmarks habituales de video-a-texto, porque el entrenamiento ata video, audio y texto juntos aprendiendo qué contenido visual corresponde a qué descripciones o sonidos. La letra chica importa: se libera solo para investigación, apoyándose legalmente en el fallo de 2024 del tribunal regional de Hamburgo que le permitió a LAION recolectar contenido con copyright para investigación sin fines comerciales. El dataset y el código están disponibles. LAION · arXiv 2608.24845 · GitHub


Fuentes consultadas: The Decoder, OpenAI, Anthropic, TechCrunch, arXiv, The Robot Report, BleepingComputer, Patchstack, Google DeepMind, LAION, GitHub.

Ver todos los briefings