El Compilado Hilos Temas Archivo RSS

miércoles · 15 min de lectura

Briefing Tech — 26 de agosto de 2026

OpenAI presenta su chip Jalapeño y dice ganarle al GB300 de Nvidia con la mitad de watts, IBM libera Granite 4.2 bajo Apache 2.0, Anthropic va al IPO con un mercado potencial de USD 30 billones, y CISA da tres días para tapar el agujero de Gitea.

iahardwareroboticaciberseguridadtecnicas

Generado el miércoles 26 de agosto de 2026, 13:10 UTC. Ventana cubierta: últimas 24 horas (25 ago 13:10 UTC → 26 ago 13:10 UTC).

TL;DR

  • OpenAI mostró en Hot Chips los primeros benchmarks de Jalapeño, su ASIC de inferencia hecho con Broadcom: 700W contra los 1.400W del GB300 de Nvidia, con 1,5-1,9 veces más throughput por kilowatt. No lo comparó contra Vera Rubin.
  • IBM liberó Granite 4.2 bajo Apache 2.0 en 3B, 8B y 30B, con ventana de 512.000 tokens, modos “thinking” y “non-thinking”, y entrenamiento agéntico con RL en sandboxes reales.
  • Anthropic les va a decir a los inversores que su mercado potencial supera los USD 30 billones de cara a un IPO que busca una valuación cercana a los USD 2 billones.
  • Están explotando un fallo crítico de Gitea que da RCE con solo registrarse, y CISA les dio tres días a las agencias federales para parchear.
  • Prime Intellect publicó Prime Agent, un harness open source que sube el Best@1 de ARC-AGI-3 RHAE de 30% a 95,5% sin tocar el modelo.

IA

IBM liberó la familia Granite 4.2 bajo Apache 2.0, con entrenamiento agéntico y ventana de 512.000 tokens (26/08). Son tres tamaños —3B, 8B y 30B— entrenados desde cero sobre unos 15 billones de tokens, con la posibilidad de alternar entre modos “thinking” y “non-thinking” para regular cuánto cómputo gasta cada tarea, más un modo “low-effort” para consultas simples. Lo distintivo está en las variantes de 8B y 30B: pasan por lo que IBM llama “agentic RL”, entrenamiento por refuerzo en sandboxes reales donde aprenden a usar herramientas, escribir y ejecutar código, y buscar en la web. Todos soportan tool calling en formato OpenAI y corren en vLLM o SGLang. En el mismo anuncio salieron los Granite Speech 5.0 Turbo CTC, de apenas 470 millones de parámetros, que según IBM transcriben tres horas de audio en un segundo y duplican en velocidad a los líderes previos del Open ASR Leaderboard. Todo está en Hugging Face, Ollama y GitHub. The Decoder · IBM Research

Anthropic va a decirle a los inversores que su mercado potencial supera los USD 30 billones antes del IPO (26/08). Según el Wall Street Journal, la empresa pondrá esa cifra como TAM —el ingreso anual teórico si se quedara con el 100% del mercado— sumando todo el trabajo que los modelos podrían llegar a hacer. Quedaría por encima de SpaceX, que en mayo reclamó USD 28,5 billones y lo llamó “el TAM accionable más grande de la historia de la humanidad”. La comparación que ordena la escala: las 191 tecnológicas del S&P 1500 facturaron en conjunto USD 2,4 billones el año pasado, según FactSet. Los números reales de Anthropic sí crecen fuerte —duplicó ingresos en el segundo trimestre hasta USD 11.600 millones y proyecta entre USD 190.000 y 200.000 millones para 2028—, y busca una valuación cercana a los USD 2 billones levantando hasta USD 100.000 millones, con salida a bolsa posible en septiembre u octubre. The Decoder · WSJ

Moonshot AI negocia con Microsoft, Amazon y Google para que hosteen Kimi K3 a cambio de hasta el 30% de los ingresos (26/08). Sería la primera vez que una empresa china de IA cierra un acuerdo así con un proveedor cloud grande de Estados Unidos: el modelo correría en Azure, AWS y Google Cloud, y Moonshot pide quedarse con hasta el 30% de lo que facture, según tres fuentes citadas por Reuters. Las conversaciones están en etapa temprana y quedan abiertos el reparto exacto, el acceso a los datos y cómo se contabiliza el uso de tokens. El contexto político pesa: el secretario del Tesoro Scott Bessent amenazó hace poco a Moonshot con una prohibición comercial, y autoridades estadounidenses acusaron a la empresa de haber robado el modelo Fable de Anthropic, algo que Moonshot niega. Microsoft, Google y AWS no quisieron comentar. The Decoder · Reuters

OpenAI desarmó una operación de influencia rusa que usaba ChatGPT para lavar el idioma de sus propios textos (25/08). La empresa baneó un conjunto de cuentas que operaban vía VPN desde Rusia y promovían un “International Burke Institute” inventado, con contenido en alemán en Telegram crítico de la UE y del gobierno alemán. El detalle técnico es el que importa para quien estudia estas campañas: los operadores no usaban el chatbot para escribir los artículos, sino para sacarles las marcas idiomáticas que los delataban como hablantes de ruso. El alcance de la campaña se mantuvo chico, pero OpenAI advierte que la infraestructura montada podía escalarse. The Decoder · Tom’s Hardware

Meta lanza su agente pago Hatch en semanas y un modelo nuevo llamado Watermelon en octubre (25/08). Lo reporta The Information a partir de documentos internos. Hatch sería la versión de consumo del agente OpenClaw y es la apuesta de Zuckerberg para monetizar el gasto en IA por fuera de la publicidad, con un esquema de precios por niveles que llegaría hasta USD 199,99 mensuales. El agente está pensado para operar sobre DoorDash, Etsy, Reddit, Yelp y Outlook, y ofrecer un dashboard configurable con cosas como seguimiento de actividad física o planificación de viajes. Todavía no está claro si Watermelon entra en la familia Muse o sale como modelo suelto. Meta además está armando una plataforma sobre WhatsApp para que los usuarios enchufen más agentes. The Decoder · The Information


Hardware y Robótica

OpenAI mostró los primeros benchmarks de Jalapeño: 700W contra los 1.400W del GB300, y hasta 1,9 veces más throughput por kilowatt (25/08). Sigue de lo de ayer, cuando Nvidia usó Hot Chips 2026 para poner el Groq 3 LPX en producción: ahora fue OpenAI la que llegó a la conferencia con números de su primer chip propio, el ASIC de inferencia que codesarrolló con Broadcom. Sobre la suite pública InferenceX de SemiAnalysis, Jalapeño entregó entre 1,5 y 1,9 veces más throughput por kilowatt y entre 1,7 y 3,6 veces menos latencia end-to-end que los sistemas rack GB200 y GB300. Las pruebas corrieron sobre GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5. Las advertencias son varias y conviene tenerlas juntas: no se comparó contra Vera Rubin, no entrena modelos, y las comparaciones principales enfrentaron predicción de un solo token contra configuraciones GB300 haciendo lo mismo, cuando en producción Nvidia suele usar predicción multi-token —donde la ventaja de eficiencia baja a unas 1,5 veces—. Cada paquete lleva seis stacks de HBM4, 216 GiB a 15,4 TB/s, en un proceso clase 3nm de TSMC. Escalar esto al acuerdo de 10 GW firmado con Broadcom convertiría a OpenAI en un nuevo demandante grande de HBM4, la pieza más escasa de la industria. Y todo esto una semana después de que Nvidia acordara respaldar hasta USD 105.000 millones de financiamiento para un campus de datacenter de OpenAI en Ohio. Tom’s Hardware · TechCrunch · The Decoder

Apple estrenó el M6, su primer chip en 2 nanómetros, y el M5 Ultra, en Mac mini y Mac Studio (25/08). El M6 combina CPU de 12 núcleos —dos “super cores”, cuatro de rendimiento y seis de eficiencia— con GPU de 12 núcleos que lleva aceleradores neuronales en cada núcleo, un Neural Engine dual de 16 núcleos y hasta 170 GB/s de ancho de banda unificado; Apple promete hasta 40% más CPU y hasta 4 veces más rendimiento de IA que el M4. El M5 Ultra sube a 36 núcleos de CPU, hasta 80 de GPU, 512 GB de memoria y 1,2 TB/s. La distinción que importa para quien corre modelos locales: el Neural Engine del Ultra sigue en 32 núcleos, los mismos que el M3 Ultra, y lo nuevo son los aceleradores neuronales metidos en cada núcleo de GPU, que aceleran la multiplicación de matrices —la operación que domina la inferencia de LLMs—. Es la primera vez que un chip Ultra los lleva. Tom’s Hardware · Apple · TechCrunch

Generalist llegó a una valuación de USD 3.000 millones con una extensión de casi USD 200 millones liderada por 8VC (25/08). Es la segunda ronda de robótica en dos días: ayer fue General Intuition negociando a USD 6.000 millones, hoy Generalist, que en junio había cerrado una Serie B de USD 400 millones a USD 2.000 millones y ahora suma la extensión, para un total de USD 600 millones. La fundaron en 2024 los ex Google DeepMind Pete Florence y Andy Zeng con el ex ingeniero de Boston Dynamics Andrew Barry, y tiene a Nvidia, Bezos Expeditions y Fei-Fei Li entre los que pusieron plata temprano. El dato técnico que están vendiendo es concreto: su modelo Gen 1.5 permitiría que un robot aprenda una tarea nueva a partir de demostraciones en video de entre 3 y 12 segundos. Compite con Physical Intelligence, valuada en USD 11.000 millones, y Skild AI, en USD 14.000 millones. La advertencia que repiten algunos VCs sigue en pie: los robots no se pueden entrenar con internet entero como los LLMs, así que un modelo verdaderamente general puede estar todavía a años. TechCrunch

Gatik levantó USD 200 millones para camiones autónomos después de cerrar con PepsiCo (25/08). La startup opera rutas cortas y repetitivas entre centros de distribución y tiendas, que es el nicho donde la conducción autónoma tiene el caso de negocio más limpio: recorridos fijos, velocidades moderadas y un cliente que mide el ahorro por viaje. El acuerdo con PepsiCo es lo que destrabó la ronda. TechCrunch

El gobierno de Estados Unidos quiere sacar la consulta pública de los permisos de contaminación del aire, y los datacenters de IA son el motivo (26/08). Un cambio propuesto a las regulaciones de la EPA eliminaría la obligación de los estados de abrir a comentario público los permisos de emisiones. En la práctica es la vía administrativa para desactivar el principal mecanismo con el que las comunidades frenan o demoran datacenters: el trámite dejaría de publicarse. Vale seguirlo porque define el costo político real de la expansión de cómputo en los próximos años. Tom’s Hardware


Ciberseguridad

Están explotando un fallo crítico de Gitea que da ejecución remota con solo registrarse, y CISA dio tres días para parchear (26/08). Es CVE-2026-60004, una inyección de código en el endpoint diffpatch reportada por el investigador de Salesforce Shai Rod: un usuario con permiso de escritura sobre un repositorio puede ejecutar comandos arbitrarios con los privilegios de la cuenta de sistema de Gitea instalando un git hook desde contenido del propio repo. El agravante es la configuración por defecto, que trae el auto-registro habilitado —así que un visitante sin credenciales se crea una cuenta, arma un repositorio y ya tiene lo que necesita—. Gitea lo parcheó el 27 de julio en la versión 1.27.1. CISA lo metió el martes en el catálogo KEV y les puso plazo hasta el 28 de agosto a las agencias federales, bajo la misma directiva BOD 26-04 que ayer apuraba lo de Zimbra. Shadowserver cuenta cerca de 5.000 instancias de Gitea expuestas; los ataques vistos hasta ahora despliegan mineros de criptomonedas. BleepingComputer · Aviso de Gitea · CISA

ToxicPanda 2.0 pide permisos de VPN para cortarle el acceso a Google Play y ya apunta a 349 apps financieras (25/08). El troyano bancario de Android pide el permiso de servicio VPN para levantar una interfaz local por la que pasa todo el tráfico, y con eso bloquea la comunicación con Google Play y Google Play Services antes de extraer e instalar su payload; recién después pide permisos de Accessibility. Cortar la red a nivel de sistema le desactiva de un saque las verificaciones de apps, las actualizaciones y la telemetría de Play Protect. La escala saltó fuerte respecto de la versión documentada antes: de 16 apps bancarias a 349 aplicaciones de banca, finanzas, billeteras y cripto en 16 países, con soporte para 167 comandos remotos. Zimperium lo detectó distribuyéndose desde buckets alojados en AWS. BleepingComputer · Malwarebytes

Un DDoS grande viene golpeando la infraestructura digital compartida del gobierno de Noruega desde el lunes (25/08). El ataque afecta servicios usados por todo el sector público, no un organismo suelto: el blanco es la capa común sobre la que se apoyan los trámites. Es el recordatorio de que centralizar la infraestructura estatal concentra también el punto único de falla. BleepingComputer

Abusan de npm y sus mirrors para hostear páginas de phishing que imitan CAPTCHAs de Cloudflare (25/08). Los atacantes publican paquetes con HTML malicioso adentro y usan la CDN del registro —y sus espejos— como hosting gratis y con reputación limpia, para redirigir visitantes a sitios que controlan. Lo que hace efectivo el truco es justamente el dominio: un link a un mirror de npm no dispara las mismas alarmas que un dominio recién registrado. Es una variante distinta del ataque a la cadena de suministro habitual: acá no se busca que instales el paquete, sino usar el registro como infraestructura de entrega. BleepingComputer

AnonyMousKIT automatiza con agentes de voz de IA el robo de passcodes de iPhone (25/08). Es una plataforma de phishing como servicio que automatiza la obtención de los códigos que desbloquean dispositivos Apple robados y desactivan el Activation Lock. El eslabón que faltaba en la cadena del robo de teléfonos era humano —había que llamar a la víctima y convencerla—, y es exactamente el que la síntesis de voz vuelve barato y escalable. BleepingComputer


Técnicas, repos y práctica

Prime Agent sube el Best@1 de ARC-AGI-3 RHAE de 30% a 95,5% sin tocar el modelo, y el código está publicado. Prime Intellect liberó un harness open source para evaluación de horizonte largo y flujos de agentes de código, con tres piezas que valen por separado. Un REPL de IPython persistente que sigue la abstracción de Recursive Language Model, o sea que el procesamiento de contexto y el cómputo en tiempo de test se hacen programáticamente en vez de todo dentro de la ventana. Un “Continual Harness” que preserva historiales, memorias, skills, prompts y especificaciones de subagentes entre trayectorias. Y subagentes recursivos que se coordinan por comunicación directa agente a agente, con una vista para que un humano inspeccione y maneje sesiones respaldadas por demonios. La tesis del paper es la que conviene retener aunque no lo uses: el harness estandariza ejecución, recuperación, verificación y contabilidad de recursos, y deja la estrategia al modelo, para que los fallos del andamiaje dejen de contarse como fallos del modelo. Empata o supera a harnesses nativos y populares en código de contexto largo, generación de kernels de GPU, construcción de emuladores y speedruns autónomos de nanoGPT. arXiv 2608.23552 · GitHub

Quantization-Aware Healing: destilar el modelo de 4 bits directamente desde el original sin comprimir, siete veces más rápido que QAT. El problema es cotidiano para cualquiera que sirva modelos barato: comprimir estructuralmente y cuantizar a 4 bits degrada razonamiento, matemática, código y contexto largo lo suficiente como para necesitar una etapa de recuperación. La receta por defecto, quantization-aware training, reajusta el modelo comprimido contra etiquetas duras, y en el pipeline de estos autores convergió lento y colapsó pasado su pico. El razonamiento detrás de QAH es limpio: un modelo comprimido estructuralmente nunca se entrenó de forma independiente en precisión completa, así que su checkpoint bfloat16 ya es una aproximación recuperada por destilación del original —conviene entonces destilar el estudiante de 4 bits desde el modelo original, no desde esa copia intermedia—. Sobre un pipeline GPT-OSS 120B → 60B → MXFP4, el estudiante iguala o supera a su fuente bfloat16 en 7 de 9 benchmarks con cuatro veces menos memoria de pesos y la mitad de parámetros que el maestro. Contra un QAT equivalente llega a un pico comparable unas 7 veces más rápido y se mantiene estable con entrenamiento continuado, sin early stopping ajustado a mano. Los pesos salieron abiertos como Hypernova-60B. arXiv 2608.20953

Apodex 1.1 apunta a la “capacidad de trabajo” y mete un Mini de 35B que corre local. El planteo separa dos cosas que suelen ir juntas: un modelo puede razonar y sintetizar conocimiento y aun así fallar en trabajo complejo, que además exige interacción sostenida con archivos, fuentes y código ejecutable, más mantenimiento de estado, recuperación de fallos y entrega verificable. El entrenamiento escala por dos ejes. “Environment Scaling” amplía la diversidad y la verificabilidad de los entornos ejecutables de archivos, búsqueda y código. “Agentic Coordination Scaling” entrena a los agentes a descomponer tareas largas, delegar trabajo en paralelo, integrar resultados asincrónicos y replanificar. Un harness de ejecución compartido y un “AgentOS” mantienen estado y procedencia a través de herramientas y agentes. El resultado que interesa: llega a la banda de rendimiento líder en trabajo profesional, finanzas, investigación científica, matemática, código y búsqueda con un modelo bastante más chico que muchos sistemas de frontera, y la variante Mini de 35.000 millones de parámetros conserva buena parte de eso en un formato desplegable localmente. arXiv 2608.23283 · Hugging Face

Thinkingbox, de Microsoft, mide lo que ninguna eval de agentes mide: si el éxito se repite. El título del paper es la tesis —“un éxito no es confiabilidad”— y ataca un vicio metodológico concreto: los benchmarks de agentes reportan si la tarea se completó alguna vez, no con qué frecuencia, y en workflows de negocio con estado esa diferencia es todo. Un agente que acierta una de cada tres veces sobre un sistema que guarda cambios no es un agente con 33% de precisión: es un agente que rompe cosas dos de cada tres corridas. El aporte es un sandbox más un benchmark de workflows empresariales con estado real, donde cada intento deja consecuencias. Si estás evaluando agentes para producción, es el marco mental que conviene copiar aunque no uses el dataset. arXiv 2608.19741 · Hugging Face


Fuentes consultadas: The Decoder, IBM Research, WSJ, Reuters, The Information, Tom’s Hardware, TechCrunch, Apple, BleepingComputer, Malwarebytes, CISA, Gitea, arXiv, Hugging Face.

Ver todos los briefings