-
El Gorgon Halo de AMD corre modelos de 345.000 millones de parámetros en local, y el primer equipo arranca en 6.799 dólares (29/09)
Es la versión overclockeada de fábrica del Strix Halo: hasta 16 núcleos Zen 5, iGPU de 40 unidades de cómputo, NPU XDNA 2 y hasta 192 GB de LPDDR5x unificada a 8.533 MT/s, con 273 GB/s de ancho de banda. A 4 bits eso alcanza para 345.000 millones de parámetros en Linux y 320.000 en Windows, es decir modelos de frontera como DeepSeek V4 Flash o el GLM-5.3-Flash de Z.AI corriendo sin salir de la máquina. El precio es el problema: el GMKtec EVO-X5 Pro empieza en 6.799 dólares y los equipos con Gorgon Halo van a estar por encima, empujados por la escasez de LPDDR5x y 50% más de capacidad. Los sistemas GB10 de Nvidia, para comparar, casi duplicaron su precio en un año y hoy van de 6.000 a 8.000. The Register
-
OpenAI aclaró que el Jalapeño es para consumo propio, pero dejó la puerta abierta: "se podría usar para cualquiera, honestamente" (28/09)
Richard Ho, head of hardware de OpenAI, le dijo a Tom's Hardware que la prioridad es cubrir la demanda interna de cómputo y que eso va a llevar "un buen rato largo", sin descartar una venta externa más adelante. El punto que quería sacar de la mesa con los benchmarks de Hot Chips es que el ASIC no está hardcodeado para modelos de OpenAI: lo mostraron corriendo GPT-OSS, DeepSeek R1 y Kimi K2.5, medido con InferenceX de SemiAnalysis contra GB200 y GB300, y aclaró que comparó contra Blackwell porque eran los mejores resultados publicados que encontró. Sobre Vera Rubin, que es con lo que va a convivir cuando despliegue, dice tener mediciones internas que no publica y que "vamos muy bien". El motor del diseño, según él, fue una sola cosa: eficiencia, porque el datacenter moderno está limitado por potencia. El límite real para vender afuera parece ser el suministro. Tom's Hardware
-
China extendió las restricciones de salida del país a los cónyuges e hijos de los ejecutivos clave de sus empresas de IA y chips (28/09)
Los familiares directos del talento senior del sector privado ahora necesitan autorización previa del gobierno para viajar al exterior; Bloomberg nombra explícitamente a Alibaba y DeepSeek. La escalada viene de marzo de 2026, cuando empleados de DeepSeek entregaron sus pasaportes y los cofundadores de Manus AI quedaron con prohibición de salida; en mayo se formalizó la aprobación previa para profesionales senior y el 15 de septiembre entraron en vigor reglas nacionales con penalidades por violaciones de seguridad industrial y tecnológica. Pekín ya trata a sus investigadores de IA como activo estratégico de seguridad nacional, con lo que eso implica para retención, reclutamiento internacional y colaboración abierta. Bloomberg · The Standard
-
DeepSeek llegó a 1.000 millones de dólares de ingresos anualizados después de subir los precios de la API, y busca cerrar 7.500 millones en Shanghái (24/09)
La cifra duplica la de hace unos meses y llega justo después de un aumento de precios de entre 2,3 y 4,5 veces, lo que dice más sobre el poder de fijar precios que sobre el crecimiento de volumen. La ronda apuntaría a cerrarse hacia fin de octubre. The Information · Investing.com
-
xAI lanzó Grok 4.7 después de cinco postergaciones, y empata con MiMo en el índice pagando cinco veces más (21/09)
El modelo tiene 2,1 billones de parámetros, 40% más que Grok 4.6, se apoya en una corrida más larga de aprendizaje por refuerzo y en entrenamiento que pesa más las tareas difíciles de horas. xAI también le metió datos suplementarios traídos de SpaceX: telemetría de satélites Starlink, registros de fabricación y bitácoras de fallas de ingeniería. Cuesta 2 dólares el millón de entrada y 6 el de salida, más cerca de los modelos chinos que de la frontera occidental, y saca 46 en el índice de Artificial Analysis contra los 53 de Claude Fable 5.1 y GPT-6. La brecha se abre en lo agéntico: 26% en Terminal-Bench 4.0, contra 60% de GPT-6 Astra y 55% de Fable 5.1, por debajo incluso del más barato DeepSeek V4.1 Flash. Musk había corrido la fecha al menos cinco veces desde fines de julio. Está en la app de Grok, en Cursor, en Grok Build, en la API y desde hoy en GitHub Copilot. The Decoder · Decrypt · GitHub Changelog
The Decoder Decrypt GitHub Changelog xAI GitHub Claude Grok GitHub Copilot
-
El consumo semanal de tokens en OpenRouter subió más de 25.000% desde enero de 2025, y el gráfico dice menos de lo que parece (17/09)
Pasó de 0,5 billones a 126,2 billones de tokens semanales en la plataforma que usan los desarrolladores para enchufar modelos a sus productos. El problema es leerlo como adopción: los modelos de razonamiento generan cantidades enormes de tokens de "pensamiento" antes de contestar, así que un aumento chico de uso real puede significar un salto gigante en la cuenta, sobre todo con sistemas agénticos sin optimizar. GPT 5.6 Luna domina el consumo de tokens, pero eso no significa que más gente lo use: puede simplemente generar más tokens por pedido. En ingresos, el que lidera es Astra. Los modelos chinos —Kimi, GLM, DeepSeek— crecen rápido, con el gasto mensual multiplicado por diez en 2026, aunque desde una base mucho más chica. Es el mismo argumento que ya se le hizo a Google cuando prefirió hablar de consumo de tokens antes que de ventas. The Decoder · LinkedIn / OpenRouter
-
Tencent liberó BrowserSkill, que le presta a un agente tu navegador ya logueado en vez de pedirle que abra uno limpio (17/09)
1.350 estrellas en el día, licencia MIT. La idea resuelve el problema más aburrido y más caro de la automatización de navegador: mantener cuentas de prueba y sesiones separadas. BrowserSkill conecta Cursor, Claude Code, Codex, DeepSeek Harness y cualquier agente que pueda llamar a una shell, a través de la CLI bsk más una extensión de Chrome o Edge, con soporte para macOS, Linux y Windows. Las decisiones de diseño son las que vale copiar. Las tareas del agente corren en una ventana separada y visible, así que se puede seguir usando el navegador propio mientras tanto. Si el agente necesita tocar una pestaña que ya está abierta, tiene que pedirla prestada explícitamente, devolverla al terminar y no tocar el resto. Y hay human-in-the-loop incorporado: cuando la tarea choca con un captcha, un login o un diálogo de confirmación, el agente pide que la persona tome el control y después sigue. La versión 0.3.0 endureció esto último: los flags que permitían saltear la confirmación de préstamo de pestañas o desactivar los pedidos de ayuda ya no lo hacen. GitHub
-
colibrì trepó a 33.000 estrellas proponiendo algo que suena imposible: correr modelos MoE de frontera desde el disco, en C puro y sin dependencias (15/09)
El repo sumó 2.035 estrellas en el día y la idea que lo mueve merece atención aunque uno nunca lo instale. Un modelo Mixture-of-Experts de 744 mil millones de parámetros activa solo unos 40 mil millones por token, y de esos apenas ~11 GB cambian de un token al siguiente. colibrì toma esa observación en serio: la parte densa —atención, expertos compartidos, embeddings, unos 17B de parámetros— se queda residente en RAM en int4, unos 9,9 GB, y los 19.456 expertos ruteados viven en NVMe y se transmiten bajo demanda. La analogía que usa el autor es la de un JIT: los parámetros no son estado a sostener, son datos a preparar justo cuando el router prueba que hacen falta, y eso funciona porque el ruteo tiene estructura medible —resulta 71,6% predecible un layer por adelantado, lo que habilita el prefetch—. Los números son honestos y modestos: 1,8 tok/s en un escritorio CPU-only de 128 GB, 1,07 tok/s en una caja con una sola RTX 5070 Ti, y 0,05-0,1 tok/s en frío en la máquina de 25 GB de RAM y doce núcleos donde nació el proyecto. Declara soporte para GLM-5.2, Inkling (975B), Kimi K3 (2,8T), DeepSeek V4 Flash, Qwen3.8-Flash-Next y OLMoE. Truco que vale más allá del repo: si tenés un segundo SSD, poner una copia completa del modelo ahí y rutear los expertos por hash entre ambos suma el ancho de banda de las dos unidades —un par de 9 GB/s + 3 GB/s lee ~33% más rápido que el disco veloz solo—. GitHub
-
Investigadores militares chinos usaron Claude para armar 16 módulos de guerra electrónica cuyo escenario por defecto tenía 12 blancos en Taiwán (13/09)
Sigue de lo de ayer, cuando el reporte de Anthropic aportó los números de velocidad de ShinyHunters: ahora se conoce el capítulo chino, con cinco programas distintos, dos de ellos militares. Un actor pidió ayuda para redactar la especificación de control de fuego de un sistema anti-torpedo —la lógica que decide cuándo y dónde engancha el arma—, probarlo contra sistemas conocidos de la Armada estadounidense y preparar una propuesta técnica de más de 200 páginas, disfrazándose de OEM del sector de defensa de Estados Unidos. Otro, un investigador del complejo militar-industrial, desarrolló los 16 módulos de software para guerra electrónica y supresión de defensas aéreas: analizan radares, baterías de misiles, puestos de comando y nodos de comunicaciones, y priorizan blancos. El escenario por defecto contenía doce objetivos en Taiwán, incluidas baterías Patriot y Tien Kung, bases aéreas, un radar de alerta temprana y un búnker de comando; los metadatos de cuenta apuntan a instituciones de investigación de la República Popular, entre ellas la Academia de Ciencias Militares del EPL. Aparte, Anthropic acusa a varios laboratorios chinos de destilación a escala industrial: Alibaba habría generado más de 151 millones de intercambios entre mayo y julio, llegando a casi 3 millones de pedidos por día a través de miles de cuentas fraudulentas, con los datos de cadena de razonamiento usados para entrenar Qwen 3.x; DeepSeek, más de 12,1 millones en 14 días; Xiaomi, más de 400.000. Tom's Hardware · Anthropic
Tom's Hardware Anthropic Anthropic Alibaba Claude Qwen ShinyHunters
-
El motor de inferencia colibri explotó en GitHub con más de 3.100 estrellas en un día (13/09)
El repo no es nuevo, pero el salto de tracción de hoy lo pone arriba de la lista de tendencias y vale mirarlo por lo que propone: correr modelos MoE de frontera —de 744.000 millones a 2,8 billones de parámetros— en hardware de consumo, en C puro y sin dependencias, tratando almacenamiento, RAM y VRAM como una sola jerarquía de inferencia. La idea central es hacer streaming de los expertos desde disco en lugar de tenerlos todos en RAM, así que un NVMe rápido pasa a ser el factor que más determina los tokens por segundo. Hoy soporta ocho familias, entre ellas GLM-5.2, GLM-5.3-Flash, Kimi K3, DeepSeek V4 Flash, Qwen3.8-Flash-Next, Qwen3.6 y OLMoE, con la jerarquía de memoria manejada por LRU más un conjunto de pines aprendido. Conviene tomarlo como lo que es —un proyecto en movimiento, con trabajo abierto en formatos, compresión, placement, scheduling, kernels y KV—, no como un reemplazo de producción de vLLM o llama.cpp. GitHub · Colibri
-
Un benchmark con más de 1.500 dólares en tokens concluye que RTK no abarata el coding agéntico (11/09)
RTK —Rust Token Killer, más de 79.000 estrellas en GitHub— filtra y comprime la salida de la terminal antes de que la lea el agente, y circulan posts prometiendo recortes del 60% al 90%. Quesma lo corrió sobre Terminal-Bench 2.1 con Claude Code sobre Fable 5.0 y OpenCode sobre DeepSeek V4 Pro, cinco intentos por tarea con y sin RTK, 1.740 intentos en total. Medido por tarea, Fable quedó 1% más caro —indistinguible de cero— y DeepSeek 17% más caro en promedio. El ahorro aparente de Fable en el total venía casi enteramente de una sola tarea. La explicación mecánica es la útil: la salida de terminal era apenas 7% del input de Fable, el contexto se cachea después de cada turno y esas lecturas cuestan una décima parte, y RTK no toca las herramientas Read, Grep y Glob. Además, menos texto por turno no compensa si hay más turnos: DeepSeek tuvo 7% menos input por turno pero 18% más turnos. Y rtk gain no mide plata sino bytes removidos sobre cuatro: en un caso contó 120,5 millones de tokens "ahorrados" comparando un head -1 contra el archivo entero. Quesma · Hacker News
-
DeepSeek lanzó V4.1 Flash, con arquitectura nueva y precio sin recargo (10/09)
Es el modelo más chico de una familia de arquitectura nueva, con multimodalidad de visión nativa y mayor throughput, y es el que le da nombre a la línea completa que viene arriba. Tiene 552.000 millones de parámetros totales pero solo 8.000 millones activos para procesar la entrada y 16.000 millones para generar salida, un reparto pensado para que la inferencia salga barata sin vaciar la capacidad. En los benchmarks agénticos y de código que publica la propia empresa queda adelante o a tiro de GPT-5.6 Sol y Claude Opus 5; en evaluaciones de conocimiento como HLE y en algunos benchmarks de terminal, los dos occidentales siguen claramente arriba. El precio es idéntico al de V4 Flash y rige desde las 04:00 UTC de hoy. OfficeChai · DeepSeek API Docs · Hacker News
-
CISA, la NSA y el FBI acusaron a seis empresas chinas de destilar los modelos frontera estadounidenses a escala industrial (09/09)
El aviso conjunto nombra a DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun y Z.AI, y sostiene que desde fines de 2024 extrajeron miles de millones de tokens con millones de pedidos a los modelos de Anthropic, OpenAI, Google y xAI. Las agencias evalúan que la escala y la sofisticación implican conocimiento del gobierno chino y que la práctica es parte central de la estrategia de desarrollo de esas empresas. La mecánica descrita es la de una operación armada: pedidos repartidos entre cuentas fraudulentas o compartidas, servicios cloud, agregadores y proxies "estación de transferencia" para saltar restricciones geográficas y límites de uso; prompts que buscan sacar cadenas de razonamiento restringidas; failover automático entre rutas cuando una se bloquea; y frameworks de evaluación de calidad para detectar si el proveedor empezó a degradar las respuestas a propósito. DeepSeek y Moonshot figuran como los principales, seguidos por MiniMax. BleepingComputer · CISA
BleepingComputer CISA OpenAI Anthropic Google xAI Moonshot AI Alibaba CISA
-
Un experimento de prefills de razonamiento midió que Qwen3.8 se corre 18 puntos hacia GPT-5.5 Pro cuando se le inyecta el arranque del razonamiento ajeno (09/09)
El método es simple y replicable: para cada problema se generan dos respuestas del modelo objetivo, una normal y otra que arranca con el primer 1% del razonamiento del modelo maestro insertado en su canal de razonamiento, y después se mide cuánto de la respuesta visible del maestro aparece en los primeros 100 tokens de la del alumno, promediando recall de unigramas, bigramas y trigramas. Sobre 45 problemas —15 STEM, 15 no-STEM y 15 puzzles sintéticos privados—, Qwen3.8 A95B pasa de 16,79% a 34,97%, con +27 puntos en STEM y +14,75 en los puzzles que nadie más tiene. DeepSeek V4 Flash no se mueve, Kimi K3 sube 4,54 puntos pero ya arranca con el solapamiento más alto. El experimento no prueba destilación, pero es la clase de evidencia técnica y reproducible que el aviso de CISA de ayer no aporta. Gist de wsxiaoys · Hacker News
-
ChatGPT recupera participación de tráfico web y llega al 55,5%, mientras el repunte de Gemini se apaga (07/09)
Los datos de Similarweb muestran a ChatGPT subiendo del 52,7% de hace tres meses al 55,5%, y a Gemini bajando del 27,8% al 25,6%. En el año, sin embargo, ChatGPT perdió muchísimo terreno —venía del 73,3%—, Gemini duplicó su parte y Claude pasó del 1,9% al 9,3%; DeepSeek (3,4%), Grok (2,4%), Copilot (1,6%) y Perplexity (0,9%) siguen siendo marginales. La advertencia metodológica importa más que el número: esto mide solo tráfico web, y deja afuera todo lo que Google empuja por Android abriendo la app de Gemini directamente, además de las apps móviles de OpenAI y del nuevo ChatGPT Work de escritorio. The Decoder · Similarweb vía X
The Decoder Similarweb vía X OpenAI Google GPT Claude Gemini Grok GitHub Copilot
-
DeepSeek planea el mayor clúster conocido de chips Huawei: al menos 160.000 Ascend-950DT en Mongolia Interior (04/09)
El dato es de Bloomberg y tiene un matiz importante: los chips correrían solo inferencia, no entrenamiento, para lo cual DeepSeek sigue usando hardware de Nvidia. Huawei probablemente no pueda entregar el pedido completo en más de un año por límites de producción y escasez de memoria; CXMT, el principal fabricante chino, recién está sacando lotes chicos de HBM3E y va tres a cinco años detrás de Samsung, SK Hynix y Micron, que ya producen HBM4 en masa. Aun así, si se construye, sería el paso concreto más grande hacia destetar a la IA china de Nvidia. The Decoder · Bloomberg
-
OpenAI mostró los primeros benchmarks de Jalapeño: 700W contra los 1.400W del GB300, y hasta 1,9 veces más throughput por kilowatt (25/08)
Sigue de lo de ayer, cuando Nvidia usó Hot Chips 2026 para poner el Groq 3 LPX en producción: ahora fue OpenAI la que llegó a la conferencia con números de su primer chip propio, el ASIC de inferencia que codesarrolló con Broadcom. Sobre la suite pública InferenceX de SemiAnalysis, Jalapeño entregó entre 1,5 y 1,9 veces más throughput por kilowatt y entre 1,7 y 3,6 veces menos latencia end-to-end que los sistemas rack GB200 y GB300. Las pruebas corrieron sobre GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5. Las advertencias son varias y conviene tenerlas juntas: no se comparó contra Vera Rubin, no entrena modelos, y las comparaciones principales enfrentaron predicción de un solo token contra configuraciones GB300 haciendo lo mismo, cuando en producción Nvidia suele usar predicción multi-token —donde la ventaja de eficiencia baja a unas 1,5 veces—. Cada paquete lleva seis stacks de HBM4, 216 GiB a 15,4 TB/s, en un proceso clase 3nm de TSMC. Escalar esto al acuerdo de 10 GW firmado con Broadcom convertiría a OpenAI en un nuevo demandante grande de HBM4, la pieza más escasa de la industria. Y todo esto una semana después de que Nvidia acordara respaldar hasta USD 105.000 millones de financiamiento para un campus de datacenter de OpenAI en Ohio. Tom's Hardware · TechCrunch · The Decoder
Tom's Hardware TechCrunch The Decoder OpenAI Nvidia Broadcom TSMC Kimi
-
Nvidia puso el Groq 3 LPX en producción y dice cuadruplicar a Cerebras, pero la cuenta esconde el conteo de chips (25/08)
Sigue de lo de ayer, cuando Cerebras presentó el CS-4: ahora Nvidia anunció en Hot Chips 2026 que su acelerador de inferencia entró en producción plena y publicó un benchmark de Artificial Analysis con 3.400 tokens por segundo en Gemma 4 31B con ventana de 100.000 tokens, contra 882 de Cerebras. The Register desarma la comparación: cada LPU tiene apenas 500 MB de memoria, 576 veces menos que una GPU Rubin con 288 GB, así que el modelo se parte entre varios aceleradores por Ethernet —hasta 256 LPUs por rack— con las GPUs haciendo el prefill y las LPUs el decode. Gemma 4 31B es el mejor caso posible: modelo denso que entra entero en un rack. DeepSeek V3 necesitaría 1.342 aceleradores, poco más de cinco racks. Y la comparación contra Cerebras omite que Nvidia usa al menos 64 chips donde Cerebras usa uno o dos, y no incluye el CS-4. Nvidia pagó unos USD 20.000 millones por la licencia de Groq en diciembre; Nebius será el primer proveedor cloud en ofrecerlo. The Decoder · Nvidia · The Register
-
Los grupos estatales chinos más que duplicaron sus ataques desde que usan IA, y DeepSeek es el favorito (24/08)
Lo dice la firma taiwanesa TeamT5 vía Bloomberg, y la razón que da su analista jefe Charles Li es incómodamente concreta: DeepSeek es "relativamente potente con muy pocas barreras de ciberseguridad". Los casos que citan: Grimfengxi lo usó para escribir código de exploits, Huapi se apoyó en un modelo chino que probablemente sea DeepSeek, y Teleboyi lo usó para juntar direcciones IP y mapear dominios. ChatGPT aparece en al menos un caso —CyCraft encontró evidencia de que lo usaron para armar un módulo de descifrado de una base de datos de Signal— y el grupo Slime22 usó Claude Code para moverse dentro de los sistemas de una empresa taiwanesa. El marco que ayuda a calibrar: el AI Safety Institute británico midió que las capacidades cibernéticas de los modelos abiertos saltaron fuerte, aunque para ataques totalmente autónomos siguen varios meses atrás de los de frontera occidentales. The Decoder · Bloomberg
-
DeepSeek libera V4-Flash-Vision-Exp y se acerca a Opus 4.8 en benchmarks de agente multimodal (21/08)
El modelo experimental le agrega comprensión de imágenes a V4-Flash sin perder el rendimiento de texto en razonamiento y conocimiento del mundo, y en los benchmarks internos de la empresa queda cerca de Opus 4.8 y a veces lo pasa. El posicionamiento es explícito hacia flujos de trabajo de agentes visuales: describir imágenes, extraer texto de capturas, analizar diagramas, todo combinado con uso de herramientas. Lo práctico está en los límites: cada imagen cuesta como máximo 384 tokens sin importar la resolución original, entran hasta 600 imágenes por request, y hay una Files API nueva y gratuita para subir un archivo una vez y referenciarlo por ID en varias llamadas. Funciona con Chat Completions y Responses de OpenAI y con el endpoint Messages de Anthropic, y la versión 0.1.1 del Harness de DeepSeek ya lo soporta de fábrica. Los precios siguen la tarifa de V4-Flash. The Decoder · DeepSeek API Docs
-
RayNeo saca unos anteojos de IA sin cámara y sin parlante, apostando todo al texto sobre el campo visual (22/08)
Los iO Glasses proyectan texto con una guía de onda verde de 97% de transparencia y unos 1.300 nits, y la ausencia de cámara es la decisión de diseño, no una carencia: no filma, no saca fotos. Lo que hacen es escuchar las conversaciones, resumirlas, extraer ítems de acción y sugerir entradas de calendario que se confirman con un movimiento de cabeza; también traen modo teleprompter y traducción de voz a texto en 40 idiomas. Cuatro micrófonos y un sensor de conducción ósea levantan la voz en ambientes ruidosos, y un LED se enciende cuando el micrófono está activo. De fábrica corren RayNeo AI y Gemini 3.1 Flash Lite, y una suscripción de USD 9,99 por mes agrega ChatGPT 5.1, Gemini 2.5 Pro, Claude y DeepSeek. La pega que conviene marcar: todos los modelos de esa lista ya están desactualizados. The Decoder · RayNeo
-
China deja entrar H200 de Nvidia a cuentagotas: ByteDance y Tencent recibieron unos 10.000 cada uno (19/08)
Según el Financial Times, Beijing autorizó lotes chicos para que las empresas locales no queden atrás en la carrera con EE.UU., y podrían sumarse más compañías pronto. El H200 está al menos dos generaciones detrás de lo mejor de Nvidia, que China no puede comprar por los controles de exportación estadounidenses; del lado de EE.UU. el tope es de 100.000 unidades por empresa, pero el freno real es interno, porque Beijing quiere sostener a fabricantes propios como Huawei y cada compra necesita el visto bueno de la NDRC. Los envíos a Hong Kong también están permitidos, aunque la ciudad no tiene ni datacenters ni energía para aprovecharlos. Técnicamente los laboratorios chinos vienen achicando la brecha —Moonshot con K3, Alibaba con Qwen3.8, DeepSeek con V4 y Z.ai con GLM-5.3—, pero siguen muy atrás en capacidad de inferencia disponible: tras un pico de demanda, Moonshot tuvo que dejar de tomar clientes nuevos. Nvidia mantiene alrededor de medio millón de H200 en stock. The Decoder · Financial Times
-
Stripe cerró la compra de OpenRouter por más de USD 7.000M, cinco veces su valuación de mayo (16/08)
Bloomberg reportó que las conversaciones que el Wall Street Journal había adelantado el mes pasado terminaron en acuerdo cerrado. OpenRouter es la capa de ruteo que le da a unos 8 millones de desarrolladores un punto único de acceso a más de 400 modelos de OpenAI, Anthropic, Google, Meta y DeepSeek, eligiendo por tarea y presupuesto; en mayo había levantado una Serie B de USD 113M a una valuación de USD 1.300M con Sequoia, a16z, Menlo y CapitalG. Su CEO Alex Atallah venía describiendo a la empresa como "el Stripe de la IA", así que la operación es menos rara de lo que parece: Stripe ya mueve volúmenes enormes de pedidos sensibles a latencia y construyó todo su negocio abstrayendo infraestructura ajena. Lo que compra, en los hechos, es el peaje de la economía de tokens. Bloomberg · TechCrunch · The Decoder
Bloomberg TechCrunch The Decoder OpenAI Anthropic Google Meta
-
Z.ai lanza GLM-5.3: récord open-source en coding y, sin buscarlo, la mejor capacidad cyber del ecosistema abierto (14/08)
El modelo es el mismo GLM-5.2 de mediados de julio — MoE de 753.000M de parámetros y 1M de contexto — con toda la ganancia sacada de post-entrenamiento más agresivo, no de un base nuevo. Consiguió el puntaje más alto de cualquier modelo abierto en Terminal Bench 3.0 y un 50% de mejora sobre GLM-5.2 en el benchmark interno de agentes de código. Lo que lo vuelve noticia es lo otro: supera a Claude Mythos 5 en CyberGym (búsqueda de vulnerabilidades), y Z.ai dice que el modelo ya encontró más de 2.400 fallas en 269 proyectos, la mitad de severidad media o mayor, incluyendo una en código escrito hace 40 años. El post-entrenamiento usó sandboxes generados por agentes que imitan workstations de desarrollo, con ejercicios que tardaban días. Los pesos salen en Hugging Face en unas dos semanas, después de la evaluación de seguridad. Sigue el patrón que se veía ayer con DeepSeek V4 Pro: los labs chinos están optimizando duro para agentes de código y ciberseguridad, no para generalidad. SiliconANGLE · Blog de Z.ai · MarkTechPost
-
DeepSeek V4 Pro 0813 sale de preview y los benchmarks generan ruido
El release fue sigiloso (un comunicado breve que después borraron) pero la cobertura y los números llegaron el 13. Es un MoE de 1.6T parámetros totales con ~49B activos por token, ventana de 1M y hasta 384K de salida, a $0.435/$0.87 por millón de tokens in/out. En agéntico el salto respecto al preview es enorme — DeepSWE de 12.8 a 62.7, CyberGym de 52.7 a 83.3, Terminal Bench 2.1 de 72.1 a 87.9 — pero en el Artificial Analysis Intelligence Index queda en 53, lejos de la frontera, y no tiene soporte de visión. Lectura: DeepSeek está optimizando duro para agentes de código y ciberseguridad, no para generalidad. SCMP · OpenRouter · VentureBeat
-
DeepSeek libera Harness v0.1: "todo es un plugin", licencia MIT
Lo más accionable del día. DeepSeek abrió en developer preview un harness de agentes completo y ejecutable — no otro anuncio de modelo — construido sobre su meta-framework Cordis. Cada capacidad es un plugin intercambiable: modelos, herramientas, skills, sesiones, sandboxes, storage, loops, scheduling y hasta la UI, todo configurable sin tocar el código fuente. Se levanta con npx @deepseek-ai/dsh web. Es explícitamente una preview con cambios que rompen compatibilidad, así que no para producción todavía, pero si estás armando scaffolding de agentes vale la pena leer cómo separaron las capas. Fue el #2 de Hacker News el 13 de agosto. deepseek.com/harness · GitHub · The New Stack
-
Terminal-Bench 2.1 y DeepSWE se consolidaron como la vara real
Vale la pena notar el patrón: los tres releases de la semana (Gemini 3.7 Flash, DeepSeek V4 Pro, GPT-5.6 Sol) se comparan entre sí en DeepSWE, FrontierCode y Terminal-Bench 2.1, no en MMLU ni en benchmarks académicos saturados. Terminal-Bench v2 son 89 tareas en entornos de shell reales cubriendo ingeniería de software, ML, seguridad y data science; hoy GPT-5.6 Sol lidera con 89.5% y Claude Opus 5 queda en 89.1%. Si estás evaluando modelos para trabajo agéntico, esa es la tabla a mirar. Leaderboard de agentes de código (agosto 2026)
Leaderboard de agentes de código (agosto 2026) GPT Claude Gemini
-
La suscripción pública del IPO de Unitree abre mañana (10-ago)
Tras el book-building del 5-6 de agosto, mañana abre la suscripción pública en el STAR Market de Shanghái, con valuación de ~RMB 60.990 M (~USD 8.500 M) y respaldo de Tencent y capital vinculado a DeepSeek (TrendForce). Es la primera valuación pública de un fabricante de humanoides rentable: Unitree declara 32,4% del share global de unidades 2025, aunque Omdia se lo disputa a favor de AgiBot (TechTimes). Resultados el 14-ago; listado antes de fin de mes.
-
Guerra de precios con Qwen3.8-Max y DeepSeek V4 Flash
Alibaba presentó Qwen3.8-Max —su modelo más capaz, con planes de liberar los pesos, revirtiendo su giro propietario— a US$2/US$6 por millón de tokens (input/output), frente a US$10/US$50 de Fable 5. DeepSeek, por su parte, empuja V4 Flash como modelo de coding que se acerca a gama alta a costo de commodity. La cadencia de releases y los recortes de precio (GPT-5.6 Luna, Gemini Flash, Muse Spark) confirman que los modelos se envían "como parches de software". (llm-stats, MarkTechPost)
-
DeepSeek V4-Flash es el nuevo rey del precio-rendimiento
Artificial Analysis lo midió en $0.14/$0.28 por millón de tokens (~$0.03 por test de benchmark, vs. $0.86 de Kimi K3 y $1.86 de GPT-5.6 Sol), con un salto de 10 puntos en su Intelligence Index (a 50) y mejoras en tareas agénticas y alucinaciones. Presión directa sobre la economía de los modelos cerrados occidentales. TechStartups · llm-stats
-
Los VCs chinos vuelven a levantar fondos con foco en IA y robótica
Según el Financial Times (1 de agosto), las firmas de venture chinas retoman el fundraising tras tres años de mínimos históricos, con LPs redirigiendo capital hacia campeones locales de tecnología, IA y robótica. Llega después de megarrondas como los US$7.400M de DeepSeek y los US$3.500M de Moonshot a US$35.000M de valuación, y reabre el grifo del capital privado chino en torno a la IA embodied y los semiconductores. (ft.com)
-
Primer caso documentado de ataque autónomo con DeepSeek: 460+ objetivos
Unit 42 (Palo Alto Networks) detalló a un actor de Zhuhai ("knaithe") que conectó DeepSeek al framework open-source Hermes Agent y lo dirigió por Telegram para enumerar objetivos, buscar exploits públicos y atacar más de 460 sistemas expuestos, sin más input del operador tras la orden inicial. Se confirmaron compromisos en tres organizaciones con NetScaler (CVE-2026-3055) y 11 instancias de notebooks Marimo. Notablemente, DeepSeek avanzó con tareas ofensivas que los modelos de Claude y OpenAI habían rechazado. (thehackernews.com)
-
Un paper reencuadra el diseño de routers MoE: los co-expertos interactúan, no se complementan
Zhejiang University y Hong Kong PolyU introducen un Expert Subspace Separation Index y un protocolo factorial 2x2 que muestra que los expertos co-seleccionados en Mixture-of-Experts no aportan direcciones de representación distintas, como se suele asumir. Intervenciones con ruta congelada exponen un "solapamiento coherente" donde candidatos fuertes interactúan negativamente: útil para repensar el diseño de routers sparse tipo Mixtral/DeepSeek. (huggingface.co)
-
Jensen Huang defiende los open-weights en una carta abierta
El CEO de Nvidia argumentó que los modelos de pesos abiertos son vitales para fomentar la competencia y asegurar el liderazgo tecnológico, sumando respaldo de ejecutivos de Microsoft, Meta, Google y OpenAI. La postura reaviva el debate abierto vs. cerrado justo cuando labs chinos (Qwen, DeepSeek, Moonshot) presionan con releases abiertos cada vez más capaces. Tech Startups
Tech Startups OpenAI Google Meta Microsoft Moonshot AI Nvidia Qwen
-
Nadella advierte contra apostar a un solo modelo
El CEO de Microsoft recomendó que las empresas no dependan exclusivamente de un modelo y desarrollen modelos propios o infraestructura de "AI gateway" que rutee entre varios. Viniendo del CEO más asociado a OpenAI, es un aval notable al enfoque multi-modelo, en un mes donde Claude Opus 5 lidera benchmarks, Kimi K3 y DeepSeek V4 abaratan la oferta abierta y OpenAI navega su incidente de seguridad. Build Fast with AI
-
AI Safety Index 2026: Anthropic a la cabeza, varios reprueban
El Future of Life Institute publicó su índice anual de seguridad: Anthropic obtuvo la nota más alta (C+), OpenAI y Google DeepMind quedaron en C, Meta en D+, y xAI, DeepSeek y Mistral esencialmente reprobaron. El informe señala que varios labs habrían retrocedido en compromisos de seguridad previos. ThursdAI
ThursdAI OpenAI Anthropic Google Google DeepMind Meta xAI Mistral
-
Inkling: Thinking Machines publica su primer modelo open-weights
El lab de Mira Murati liberó Inkling el 15 de julio, un mixture-of-experts de 975B parámetros totales con ~41B activos por tarea. Debutó como el mejor open-weights de un lab estadounidense en el Artificial Analysis Intelligence Index. Es la primera vez que un lab frontier de EE.UU. compite de verdad en el terreno open-weight que venían dominando Moonshot, DeepSeek y Qwen. TechCrunch · Artificial Analysis · Simon Willison
TechCrunch Artificial Analysis Simon Willison Moonshot AI Qwen
-
Ola open-weight de julio: Inkling y compañía
Además de Kimi K3, el mes concentró varios lanzamientos abiertos: Thinking Machines liberó Inkling (975B totales / 41B activos, licencia Apache 2.0, pesos en Hugging Face al lanzamiento) el 15 de julio, posicionado como modelo general de razonamiento y código competitivo con cerrados mainstream. También suenan la V4 oficial de DeepSeek para mediados de mes y una familia MoE dispersa de Mistral en early access. - -
-
Los modelos open-weight chinos siguen apretando
GLM-5.2 (MoE de 744B parámetros totales, ~40B activos, licencia MIT) marcó 62,1% en SWE-bench Pro, superando el 58,6% de GPT-5.5, un hito para un modelo de pesos abiertos. Sumado a Qwen 3, DeepSeek V4 y Kimi K2, refuerza la tendencia de empresas de EE.UU. mirando alternativas abiertas frente a los costos crecientes de OpenAI y Anthropic. Thunder Compute · CNBC
-
DeepSeek V4 llega esta semana con precios diferenciados por horario
La versión oficial de DeepSeek V4 está agendada para mediados de julio: ventana de 1 millón de tokens en toda la línea y mejoras en tareas agénticas, razonamiento matemático y generación de código. La novedad estructural es el pricing: por primera vez DeepSeek introduce tarifas pico y valle, con horario pico de 9 a 12 y de 14 a 18, cobrando el doble. Además, los alias deepseek-chat y deepseek-reasoner quedan deprecados el 24 de julio, así que hay que migrar. TechNode · DeepSeek API Docs
-
Los modelos chinos de peso abierto aprietan en costo
DeepSeek V4 (open-weight, contexto de 1M de tokens, ~US$1,74 por millón de entrada) se ubica cerca de la paridad con modelos frontera en matemática y Q&A, mientras Qwen3-Coder-Next y Mistral Medium 3.5 apuntan a agentes de código a precios bajos. CNBC reporta que empresas de EE.UU. empiezan a adoptar modelos chinos ante la suba de costos de OpenAI y Anthropic. MindStudio · CNBC
-
Anthropic acusa a Alibaba de la mayor "destilación" ilícita de Claude
En una carta del 10 de junio al Comité Bancario del Senado de EE.UU., Anthropic afirma que operadores vinculados a Alibaba y su laboratorio Qwen usaron ~25.000 cuentas fraudulentas para generar 28,8 millones de intercambios con Claude entre el 22/4 y el 5/6, apuntando a sus capacidades más valiosas (desarrollo de software, razonamiento multipaso y tareas agénticas). Importa porque expone la tensión geopolítica y competitiva alrededor de la "destilación" de modelos frontera, y porque Anthropic ya había hecho acusaciones similares contra DeepSeek, Moonshot y MiniMax. Tom's Hardware · InfoWorld
Tom's Hardware InfoWorld Anthropic Moonshot AI Alibaba Claude Qwen
-
MiniMax M3, nuevo referente open-weight
MiniMax M3, lanzado en junio, se posiciona como el primer modelo open-weight que combina coding frontera, contexto de 1M de tokens y multimodalidad nativa, liderando el SWE-Bench Pro open-weight con 59,0%. Importa porque sigue achicando la brecha entre modelos abiertos y cerrados en la frontera de coding agéntico, junto a otros lanzamientos recientes como GLM-5.2 (MIT, MoE, 1M de contexto), Kimi K2.6 y DeepSeek V4. llm-stats · Kilo
-
DeepSeek V4, entrenado en chips Huawei Ascend 950 en lugar de Nvidia
Uno de los datos que circula es que DeepSeek V4 se entrenó sobre silicio Huawei Ascend 950 y no sobre hardware Nvidia: sería el primer modelo chino de frontera (o cercano a ella) en hacer públicamente esa transición, validando la plataforma Ascend como sustrato viable para grandes modelos MoE. Es un punto relevante en la competencia de controles de chips entre EE.UU. y China. BuildFast With AI
-
El ritmo de lanzamiento de modelos sigue acelerándose
Los trackers del sector reportan nuevos modelos cada ~2 días: en junio aparecieron, entre otros, GPT-5.6 de OpenAI, una actualización multimodal Gemini 3.2 de Google, el preview de Claude Fable 5 de Anthropic y varios modelos frontera chinos (Qwen 3.7, DeepSeek V4.1, GLM-6). Conviene tomar las fechas exactas con cautela porque provienen de agregadores. (LLM-Stats, pricepertoken)
LLM-Stats pricepertoken OpenAI Anthropic Google GPT Claude Gemini Qwen
-
Sigue la ola de modelos open-weights de frontera
En junio se consolidaron varios pesos abiertos competitivos: MiniMax M3 (combina coding de frontera, 1M de contexto y multimodalidad nativa, lidera el SWE-Bench Pro open-weight con 59,0%) y GLM-5.2 (pesos MIT, hasta 5,7x más barato y fuerte en código). El panorama de modelos descargables de calidad frontera —GLM-5.1/5.2, MiniMax M3, Kimi K2.6, DeepSeek V4, Qwen3-Coder-Next— sigue achicando la distancia con las APIs cerradas. pricepertoken · kilo.ai
-
Lluvia de modelos frontier en pocos días
OpenAI lanzó GPT-5.6 y Google sacó Gemini 3.2 como refresh multimodal de mitad de ciclo (con Gemini 3.5 Pro anticipado para el mes que viene). En paralelo, el frente chino se apretó fuerte: Qwen 3.7, DeepSeek V4.1, Hunyuan Large 3, ERNIE 5.1, Doubao Pro y GLM-6 salieron casi todos en la misma quincena. El ritmo actual es de un modelo nuevo cada ~2 días. llm-stats · Presenc AI roundup
llm-stats Presenc AI roundup OpenAI Google GPT Gemini Qwen ERNIE