-
K2 Horizon: el Institute of Foundation Models publica seis modelos abiertos de 0,9B a 375B con todo el ciclo de entrenamiento, no solo los pesos (03/09)
Pesos y código van bajo Apache 2.0, con soporte día cero en vLLM, SGLang y Ollama, y sobre hardware Nvidia, AMD y Cerebras. Lo distinto no son los puntajes sino lo que sale con ellos: checkpoints intermedios, datos o recetas de construcción, mezclas de pre-entrenamiento, código de entrenamiento, logs finos y los resultados de evaluación de cada etapa, incluido el post-entrenamiento agéntico. Los seis comparten arquitectura, vocabulario y tooling, así que se puede saltar de tamaño sin rehacer nada. Dos novedades técnicas: MoVA, que lleva el enrutado de expertos adentro de la atención y le permite al 36B-A4B activar solo ~4B de parámetros por token quedando apenas debajo del 32B denso; y Uno, un adaptador LoRA de difusión que acelera la generación sin tocar los parámetros autorregresivos ni degradar la calidad. El 17% del corpus de pre-entrenamiento son trayectorias de razonamiento explícito, y eligieron Markdown en vez de JSON para presentar herramientas porque les dio 18,5% más eficiencia de tokens. IFM · Hacker News · Hugging Face
-
Qwen 3.8 27B queda disponible en Cerebras a 1.500 tokens por segundo (04/09)
Es un denso de 27B, o sea que entra en categorías donde la velocidad cambia el tipo de aplicación que se puede armar: a esa tasa el cuello de botella deja de ser el modelo y pasa a ser todo lo demás del loop. Los números del modelo acompañan —en las tablas comparativas que publicó IFM el mismo día, Qwen 3.8 27B saca 79,8 en Terminal-Bench 2.1, 90,5 en GPQA Diamond y 33,9 en HLE sin herramientas, arriba de los otros densos de su clase—. Está solo con precio por token de API, aunque Cerebras ya soporta prompt caching, que es lo que hace o rompe la economía de las tareas agénticas largas. Cerebras · Hacker News
-
Nvidia puso el Groq 3 LPX en producción y dice cuadruplicar a Cerebras, pero la cuenta esconde el conteo de chips (25/08)
Sigue de lo de ayer, cuando Cerebras presentó el CS-4: ahora Nvidia anunció en Hot Chips 2026 que su acelerador de inferencia entró en producción plena y publicó un benchmark de Artificial Analysis con 3.400 tokens por segundo en Gemma 4 31B con ventana de 100.000 tokens, contra 882 de Cerebras. The Register desarma la comparación: cada LPU tiene apenas 500 MB de memoria, 576 veces menos que una GPU Rubin con 288 GB, así que el modelo se parte entre varios aceleradores por Ethernet —hasta 256 LPUs por rack— con las GPUs haciendo el prefill y las LPUs el decode. Gemma 4 31B es el mejor caso posible: modelo denso que entra entero en un rack. DeepSeek V3 necesitaría 1.342 aceleradores, poco más de cinco racks. Y la comparación contra Cerebras omite que Nvidia usa al menos 64 chips donde Cerebras usa uno o dos, y no incluye el CS-4. Nvidia pagó unos USD 20.000 millones por la licencia de Groq en diciembre; Nebius será el primer proveedor cloud en ofrecerlo. The Decoder · Nvidia · The Register
-
El CS-4 de Cerebras duplica el rendimiento con el mismo chip, y SemiAnalysis dice que la red mejoró poco (24/08)
El sistema es rack-scale —un gabinete entero que entra al datacenter como una sola unidad, con cómputo, potencia y refrigeración— y sigue montando el WSE de 5 nm, pero mete tres wafers por rack en vez de dos y sube la frecuencia a fuerza de más potencia y mejor refrigeración. Cerebras declara 750 PFLOPS, 129,6 petabytes por segundo de ancho de banda de memoria y hasta 4.400 tokens por segundo por usuario en GPT-OSS-120B, lo que según la empresa es hasta 30 veces más rápido que armados con GPUs de Nvidia; la capacidad de memoria queda igual, en 44 GB por wafer. Lo nuevo de verdad es el empaque: un diseño modular llamado "Backpack" que pega conversión de potencia a medio milímetro del procesador en vez de los 50 milímetros habituales de una placa GPU, con 50% menos componentes, y un modo de comunicación sin switch —Direct Wafer Links— que baja la latencia wafer a wafer a dos microsegundos. Los analistas de SemiAnalysis consideran chicas las ganancias de networking. El hardware de Cerebras lo usa, entre otros, OpenAI para Codex Spark. The Decoder · Cerebras · SemiAnalysis
-
OpenAI + Cerebras: "Ultrafast mode" corre GPT-5.6 Sol a 750 tokens/s
OpenAI anunció el 13 de agosto un nuevo tier de servicio en la API que entrega hasta 14× la velocidad del modo Standard con el mismo modelo y la misma inteligencia, no una versión destilada. Corre sobre el Wafer-Scale Engine de Cerebras, que mantiene los pesos en 44 GB de SRAM on-chip para esquivar el cuello de botella de ancho de banda de memoria. En Humanity's Last Exam resolvió las 2.500 preguntas en poco más de 11 horas (~7× más rápido que Claude Fable 5 con precisión comparable) y en GDP-Val dio 5.6× de speedup end-to-end sin pérdida de calidad. Por ahora es preview limitado. Casos citados: respuesta a incidentes, soporte, análisis de mercados, e-commerce. OpenAI · TechCrunch · Cerebras (nota de prensa)
OpenAI TechCrunch Cerebras (nota de prensa) OpenAI GPT Claude
-
Cerebras cae ~20% en bolsa el mismo día que anuncia lo de OpenAI
Contraste llamativo del 13 de agosto: mientras la compañía publicaba el logro técnico de Ultrafast, sus resultados quedaron por debajo de expectativas. La venta de hardware cayó, pero los ingresos de su nube de IA subieron 281% — señal de que el modelo de negocio se está corriendo de vender wafers a vender inferencia. Tom's Hardware
-
El writeup técnico de Cerebras sobre cómo sirven GPT-5.6 Sol a 750 tok/s
Más allá del anuncio comercial, el post de ingeniería explica la apuesta contraria al consenso: la inferencia en modelos grandes está limitada por ancho de banda de memoria, así que en lugar de optimizar el movimiento de pesos los meten enteros en 44 GB de SRAM por wafer y pipelinean las capas del modelo entre wafers, con los tokens fluyendo sin interrupción. Lectura obligada si estás pensando en serving y en el trade-off latencia/costo/calidad. Cerebras
-
AMD y Cerebras se alían para inferencia híbrida
AMD cerró una asociación con Cerebras Systems que permitirá dividir cargas de inferencia de IA entre hardware de ambos. Cerebras incorporará sistemas Helios de AMD en sus data centers y ofrecerá la infraestructura combinada a través de Cerebras Cloud más adelante este año. Es otra señal de la estrategia de AMD de ganar terreno en inferencia frente a Nvidia. Tech Startups
-
OpenAI recibe luz verde para el despliegue público de GPT-5.6
El Departamento de Comercio de EE.UU. autorizó la salida amplia de GPT-5.6, que hasta ahora estaba limitado a unas 20 organizaciones socias bajo revisión de seguridad del gobierno. Es una familia de tres modelos —Sol (flagship), Terra (costo medio) y Luna (el más rápido y económico)— con contexto de 2M de tokens y precio de referencia de US$5/US$30 por millón (entrada/salida). OpenAI también anunció que servirá GPT-5.6 Sol sobre Cerebras a hasta 750 tokens/segundo. OpenAI · Cyberpress · Wikipedia
-
OpenAI arranca a servir GPT-5.6 Sol sobre Cerebras a ~750 tokens/s
OpenAI comenzó a desplegar su modelo tope de gama GPT-5.6 Sol corriendo sobre aceleradores de Cerebras, alcanzando hasta ~750 tokens por segundo, una velocidad inédita para un modelo frontera. El acceso sigue restringido a un grupo acotado de clientes mientras escalan capacidad, y el lanzamiento llega con el stack de seguridad más robusto de OpenAI hasta la fecha (protecciones extra para pedidos sensibles de ciberseguridad y abuso reiterado). La familia se completa con Terra (equilibrado) y Luna (rápido y barato). OpenAI · VentureBeat