El Compilado Hilos Temas Archivo RSS

Hilos · 4 noticias en 13 días

El CS-4 de Cerebras duplica el rendimiento con el mismo chip, y SemiAnalysis dice que la red mejoró poco (24/08)

Noticias
4
Briefings
4
Empieza
Última
  1. IA

    OpenAI + Cerebras: "Ultrafast mode" corre GPT-5.6 Sol a 750 tokens/s

    OpenAI anunció el 13 de agosto un nuevo tier de servicio en la API que entrega hasta 14× la velocidad del modo Standard con el mismo modelo y la misma inteligencia, no una versión destilada. Corre sobre el Wafer-Scale Engine de Cerebras, que mantiene los pesos en 44 GB de SRAM on-chip para esquivar el cuello de botella de ancho de banda de memoria. En Humanity's Last Exam resolvió las 2.500 preguntas en poco más de 11 horas (~7× más rápido que Claude Fable 5 con precisión comparable) y en GDP-Val dio 5.6× de speedup end-to-end sin pérdida de calidad. Por ahora es preview limitado. Casos citados: respuesta a incidentes, soporte, análisis de mercados, e-commerce. OpenAI · TechCrunch · Cerebras (nota de prensa)

    OpenAI TechCrunch Cerebras (nota de prensa) OpenAI Cerebras GPT Claude

  2. Hardware y robótica

    El CS-4 de Cerebras duplica el rendimiento con el mismo chip, y SemiAnalysis dice que la red mejoró poco (24/08)

    El sistema es rack-scale —un gabinete entero que entra al datacenter como una sola unidad, con cómputo, potencia y refrigeración— y sigue montando el WSE de 5 nm, pero mete tres wafers por rack en vez de dos y sube la frecuencia a fuerza de más potencia y mejor refrigeración. Cerebras declara 750 PFLOPS, 129,6 petabytes por segundo de ancho de banda de memoria y hasta 4.400 tokens por segundo por usuario en GPT-OSS-120B, lo que según la empresa es hasta 30 veces más rápido que armados con GPUs de Nvidia; la capacidad de memoria queda igual, en 44 GB por wafer. Lo nuevo de verdad es el empaque: un diseño modular llamado "Backpack" que pega conversión de potencia a medio milímetro del procesador en vez de los 50 milímetros habituales de una placa GPU, con 50% menos componentes, y un modo de comunicación sin switch —Direct Wafer Links— que baja la latencia wafer a wafer a dos microsegundos. Los analistas de SemiAnalysis consideran chicas las ganancias de networking. El hardware de Cerebras lo usa, entre otros, OpenAI para Codex Spark. The Decoder · Cerebras · SemiAnalysis

    The Decoder Cerebras SemiAnalysis OpenAI Nvidia Cerebras

  3. Hardware y robótica

    Nvidia puso el Groq 3 LPX en producción y dice cuadruplicar a Cerebras, pero la cuenta esconde el conteo de chips (25/08)

    Sigue de lo de ayer, cuando Cerebras presentó el CS-4: ahora Nvidia anunció en Hot Chips 2026 que su acelerador de inferencia entró en producción plena y publicó un benchmark de Artificial Analysis con 3.400 tokens por segundo en Gemma 4 31B con ventana de 100.000 tokens, contra 882 de Cerebras. The Register desarma la comparación: cada LPU tiene apenas 500 MB de memoria, 576 veces menos que una GPU Rubin con 288 GB, así que el modelo se parte entre varios aceleradores por Ethernet —hasta 256 LPUs por rack— con las GPUs haciendo el prefill y las LPUs el decode. Gemma 4 31B es el mejor caso posible: modelo denso que entra entero en un rack. DeepSeek V3 necesitaría 1.342 aceleradores, poco más de cinco racks. Y la comparación contra Cerebras omite que Nvidia usa al menos 64 chips donde Cerebras usa uno o dos, y no incluye el CS-4. Nvidia pagó unos USD 20.000 millones por la licencia de Groq en diciembre; Nebius será el primer proveedor cloud en ofrecerlo. The Decoder · Nvidia · The Register

    The Decoder Nvidia The Register DeepSeek Nvidia Cerebras

  4. Hardware y robótica

    OpenAI mostró los primeros benchmarks de Jalapeño: 700W contra los 1.400W del GB300, y hasta 1,9 veces más throughput por kilowatt (25/08)

    Sigue de lo de ayer, cuando Nvidia usó Hot Chips 2026 para poner el Groq 3 LPX en producción: ahora fue OpenAI la que llegó a la conferencia con números de su primer chip propio, el ASIC de inferencia que codesarrolló con Broadcom. Sobre la suite pública InferenceX de SemiAnalysis, Jalapeño entregó entre 1,5 y 1,9 veces más throughput por kilowatt y entre 1,7 y 3,6 veces menos latencia end-to-end que los sistemas rack GB200 y GB300. Las pruebas corrieron sobre GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5. Las advertencias son varias y conviene tenerlas juntas: no se comparó contra Vera Rubin, no entrena modelos, y las comparaciones principales enfrentaron predicción de un solo token contra configuraciones GB300 haciendo lo mismo, cuando en producción Nvidia suele usar predicción multi-token —donde la ventaja de eficiencia baja a unas 1,5 veces—. Cada paquete lleva seis stacks de HBM4, 216 GiB a 15,4 TB/s, en un proceso clase 3nm de TSMC. Escalar esto al acuerdo de 10 GW firmado con Broadcom convertiría a OpenAI en un nuevo demandante grande de HBM4, la pieza más escasa de la industria. Y todo esto una semana después de que Nvidia acordara respaldar hasta USD 105.000 millones de financiamiento para un campus de datacenter de OpenAI en Ohio. Tom's Hardware · TechCrunch · The Decoder

    Tom's Hardware TechCrunch The Decoder OpenAI DeepSeek Nvidia Broadcom TSMC Kimi

El hilo se arma solo en cada build: junta noticias de días distintos que nombran a la misma entidad y repiten vocabulario que casi no aparece en el resto del archivo. Nadie lo edita a mano, así que puede dejar afuera una noticia o sumar una de al lado.