Hilos · 3 noticias en 6 días
La ventaja de Nvidia se corrió del GPU al resto del rack, y ese es el relato nuevo después de los resultados (29/08)
- Noticias
- 3
- Briefings
- 3
- Empieza
- Última
-
Nvidia puso el Groq 3 LPX en producción y dice cuadruplicar a Cerebras, pero la cuenta esconde el conteo de chips (25/08)
Sigue de lo de ayer, cuando Cerebras presentó el CS-4: ahora Nvidia anunció en Hot Chips 2026 que su acelerador de inferencia entró en producción plena y publicó un benchmark de Artificial Analysis con 3.400 tokens por segundo en Gemma 4 31B con ventana de 100.000 tokens, contra 882 de Cerebras. The Register desarma la comparación: cada LPU tiene apenas 500 MB de memoria, 576 veces menos que una GPU Rubin con 288 GB, así que el modelo se parte entre varios aceleradores por Ethernet —hasta 256 LPUs por rack— con las GPUs haciendo el prefill y las LPUs el decode. Gemma 4 31B es el mejor caso posible: modelo denso que entra entero en un rack. DeepSeek V3 necesitaría 1.342 aceleradores, poco más de cinco racks. Y la comparación contra Cerebras omite que Nvidia usa al menos 64 chips donde Cerebras usa uno o dos, y no incluye el CS-4. Nvidia pagó unos USD 20.000 millones por la licencia de Groq en diciembre; Nebius será el primer proveedor cloud en ofrecerlo. The Decoder · Nvidia · The Register
-
OpenAI mostró los primeros benchmarks de Jalapeño: 700W contra los 1.400W del GB300, y hasta 1,9 veces más throughput por kilowatt (25/08)
Sigue de lo de ayer, cuando Nvidia usó Hot Chips 2026 para poner el Groq 3 LPX en producción: ahora fue OpenAI la que llegó a la conferencia con números de su primer chip propio, el ASIC de inferencia que codesarrolló con Broadcom. Sobre la suite pública InferenceX de SemiAnalysis, Jalapeño entregó entre 1,5 y 1,9 veces más throughput por kilowatt y entre 1,7 y 3,6 veces menos latencia end-to-end que los sistemas rack GB200 y GB300. Las pruebas corrieron sobre GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5. Las advertencias son varias y conviene tenerlas juntas: no se comparó contra Vera Rubin, no entrena modelos, y las comparaciones principales enfrentaron predicción de un solo token contra configuraciones GB300 haciendo lo mismo, cuando en producción Nvidia suele usar predicción multi-token —donde la ventaja de eficiencia baja a unas 1,5 veces—. Cada paquete lleva seis stacks de HBM4, 216 GiB a 15,4 TB/s, en un proceso clase 3nm de TSMC. Escalar esto al acuerdo de 10 GW firmado con Broadcom convertiría a OpenAI en un nuevo demandante grande de HBM4, la pieza más escasa de la industria. Y todo esto una semana después de que Nvidia acordara respaldar hasta USD 105.000 millones de financiamiento para un campus de datacenter de OpenAI en Ohio. Tom's Hardware · TechCrunch · The Decoder
Tom's Hardware TechCrunch The Decoder OpenAI DeepSeek Nvidia Broadcom TSMC Kimi
-
La ventaja de Nvidia se corrió del GPU al resto del rack, y ese es el relato nuevo después de los resultados (29/08)
El argumento de Russell Brandom es que el problema ya no es fabricar un GPU competitivo —Amazon y Google llevan años haciendo los suyos— sino operar un datacenter de escala gigavatio cerca de su eficiencia máxima. Lo que Nvidia está vendiendo con la arquitectura Vera Rubin lo muestra: junto al GPU Rubin van la CPU Vera, el acelerador de inferencia Groq 3 LPX y racks equivalentes para almacenamiento y red, todos sistemas especializados que en vez de procesar tokens se ocupan de que todo lo que rodea al GPU no lo frene. "Vera importa porque hay un límite de memoria que podés poner en un solo servidor o en cualquier plataforma de cómputo", explicó Jason Hardy, VP de tecnología de almacenamiento de Nvidia, que reporta hasta 3x de mejora en esas operaciones y la posibilidad de usar el flash a fondo sin cuello de botella. El mismo problema aparece del otro lado: cuando OpenAI diseñó su chip Jalapeño el foco fue evitar el movimiento de datos por completo manteniendo la carga entera dentro de un sistema conectado. La conclusión práctica es que la competencia se mudó a una capa nueva, donde construir un GPU rival importa menos que hacer funcionar el sistema completo. TechCrunch
El hilo se arma solo en cada build: junta noticias de días distintos que nombran a la misma entidad y repiten vocabulario que casi no aparece en el resto del archivo. Nadie lo edita a mano, así que puede dejar afuera una noticia o sumar una de al lado.