El Compilado Hilos Temas Archivo RSS

Hilos · 3 noticias en 9 días

xAI lanzó Grok 4.7 después de cinco postergaciones, y empata con MiMo en el índice pagando cinco veces más (21/09)

Noticias
3
Briefings
3
Empieza
Última
  1. IA

    StepFun presentó Step 5 Preview, un MoE de 600B para agentes a un dólar el millón de entrada, con pesos prometidos para el 15 de octubre (20/09)

    La empresa china apunta a trabajo agéntico de horizonte largo —programación, ingeniería de software, análisis financiero— con 600.000 millones de parámetros totales, unos 27.000 activos por token, un millón de tokens de contexto y entrada de texto e imagen. La decisión de arquitectura que llama la atención es que en vez de ensanchar la red la hicieron angosta y profunda: 92 capas de Transformer. El entrenamiento se apoya en aprendizaje por refuerzo on-policy de horizonte largo con alineación bit a bit entre entrenamiento e inferencia sobre el ruteo del MoE, más decodificación especulativa MTP-3, MoE en FP8 y descarga de caché KV. El precio es la carta: 1 dólar por millón de tokens de entrada con caché fría, 0,05 con caché caliente y 2,70 de salida, contando los tokens de razonamiento como salida. En el índice de Artificial Analysis queda en 44, a la par de Kimi K3 y GLM 5.3 en la mayoría de las filas y por detrás de GPT-6 Astra y Claude Opus 5 en las de programación y agentes más duras. MarkTechPost · StepFun · Pandaily

    MarkTechPost StepFun Pandaily Claude Kimi GLM

  2. IA

    xAI lanzó Grok 4.7 después de cinco postergaciones, y empata con MiMo en el índice pagando cinco veces más (21/09)

    El modelo tiene 2,1 billones de parámetros, 40% más que Grok 4.6, se apoya en una corrida más larga de aprendizaje por refuerzo y en entrenamiento que pesa más las tareas difíciles de horas. xAI también le metió datos suplementarios traídos de SpaceX: telemetría de satélites Starlink, registros de fabricación y bitácoras de fallas de ingeniería. Cuesta 2 dólares el millón de entrada y 6 el de salida, más cerca de los modelos chinos que de la frontera occidental, y saca 46 en el índice de Artificial Analysis contra los 53 de Claude Fable 5.1 y GPT-6. La brecha se abre en lo agéntico: 26% en Terminal-Bench 4.0, contra 60% de GPT-6 Astra y 55% de Fable 5.1, por debajo incluso del más barato DeepSeek V4.1 Flash. Musk había corrido la fecha al menos cinco veces desde fines de julio. Está en la app de Grok, en Cursor, en Grok Build, en la API y desde hoy en GitHub Copilot. The Decoder · Decrypt · GitHub Changelog

    The Decoder Decrypt GitHub Changelog xAI DeepSeek GitHub Claude Grok GitHub Copilot

  3. IA

    Anthropic lanzó Claude Sonnet 5.5, que empata a Opus 5.5 en trabajo de conocimiento y cuesta hasta 30% menos por tarea (28/09)

    El salto más grande está en código: Terminal-Bench pasó de 10,3% a 70,6%, y CursorBench llegó a 55,5% contra 57,8% de Opus 5.5. En GDPval-AA marca 1.844 contra 1.846 de Opus, es decir empate técnico, y Chartography subió de 15,6% a 61,6%. El precio por token no cambió respecto de Sonnet 5 —2 dólares por millón de entrada, 10 de salida, 0,20 de lectura de caché—: el ahorro de hasta 30% sale de usar menos tokens para el mismo trabajo. Está disponible con el ID claude-sonnet-5-5 en AWS, Google Cloud y Azure. Para quien arma agentes, el cálculo cambia: el modelo del medio ya alcanza para la mayoría del pipeline. Anthropic · The Decoder · TechCrunch

    Anthropic The Decoder TechCrunch Anthropic Google Amazon Claude

El hilo se arma solo en cada build: junta noticias de días distintos que nombran a la misma entidad y repiten vocabulario que casi no aparece en el resto del archivo. Nadie lo edita a mano, así que puede dejar afuera una noticia o sumar una de al lado.