El Compilado Hilos Temas Archivo RSS

Temas · modelo

Grok

Seguir Grok por RSS

Noticias
28
Briefings
26
Primera
Última
  1. IA Hilo 3

    xAI lanzó Grok 4.7 después de cinco postergaciones, y empata con MiMo en el índice pagando cinco veces más (21/09)

    El modelo tiene 2,1 billones de parámetros, 40% más que Grok 4.6, se apoya en una corrida más larga de aprendizaje por refuerzo y en entrenamiento que pesa más las tareas difíciles de horas. xAI también le metió datos suplementarios traídos de SpaceX: telemetría de satélites Starlink, registros de fabricación y bitácoras de fallas de ingeniería. Cuesta 2 dólares el millón de entrada y 6 el de salida, más cerca de los modelos chinos que de la frontera occidental, y saca 46 en el índice de Artificial Analysis contra los 53 de Claude Fable 5.1 y GPT-6. La brecha se abre en lo agéntico: 26% en Terminal-Bench 4.0, contra 60% de GPT-6 Astra y 55% de Fable 5.1, por debajo incluso del más barato DeepSeek V4.1 Flash. Musk había corrido la fecha al menos cinco veces desde fines de julio. Está en la app de Grok, en Cursor, en Grok Build, en la API y desde hoy en GitHub Copilot. The Decoder · Decrypt · GitHub Changelog

    The Decoder Decrypt GitHub Changelog xAI DeepSeek GitHub Claude GitHub Copilot

  2. Técnicas y repos

    Brood War Bench: 19 configuraciones de agentes jugaron 171 partidas de StarCraft y ninguna pasó de principiante (20/09)

    Ben Swerdlow armó un torneo todos contra todos en el juego de estrategia en tiempo real de Blizzard de 1998, publicó los resultados el 19 y el informe llegó al pelotón de cabeza de Hacker News en las últimas horas. La conclusión desnuda es que un humano con nociones tácticas básicas le gana a cualquiera de las configuraciones probadas. La tabla la encabeza Astra (xhigh) con 18 victorias y ninguna derrota, seguida de Astra (medium) con 16 y 2, y Fable con 15 y 3. Lo interesante no es el ranking sino que aparecieron estilos distintos: Codex prefirió estrategias tramposas y poco convencionales antes que el juego estándar, Claude jugó de manual, y Grok directamente dejó de jugar a mitad de partida. Mide algo que los benchmarks de texto no miden: si el razonamiento de un modelo de propósito general se transfiere a decisiones en tiempo real sin entrenamiento específico. Por ahora, no. Brood War Bench

    Brood War Bench Claude

  3. Técnicas y repos

    Un repo que junta los system prompts extraídos de los modelos de frontera pasó las 700 estrellas en un día (14/09)

    system_prompts_leaks mantiene actualizada una colección de prompts de sistema extraídos de Claude Fable 5.1, Opus 5, Claude Design y Claude Code; de ChatGPT con GPT-6 Astra y Codex; de Gemini 3.8 Flash, 3.1 Pro y Antigravity; de Grok, Cursor y Kimi, entre otros. La utilidad práctica no es el morbo sino la comparación: son documentos escritos por gente que tiene acceso a las evaluaciones internas del modelo, así que leer cómo un laboratorio estructura instrucciones, define herramientas y acota el comportamiento es probablemente la mejor documentación disponible sobre cómo se le habla a ese modelo en particular. Se cruza directo con lo que recomendaba OpenAI el viernes sobre sacar andamios en vez de agregarlos, y con la nota de Anthropic sobre haber recortado 80% del prompt de sistema de Claude Code. La advertencia obvia: son extracciones, no publicaciones oficiales, así que pueden estar incompletas o desactualizadas respecto de lo que corre hoy en producción. GitHub

    GitHub OpenAI Anthropic GitHub GPT Claude Gemini Kimi Claude Code

  4. IA

    ChatGPT recupera participación de tráfico web y llega al 55,5%, mientras el repunte de Gemini se apaga (07/09)

    Los datos de Similarweb muestran a ChatGPT subiendo del 52,7% de hace tres meses al 55,5%, y a Gemini bajando del 27,8% al 25,6%. En el año, sin embargo, ChatGPT perdió muchísimo terreno —venía del 73,3%—, Gemini duplicó su parte y Claude pasó del 1,9% al 9,3%; DeepSeek (3,4%), Grok (2,4%), Copilot (1,6%) y Perplexity (0,9%) siguen siendo marginales. La advertencia metodológica importa más que el número: esto mide solo tráfico web, y deja afuera todo lo que Google empuja por Android abriendo la app de Gemini directamente, además de las apps móviles de OpenAI y del nuevo ChatGPT Work de escritorio. The Decoder · Similarweb vía X

    The Decoder Similarweb vía X OpenAI Google DeepSeek GPT Claude Gemini GitHub Copilot

  5. Técnicas y repos

    EEBench: atopile mide diseño de circuitos con simulación SPICE en vez de opinión humana, y ningún modelo pasa del 61,6% (04/09)

    Es el intento de darle a hardware su SWE-bench. Son 13 tareas de diseño analógico y digital que siguen el loop real de un ingeniero electrónico: escribir los requisitos, producir el diseño, verificarlo. Los modelos escriben código atopile en vez de hacer clics en un CAD, así que el corrector lee componentes, conexiones y restricciones eléctricas directo; cada envío se convierte en un grafo de circuito y una lista de materiales, y se corre por SPICE midiendo ganancia, respuesta transitoria, umbrales, ripple y margen de tolerancia en los peores casos, no en valores nominales. El puntaje final pesa 0,65 desempeño técnico y 0,35 eficiencia de costo contra una lista de materiales de referencia a precio de distribuidor por 100 unidades, que es una decisión de diseño acertada: un circuito que cumple todo con partes carísimas no es un buen circuito. Lidera Claude Opus 5 con 61,6%, seguido por Grok 4.6 con 57,1% y Fable 5.1 con 56,4%; GPT-5.6 Sol queda en 39,4%. Las presentaciones son por pedido, con autoservicio prometido más adelante. EEBench · AI/TLDR

    EEBench AI/TLDR GPT Claude

  6. IA

    El Pentágono suma ChatGPT Mil y Grok for Government a GenAI.mil, y Claude sigue ausente (02/09)

    Hasta ahora la plataforma solo tenía Gemini, desde su lanzamiento en diciembre pasado; el Departamento de Defensa dice que ya la usan más de 1,7 millones de personas sobre más de tres millones de empleados y militares. ChatGPT Mil apunta a tareas administrativas, logística y planificación; a Grok lo presentan con vocabulario más militar, análisis de compras y cadena de suministro. Los dos corren en un entorno seguro separado de las versiones comerciales, sin recolección de datos de usuario. La ausencia de Anthropic tiene historia: la empresa se negó a darle al Pentágono uso irrestricto, la administración la clasificó como riesgo de cadena de suministro y a fines de agosto un tribunal declaró ilegal esa clasificación. The Decoder · Departamento de Defensa

    The Decoder Departamento de Defensa Anthropic GPT Claude Gemini

  7. Ciberseguridad Hilo 3

    GitSpawn: ocho fallas hacen que siete agentes de código ejecuten comandos que vienen adentro del repositorio, sin sandbox y sin pedir permiso (02/09)

    El mecanismo es viejo y aburrido, que es justamente por qué funciona: core.fsmonitor es una opción de rendimiento de Git cuyo valor es un comando que Git corre para saber qué archivos cambiaron, y Git la lee del.git/config del propio repositorio. Cualquier operación que refresque el índice —git status, git diff— lo ejecuta, y los agentes llaman a esos comandos en segundo plano al arrancar para saber en qué rama están. En Claude Code y Hermes Agent el payload dispara antes de que se acepte el prompt de confianza del workspace; en Qwen Code, antes de autenticarse; en Grok Build, con la primera tecla. No aplica a un git clone normal: hace falta que el repositorio llegue como archivos con su directorio.git intacto, o sea un ZIP compartido, un disco de red, una carpeta sincronizada o un pendrive. Ya hay fixes en goose 1.44.0, Codex CLI 0.131.0 y Claude Code 2.1.196; seguían vivos Hermes Agent, Qwen Code, Grok Build y un segundo camino en Claude Code vía claude ultrareview, que Manifold reconfirmó el 1 de septiembre. OpenAI publicó tres CVEs propios el mismo día. La mitigación casera es una línea: git config --global core.fsmonitor false. The Hacker News · Manifold Security

    The Hacker News Manifold Security OpenAI Claude Qwen Claude Code

  8. IA

    El Pentágono suma ChatGPT Mil y Grok for Government al portal GenAI.mil, que ya tenía Gemini (31/08)

    GenAI.mil arrancó en diciembre con Google Gemini y ahora incorpora versiones a medida de los productos de OpenAI y xAI, disponibles para los más de 3 millones de personas —civiles y militares— del Departamento de Defensa. La plataforma lleva 1,7 millones de usuarios únicos en nueve meses. El punto técnico que justifica el portal es el aislamiento: los datos procesados en GenAI.mil se quedan dentro del entorno del gobierno y no se usan para entrenar ni mejorar los modelos públicos de los proveedores, que es exactamente lo que pasaría si cada empleado usara la versión de consumo por su cuenta. La otra lectura es de mercado: los tres laboratorios grandes de Estados Unidos quedaron adentro del mismo contrato marco, sin exclusividad. TechCrunch · DefenseScoop

    TechCrunch DefenseScoop OpenAI Google xAI GPT Gemini

  9. IA

    OpenAI le corta el acceso a Cursor después de que SpaceX la comprara, y lo justifica con el historial de Musk rompiendo contratos (29/08)

    El contrato termina el 12 de noviembre de 2026, el plazo máximo de preaviso que permite el acuerdo, y la cláusula invocada es la de rescisión por cambio de control. "It boils down to trust", resumió Thibault Sottiaux, de OpenAI, que aclaró que el corte apunta a Musk y no al ecosistema de herramientas de coding: los usuarios van a poder seguir usando modelos GPT en Cursor con su propia API key y las extensiones de IDE de OpenAI siguen funcionando. Los antecedentes que enumera OpenAI son dos: Musk cortó en diciembre de 2022 el acceso al feed completo de Twitter —una licencia de unos USD 2 millones al año que se usaba para entrenar ChatGPT— y admitió en juicio haber entrenado Grok con salidas de modelos de otros labs. Michael Truell, cofundador de Cursor, minimizó el impacto: los modelos de OpenAI son alrededor del 5% del tráfico de IA de la herramienta. Hay precedentes en la otra dirección: Anthropic bloqueó a Windsurf en junio de 2025 cuando trascendió el interés de compra de OpenAI, y en agosto de 2025 le revocó la API a OpenAI por usar Claude en benchmarks internos. The Decoder · OpenAI

    The Decoder OpenAI OpenAI Anthropic GPT Claude

  10. Hardware y robótica

    SpaceXAI va a desplegar CPUs Vera de Nvidia por separado para las cargas agénticas de Grok (25/08)

    Es la primera vez que la CPU Vera se despliega como pieza autónoma y no como mitad del combo Vera Rubin. Nvidia declara que el chip completa tareas agénticas, de aprendizaje por refuerzo y de procesamiento de datos hasta 1,8 veces más rápido que procesadores x86. El movimiento tiene lógica de sistema: si el cuello de botella de un agente deja de ser la GPU y pasa a ser la orquestación —parseo, tool calls, manejo de estado—, conviene un CPU pensado para eso. Tom's Hardware

    Tom's Hardware Nvidia

  11. IA

    Los chatbots mandan a embarazadas a sitios antiaborto sin aclarar de qué se trata (24/08)

    Una investigación de AlgorithmWatch probó ChatGPT-5, Gemini 3, Grok 4.3 y Claude Sonnet 4.8 con tres personas ficticias en inglés, alemán e italiano, y juntó 270 respuestas: en al menos una de cada cuatro consultas apareció un link a una web antiaborto sin distinguirla de una autoridad sanitaria oficial. La organización Profemina, ligada a Heartbeat International, salió en cerca del 17% de todas las respuestas, y en las consultas que pedían testimonios personales llegó al 33% en alemán y 29% en italiano. Hay dos comportamientos que valen aparte: Gemini enlazó a Profemina cinco veces en una misma conversación, compartió un gráfico de su web y después advirtió contra esa misma fuente; Claude hizo algo parecido. El caso alemán es el más concreto en daño: en once de doce conversaciones los modelos recomendaron Caritas para el asesoramiento previo obligatorio, y Caritas no emite el certificado que la ley alemana exige para abortar dentro de las doce semanas, así que quien va ahí primero pierde tiempo del plazo. Google y OpenAI remitieron a sus políticas, que no cubren el tema; Anthropic y xAI no contestaron. The Decoder · AlgorithmWatch

    The Decoder AlgorithmWatch OpenAI Anthropic Google xAI Claude Gemini

  12. IA

    SpaceX cerró formalmente la compra de Cursor por USD 60.000M (15/08)

    El cierre se formalizó en un filing del 14 —la subsidiaria X67 Inc. se fusionó con Anysphere y los accionistas reciben unas 389,3 millones de acciones de SpaceX— y Cursor lo anunció en su blog el 15. La operación arrancó en abril como acuerdo de desarrollo conjunto con opción de compra, se confirmó en junio días después del IPO de SpaceX, y ahora deja a Cursor dentro de la división SpaceXAI junto a Grok Build y Grok Bot. En su anuncio, Cursor destacó que pasa a tener acceso a "la flota de GPUs más grande del mundo" — la misma infraestructura que SpaceX le alquila a Anthropic y a Google. Es la consolidación completa de cómputo, modelo y herramienta de código bajo un mismo techo. TechCrunch · Cursor

    TechCrunch Cursor Anthropic Google

  13. IA

    xAI/SpaceXAI lanzó Grok 4.6, su nuevo flagship para agentes

    Modelo con contexto de 500K tokens, entrada de texto e imagen, y RL sobre entornos agénticos (coding, kernel optimization, web dev, CAD). Empata a GPT-5.6 Sol y supera a Kimi K3 en el Intelligence Index de Artificial Analysis (61 puntos, +5 vs. Grok 4.5), a US$2/M input y US$6/M output. VentureBeat · MarkTechPost

    VentureBeat MarkTechPost xAI GPT Kimi

  14. Técnicas y repos

    Grok 4.6 para agent builders: nuevo nivel xhigh de reasoning_effort y disponibilidad amplia

    El parámetro reasoning_effort ahora soporta low/medium/high/xhigh; el modelo está disponible vía API, Cursor, Grok Build y OpenRouter a US$2/US$6 por millón de tokens (variante rápida al doble). Con 500K de contexto y RL específico en entornos de coding y CAD, es candidato directo para harnesses de agentes de larga duración — vale la pena A/B-testearlo contra tu modelo actual en tareas multi-paso. MarkTechPost · dev.to (benchmarks y pricing)

    MarkTechPost dev.to (benchmarks y pricing)

  15. Técnicas y repos

    "AI Recommendation Poisoning": botones "Ask AI" que alteran la memoria de tu asistente

    Sitios comerciales están embebiendo prompts ocultos en deep links pre-llenados ("Ask AI"): al clickearlos logueado en ChatGPT, Claude, Gemini o Grok, la query se ejecuta sin confirmación y algunas instruyen al asistente a guardar el dominio del vendor como "fuente confiable", sesgando respuestas futuras. Microsoft ya catalogó 31 empresas haciéndolo. Accionable: desconfiá de esos botones y revisá periódicamente la memoria persistente de tus asistentes. (6/8) The Hacker News

    The Hacker News Microsoft GPT Claude Gemini

  16. IA

    xAI lanza Grok Imagine Video 1.5 con texto-a-video nativo en 1080p

    El 1 de agosto xAI actualizó su generador de video sumando 1080p nativo tanto desde texto como desde imagen, hasta siete imágenes de referencia para consistencia de personajes/entornos y hasta tres inputs de audio para consistencia de voz entre escenas. Ya está disponible en web, mobile y la API, arrancando por los planes SuperGrok Heavy y Plus en EE.UU. (cryptobriefing.com)

    cryptobriefing.com xAI

  17. Técnicas y repos

    Grok Build (xAI) — agente de coding open-source

    xAI liberó el CLI/TUI que corre el mismo loop de agente detrás de su stack de coding. Suma a la ola de "harnesses" de agentes que domina GitHub este mes (junto a bytedance/deer-flow para tareas de largo horizonte). Vale probarlo si estás armando scaffolding de agentes de coding. Analytics Vidhya

    Analytics Vidhya xAI GitHub

  18. IA

    Google lanza Gemini 3.6 Flash (21/07)

    Google puso a disposición Gemini 3.6 Flash, su modelo rápido de nueva generación, sumándose a una temporada intensísima: en el último mes también se publicaron Claude Sonnet 5 (Anthropic), GPT-5.6 —dividido en tres modelos: Sol, Terra y Luna (OpenAI)— y Grok 4.5 (xAI). El ritmo de lanzamientos entre labs sigue acelerando. llm-stats · ThursdAI

    llm-stats ThursdAI OpenAI Anthropic Google xAI GPT Claude Gemini

  19. IA

    Musk confirmó Grok 4.6, de 2T de parámetros, para responderle a Kimi

    El 18 de julio Elon Musk confirmó Grok 4.6, un modelo frontier de 2 billones de parámetros que terminó su pre-entrenamiento inicial la semana del 20 de julio. La apuesta de xAI es igualar o superar a Kimi K3 manteniendo la velocidad y eficiencia de tokens del Grok 4.5 (lanzado el 8 de julio, que ya superaba a Opus 4.8 y Fable en SWE Marathon). Inshorts · kie.ai

    Inshorts kie.ai xAI Kimi

  20. IA Hilo 7

    GPT-5.6 (Sol, Terra, Luna) ya en despliegue general

    La familia GPT-5.6 de OpenAI —lanzada el 9 de julio tras una revisión de seguridad del gobierno de EE.UU.— completó su rollout: Sol (insignia, con modo subagente Ultra y ajuste de esfuerzo de razonamiento Max), Terra (calidad tipo GPT-5.5 a mitad de costo) y Luna (tier rápido y económico). Se ubica entre los modelos frontera de referencia del mes junto a Gemini 3.5 Pro y Grok 4.5. - -

    merca2.es lanacion.com.ar OpenAI GPT Gemini

  21. IA Hilo 3

    xAI/SpaceXAI pone a Grok 4.5 como "clase Opus" a menor costo

    Anunciado el 8/07 y disponible esta semana, Grok 4.5 fue entrenado junto a Cursor sobre decenas de miles de GPUs NVIDIA GB300. Musk lo describe como "clase Opus, pero más rápido, más eficiente en tokens y más barato", a US$2/US$6 por millón de tokens (input/output) frente a US$5/US$25 de Opus 4.8. TechCrunch · Axios

    TechCrunch Axios xAI Nvidia

  22. IA

    xAI presenta Grok 4.5

    xAI anunció Grok 4.5, su modelo más avanzado, orientado a coding, tareas agénticas y trabajo de conocimiento. Corre a 80 tokens/segundo, dice superar a Opus 4.8 en benchmarks clave como DeepSWE 1.0 y ofrece el doble de eficiencia de tokens a $2/M input y $6/M output. El precio y la velocidad lo posicionan como una opción de bajo costo para cargas agénticas. BuildFastWithAI

    BuildFastWithAI xAI

  23. IA Hilo 3

    Grok 4.5: xAI se mete en la pelea de coding con eficiencia de tokens como argumento

    xAI lanzó Grok 4.5, entrenado sobre decenas de miles de GB300 de Nvidia y —según la empresa— junto a Cursor. En los benchmarks propios queda por debajo de Fable y GPT-5.5 en la mayoría de las pruebas de coding (DeepSWE, SWE-Bench Pro), pero clava Terminal Bench 2.1 en 83,3%, prácticamente empatado con GPT-5.5. El dato que xAI empuja fuerte es el consumo: reporta ~15.954 tokens de salida promedio en SWE-Bench Pro contra ~67.020 de Opus 4.8, una brecha de 4,2x. Advertencia obligatoria: son números autoreportados, sin verificación independiente todavía. x.ai · Axios · The Decoder

    x.ai Axios The Decoder xAI Nvidia GPT

  24. IA

    Se acomodan las fichas tras la semana de lanzamientos

    Con el polvo asentado: Grok 4.5 (8/7), Muse Spark 1.1 de Meta (9/7) y GPT-5.6 (9/7) ya están en producción, y ByteDance sumó Seedream 5.0 Pro. En los trackers independientes, Claude Fable 5 sigue primero en el ranking general (91/100 en BenchLM al 9 de julio). Queda pendiente Gemini 3.5 Pro, que Google corrió al 17 de julio. La foto: cuatro labs empujando releases en una sola semana y ninguno con ventaja estable. LLM-Stats · ThursdAI

    LLM-Stats ThursdAI Google Meta GPT Claude Gemini

  25. IA Hilo 3

    xAI saca Grok 4.5, "clase Opus" y más barato

    El 8 de julio xAI lanzó Grok 4.5, su primer modelo orientado específicamente a coding y trabajo agéntico, entrenado con datos reales de sesiones de Cursor sobre una base V9 de 1,5 billones de parámetros. Queda cuarto en el Artificial Analysis Intelligence Index —por encima de todo modelo open-weight y de los Gemini— a un precio de US$2/US$6 por millón de tokens, ~60% más barato que Opus 4.8 o GPT-5.5. Todavía no está disponible en la UE (previsto para mediados de julio). x.ai · Axios · Yahoo Tech

    x.ai Axios Yahoo Tech xAI GPT Gemini

  26. IA

    xAI publica Grok 4.5

    Grok 4.5 salió el 8 de julio de 2026, siendo el modelo más reciente al momento del relevamiento. Su aparición, casi en paralelo con GPT-5.6 y con la Claude Sonnet 5 de Anthropic (30 de junio), confirma que el ritmo de releases frontera se comprimió a cuestión de días. llm-stats · pricepertoken

    llm-stats pricepertoken Anthropic xAI GPT Claude

  27. IA

    Grok 4.5 en beta privada; xAI abre su Voice Agent Builder

    Elon Musk confirmó (28 de junio) que Grok 4.5 está en beta privada con equipos de SpaceX y Tesla, construido sobre una nueva base "V9" de ~1,5 billones de parámetros, aunque sin fecha pública de lanzamiento; Grok 4.3 sigue siendo el flagship abierto. En paralelo, xAI lanzó en beta Voice Agent Builder, una plataforma no-code para crear agentes de voz de producción sobre Grok Voice. Releasebot — xAI · llm-stats

    Releasebot — xAI llm-stats xAI Tesla

  28. IA

    Un agente de IA resuelve conjeturas abiertas de Erdős en un paper sobre matemática autónoma

    Un trabajo reciente en arXiv describe el despliegue sistemático de un agente sobre 700 problemas abiertos de la base de conjeturas de Erdős, resolviendo por completo Erdős-1051 y varias preguntas más, y derivando una generalización que dio lugar a un paper. Es uno de los ejemplos más concretos de IA participando del proceso de descubrimiento y no solo de resumen. arXiv 2602.10177 (Nota: Grok 4.5 apareció en beta privada el 28 de junio según reportes, sin fecha de lanzamiento público; se incluye como rumor no confirmado oficialmente.)

    arXiv 2602.10177