El Compilado Hilos Temas Archivo RSS

Temas · modelo

Kimi

Seguir Kimi por RSS

Noticias
42
Briefings
30
Primera
Última
  1. Hardware y robótica

    OpenAI aclaró que el Jalapeño es para consumo propio, pero dejó la puerta abierta: "se podría usar para cualquiera, honestamente" (28/09)

    Richard Ho, head of hardware de OpenAI, le dijo a Tom's Hardware que la prioridad es cubrir la demanda interna de cómputo y que eso va a llevar "un buen rato largo", sin descartar una venta externa más adelante. El punto que quería sacar de la mesa con los benchmarks de Hot Chips es que el ASIC no está hardcodeado para modelos de OpenAI: lo mostraron corriendo GPT-OSS, DeepSeek R1 y Kimi K2.5, medido con InferenceX de SemiAnalysis contra GB200 y GB300, y aclaró que comparó contra Blackwell porque eran los mejores resultados publicados que encontró. Sobre Vera Rubin, que es con lo que va a convivir cuando despliegue, dice tener mediciones internas que no publica y que "vamos muy bien". El motor del diseño, según él, fue una sola cosa: eficiencia, porque el datacenter moderno está limitado por potencia. El límite real para vender afuera parece ser el suministro. Tom's Hardware

    Tom's Hardware OpenAI DeepSeek

  2. Técnicas y repos

    Evals: el Furniture Assembly Benchmark de Epoch AI pasó de 28% a 80% en diez meses, y es un termómetro raro y útil de razonamiento visual (26/09)

    El test le da al modelo fotos de tres muebles de IKEA a medio armar, con errores puestos a propósito, y le pide compararlas con las instrucciones, encontrar la macana y describirla. GPT-6 Astra marca 80% tardando tres minutos por foto; Claude Fable 5.1 llega a 70% y Opus 5 a 61%. La referencia histórica es lo que sorprende: en noviembre de 2025 el mejor modelo era Claude Opus 4.5 con 28%. Los open-weights chinos, Kimi K3 incluido, quedan a siete meses de distancia por lo menos. Sigue siendo demasiado lento para asistir en tiempo real, pero como métrica de "mirá esta foto y decime qué está mal" es más honesta que casi cualquier benchmark multimodal de pregunta y respuesta. The Decoder

    The Decoder Claude

  3. IA Hilo 3

    StepFun presentó Step 5 Preview, un MoE de 600B para agentes a un dólar el millón de entrada, con pesos prometidos para el 15 de octubre (20/09)

    La empresa china apunta a trabajo agéntico de horizonte largo —programación, ingeniería de software, análisis financiero— con 600.000 millones de parámetros totales, unos 27.000 activos por token, un millón de tokens de contexto y entrada de texto e imagen. La decisión de arquitectura que llama la atención es que en vez de ensanchar la red la hicieron angosta y profunda: 92 capas de Transformer. El entrenamiento se apoya en aprendizaje por refuerzo on-policy de horizonte largo con alineación bit a bit entre entrenamiento e inferencia sobre el ruteo del MoE, más decodificación especulativa MTP-3, MoE en FP8 y descarga de caché KV. El precio es la carta: 1 dólar por millón de tokens de entrada con caché fría, 0,05 con caché caliente y 2,70 de salida, contando los tokens de razonamiento como salida. En el índice de Artificial Analysis queda en 44, a la par de Kimi K3 y GLM 5.3 en la mayoría de las filas y por detrás de GPT-6 Astra y Claude Opus 5 en las de programación y agentes más duras. MarkTechPost · StepFun · Pandaily

    MarkTechPost StepFun Pandaily Claude GLM

  4. IA

    El consumo semanal de tokens en OpenRouter subió más de 25.000% desde enero de 2025, y el gráfico dice menos de lo que parece (17/09)

    Pasó de 0,5 billones a 126,2 billones de tokens semanales en la plataforma que usan los desarrolladores para enchufar modelos a sus productos. El problema es leerlo como adopción: los modelos de razonamiento generan cantidades enormes de tokens de "pensamiento" antes de contestar, así que un aumento chico de uso real puede significar un salto gigante en la cuenta, sobre todo con sistemas agénticos sin optimizar. GPT 5.6 Luna domina el consumo de tokens, pero eso no significa que más gente lo use: puede simplemente generar más tokens por pedido. En ingresos, el que lidera es Astra. Los modelos chinos —Kimi, GLM, DeepSeek— crecen rápido, con el gasto mensual multiplicado por diez en 2026, aunque desde una base mucho más chica. Es el mismo argumento que ya se le hizo a Google cuando prefirió hablar de consumo de tokens antes que de ventas. The Decoder · LinkedIn / OpenRouter

    The Decoder LinkedIn / OpenRouter Google DeepSeek GPT GLM

  5. Técnicas y repos Hilo 3

    colibrì trepó a 33.000 estrellas proponiendo algo que suena imposible: correr modelos MoE de frontera desde el disco, en C puro y sin dependencias (15/09)

    El repo sumó 2.035 estrellas en el día y la idea que lo mueve merece atención aunque uno nunca lo instale. Un modelo Mixture-of-Experts de 744 mil millones de parámetros activa solo unos 40 mil millones por token, y de esos apenas ~11 GB cambian de un token al siguiente. colibrì toma esa observación en serio: la parte densa —atención, expertos compartidos, embeddings, unos 17B de parámetros— se queda residente en RAM en int4, unos 9,9 GB, y los 19.456 expertos ruteados viven en NVMe y se transmiten bajo demanda. La analogía que usa el autor es la de un JIT: los parámetros no son estado a sostener, son datos a preparar justo cuando el router prueba que hacen falta, y eso funciona porque el ruteo tiene estructura medible —resulta 71,6% predecible un layer por adelantado, lo que habilita el prefetch—. Los números son honestos y modestos: 1,8 tok/s en un escritorio CPU-only de 128 GB, 1,07 tok/s en una caja con una sola RTX 5070 Ti, y 0,05-0,1 tok/s en frío en la máquina de 25 GB de RAM y doce núcleos donde nació el proyecto. Declara soporte para GLM-5.2, Inkling (975B), Kimi K3 (2,8T), DeepSeek V4 Flash, Qwen3.8-Flash-Next y OLMoE. Truco que vale más allá del repo: si tenés un segundo SSD, poner una copia completa del modelo ahí y rutear los expertos por hash entre ambos suma el ancho de banda de las dos unidades —un par de 9 GB/s + 3 GB/s lee ~33% más rápido que el disco veloz solo—. GitHub

    GitHub DeepSeek GitHub

  6. Técnicas y repos

    Un repo que junta los system prompts extraídos de los modelos de frontera pasó las 700 estrellas en un día (14/09)

    system_prompts_leaks mantiene actualizada una colección de prompts de sistema extraídos de Claude Fable 5.1, Opus 5, Claude Design y Claude Code; de ChatGPT con GPT-6 Astra y Codex; de Gemini 3.8 Flash, 3.1 Pro y Antigravity; de Grok, Cursor y Kimi, entre otros. La utilidad práctica no es el morbo sino la comparación: son documentos escritos por gente que tiene acceso a las evaluaciones internas del modelo, así que leer cómo un laboratorio estructura instrucciones, define herramientas y acota el comportamiento es probablemente la mejor documentación disponible sobre cómo se le habla a ese modelo en particular. Se cruza directo con lo que recomendaba OpenAI el viernes sobre sacar andamios en vez de agregarlos, y con la nota de Anthropic sobre haber recortado 80% del prompt de sistema de Claude Code. La advertencia obvia: son extracciones, no publicaciones oficiales, así que pueden estar incompletas o desactualizadas respecto de lo que corre hoy en producción. GitHub

    GitHub OpenAI Anthropic GitHub GPT Claude Gemini Grok Claude Code

  7. Técnicas y repos Hilo 3

    El motor de inferencia colibri explotó en GitHub con más de 3.100 estrellas en un día (13/09)

    El repo no es nuevo, pero el salto de tracción de hoy lo pone arriba de la lista de tendencias y vale mirarlo por lo que propone: correr modelos MoE de frontera —de 744.000 millones a 2,8 billones de parámetros— en hardware de consumo, en C puro y sin dependencias, tratando almacenamiento, RAM y VRAM como una sola jerarquía de inferencia. La idea central es hacer streaming de los expertos desde disco en lugar de tenerlos todos en RAM, así que un NVMe rápido pasa a ser el factor que más determina los tokens por segundo. Hoy soporta ocho familias, entre ellas GLM-5.2, GLM-5.3-Flash, Kimi K3, DeepSeek V4 Flash, Qwen3.8-Flash-Next, Qwen3.6 y OLMoE, con la jerarquía de memoria manejada por LRU más un conjunto de pines aprendido. Conviene tomarlo como lo que es —un proyecto en movimiento, con trabajo abierto en formatos, compresión, placement, scheduling, kernels y KV—, no como un reemplazo de producción de vLLM o llama.cpp. GitHub · Colibri

    GitHub Colibri DeepSeek GitHub vLLM llama.cpp

  8. Técnicas y repos

    Cognition lanzó SWE-2: 50,0% en FrontierCode 1.1 Main, a un punto de Fable 5.1 y 64% más barato (10/09)

    Está post-entrenado sobre Kimi K3, un modelo de 2,8 billones de parámetros que ya venía con RL extensivo para código agéntico, y sobre esa base el RL de Cognition todavía encuentra 5 a 6 puntos de margen en varios benchmarks. El aporte metodológico es el interesante: un algoritmo que entrena todos los niveles de esfuerzo en una sola corrida, aplicando una penalidad de costo lineal por nivel, con cada penalidad calibrada a la pendiente local de la frontera de Pareto del modelo base. Prueban que la penalidad tiene que ser lineal, porque es la única forma que da el mismo resultado se aplique antes o después de promediar. Los resultados de comportamiento acompañan: SWE-2 medium puntúa más alto que SWE-1.7 tomando 58% menos turnos y costando 81% menos en promedio. Ya está disponible en Devin Desktop y CLI. Cognition · Hacker News

    Cognition Hacker News

  9. Técnicas y repos

    Un experimento de prefills de razonamiento midió que Qwen3.8 se corre 18 puntos hacia GPT-5.5 Pro cuando se le inyecta el arranque del razonamiento ajeno (09/09)

    El método es simple y replicable: para cada problema se generan dos respuestas del modelo objetivo, una normal y otra que arranca con el primer 1% del razonamiento del modelo maestro insertado en su canal de razonamiento, y después se mide cuánto de la respuesta visible del maestro aparece en los primeros 100 tokens de la del alumno, promediando recall de unigramas, bigramas y trigramas. Sobre 45 problemas —15 STEM, 15 no-STEM y 15 puzzles sintéticos privados—, Qwen3.8 A95B pasa de 16,79% a 34,97%, con +27 puntos en STEM y +14,75 en los puzzles que nadie más tiene. DeepSeek V4 Flash no se mueve, Kimi K3 sube 4,54 puntos pero ya arranca con el solapamiento más alto. El experimento no prueba destilación, pero es la clase de evidencia técnica y reproducible que el aviso de CISA de ayer no aporta. Gist de wsxiaoys · Hacker News

    Gist de wsxiaoys Hacker News DeepSeek GPT CISA

  10. IA

    Mistral levanta 3.000 millones de euros con Samsung a la cabeza, la ronda más grande de la historia tecnológica europea (08/09)

    La Serie D lleva la valuación arriba de 21.000 millones de euros, casi el doble de los 12.000 millones que valía cuando ASML puso 1.300 millones en septiembre de 2025. Coliderean el Scaleup Europe Fund (gestionado por EQT) y PSG Equity, y entran Advent, fondos de BlackRock y el Gran Ducado de Luxemburgo; a16z, Nvidia, ASML y General Catalyst siguen adentro. El dato incómodo es que los modelos no acompañan: Mistral Medium 3.5 queda atrás de Qwen y Kimi entre los abiertos y no compite con los cerrados de EE.UU. La apuesta es enteramente empresarial —opera en 20 países con más de 125 clientes como Airbus, ASML y HSBC— y el motor es la demanda europea de bajar la dependencia de proveedores estadounidenses. Mistral AI · The Decoder

    Mistral AI The Decoder Mistral Nvidia Samsung Qwen ASML

  11. IA

    Moonshot AI negocia con Microsoft, Amazon y Google para que hosteen Kimi K3 a cambio de hasta el 30% de los ingresos (26/08)

    Sería la primera vez que una empresa china de IA cierra un acuerdo así con un proveedor cloud grande de Estados Unidos: el modelo correría en Azure, AWS y Google Cloud, y Moonshot pide quedarse con hasta el 30% de lo que facture, según tres fuentes citadas por Reuters. Las conversaciones están en etapa temprana y quedan abiertos el reparto exacto, el acceso a los datos y cómo se contabiliza el uso de tokens. El contexto político pesa: el secretario del Tesoro Scott Bessent amenazó hace poco a Moonshot con una prohibición comercial, y autoridades estadounidenses acusaron a la empresa de haber robado el modelo Fable de Anthropic, algo que Moonshot niega. Microsoft, Google y AWS no quisieron comentar. The Decoder · Reuters

    The Decoder Reuters Anthropic Google Microsoft Moonshot AI Amazon

  12. Hardware y robótica Hilo 3

    OpenAI mostró los primeros benchmarks de Jalapeño: 700W contra los 1.400W del GB300, y hasta 1,9 veces más throughput por kilowatt (25/08)

    Sigue de lo de ayer, cuando Nvidia usó Hot Chips 2026 para poner el Groq 3 LPX en producción: ahora fue OpenAI la que llegó a la conferencia con números de su primer chip propio, el ASIC de inferencia que codesarrolló con Broadcom. Sobre la suite pública InferenceX de SemiAnalysis, Jalapeño entregó entre 1,5 y 1,9 veces más throughput por kilowatt y entre 1,7 y 3,6 veces menos latencia end-to-end que los sistemas rack GB200 y GB300. Las pruebas corrieron sobre GPT-OSS 120B, DeepSeek R1 670B y Kimi K2.5. Las advertencias son varias y conviene tenerlas juntas: no se comparó contra Vera Rubin, no entrena modelos, y las comparaciones principales enfrentaron predicción de un solo token contra configuraciones GB300 haciendo lo mismo, cuando en producción Nvidia suele usar predicción multi-token —donde la ventaja de eficiencia baja a unas 1,5 veces—. Cada paquete lleva seis stacks de HBM4, 216 GiB a 15,4 TB/s, en un proceso clase 3nm de TSMC. Escalar esto al acuerdo de 10 GW firmado con Broadcom convertiría a OpenAI en un nuevo demandante grande de HBM4, la pieza más escasa de la industria. Y todo esto una semana después de que Nvidia acordara respaldar hasta USD 105.000 millones de financiamiento para un campus de datacenter de OpenAI en Ohio. Tom's Hardware · TechCrunch · The Decoder

    Tom's Hardware TechCrunch The Decoder OpenAI DeepSeek Nvidia Broadcom TSMC

  13. IA

    GLM-5.3 empata el primer puesto entre los modelos abiertos, pero Z.ai retrasa los pesos porque encuentra vulnerabilidades demasiado bien (19/08)

    El modelo de la startup china saca 60 puntos en el Artificial Analysis Intelligence Index, siete arriba de GLM-5.2, y queda a la par de Kimi K3 en la cima de los abiertos. La mayor ganancia está en tareas agénticas: en GDPval-AA v2 su Elo salta de 1.524 a 1.770 —246 puntos— y queda segundo detrás solo de Claude Opus 5 (1.855). En costo pega USD 0,68 por tarea, 1,5 veces los 0,44 de su antecesor pero 19% más barato que Kimi K3 (0,84). Lo llamativo es el motivo del retraso: el modelo ya está disponible por la API de Z.ai, pero la publicación de los pesos abiertos se corre unas dos semanas porque, según la empresa, GLM-5.3 es tan efectivo detectando vulnerabilidades de seguridad que primero quiere reforzar controles y limitar el acceso completo a socios de seguridad seleccionados. Es el mismo argumento que usan los labs occidentales para no abrir, ahora en boca de un laboratorio chino. Artificial Analysis en X · The Decoder

    Artificial Analysis en X The Decoder Claude

  14. IA

    xAI/SpaceXAI lanzó Grok 4.6, su nuevo flagship para agentes

    Modelo con contexto de 500K tokens, entrada de texto e imagen, y RL sobre entornos agénticos (coding, kernel optimization, web dev, CAD). Empata a GPT-5.6 Sol y supera a Kimi K3 en el Intelligence Index de Artificial Analysis (61 puntos, +5 vs. Grok 4.5), a US$2/M input y US$6/M output. VentureBeat · MarkTechPost

    VentureBeat MarkTechPost xAI GPT Grok

  15. IA

    ByteDance pre-entrena un modelo de hasta 10 billones de parámetros

    El dueño de TikTok estaría entrenando un modelo de ~10T de parámetros —unas tres veces Kimi K3 de Moonshot y cerca de estimaciones para los sistemas Mythos de Anthropic (~8T)—, todavía en fase temprana de pre-training (3 a 6 meses antes de fine-tuning). Zhang Yiming habría pedido priorizar capacidad real por sobre destilación de corto plazo. Es uno de los scale-ups más ambiciosos de un lab chino y podría mover el tablero EE.UU.-China. (Reuters vía TechStartups)

    Reuters vía TechStartups Anthropic Moonshot AI

  16. IA

    Alibaba lanzó Qwen3.8-Max, su modelo más grande hasta ahora

    MoE de 2.4 billones (trillions) de parámetros totales con solo 95B activos por token, contexto de 1M, multimodal nativo, disponible ya por API ($2/$6 por millón de tokens) y con open weights prometidos para la semana próxima. En pruebas internas completó un proyecto de software autónomo de 16 días y compite con Anthropic y Kimi K3 en coding y tareas de horizonte largo. TechStartups

    TechStartups Anthropic Alibaba

  17. IA

    DeepSeek V4-Flash es el nuevo rey del precio-rendimiento

    Artificial Analysis lo midió en $0.14/$0.28 por millón de tokens (~$0.03 por test de benchmark, vs. $0.86 de Kimi K3 y $1.86 de GPT-5.6 Sol), con un salto de 10 puntos en su Intelligence Index (a 50) y mejoras en tareas agénticas y alucinaciones. Presión directa sobre la economía de los modelos cerrados occidentales. TechStartups · llm-stats

    TechStartups llm-stats DeepSeek GPT

  18. IA Hilo 11

    Kimi K3 sale con pesos abiertos: 2.8 billones de parámetros, licencia permisiva

    Moonshot AI publicó los pesos completos de Kimi K3, un mixture-of-experts de 2.8T de parámetros que activa ~104B por token, con ventana de contexto nativa de 1M de tokens y capacidades multimodales de visión, bajo una licencia estilo MIT modificado. La empresa afirma ~2.5x más "inteligencia por unidad de cómputo" gracias a mejoras como Kimi Delta Attention. La licencia permisiva es lo clave: habilita productos comerciales sobre un modelo de escala frontier y presiona la economía de las APIs cerradas. TechStartups · Interconnects

    TechStartups Interconnects Moonshot AI

  19. IA

    Nadella advierte contra apostar a un solo modelo

    El CEO de Microsoft recomendó que las empresas no dependan exclusivamente de un modelo y desarrollen modelos propios o infraestructura de "AI gateway" que rutee entre varios. Viniendo del CEO más asociado a OpenAI, es un aval notable al enfoque multi-modelo, en un mes donde Claude Opus 5 lidera benchmarks, Kimi K3 y DeepSeek V4 abaratan la oferta abierta y OpenAI navega su incidente de seguridad. Build Fast with AI

    Build Fast with AI OpenAI Microsoft DeepSeek Claude

  20. IA Hilo 11

    Moonshot libera Kimi K3: el modelo open-weight más grande hasta la fecha (2,8T de parámetros)

    El startup chino publicó los pesos completos de Kimi K3 el 26–27 de julio en Hugging Face: ~1,4 TB bajo cuantización MXFP4, MoE (solo ~16 de 896 expertos activos por token), visión nativa y ventana de contexto de 1M de tokens. Fuerte en coding y tareas agénticas, aunque todavía por detrás de los cerrados en algunos benchmarks frontera. Baja la barrera para self-hosting y fine-tuning, e intensifica la disputa abierto vs. propietario y EE.UU. vs. China. (26–27/7) techstartups · Interconnects

    techstartups Interconnects Moonshot AI Hugging Face

  21. IA

    Los modelos open-weight chinos ganan tracción entre developers de EE.UU

    Modelos de Moonshot y otros escalan en rankings de plataformas de routing (OpenRouter) por precio bajo, buen desempeño en coding y pesos abiertos que se pueden correr en infraestructura propia. Kimi K3 registró un salto fuerte de descargas, incluido crecimiento entre usuarios estadounidenses. Complica la estrategia de Washington: los controles de exportación no frenan la adopción de modelos que compiten por eficiencia y apertura. (27/7) techstartups

    techstartups Moonshot AI

  22. Técnicas y repos

    Correr Kimi K3 localmente: MXFP4 y llama.cpp

    Con los pesos abiertos de Kimi K3 ya publicados (~1,4 TB en MXFP4), la comunidad está armando guías para self-hosting. La ruta práctica: GGUF + llama.cpp (sin paso extra de conversión/cuantización, se apunta el server al archivo) o vLLM/SGLang para serving. El Hub de Hugging Face (org ggml-org) concentra las conversiones oficiales. Accionable para quien quiera evaluar un frontier open-weight sin depender de API. explainx · dev.to — guía inference tools

    explainx dev.to — guía inference tools Hugging Face vLLM llama.cpp

  23. IA Hilo 11

    Kimi K3 (Moonshot AI) sale con pesos abiertos y récord de tamaño

    Moonshot liberó los pesos de Kimi K3 alrededor de las 00:00 UTC del 27/07 (tarde-noche del 26 en horario de EE.UU.): 2,8 billones de parámetros, arquitectura MoE (16 de 896 expertos activos, ~50B de parámetros efectivos por token) y ventana de 1M de contexto. Es el mayor modelo open-weight publicado hasta la fecha; en MXFP4 (4 bits) pesa ~1,4 TB, y Together AI y Modal ya ofrecen hosting day-0. Importa porque sube la vara de lo que se puede autohostear y presiona a los labs cerrados. techtimes · qz · interconnects

    techtimes qz interconnects Moonshot AI

  24. Técnicas y repos

    TurboQuant: compresión de KV cache sin calibración

    Técnica que comprime la KV cache usando coordenadas polares y reduce el uso de memoria hasta 6x con mínima pérdida de exactitud. Es online y calibration-free, ideal para inferencia en vivo y contextos largos —relevante justo cuando modelos como Kimi K3 empujan ventanas de 1M. dev.to

    dev.to

  25. IA Hilo 3

    Jensen Huang debuta en X defendiendo los modelos abiertos (24-25/07)

    El CEO de Nvidia usó su primer posteo para compartir una carta firmada por 25 empresas —Nvidia, Microsoft, Meta, IBM, Dell, Mistral, Mozilla, Hugging Face, Linux Foundation, Perplexity, Y Combinator— argumentando que "los modelos abiertos fortalecen la seguridad y la ciberseguridad, aceleran la innovación y habilitan la soberanía". El timing no es casual: Washington está debatiendo restringir modelos open-weight chinos como Kimi K3. Es el lobby pro-open-weights más coordinado que se vio hasta ahora. Post original · Fortune · VideoCardz

    Post original Fortune VideoCardz Meta Microsoft Mistral Hugging Face Nvidia Dell Linux

  26. IA Hilo 11

    Los pesos de Kimi K3 se liberan a las 00:00 UTC del 27/07

    Moonshot AI anunció el modelo el 16/07 y los pesos completos bajan esta noche bajo licencia MIT modificada: ~1,4 TB con cuantización MXFP4, 2,8 billones de parámetros en un MoE disperso (16 de 896 expertos activos), contexto de 1M de tokens y comprensión de imagen y video. Sería el release open-weight más grande jamás publicado. Ya lidera el Frontend Code Arena con 1.679 puntos, por encima de Claude Fable 5 (1.631) y GPT-5.6 Sol (1.618). VentureBeat · Tom's Hardware · Hugging Face blog

    VentureBeat Tom's Hardware Hugging Face blog Moonshot AI Hugging Face GPT Claude

  27. IA Hilo 11

    Moonshot negocia una valuación de hasta US$50.000M

    La china Moonshot AI, creadora de la familia Kimi, está en conversaciones para levantar capital a una valuación de hasta US$50.000M de cara a una posible IPO en Hong Kong dentro de seis meses. Llega tras el lanzamiento de Kimi K3, un modelo MoE de 2,8 billones de parámetros (el open-weight más grande a la fecha), ubicado a nivel frontier en coding agéntico. buildfastwithai · The Hacker News

    buildfastwithai The Hacker News Moonshot AI

  28. Ciberseguridad

    Redis publica 7 releases de seguridad tras PoCs de RCE — hallados por agentes de IA

    El 23 de julio Redis emitió siete actualizaciones de seguridad después de que se publicaran pruebas de concepto de RCE autenticada para versiones estándar (6.2.22, 7.4.9, 8.6.4 y 8.8.0). Lo notable: investigadores reportan que agentes basados en Kimi K3 encontraron los zero-days y construyeron el exploit de forma autónoma, un hito de IA ofensiva aplicada a hallazgo de vulnerabilidades. No se reportó explotación in-the-wild al 24/jul. Los administradores de Redis deberían actualizar cuanto antes. The Hacker News · ZeroDay.cloud

    The Hacker News ZeroDay.cloud

  29. IA

    La Casa Blanca acusa a Moonshot AI de "robar" el modelo Fable de Anthropic

    El 22 de julio, Michael Kratsios (director de política científica y tecnológica de la Casa Blanca) acusó a la china Moonshot AI de una destilación "encubierta y a gran escala" del modelo Fable de Anthropic para construir Kimi K3, y de haber accedido a servidores Nvidia GB300 restringidos vía Tailandia. Es la primera vez que un alto funcionario estadounidense nombra a un laboratorio chino por copiar un modelo específico; el Tesoro advirtió que "sanciones y designaciones en la Entity List están sobre la mesa". TechCrunch · CyberScoop · The Hill

    TechCrunch CyberScoop The Hill Anthropic Moonshot AI Nvidia

  30. IA Hilo 11

    Kimi K3, el mayor modelo open-weight hasta la fecha

    Moonshot presentó Kimi K3 (16 jul), un MoE open-weight de ~2,8 billones de parámetros con visión nativa y contexto de 1M de tokens, apuntado a coding agéntico con rendimiento de frontera. Los pesos abiertos están programados para el 27 de julio, cuatro días después de la acusación de la Casa Blanca, lo que agrega tensión geopolítica al release. llm-stats · The New Stack

    llm-stats The New Stack Moonshot AI

  31. IA Hilo 11

    Kimi K3 de Moonshot AI reabre la discusión sobre modelos chinos open-weight

    Moonshot AI lanzó el 17 de julio Kimi K3, un modelo de 2.8 billones de parámetros que la empresa presenta como el open-weight más grande jamás publicado, y que según sus propios benchmarks supera a Claude Fable 5 en el Frontend Code Arena y a GPT-5.5 en varias pruebas de coding y agentes. Los pesos se publicarían el 27 de julio, lo que en la práctica los vuelve indescargables de vuelta. Vale aclarar que los números de rendimiento son auto-reportados por Moonshot y todavía no hay verificación independiente. Tom's Hardware

    Tom's Hardware Moonshot AI GPT Claude

  32. IA

    La administración Trump evalúa restricciones a la IA china open-source

    Axios reportó el 20 de julio que el gobierno estadounidense reactivó internamente la discusión sobre limitar modelos chinos, con el lanzamiento de Kimi K3 como disparador y la ciberseguridad como argumento. Lo que se estaría barajando no es una prohibición frontal sino designaciones en la Entity List y reglas de compras públicas. El problema práctico es evidente: una vez que los pesos están publicados, no hay forma realista de sacarlos de circulación. Axios · Tom's Hardware

    Axios Tom's Hardware

  33. IA Hilo 11

    Kimi K3 de Moonshot lidera el arena de coding y se convierte en el open-weight más grande de la historia

    Moonshot AI lanzó Kimi K3 el 16 de julio: 2,8 billones de parámetros totales con solo 16 de 896 expertos activos por token. En cuestión de horas trepó al tope del arena de coding, superando a modelos cerrados de referencia. Los pesos abiertos están prometidos para el 27 de julio, así que todavía no se puede descargar. Es la señal más clara hasta ahora de que la brecha entre labs chinos y frontier occidental se achicó a menos de una generación. Digital Applied — Open-Weight Wave July 2026 · LLM Stats

    Digital Applied — Open-Weight Wave July 2026 LLM Stats Moonshot AI

  34. IA Hilo 11

    Kimi K3 de Moonshot AI se consolida en el top de los benchmarks

    El modelo open-weight chino de 2,8 billones de parámetros (1M de contexto, multimodal nativo), lanzado el 16 de julio, encabezó arenas de coding pocas horas después de salir y ranquea alrededor del #3-#4 global (~81/100 en leaderboards públicos, 88,3 en Terminal-Bench 2.1 con su harness KimiCode). Los pesos abiertos se liberarían hacia el 27 de julio. Es una señal fuerte de que los modelos abiertos siguen achicando la brecha con los frontier cerrados. Simon Willison · BenchLM

    Simon Willison BenchLM Moonshot AI

  35. IA

    Musk confirmó Grok 4.6, de 2T de parámetros, para responderle a Kimi

    El 18 de julio Elon Musk confirmó Grok 4.6, un modelo frontier de 2 billones de parámetros que terminó su pre-entrenamiento inicial la semana del 20 de julio. La apuesta de xAI es igualar o superar a Kimi K3 manteniendo la velocidad y eficiencia de tokens del Grok 4.5 (lanzado el 8 de julio, que ya superaba a Opus 4.8 y Fable en SWE Marathon). Inshorts · kie.ai

    Inshorts kie.ai xAI Grok

  36. IA Hilo 11

    Moonshot AI lanza Kimi K3, el open-weight más grande hasta ahora

    La china Moonshot AI liberó vía app y API su modelo insignia Kimi K3, un MoE disperso de ~2,8 billones de parámetros (896 expertos, sólo 16 activos por token), ventana de 1M tokens, visión nativa y "thinking mode" siempre activo. En evaluaciones independientes queda cuarto entre los frontera —detrás sólo de Claude Fable 5 y GPT-5.6 Sol, superando a Claude Opus 4.8—, un hito para los modelos abiertos. Los pesos completos llegarán a Hugging Face el 27 de julio. Cobertura de Bloomberg, VentureBeat, Axios y TechCrunch. - - -

    bloomberg.com venturebeat.com simonwillison.net Moonshot AI Hugging Face GPT Claude

  37. IA

    Ola open-weight de julio: Inkling y compañía

    Además de Kimi K3, el mes concentró varios lanzamientos abiertos: Thinking Machines liberó Inkling (975B totales / 41B activos, licencia Apache 2.0, pesos en Hugging Face al lanzamiento) el 15 de julio, posicionado como modelo general de razonamiento y código competitivo con cerrados mainstream. También suenan la V4 oficial de DeepSeek para mediados de mes y una familia MoE dispersa de Mistral en early access. - -

    digitalapplied.com llm-stats.com DeepSeek Mistral Hugging Face

  38. IA Hilo 11

    Moonshot lanza Kimi K3, un modelo abierto de 2.8 billones de parámetros

    La china Moonshot AI publicó Kimi K3, un MoE open-weights de 2.8T de parámetros (activa 16 de 896 expertos) con ventana de contexto de ~1M de tokens, posicionado para cerrar la brecha con los modelos top de EE.UU. como Opus 4.8. Es una de las señales más fuertes de que el open-weights chino ya juega en la primera división. Bloomberg · TechCrunch · Fortune

    Bloomberg TechCrunch Fortune Moonshot AI

  39. IA Hilo 4

    Los modelos open-weight chinos siguen apretando

    GLM-5.2 (MoE de 744B parámetros totales, ~40B activos, licencia MIT) marcó 62,1% en SWE-bench Pro, superando el 58,6% de GPT-5.5, un hito para un modelo de pesos abiertos. Sumado a Qwen 3, DeepSeek V4 y Kimi K2, refuerza la tendencia de empresas de EE.UU. mirando alternativas abiertas frente a los costos crecientes de OpenAI y Anthropic. Thunder Compute · CNBC

    Thunder Compute CNBC OpenAI Anthropic DeepSeek GPT Qwen

  40. IA Hilo 4

    Los modelos open-weight siguen apretando a los cerrados

    Junio consolidó una ola de lanzamientos abiertos competitivos: GLM 5.2 (Z.ai/Zhipu, 13/6) pasó a liderar el Artificial Analysis Intelligence Index entre open-weights; MiniMax M3 combina coding de frontera, contexto de 1M y multimodalidad nativa (lidera SWE-Bench Pro open-weight con 59,0%); y Kimi K2.7 Code (Moonshot) recorta ~30% los tokens de "thinking" para abaratar corridas de agentes. Importa porque la brecha con los modelos propietarios se sigue achicando. llm-stats · Hugging Face blog

    llm-stats Hugging Face blog Moonshot AI Hugging Face GLM

  41. IA Hilo 4

    MiniMax M3, nuevo referente open-weight

    MiniMax M3, lanzado en junio, se posiciona como el primer modelo open-weight que combina coding frontera, contexto de 1M de tokens y multimodalidad nativa, liderando el SWE-Bench Pro open-weight con 59,0%. Importa porque sigue achicando la brecha entre modelos abiertos y cerrados en la frontera de coding agéntico, junto a otros lanzamientos recientes como GLM-5.2 (MIT, MoE, 1M de contexto), Kimi K2.6 y DeepSeek V4. llm-stats · Kilo

    llm-stats Kilo DeepSeek

  42. IA Hilo 4

    Sigue la ola de modelos open-weights de frontera

    En junio se consolidaron varios pesos abiertos competitivos: MiniMax M3 (combina coding de frontera, 1M de contexto y multimodalidad nativa, lidera el SWE-Bench Pro open-weight con 59,0%) y GLM-5.2 (pesos MIT, hasta 5,7x más barato y fuerte en código). El panorama de modelos descargables de calidad frontera —GLM-5.1/5.2, MiniMax M3, Kimi K2.6, DeepSeek V4, Qwen3-Coder-Next— sigue achicando la distancia con las APIs cerradas. pricepertoken · kilo.ai

    pricepertoken kilo.ai DeepSeek