El Compilado Hilos Temas Archivo RSS

Temas · Categoría

Técnicas y repos

Seguir solo técnicas y repos por RSS

Noticias
80
Briefings
20
Última
  1. DeepSeek libera Harness v0.1: "todo es un plugin", licencia MIT

    Lo más accionable del día. DeepSeek abrió en developer preview un harness de agentes completo y ejecutable — no otro anuncio de modelo — construido sobre su meta-framework Cordis. Cada capacidad es un plugin intercambiable: modelos, herramientas, skills, sesiones, sandboxes, storage, loops, scheduling y hasta la UI, todo configurable sin tocar el código fuente. Se levanta con npx @deepseek-ai/dsh web. Es explícitamente una preview con cambios que rompen compatibilidad, así que no para producción todavía, pero si estás armando scaffolding de agentes vale la pena leer cómo separaron las capas. Fue el #2 de Hacker News el 13 de agosto. deepseek.com/harness · GitHub · The New Stack

    deepseek.com/harness GitHub The New Stack DeepSeek GitHub

  2. El writeup técnico de Cerebras sobre cómo sirven GPT-5.6 Sol a 750 tok/s

    Más allá del anuncio comercial, el post de ingeniería explica la apuesta contraria al consenso: la inferencia en modelos grandes está limitada por ancho de banda de memoria, así que en lugar de optimizar el movimiento de pesos los meten enteros en 44 GB de SRAM por wafer y pipelinean las capas del modelo entre wafers, con los tokens fluyendo sin interrupción. Lectura obligada si estás pensando en serving y en el trade-off latencia/costo/calidad. Cerebras

    Cerebras Cerebras GPT

  3. Terminal-Bench 2.1 y DeepSWE se consolidaron como la vara real

    Vale la pena notar el patrón: los tres releases de la semana (Gemini 3.7 Flash, DeepSeek V4 Pro, GPT-5.6 Sol) se comparan entre sí en DeepSWE, FrontierCode y Terminal-Bench 2.1, no en MMLU ni en benchmarks académicos saturados. Terminal-Bench v2 son 89 tareas en entornos de shell reales cubriendo ingeniería de software, ML, seguridad y data science; hoy GPT-5.6 Sol lidera con 89.5% y Claude Opus 5 queda en 89.1%. Si estás evaluando modelos para trabajo agéntico, esa es la tabla a mirar. Leaderboard de agentes de código (agosto 2026)

    Leaderboard de agentes de código (agosto 2026) DeepSeek GPT Claude Gemini

  4. Comparativa práctica: un prompt, 11 modelos, resultados distintos

    Netlify publicó un experimento simple y honesto sobre cuánto divergen los modelos ante el mismo prompt — útil como recordatorio de que el "mejor modelo" depende de la tarea y de que conviene probar antes de casarse con uno. Estuvo entre lo más leído de Hacker News el 13 de agosto. Discusión en HN (con link al post original)

    Discusión en HN (con link al post original)

  5. Grok 4.6 para agent builders: nuevo nivel xhigh de reasoning_effort y disponibilidad amplia

    El parámetro reasoning_effort ahora soporta low/medium/high/xhigh; el modelo está disponible vía API, Cursor, Grok Build y OpenRouter a US$2/US$6 por millón de tokens (variante rápida al doble). Con 500K de contexto y RL específico en entornos de coding y CAD, es candidato directo para harnesses de agentes de larga duración — vale la pena A/B-testearlo contra tu modelo actual en tareas multi-paso. MarkTechPost · dev.to (benchmarks y pricing)

    MarkTechPost dev.to (benchmarks y pricing) Grok

  6. Agent Plugins v1.0.0: el estándar de plugins para agentes ya es implementable

    (working draft publicado el 11/8, con adopción moviéndose en las últimas horas). Especificación con schemas JSON canónicos, guías para autores y clientes, y matriz de compatibilidad que abarca OpenAI, AWS, Cursor, GitHub y VS Code. Si mantenés tooling para agentes, es el momento de revisar el draft y validar tus manifests contra los schemas. explainx.ai - Sin más novedades verificables de las últimas 24h en esta categoría. Contexto de la semana: en GitHub trending siguen dominando los visual builders de agentes (Langflow, Dify, Flowise) y crece la acción Claude Code Security Review de Anthropic para revisar PRs con Claude. OSSInsight · startupcorners (digest 9/8) --- Fuentes agregadoras usadas para ítems sin cobertura primaria accesible: Tech Startups (13/8), que cita Reuters, Bloomberg, WSJ, FT, SecurityWeek y TNW. Ítems no verificables u older de 24h fueron omitidos.

    explainx.ai OSSInsight startupcorners (digest 9/8) OpenAI Anthropic Amazon GitHub Claude Claude Code

  7. Hilo 4

    Correr Muse Glimmer 30B local como motor de agentes

    Lo más accionable de las últimas 24h: la colección de Hugging Face trae pesos BF16, GGUF k-quants (de Unsloth, publicados ayer), builds de ExecuTorch y el drafter DFlash para speculative decoding. Con ~20 GB corre en una GPU de consumo o Mac dentro de un loop de agente real, sin llamadas de red. Si querés agentes locales con tool use y 131K de contexto, es el candidato a probar hoy. Fuentes: VentureBeat, explainx.

    VentureBeat explainx Hugging Face

  8. NVIDIA publica Nemotron 3.5 Lightning y NeMo Switchyard

    Nemotron 3.5 Lightning es un modelo de alta eficiencia para cargas agénticas; Switchyard es una librería open source de routing inteligente entre modelos dentro de herramientas de agentes populares — útil si querés enrutar tareas baratas a modelos chicos y reservar el modelo grande para lo difícil. Fuente: The Daily Commit (11/8).

    The Daily Commit (11/8) Nvidia

  9. GPT-5.6-Cyber como herramienta práctica para equipos de seguridad

    Si trabajás en seguridad ofensiva/defensiva autorizada, el acceso vía Daybreak Red habilita flujos que los modelos generales bloquean (validación de exploits, revisión profunda de código, respuesta a incidentes). Requiere verificación como defensor aprobado. Fuente: Releasebot. Nota: no encontré más material verificable de las últimas 24h para esta sección (los digests de GitHub Trending más recientes son del 9/8, fuera de ventana), así que preferí no rellenar.

    Releasebot GitHub GPT

  10. antirez publicó h3.c: inferencia nativa de MiniMax H3 en Apple Silicon

    Salvatore Sanfilippo (creador de Redis) lanzó una implementación from-scratch en Metal 4 del modelo de generación de video MiniMax H3. En una M5 Max renderiza clips de 512×512 y 22 frames en ~12,6 s (u ~8 s con reuso de velocity 3×), con pico de ~25,9 GiB usando cuantización int8 de activaciones y kernels fusionados. Referencia excelente si te interesa inferencia local optimizada a mano. GitHub

    GitHub Apple GitHub

  11. Evo-Bench: el primer benchmark que mide si un LLM puede mejorar su propio harness de agente

    Aísla la capacidad del modelo de optimizar autónomamente su scaffolding en dominios Search, Office y General. En nueve modelos frontier y open-weight, los mejores logran ganancias absolutas de hasta 16,6 puntos, casi igualando harnesses diseñados por humanos en Search y General — pero se estancan en workflows de Office. Útil si estás construyendo agentes que se auto-mejoran. Paper (HF)

    Paper (HF)

  12. SWE-Bench ProMax: nuevo benchmark multilenguaje de refactoring donde el mejor modelo saca 41,2%

    Son 170 tareas curadas por expertos en Python, Java, TypeScript, Go, C, C++ y Rust, con un promedio de 11,4 archivos modificados por tarea. Los autores reescribieron cada issue y revisaron los test suites a mano, corrigiendo los tests defectuosos que una auditoría reciente encontró en el 60% de las instancias no resueltas de SWE-Bench Verified. Recalibra qué tan lejos están los agentes de coding del trabajo real. Paper (HF)

    Paper (HF)

  13. Dan Luu: el lenguaje de programación casi no predice el costo de un coding agent

    Desafía el claim viral de que los lenguajes dinámicos dan una gran ventaja de eficiencia de tokens: corriendo los mismos agentes en tareas realistas (decoder de Zstd, Pandoc), la brecha de 2,6× entre C y Clojure reportada en problemas triviales desaparece a mayor dificultad. Lo que sí correlaciona con éxito es la popularidad del lenguaje. Dato útil antes de elegir stack "para agentes". danluu.com

    danluu.com

  14. Metodología para inferir el training run real de modelos frontier

    Shrivu Shankar publicó una técnica de probing con quizzes de hechos históricos y auto-identificación que revela que los Opus 4.7+ de Anthropic comparten un cutoff de fines de diciembre 2025 (probablemente un mismo run), que la familia GPT-5.6 se agrupa en un checkpoint de febrero 2026, y que Opus 5 tiene un estado de conocimiento más viejo (~enero 2026) que su cutoff publicado de mayo. Interesante para entender qué hay realmente detrás de los model cards. blog.sshh.io

    blog.sshh.io Anthropic GPT

  15. Docker Sandboxes: entornos descartables y aislados para agentes de IA

    (portada de HN hoy, 346 puntos). Docker lanzó un producto para correr agentes con acceso a shell y filesystem dentro de sandboxes efímeros, atacando el problema #1 de los agentes autónomos: ejecutar código generado por el modelo sin exponer tu máquina. Si corrés agentes tipo Claude Code u OpenClaw en local, es una capa de aislamiento lista para usar. Docker · HN (214 comentarios)

    Docker HN (214 comentarios) Claude Claude Code

  16. semantica: infraestructura graph-native para contexto y auditoría de agentes, #1 en GitHub Trending

    (hoy). Se autodefine como "el Palantir open source para agentes": construye knowledge graphs con provenance W3C PROV-O, registra cada decisión del agente como nodo consultable (record_decision, trace_decision_chain) y razona en forma determinística sin LLM. Incluye MCP server y plugins para Claude Code, Cursor y Windsurf; apunta a dominios regulados donde "¿por qué decidió eso la IA?" tiene que tener respuesta auditable. pip install semantica. GitHub

    GitHub GitHub Claude Claude Code MCP

  17. Prime Agent (PrimeIntellect): agente RLM auto-mejorable para tareas largas

    (trending hoy). Open source (MIT), implementa el modelo Recursive Language Model: el contexto se trata como variables y los subagentes como llamadas a función dentro de un REPL de Python persistente. Lo distintivo es el "Continual Harness": con /refine el agente aplica mejoras pequeñas y con evidencia a sus prompts, memorias y skills, con rollback. Corre en daemon para trabajo de fondo y comunicación agente-a-agente. GitHub

    GitHub GitHub

  18. "How I use LLMs to learn complex topics": workflow práctico que dominó HN

    (716 puntos, últimas 24h). Un post con un método concreto para usar LLMs como tutor de temas complejos (descomposición, interrogación activa, verificación cruzada) que generó 460 comentarios con variantes y críticas. Útil como plantilla si usás modelos para estudio técnico. Post · HN

    Post HN

  19. prime-agent (Prime Intellect) es de lo más caliente de GitHub trending hoy

    Agente open source (MIT) de coding e investigación para tareas largas, construido sobre dos ideas: un Recursive Language Model que trata el contexto como variables y a los subagentes como llamadas a función dentro de un REPL de IPython persistente, y un "continual harness" que persiste memorias, skills y specs de subagentes como estado durable que el agente refina con updates chicos respaldados por evidencia. La v0.7.0 salió el 5-ago y el repo está en el top del trending de esta mañana (GitHub, OSSInsight). Si estás armando agentes long-running, vale la pena mirar el diseño del harness.

    GitHub OSSInsight GitHub

  20. La fiebre de los agent skills sigue escalando: tres directorios en el trending

    mattpocock/skills quedó #1 del Skill Leaderboard al 8-ago con skills de ingeniería (domain modeling, ADRs, code review contra specs), acompañado en el trending por google/skills (skills oficiales para productos Google) y addyosmani/agent-skills (24 bundles SKILL.md production-grade, 77k estrellas). Lo accionable: el formato SKILL.md ya es el estándar de facto entre harnesses — empaquetar tus workflows repetibles como skills es hoy la vía más barata de mejorar rendimiento de agentes.

    mattpocock/skills Skill Leaderboard google/skills addyosmani/agent-skills Google

  21. Tip práctico del día: convertí pasos repetibles de skills en scripts testeados, no en prompts

    El TechBeat del 8-ago destaca esa guía: si un paso de un workflow de agente es determinístico, moverlo de instrucción en prompt a script testeado que el agente invoca reduce variancia y tokens (HackerNoon). Alineado con cómo están diseñados los harnesses tipo prime-agent: menos prosa en el contexto, más herramientas verificables.

    HackerNoon

  22. cloudflare/computer: "dale una computadora a tu agente", no un contenedor

    Cloudflare abrió @cloudflare/computer, un filesystem virtual que vive dentro de un Durable Object (estado autoritativo en SQLite) con superficie de ejecución pluggable. Trae tres backends: Container (FUSE mount real con un daemon computerd y userland Linux completo), Isolate shell (just-bash en un Dynamic Worker) e Isolate JavaScript (módulo ESM con node:fs/promises respaldado por el Workspace). Interesante para dar a los agentes un entorno de ejecución persistente y barato sin levantar contenedores completos. (GitHub, Cloudflare Blog)

    GitHub Cloudflare Blog GitHub Linux

  23. Guía de Anthropic sobre harnesses para agentes de larga duración

    Anthropic publicó "Effective harnesses for long-running agents", con prácticas accionables: mantener el archivo de instrucciones top-level corto (~100 líneas) como índice hacia un docs/ estructurado, guardar planes/specs en el directorio del proyecto para que el agente los referencie, y automatizar el setup del entorno con scripts de init para no gastar contexto en instalaciones. Aplicable directamente a scaffolding de agentes de coding. (Anthropic Engineering)

    Anthropic Engineering Anthropic

  24. Técnica: consenso en inference-time para mitigar comportamientos ocultos del fine-tuning

    El paper "Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning" (arXiv 2607.23394) propone entrenar varios modelos de referencia sobre datasets distintos y agregar sus distribuciones de próximo token en el decoding vía "consensus decoders" (un mínimo token-wise y una variante base-relative). Útil como defensa práctica frente a backdoors o sesgos introducidos por fine-tuning, sin re-entrenar. (Nota: es del 25 de julio; se incluye por su relevancia accionable ante los incidentes de seguridad de agentes de esta semana.) (arXiv)

    arXiv

  25. Parcheá tus harnesses de agentes: fallas en AWS, Google y Vercel permitían disparar tools sin pasar por el modelo

    Instrucciones forjadas podían llegar a las tools de un agente sin que ningún turno del modelo las autorizara — o sea, system prompts y guardrails nunca intervenían. Afectados: Bedrock AgentCore (InvokeHarness, ya corregido en el servicio), Google ADK para Python (corregido en 2.5.0) y Vercel @ai-sdk/harness-codex (fix en 1.0.29) / @ai-sdk/harness-opencode (1.0.28). Accionable: actualizá versiones y no expongas endpoints de harness a input no confiable. (6/8) The Hacker News

    The Hacker News Google Amazon

  26. Qué está explotando en GitHub: agentes con memoria de equipo y skills

    Entre lo más trending del día: cloudflare/computer, mattpocock/skills (framework de skills agénticas y metodología de desarrollo), TencentDB-Agent-Memory (hub de memoria de equipo que convierte chats, docs y código en cuatro activos reutilizables compartidos entre agentes) y DeepSeek-Reasonix (agente de coding para terminal diseñado alrededor de la estabilidad del prefix-cache). El patrón: memoria compartida y skills reutilizables como capa estándar del stack de agentes. (7/8) OSSInsight

    OSSInsight GitHub

  27. Papers frescos de agentes en arXiv: runtimes de largo horizonte y memoria jerárquica

    De los últimos dos días: "Argus", un runtime agéntico de propósito general para razonamiento de largo horizonte; "ABSeeker", que entrena agentes de búsqueda con asignación de crédito retropropagada desde la respuesta; y trabajos de memoria jerárquica en grafos con localización a nivel de paths. Útiles si estás armando agentes que corren horas: el cuello de botella ya no es el modelo sino el scaffolding de memoria y crédito. (5-6/8) arXiv cs.MA recent

    arXiv cs.MA recent

  28. "AI Recommendation Poisoning": botones "Ask AI" que alteran la memoria de tu asistente

    Sitios comerciales están embebiendo prompts ocultos en deep links pre-llenados ("Ask AI"): al clickearlos logueado en ChatGPT, Claude, Gemini o Grok, la query se ejecuta sin confirmación y algunas instruyen al asistente a guardar el dominio del vendor como "fuente confiable", sesgando respuestas futuras. Microsoft ya catalogó 31 empresas haciéndolo. Accionable: desconfiá de esos botones y revisá periódicamente la memoria persistente de tus asistentes. (6/8) The Hacker News

    The Hacker News Microsoft GPT Claude Gemini Grok

  29. JudgeArena: framework unificado para evaluación reproducible con LLM-as-judge

    (paper, 5 ago). Ataca la fragmentación del ecosistema de benchmarks con jueces LLM: un marco común para correr y reproducir evaluaciones. Accionable si estás armando evals propios y querés comparabilidad entre modelos jueces. Fuente: arXiv:2608.02620.

    arXiv:2608.02620

  30. "Beyond the Hivemind": meta-persona anchoring + temperature scaling secuencial contra la homogeneidad de LLMs

    (paper, 5 ago). Propone dos técnicas concretas de prompting/decoding para escapar del efecto "hivemind" (respuestas convergentes y homogéneas entre modelos). Útil para generación creativa, datos sintéticos diversos y ensembles. Fuente: arXiv:2608.02618.

    arXiv:2608.02618

  31. MemArena: benchmark ego-céntrico para asistentes con memoria personal on-device

    (paper, 5 ago). Evalúa cómo manejan modelos open-weight la memoria agéntica sobre conversaciones privadas en el dispositivo — relevante si construís agentes con memoria persistente y te importa qué modelo local usar. Fuente: arXiv:2608.02613.

    arXiv:2608.02613

  32. Tokens de n8n filtrados en GitHub daban acceso real a 321 instancias

    (5 ago). GitGuardian encontró 4.576 tokens únicos en commits públicos; el 36% de las instancias alcanzables aceptaba al menos uno, exponiendo workflows y credenciales downstream (DBs, repos, cloud, servicios de IA). Práctica concreta: escanear secretos en CI, rotar tokens de n8n y restringir acceso de red a la instancia. Fuente: The Hacker News.

    The Hacker News GitHub

  33. Simon Willison: un juego completo "one-shot" con Claude Fable 5

    (post, 5 ago). Willison repitió su experimento de 2024 (GPT-3 + DALL-E) y generó un juego funcional de una sola pasada, buen ejemplo práctico de hasta dónde llegó la generación de código de una sola instrucción. Fuente: vía LLM Stats.

    vía LLM Stats Claude

  34. Microsoft Research libera Orchard, framework abierto para agentes a escala

    Publicado el 4 de agosto. Su núcleo es Orchard Env, un servicio de entornos aislados sobre Kubernetes que permite entrenar y evaluar agentes dentro de los harnesses reales de deployment (Claude Code, Codex, OpenClaw), cerrando la brecha entrenamiento-producción. Incluye tres recetas (Orchard-SWE, Orchard-GUI, Orchard-Claw) con mejoras medibles en ingeniería de software, automatización de navegador y asistentes, y liberan datos de entrenamiento y métodos de eval completos. Accionable si hacés RL o evals de agentes sin depender de cloud propietario. Microsoft Research · AI Business

    Microsoft Research AI Business Microsoft Claude Claude Code

  35. rust-lang/rust adopta política de LLMs: "analizar sí, crear no"

    Publicada el 5 de agosto en el blog Inside Rust: cinco equipos del proyecto acordaron que los LLMs pueden usarse para "responder preguntas, analizar, destilar, refinar, chequear, sugerir, revisar" pero no para crear código en PRs al monorepo. No es postura oficial de todo el proyecto, pero es uno de los precedentes más claros de gobernanza de contribuciones con IA en open source de gran escala — probable plantilla para otros proyectos. Inside Rust Blog · Hacker News

    Inside Rust Blog Hacker News

  36. OpenAI baja precios de GPT-5.6 y estrena "Fast mode" en la API

    El 4 de agosto recortó los precios de GPT-5.6 Luna y Terra y lanzó un modo rápido para GPT-5.6 Sol en la API, además de ampliar el acceso enterprise en ChatGPT Work, Codex y la API. Accionable: si tenés pipelines sobre estos modelos, conviene rehacer el cálculo de costos y probar Fast mode donde la latencia manda. Releasebot — OpenAI updates --- Fuentes verificadas por búsqueda web el 2026-08-05. Nota: Qwen3.8-Max (Alibaba, 2.4T parámetros MoE) se lanzó el 3 de agosto — fuera de la ventana de 24h — con open weights prometidos para esta semana; vale la pena seguirlo.

    Releasebot — OpenAI updates OpenAI Alibaba GPT

  37. Memoria de equipo para agentes: TencentDB-Agent-Memory

    . Hub de memoria a nivel equipo que convierte conversaciones, docs y código en cuatro activos reutilizables (Chat Memory, Skills, LLM-Wiki, Code-Graph) gobernados y compartidos entre agentes y frameworks. Interesante como patrón si tus agentes pisan el mismo contexto una y otra vez. Trendshift

    Trendshift

  38. Deadline de migración: Moonshot da de baja kimi-k2.5 y todos los strings moonshot-v1 el 31/8

    (confirmado 3/8). Quedan ~27 días: si tenés apps apuntando a esos model strings, migrá ya a los identificadores nuevos para evitar cortes. AI Agents News — semana del 3/8

    AI Agents News — semana del 3/8 Moonshot AI

  39. Tooling de documentos para agentes: OfficeCLI y firecrawl/pdf-inspector

    . OfficeCLI (binario único, open source) permite a agentes leer/editar Word, Excel y PowerPoint sin Office instalado, con soporte MCP; pdf-inspector (Rust, de Firecrawl) clasifica PDFs escaneados vs. de texto para rutear inteligentemente OCR vs. extracción directa — piezas útiles para pipelines de documentos. OfficeCLI · pdf-inspector

    OfficeCLI pdf-inspector MCP

  40. Meta AI usa un segundo agente como "memory coach" para tareas largas

    Para evitar que los agentes olviden errores ya diagnosticados y repitan pasos fallidos, Meta introduce un agente de memoria separado que mantiene un banco estructurado y decide qué recordar durante tareas complejas. Patrón accionable de memory engineering para scaffolding de agentes multi-paso. The Decoder / feed LLM Stats

    The Decoder / feed LLM Stats Meta

  41. Tutorial práctico: reemplazar un proceso de booking con un agente LangGraph + Langfuse

    Guía paso a paso para construir, correr y monitorear un agente de soporte con estado usando Python, LangGraph y Langfuse (observabilidad). Directamente reproducible para quien quiera pasar de PoC a un agente instrumentado. Planet AI / feed LLM Stats

    Planet AI / feed LLM Stats

  42. Presence como referencia de "agente en producción"

    Más allá de la noticia, el diseño de OpenAI Presence —razonamiento del modelo envuelto en políticas, testing/evals y reglas de escalado a humano— es una plantilla útil de mejores prácticas para llevar agentes a producción con guardrails y evaluación continua. OpenAI

    OpenAI OpenAI

  43. Microsoft libera Flint, un lenguaje de gráficos pensado para que los LLMs los generen sin romperse

    Microsoft Research publicó Flint, un DSL open source de visualización posicionado como reemplazo de Vega-Lite y diseñado para que los modelos generen gráficos de forma confiable a partir de datos tabulares. La propuesta: gramática más corta, menos overhead de tokens y rendering predecible cuando el modelo compone vistas al vuelo. Accionable para cualquiera que arme dashboards o reporting con agentes. (microsoft.github.io)

    microsoft.github.io Microsoft

  44. β-OPSD: generaliza el self-distillation on-policy y mejora razonamiento matemático sin RL caro

    Investigadores de la Universidad de Maryland reformulan el on-policy self-distillation (OPSD) como el caso β=1 de una familia más amplia que ajusta el ancla KL entre las políticas de estudiante, referencia y profesor. El óptimo cerrado se convierte en una mezcla de logits usada como target de destilación, evitando RL costoso, con mejoras consistentes de estabilidad y accuracy en benchmarks de matemática sobre el OPSD estándar. (huggingface.co)

    huggingface.co

  45. Un paper reencuadra el diseño de routers MoE: los co-expertos interactúan, no se complementan

    Zhejiang University y Hong Kong PolyU introducen un Expert Subspace Separation Index y un protocolo factorial 2x2 que muestra que los expertos co-seleccionados en Mixture-of-Experts no aportan direcciones de representación distintas, como se suele asumir. Intervenciones con ruta congelada exponen un "solapamiento coherente" donde candidatos fuertes interactúan negativamente: útil para repensar el diseño de routers sparse tipo Mixtral/DeepSeek. (huggingface.co)

    huggingface.co DeepSeek

  46. Fairness Pruning: 40 neuronas alcanzan para mover el sesgo demográfico en LLMs de 3B

    Un nuevo paper muestra que poner en cero apenas 40 neuronas (0,031% del ancho de MLP en modelos de hasta 3B) mueve de forma medible el sesgo demográfico conservando el 99,49% de la capacidad general. La intervención produce una "desestabilización" bidireccional del sesgo más que una reducción limpia, porque captura magnitud y no dirección: señal interesante para equipos de interpretabilidad y alignment que exploran circuitos disociables. (huggingface.co)

    huggingface.co

  47. El "unhobbling" del prompt como técnica: menos contexto, mismo rendimiento

    Sigue ganando tracción la práctica que Anthropic aplicó con Opus 5/Fable 5 —recortar más del 80% del system prompt de Claude Code sin pérdida medible en evals de código—. La lección accionable: en agentes de producción, borrar restricciones y few-shots redundantes suele mejorar más que agregar instrucciones, porque todo modelo frontier se degrada a medida que crece el contexto, mucho antes de llenar la ventana. explainx.ai · Developers Digest

    explainx.ai Developers Digest Anthropic Claude Claude Code

  48. Regla práctica para tool use: menos herramientas por agente

    Guías recientes de context engineering convergen en un límite claro: OpenAI recomienda menos de 20 herramientas por agente, con la precisión degradándose ya pasadas las 10. Combinado con el formato Agent Skills (adoptado por OpenAI, Google, GitHub y Cursor), el patrón es componer capacidades en skills cargadas bajo demanda en vez de inflar el set de tools. Towards AI · Sourcegraph

    Towards AI Sourcegraph OpenAI Google GitHub

  49. AWS congela Bedrock Agents "Classic" para nuevos clientes

    Desde el 30 de julio, Amazon renombró su servicio a Bedrock Agents Classic y lo cerró a nuevas cuentas (bloquea CreateAgent e InvokeInlineAgent y congela el catálogo de modelos), empujando a AgentCore como el camino para agentes de producción. Si construís sobre AWS, conviene auditar qué workloads siguen en Classic y empezar a testear los flujos equivalentes en AgentCore. (AI Agent Store)

    AI Agent Store Amazon

  50. Crogl libera un agente SOC autónomo gratis

    Crogl puso su Enterprise AI SOC Agent como descarga gratuita, desplegable en minutos dentro del propio entorno (incluso on-prem y air-gapped), sin normalización de esquemas: investiga alertas, hace threat hunting y documenta cada paso manteniendo al analista humano en control. Buen candidato para probar automatización agéntica sobre una cola de incidentes real sin lock-in de SaaS. (AI Agent Store)

    AI Agent Store

  51. Cequence suma controles zero-trust para agentes

    Cequence Security liberó cuatro capacidades nuevas en su AI Gateway —AI Discovery, API Registry, LLM Registry y Skill Registry— más Agent Personas que atan la "descripción de puesto" de un agente a su modelo, tools y guardrails. AI Discovery descubre agentes, proveedores de IA y servidores MCP ya corriendo desde los logs existentes, y el API Registry permite que los agentes llamen APIs aprobadas sin manejar credenciales crudas. Útil para encontrar "shadow agents" en producción. (AI Agent Store)

    AI Agent Store MCP

  52. Bedrock Data lanza "Agent DLP" para inspeccionar tool calls MCP

    Nueva capacidad de prevención de pérdida de datos en runtime, pensada para agentes autónomos: se ubica inline en el gateway del agente e inspecciona bidireccionalmente las llamadas y respuestas de tools MCP en tiempo real, con integración nativa a AWS AgentCore y LiteLLM. Da visibilidad sobre qué datos sensibles salen hacia herramientas externas. (AI Agent Store)

    AI Agent Store Amazon MCP

  53. Colibri: motor de inferencia en C puro que corre GLM-5.2 (744B) en ~25GB de RAM

    Sin dependencias, streamea los "expertos" del MoE desde disco a demanda para correr un modelo enorme en una máquina de consumo. Interesante para quien quiera experimentar con MoE grandes sin GPU de datacenter. Analytics Vidhya – trending

    Analytics Vidhya – trending

  54. deer-flow (ByteDance) y herdr: harnesses de agentes

    deer-flow es un harness open-source de "super-agente" de largo horizonte para research/coding/creación con sandboxes y subagentes; herdr es un multiplexor que vive en la terminal para orquestar varios agentes en paralelo. Útiles como scaffolding para tareas agénticas multi-paso. Analytics Vidhya · OSSInsight trending

    Analytics Vidhya OSSInsight trending

  55. stitch-skills (Google Labs): librería de "Agent Skills" cross-tool

    Skills que siguen el estándar abierto de Agent Skills, compatibles con Gemini CLI, Claude Code y Cursor — señal de que el stack agéntico se está consolidando alrededor de MCP + skills portables. Bueno para reutilizar capacidades entre herramientas. Analytics Vidhya

    Analytics Vidhya Google Claude Gemini Claude Code Gemini CLI MCP

  56. Guía práctica: tooling de inferencia local comparado (llama.cpp, Ollama, vLLM, SGLang)

    Repaso actualizado a julio de cuándo conviene cada motor para servir modelos localmente — referencia útil para decidir stack de serving según throughput vs. simplicidad. DEV Community

    DEV Community vLLM llama.cpp

  57. Colibri: correr un MoE de 744B en una máquina de consumo

    Un motor de inferencia diminuto y en C puro que permite ejecutar GLM-5.2 (744B de parámetros MoE) en ~25 GB de RAM. Es lo más accionable para quien quiera experimentar con modelos grandes localmente sin depender de la nube. OSSInsight — Trending AI

    OSSInsight — Trending AI

  58. LMCache: más throughput en inferencia LLM

    Capa de KV cache de alta velocidad diseñada para acelerar el throughput de inferencia; encaja con stacks tipo vLLM para serving local de producción. Útil si estás optimizando latencia/costo de serving. OSSInsight — Trending AI

    OSSInsight — Trending AI vLLM

  59. Grok Build (xAI) — agente de coding open-source

    xAI liberó el CLI/TUI que corre el mismo loop de agente detrás de su stack de coding. Suma a la ola de "harnesses" de agentes que domina GitHub este mes (junto a bytedance/deer-flow para tareas de largo horizonte). Vale probarlo si estás armando scaffolding de agentes de coding. Analytics Vidhya

    Analytics Vidhya xAI GitHub Grok

  60. MCP como primitiva de facto

    El tooling de Model Context Protocol sigue generando tracción: servidores especializados que dan a los agentes control de sistemas locales, browsers y librerías de skills (p. ej. DesktopCommanderMCP, y el inspector oficial para testear servidores MCP). Si construís agentes, skills + memoria + sandboxing + MCP ya son ciudadanos de primera clase. Build Fast with AI

    Build Fast with AI MCP

  61. Patrón práctico: AI gateway / routing multi-modelo

    Reforzado hoy por el consejo de Nadella: una capa de abstracción que rutee cada request al modelo mejor para la tarea (por costo, capacidad y capability) es la estrategia de resiliencia del momento, dado que ningún modelo único es la elección permanente para todo. Build Fast with AI

    Build Fast with AI

  62. Correr Kimi K3 localmente: MXFP4 y llama.cpp

    Con los pesos abiertos de Kimi K3 ya publicados (~1,4 TB en MXFP4), la comunidad está armando guías para self-hosting. La ruta práctica: GGUF + llama.cpp (sin paso extra de conversión/cuantización, se apunta el server al archivo) o vLLM/SGLang para serving. El Hub de Hugging Face (org ggml-org) concentra las conversiones oficiales. Accionable para quien quiera evaluar un frontier open-weight sin depender de API. explainx · dev.to — guía inference tools

    explainx dev.to — guía inference tools Hugging Face Kimi vLLM llama.cpp

  63. Hugging Face transformers v5.13.0 se alinea con la última vLLM

    El release trae fixes de generación, attention, cache, cuantización y serving orientados a habilitar transformers con la versión más reciente de vLLM. Útil si servís modelos y venías peleando compatibilidades entre ambas libs. Nota de ecosistema: TGI está en modo mantenimiento y redirige a vLLM, SGLang, llama.cpp y MLX. Releasebot — Hugging Face

    Releasebot — Hugging Face Hugging Face vLLM llama.cpp

  64. OpenViking: base de contexto "self-evolving" para agentes (memoria + RAG + skills)

    Entre lo que está explotando en GitHub Trending de julio, el proyecto de Volcengine unifica memoria de agente, RAG de conocimiento y skills en una sola base de contexto que se auto-actualiza. Interesante como scaffolding de memoria para agentes de larga duración. Analytics Vidhya — Top GitHub repos julio 2026

    Analytics Vidhya — Top GitHub repos julio 2026 GitHub

  65. Hilo 3

    OpenManus y el auge del tooling de agentes/MCP

    El foco de la comunidad se corrió de "mejores LLMs" a "mejores apps de IA": frameworks agénticos, servidores MCP y dev-tools. OpenManus (FoundationAgents) se posiciona como alternativa totalmente abierta a los sistemas de agentes cerrados, y OpenWiki (equipo de LangChain) es una CLI que genera y mantiene documentación "AI-friendly" de tu codebase automáticamente. Analytics Vidhya · Startup Corners — GitHub Trending

    Analytics Vidhya Startup Corners — GitHub Trending GitHub MCP

  66. Paper: MosaicKV — compresión dinámica 2D del KV cache para long-context

    Un arXiv reciente aborda el serving de LLMs de contexto largo con compresión dinámica del KV cache en dos dimensiones, apuntando a bajar el costo de memoria de inferencia sin degradar demasiado la calidad. Relevante para quien sirve modelos con ventanas grandes y pelea con el peso del KV cache. arXiv — listado cs.CL

    arXiv — listado cs.CL

  67. "Unhobbling" en Claude Code: menos prompt, igual (o mejor) rendimiento

    El mismo día del lanzamiento de Opus 5 (24/07), el equipo de Claude Code publicó que removieron >80% del system prompt para Opus 5 y Fable 5 sin pérdida medible en evals de código. La lección de context engineering: no se trata de mejores few-shots sino de borrar restricciones que hoy generan instrucciones en conflicto y desperdician tokens. Accionable para cualquiera que mantenga prompts de agentes largos. explainx · anthropic

    explainx anthropic Claude Claude Code

  68. TurboQuant: compresión de KV cache sin calibración

    Técnica que comprime la KV cache usando coordenadas polares y reduce el uso de memoria hasta 6x con mínima pérdida de exactitud. Es online y calibration-free, ideal para inferencia en vivo y contextos largos —relevante justo cuando modelos como Kimi K3 empujan ventanas de 1M. dev.to

    dev.to Kimi

  69. OpenWiki (LangChain): documentación "AI-friendly" automática

    CLI que genera y mantiene documentación de tu codebase pensada para que agentes de IA naveguen y mantengan el proyecto. Útil para equipos que ya trabajan con agentes de código sobre repos grandes. analyticsvidhya

    analyticsvidhya

  70. OpenClaw sigue explotando en GitHub

    El asistente agéntico autohospedado (corre en tu infraestructura, se conecta nativamente a 50+ herramientas como WhatsApp, Slack o Discord sin enrutar datos por APIs externas) pasó de ~9k a +382k estrellas en 2026. Opción interesante si te importa mantener los datos on-prem. fungies · analyticsvidhya

    fungies analyticsvidhya GitHub

  71. "Harness engineering" se consolida como disciplina propia

    El término separa cuatro capas que se venían mezclando —prompt engineering, context engineering, loop engineering y harness engineering— y ya tiene guías consolidadas y listas curadas. El modelo de referencia que circula descompone un harness en ~15 módulos (instruction manager, context builder, model adapter, tool registry, permission resolver) más un loop agéntico canónico con presupuestos, disparadores de compactación y condiciones de parada. Si estás armando agentes en producción, es el vocabulario que conviene adoptar. Anthropic — Effective harnesses for long-running agents · awesome-harness-engineering · ExplainX — context vs prompt vs loop vs harness

    Anthropic — Effective harnesses for long-running agents awesome-harness-engineering ExplainX — context vs prompt vs loop vs harness Anthropic

  72. El contexto como presupuesto de memoria, no como depósito

    La práctica que más tracción está ganando: tratar la ventana de contexto como memoria de trabajo con presupuesto, y puentear entre sesiones con un archivo de progreso persistente (claude-progress.txt o equivalente) junto al historial de git, en vez de intentar meter todo en una sola ventana. Se combina con la división en agentes especializados —Planner que expande el prompt en un spec, Generator que implementa, Evaluator que testea y devuelve feedback. Anthropic · Harness Engineering Best Practices (gist)

    Anthropic Harness Engineering Best Practices (gist) Anthropic

  73. Hilo 3

    Repos que están explotando: DeerFlow 2.0, OpenWiki y Strix

    DeerFlow sacó un rewrite desde cero en la v2.0 y llegó al #1 de GitHub Trending. OpenWiki, del equipo de LangChain, es un CLI que genera y mantiene documentación pensada para que la lean agentes, no humanos. Strix es una herramienta open-source de pentesting con IA que valida vulnerabilidades con PoCs reales e incluye proxy HTTP, sandbox de Python e integración con CI/CD. El patrón de julio: el centro de gravedad se movió de los modelos a la infraestructura de agentes. Analytics Vidhya · OSSInsight — trending AI

    Analytics Vidhya OSSInsight — trending AI GitHub

  74. TurboQuant: compresión de KV cache en coordenadas polares

    La técnica logra reducir hasta 6x el uso de memoria del KV cache con pérdida mínima de precisión, alcanzando 2,5-3,5 bits efectivos y sin necesidad de calibración; algunas implementaciones reportan 8x de speedup en el cómputo de logits de atención sobre H100. Complementa el camino ya conocido de Marlin, que corre pesos GPTQ 2,5x más rápido solo por kernels CUDA optimizados. Ganancias de inferencia sin tocar el modelo. dasroot — Inference Engine Showdown

    dasroot — Inference Engine Showdown

  75. AgenticDataBench: benchmark para agentes de datos

    Cubre 15 dominios y cinco casos de uso reales de fintech B2B, evaluando flujos de data science realistas con etiquetas de grano fino, y viene con testbed en GitHub y dataset en Hugging Face para reproducir las tareas. Útil si estás midiendo agentes que tocan datos reales en vez de solo código. Let's Data Science

    Let's Data Science Hugging Face GitHub