Temas · Categoría
Técnicas y repos
Seguir solo técnicas y repos por RSS
- Noticias
- 80
- Briefings
- 20
- Última
-
DeepSeek libera Harness v0.1: "todo es un plugin", licencia MIT
Lo más accionable del día. DeepSeek abrió en developer preview un harness de agentes completo y ejecutable — no otro anuncio de modelo — construido sobre su meta-framework Cordis. Cada capacidad es un plugin intercambiable: modelos, herramientas, skills, sesiones, sandboxes, storage, loops, scheduling y hasta la UI, todo configurable sin tocar el código fuente. Se levanta con npx @deepseek-ai/dsh web. Es explícitamente una preview con cambios que rompen compatibilidad, así que no para producción todavía, pero si estás armando scaffolding de agentes vale la pena leer cómo separaron las capas. Fue el #2 de Hacker News el 13 de agosto. deepseek.com/harness · GitHub · The New Stack
-
El writeup técnico de Cerebras sobre cómo sirven GPT-5.6 Sol a 750 tok/s
Más allá del anuncio comercial, el post de ingeniería explica la apuesta contraria al consenso: la inferencia en modelos grandes está limitada por ancho de banda de memoria, así que en lugar de optimizar el movimiento de pesos los meten enteros en 44 GB de SRAM por wafer y pipelinean las capas del modelo entre wafers, con los tokens fluyendo sin interrupción. Lectura obligada si estás pensando en serving y en el trade-off latencia/costo/calidad. Cerebras
-
Terminal-Bench 2.1 y DeepSWE se consolidaron como la vara real
Vale la pena notar el patrón: los tres releases de la semana (Gemini 3.7 Flash, DeepSeek V4 Pro, GPT-5.6 Sol) se comparan entre sí en DeepSWE, FrontierCode y Terminal-Bench 2.1, no en MMLU ni en benchmarks académicos saturados. Terminal-Bench v2 son 89 tareas en entornos de shell reales cubriendo ingeniería de software, ML, seguridad y data science; hoy GPT-5.6 Sol lidera con 89.5% y Claude Opus 5 queda en 89.1%. Si estás evaluando modelos para trabajo agéntico, esa es la tabla a mirar. Leaderboard de agentes de código (agosto 2026)
Leaderboard de agentes de código (agosto 2026) DeepSeek GPT Claude Gemini
-
Comparativa práctica: un prompt, 11 modelos, resultados distintos
Netlify publicó un experimento simple y honesto sobre cuánto divergen los modelos ante el mismo prompt — útil como recordatorio de que el "mejor modelo" depende de la tarea y de que conviene probar antes de casarse con uno. Estuvo entre lo más leído de Hacker News el 13 de agosto. Discusión en HN (con link al post original)
-
Grok 4.6 para agent builders: nuevo nivel xhigh de reasoning_effort y disponibilidad amplia
El parámetro reasoning_effort ahora soporta low/medium/high/xhigh; el modelo está disponible vía API, Cursor, Grok Build y OpenRouter a US$2/US$6 por millón de tokens (variante rápida al doble). Con 500K de contexto y RL específico en entornos de coding y CAD, es candidato directo para harnesses de agentes de larga duración — vale la pena A/B-testearlo contra tu modelo actual en tareas multi-paso. MarkTechPost · dev.to (benchmarks y pricing)
-
Agent Plugins v1.0.0: el estándar de plugins para agentes ya es implementable
(working draft publicado el 11/8, con adopción moviéndose en las últimas horas). Especificación con schemas JSON canónicos, guías para autores y clientes, y matriz de compatibilidad que abarca OpenAI, AWS, Cursor, GitHub y VS Code. Si mantenés tooling para agentes, es el momento de revisar el draft y validar tus manifests contra los schemas. explainx.ai - Sin más novedades verificables de las últimas 24h en esta categoría. Contexto de la semana: en GitHub trending siguen dominando los visual builders de agentes (Langflow, Dify, Flowise) y crece la acción Claude Code Security Review de Anthropic para revisar PRs con Claude. OSSInsight · startupcorners (digest 9/8) --- Fuentes agregadoras usadas para ítems sin cobertura primaria accesible: Tech Startups (13/8), que cita Reuters, Bloomberg, WSJ, FT, SecurityWeek y TNW. Ítems no verificables u older de 24h fueron omitidos.
explainx.ai OSSInsight startupcorners (digest 9/8) OpenAI Anthropic Amazon GitHub Claude Claude Code
-
Correr Muse Glimmer 30B local como motor de agentes
Lo más accionable de las últimas 24h: la colección de Hugging Face trae pesos BF16, GGUF k-quants (de Unsloth, publicados ayer), builds de ExecuTorch y el drafter DFlash para speculative decoding. Con ~20 GB corre en una GPU de consumo o Mac dentro de un loop de agente real, sin llamadas de red. Si querés agentes locales con tool use y 131K de contexto, es el candidato a probar hoy. Fuentes: VentureBeat, explainx.
-
NVIDIA publica Nemotron 3.5 Lightning y NeMo Switchyard
Nemotron 3.5 Lightning es un modelo de alta eficiencia para cargas agénticas; Switchyard es una librería open source de routing inteligente entre modelos dentro de herramientas de agentes populares — útil si querés enrutar tareas baratas a modelos chicos y reservar el modelo grande para lo difícil. Fuente: The Daily Commit (11/8).
-
GPT-5.6-Cyber como herramienta práctica para equipos de seguridad
Si trabajás en seguridad ofensiva/defensiva autorizada, el acceso vía Daybreak Red habilita flujos que los modelos generales bloquean (validación de exploits, revisión profunda de código, respuesta a incidentes). Requiere verificación como defensor aprobado. Fuente: Releasebot. Nota: no encontré más material verificable de las últimas 24h para esta sección (los digests de GitHub Trending más recientes son del 9/8, fuera de ventana), así que preferí no rellenar.
-
antirez publicó h3.c: inferencia nativa de MiniMax H3 en Apple Silicon
Salvatore Sanfilippo (creador de Redis) lanzó una implementación from-scratch en Metal 4 del modelo de generación de video MiniMax H3. En una M5 Max renderiza clips de 512×512 y 22 frames en ~12,6 s (u ~8 s con reuso de velocity 3×), con pico de ~25,9 GiB usando cuantización int8 de activaciones y kernels fusionados. Referencia excelente si te interesa inferencia local optimizada a mano. GitHub
-
Evo-Bench: el primer benchmark que mide si un LLM puede mejorar su propio harness de agente
Aísla la capacidad del modelo de optimizar autónomamente su scaffolding en dominios Search, Office y General. En nueve modelos frontier y open-weight, los mejores logran ganancias absolutas de hasta 16,6 puntos, casi igualando harnesses diseñados por humanos en Search y General — pero se estancan en workflows de Office. Útil si estás construyendo agentes que se auto-mejoran. Paper (HF)
-
SWE-Bench ProMax: nuevo benchmark multilenguaje de refactoring donde el mejor modelo saca 41,2%
Son 170 tareas curadas por expertos en Python, Java, TypeScript, Go, C, C++ y Rust, con un promedio de 11,4 archivos modificados por tarea. Los autores reescribieron cada issue y revisaron los test suites a mano, corrigiendo los tests defectuosos que una auditoría reciente encontró en el 60% de las instancias no resueltas de SWE-Bench Verified. Recalibra qué tan lejos están los agentes de coding del trabajo real. Paper (HF)
-
Dan Luu: el lenguaje de programación casi no predice el costo de un coding agent
Desafía el claim viral de que los lenguajes dinámicos dan una gran ventaja de eficiencia de tokens: corriendo los mismos agentes en tareas realistas (decoder de Zstd, Pandoc), la brecha de 2,6× entre C y Clojure reportada en problemas triviales desaparece a mayor dificultad. Lo que sí correlaciona con éxito es la popularidad del lenguaje. Dato útil antes de elegir stack "para agentes". danluu.com
-
Metodología para inferir el training run real de modelos frontier
Shrivu Shankar publicó una técnica de probing con quizzes de hechos históricos y auto-identificación que revela que los Opus 4.7+ de Anthropic comparten un cutoff de fines de diciembre 2025 (probablemente un mismo run), que la familia GPT-5.6 se agrupa en un checkpoint de febrero 2026, y que Opus 5 tiene un estado de conocimiento más viejo (~enero 2026) que su cutoff publicado de mayo. Interesante para entender qué hay realmente detrás de los model cards. blog.sshh.io
-
Docker Sandboxes: entornos descartables y aislados para agentes de IA
(portada de HN hoy, 346 puntos). Docker lanzó un producto para correr agentes con acceso a shell y filesystem dentro de sandboxes efímeros, atacando el problema #1 de los agentes autónomos: ejecutar código generado por el modelo sin exponer tu máquina. Si corrés agentes tipo Claude Code u OpenClaw en local, es una capa de aislamiento lista para usar. Docker · HN (214 comentarios)
-
semantica: infraestructura graph-native para contexto y auditoría de agentes, #1 en GitHub Trending
(hoy). Se autodefine como "el Palantir open source para agentes": construye knowledge graphs con provenance W3C PROV-O, registra cada decisión del agente como nodo consultable (record_decision, trace_decision_chain) y razona en forma determinística sin LLM. Incluye MCP server y plugins para Claude Code, Cursor y Windsurf; apunta a dominios regulados donde "¿por qué decidió eso la IA?" tiene que tener respuesta auditable. pip install semantica. GitHub
-
Prime Agent (PrimeIntellect): agente RLM auto-mejorable para tareas largas
(trending hoy). Open source (MIT), implementa el modelo Recursive Language Model: el contexto se trata como variables y los subagentes como llamadas a función dentro de un REPL de Python persistente. Lo distintivo es el "Continual Harness": con /refine el agente aplica mejoras pequeñas y con evidencia a sus prompts, memorias y skills, con rollback. Corre en daemon para trabajo de fondo y comunicación agente-a-agente. GitHub
-
"How I use LLMs to learn complex topics": workflow práctico que dominó HN
(716 puntos, últimas 24h). Un post con un método concreto para usar LLMs como tutor de temas complejos (descomposición, interrogación activa, verificación cruzada) que generó 460 comentarios con variantes y críticas. Útil como plantilla si usás modelos para estudio técnico. Post · HN
-
prime-agent (Prime Intellect) es de lo más caliente de GitHub trending hoy
Agente open source (MIT) de coding e investigación para tareas largas, construido sobre dos ideas: un Recursive Language Model que trata el contexto como variables y a los subagentes como llamadas a función dentro de un REPL de IPython persistente, y un "continual harness" que persiste memorias, skills y specs de subagentes como estado durable que el agente refina con updates chicos respaldados por evidencia. La v0.7.0 salió el 5-ago y el repo está en el top del trending de esta mañana (GitHub, OSSInsight). Si estás armando agentes long-running, vale la pena mirar el diseño del harness.
-
La fiebre de los agent skills sigue escalando: tres directorios en el trending
mattpocock/skills quedó #1 del Skill Leaderboard al 8-ago con skills de ingeniería (domain modeling, ADRs, code review contra specs), acompañado en el trending por google/skills (skills oficiales para productos Google) y addyosmani/agent-skills (24 bundles SKILL.md production-grade, 77k estrellas). Lo accionable: el formato SKILL.md ya es el estándar de facto entre harnesses — empaquetar tus workflows repetibles como skills es hoy la vía más barata de mejorar rendimiento de agentes.
mattpocock/skills Skill Leaderboard google/skills addyosmani/agent-skills Google
-
Tip práctico del día: convertí pasos repetibles de skills en scripts testeados, no en prompts
El TechBeat del 8-ago destaca esa guía: si un paso de un workflow de agente es determinístico, moverlo de instrucción en prompt a script testeado que el agente invoca reduce variancia y tokens (HackerNoon). Alineado con cómo están diseñados los harnesses tipo prime-agent: menos prosa en el contexto, más herramientas verificables.
-
cloudflare/computer: "dale una computadora a tu agente", no un contenedor
Cloudflare abrió @cloudflare/computer, un filesystem virtual que vive dentro de un Durable Object (estado autoritativo en SQLite) con superficie de ejecución pluggable. Trae tres backends: Container (FUSE mount real con un daemon computerd y userland Linux completo), Isolate shell (just-bash en un Dynamic Worker) e Isolate JavaScript (módulo ESM con node:fs/promises respaldado por el Workspace). Interesante para dar a los agentes un entorno de ejecución persistente y barato sin levantar contenedores completos. (GitHub, Cloudflare Blog)
-
Repos que explotan en GitHub Trending (7 ago)
Entre los que suben: cloudflare/computer (arriba), mattpocock/skills (skills reutilizables para agentes), firecrawl/pdf-inspector (librería Rust rápida que detecta PDFs escaneados vs. texto y extrae contenido) y TencentCloud/TencentDB-Agent-Memory (hub de memoria a nivel equipo que convierte conversaciones, docs y código en "memory assets" gobernados y compartidos entre agentes y frameworks). Buen material para probar en pipelines de agentes y RAG. (OSSInsight Trending AI)
-
Guía de Anthropic sobre harnesses para agentes de larga duración
Anthropic publicó "Effective harnesses for long-running agents", con prácticas accionables: mantener el archivo de instrucciones top-level corto (~100 líneas) como índice hacia un docs/ estructurado, guardar planes/specs en el directorio del proyecto para que el agente los referencie, y automatizar el setup del entorno con scripts de init para no gastar contexto en instalaciones. Aplicable directamente a scaffolding de agentes de coding. (Anthropic Engineering)
-
Técnica: consenso en inference-time para mitigar comportamientos ocultos del fine-tuning
El paper "Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning" (arXiv 2607.23394) propone entrenar varios modelos de referencia sobre datasets distintos y agregar sus distribuciones de próximo token en el decoding vía "consensus decoders" (un mínimo token-wise y una variante base-relative). Útil como defensa práctica frente a backdoors o sesgos introducidos por fine-tuning, sin re-entrenar. (Nota: es del 25 de julio; se incluye por su relevancia accionable ante los incidentes de seguridad de agentes de esta semana.) (arXiv)
-
Parcheá tus harnesses de agentes: fallas en AWS, Google y Vercel permitían disparar tools sin pasar por el modelo
Instrucciones forjadas podían llegar a las tools de un agente sin que ningún turno del modelo las autorizara — o sea, system prompts y guardrails nunca intervenían. Afectados: Bedrock AgentCore (InvokeHarness, ya corregido en el servicio), Google ADK para Python (corregido en 2.5.0) y Vercel @ai-sdk/harness-codex (fix en 1.0.29) / @ai-sdk/harness-opencode (1.0.28). Accionable: actualizá versiones y no expongas endpoints de harness a input no confiable. (6/8) The Hacker News
-
Qué está explotando en GitHub: agentes con memoria de equipo y skills
Entre lo más trending del día: cloudflare/computer, mattpocock/skills (framework de skills agénticas y metodología de desarrollo), TencentDB-Agent-Memory (hub de memoria de equipo que convierte chats, docs y código en cuatro activos reutilizables compartidos entre agentes) y DeepSeek-Reasonix (agente de coding para terminal diseñado alrededor de la estabilidad del prefix-cache). El patrón: memoria compartida y skills reutilizables como capa estándar del stack de agentes. (7/8) OSSInsight
-
Papers frescos de agentes en arXiv: runtimes de largo horizonte y memoria jerárquica
De los últimos dos días: "Argus", un runtime agéntico de propósito general para razonamiento de largo horizonte; "ABSeeker", que entrena agentes de búsqueda con asignación de crédito retropropagada desde la respuesta; y trabajos de memoria jerárquica en grafos con localización a nivel de paths. Útiles si estás armando agentes que corren horas: el cuello de botella ya no es el modelo sino el scaffolding de memoria y crédito. (5-6/8) arXiv cs.MA recent
-
"AI Recommendation Poisoning": botones "Ask AI" que alteran la memoria de tu asistente
Sitios comerciales están embebiendo prompts ocultos en deep links pre-llenados ("Ask AI"): al clickearlos logueado en ChatGPT, Claude, Gemini o Grok, la query se ejecuta sin confirmación y algunas instruyen al asistente a guardar el dominio del vendor como "fuente confiable", sesgando respuestas futuras. Microsoft ya catalogó 31 empresas haciéndolo. Accionable: desconfiá de esos botones y revisá periódicamente la memoria persistente de tus asistentes. (6/8) The Hacker News
-
JudgeArena: framework unificado para evaluación reproducible con LLM-as-judge
(paper, 5 ago). Ataca la fragmentación del ecosistema de benchmarks con jueces LLM: un marco común para correr y reproducir evaluaciones. Accionable si estás armando evals propios y querés comparabilidad entre modelos jueces. Fuente: arXiv:2608.02620.
-
"Beyond the Hivemind": meta-persona anchoring + temperature scaling secuencial contra la homogeneidad de LLMs
(paper, 5 ago). Propone dos técnicas concretas de prompting/decoding para escapar del efecto "hivemind" (respuestas convergentes y homogéneas entre modelos). Útil para generación creativa, datos sintéticos diversos y ensembles. Fuente: arXiv:2608.02618.
-
MemArena: benchmark ego-céntrico para asistentes con memoria personal on-device
(paper, 5 ago). Evalúa cómo manejan modelos open-weight la memoria agéntica sobre conversaciones privadas en el dispositivo — relevante si construís agentes con memoria persistente y te importa qué modelo local usar. Fuente: arXiv:2608.02613.
-
Tokens de n8n filtrados en GitHub daban acceso real a 321 instancias
(5 ago). GitGuardian encontró 4.576 tokens únicos en commits públicos; el 36% de las instancias alcanzables aceptaba al menos uno, exponiendo workflows y credenciales downstream (DBs, repos, cloud, servicios de IA). Práctica concreta: escanear secretos en CI, rotar tokens de n8n y restringir acceso de red a la instancia. Fuente: The Hacker News.
-
Simon Willison: un juego completo "one-shot" con Claude Fable 5
(post, 5 ago). Willison repitió su experimento de 2024 (GPT-3 + DALL-E) y generó un juego funcional de una sola pasada, buen ejemplo práctico de hasta dónde llegó la generación de código de una sola instrucción. Fuente: vía LLM Stats.
-
Microsoft Research libera Orchard, framework abierto para agentes a escala
Publicado el 4 de agosto. Su núcleo es Orchard Env, un servicio de entornos aislados sobre Kubernetes que permite entrenar y evaluar agentes dentro de los harnesses reales de deployment (Claude Code, Codex, OpenClaw), cerrando la brecha entrenamiento-producción. Incluye tres recetas (Orchard-SWE, Orchard-GUI, Orchard-Claw) con mejoras medibles en ingeniería de software, automatización de navegador y asistentes, y liberan datos de entrenamiento y métodos de eval completos. Accionable si hacés RL o evals de agentes sin depender de cloud propietario. Microsoft Research · AI Business
-
rust-lang/rust adopta política de LLMs: "analizar sí, crear no"
Publicada el 5 de agosto en el blog Inside Rust: cinco equipos del proyecto acordaron que los LLMs pueden usarse para "responder preguntas, analizar, destilar, refinar, chequear, sugerir, revisar" pero no para crear código en PRs al monorepo. No es postura oficial de todo el proyecto, pero es uno de los precedentes más claros de gobernanza de contribuciones con IA en open source de gran escala — probable plantilla para otros proyectos. Inside Rust Blog · Hacker News
-
OpenAI baja precios de GPT-5.6 y estrena "Fast mode" en la API
El 4 de agosto recortó los precios de GPT-5.6 Luna y Terra y lanzó un modo rápido para GPT-5.6 Sol en la API, además de ampliar el acceso enterprise en ChatGPT Work, Codex y la API. Accionable: si tenés pipelines sobre estos modelos, conviene rehacer el cálculo de costos y probar Fast mode donde la latencia manda. Releasebot — OpenAI updates --- Fuentes verificadas por búsqueda web el 2026-08-05. Nota: Qwen3.8-Max (Alibaba, 2.4T parámetros MoE) se lanzó el 3 de agosto — fuera de la ventana de 24h — con open weights prometidos para esta semana; vale la pena seguirlo.
-
Trending de hoy en agentes: yc-software/qm y cloudflare/computer
. qm ("multiplayer agent harness for work", +41k estrellas) apunta a coordinar varios agentes sobre trabajo compartido, y Cloudflare publicó computer, primitiva para darle a tu agente una computadora sandboxeada. Si estás armando scaffolding de agentes, los dos valen una mirada hoy. qm en Trendshift · cloudflare/computer
-
Memoria de equipo para agentes: TencentDB-Agent-Memory
. Hub de memoria a nivel equipo que convierte conversaciones, docs y código en cuatro activos reutilizables (Chat Memory, Skills, LLM-Wiki, Code-Graph) gobernados y compartidos entre agentes y frameworks. Interesante como patrón si tus agentes pisan el mismo contexto una y otra vez. Trendshift
-
Inferencia local en máquinas chicas vuelve al trending: AirLLM y DeepSeek-Reasonix
. AirLLM (70B en una GPU de 4GB, +30k estrellas) resurgió en el ranking diario, y DeepSeek-Reasonix es un coding agent de terminal diseñado alrededor de la estabilidad del prefix-cache — patrón a copiar: mantener el prefijo estable abarata y acelera sesiones largas de agente. AirLLM · DeepSeek-Reasonix
-
Deadline de migración: Moonshot da de baja kimi-k2.5 y todos los strings moonshot-v1 el 31/8
(confirmado 3/8). Quedan ~27 días: si tenés apps apuntando a esos model strings, migrá ya a los identificadores nuevos para evitar cortes. AI Agents News — semana del 3/8
-
Tooling de documentos para agentes: OfficeCLI y firecrawl/pdf-inspector
. OfficeCLI (binario único, open source) permite a agentes leer/editar Word, Excel y PowerPoint sin Office instalado, con soporte MCP; pdf-inspector (Rust, de Firecrawl) clasifica PDFs escaneados vs. de texto para rutear inteligentemente OCR vs. extracción directa — piezas útiles para pipelines de documentos. OfficeCLI · pdf-inspector
-
Meta AI usa un segundo agente como "memory coach" para tareas largas
Para evitar que los agentes olviden errores ya diagnosticados y repitan pasos fallidos, Meta introduce un agente de memoria separado que mantiene un banco estructurado y decide qué recordar durante tareas complejas. Patrón accionable de memory engineering para scaffolding de agentes multi-paso. The Decoder / feed LLM Stats
-
Tutorial práctico: reemplazar un proceso de booking con un agente LangGraph + Langfuse
Guía paso a paso para construir, correr y monitorear un agente de soporte con estado usando Python, LangGraph y Langfuse (observabilidad). Directamente reproducible para quien quiera pasar de PoC a un agente instrumentado. Planet AI / feed LLM Stats
-
Presence como referencia de "agente en producción"
Más allá de la noticia, el diseño de OpenAI Presence —razonamiento del modelo envuelto en políticas, testing/evals y reglas de escalado a humano— es una plantilla útil de mejores prácticas para llevar agentes a producción con guardrails y evaluación continua. OpenAI
-
Microsoft libera Flint, un lenguaje de gráficos pensado para que los LLMs los generen sin romperse
Microsoft Research publicó Flint, un DSL open source de visualización posicionado como reemplazo de Vega-Lite y diseñado para que los modelos generen gráficos de forma confiable a partir de datos tabulares. La propuesta: gramática más corta, menos overhead de tokens y rendering predecible cuando el modelo compone vistas al vuelo. Accionable para cualquiera que arme dashboards o reporting con agentes. (microsoft.github.io)
-
β-OPSD: generaliza el self-distillation on-policy y mejora razonamiento matemático sin RL caro
Investigadores de la Universidad de Maryland reformulan el on-policy self-distillation (OPSD) como el caso β=1 de una familia más amplia que ajusta el ancla KL entre las políticas de estudiante, referencia y profesor. El óptimo cerrado se convierte en una mezcla de logits usada como target de destilación, evitando RL costoso, con mejoras consistentes de estabilidad y accuracy en benchmarks de matemática sobre el OPSD estándar. (huggingface.co)
-
Un paper reencuadra el diseño de routers MoE: los co-expertos interactúan, no se complementan
Zhejiang University y Hong Kong PolyU introducen un Expert Subspace Separation Index y un protocolo factorial 2x2 que muestra que los expertos co-seleccionados en Mixture-of-Experts no aportan direcciones de representación distintas, como se suele asumir. Intervenciones con ruta congelada exponen un "solapamiento coherente" donde candidatos fuertes interactúan negativamente: útil para repensar el diseño de routers sparse tipo Mixtral/DeepSeek. (huggingface.co)
-
Fairness Pruning: 40 neuronas alcanzan para mover el sesgo demográfico en LLMs de 3B
Un nuevo paper muestra que poner en cero apenas 40 neuronas (0,031% del ancho de MLP en modelos de hasta 3B) mueve de forma medible el sesgo demográfico conservando el 99,49% de la capacidad general. La intervención produce una "desestabilización" bidireccional del sesgo más que una reducción limpia, porque captura magnitud y no dirección: señal interesante para equipos de interpretabilidad y alignment que exploran circuitos disociables. (huggingface.co)
-
El "unhobbling" del prompt como técnica: menos contexto, mismo rendimiento
Sigue ganando tracción la práctica que Anthropic aplicó con Opus 5/Fable 5 —recortar más del 80% del system prompt de Claude Code sin pérdida medible en evals de código—. La lección accionable: en agentes de producción, borrar restricciones y few-shots redundantes suele mejorar más que agregar instrucciones, porque todo modelo frontier se degrada a medida que crece el contexto, mucho antes de llenar la ventana. explainx.ai · Developers Digest
-
GitHub trending: la carrera se movió del modelo a la infraestructura de agentes
El tema dominante en las listas de julio es la orquestación de agentes autónomos —fleets de agentes, servidores MCP, gateways de IA y harnesses de coding— más que nuevos modelos base. Práctica recomendada para quien construye: estandarizar sobre MCP y sumar sandboxing/gobernanza temprano, dado el riesgo operacional de dar a los agentes acceso a sistemas reales. Analytics Vidhya · OSSInsight
-
Regla práctica para tool use: menos herramientas por agente
Guías recientes de context engineering convergen en un límite claro: OpenAI recomienda menos de 20 herramientas por agente, con la precisión degradándose ya pasadas las 10. Combinado con el formato Agent Skills (adoptado por OpenAI, Google, GitHub y Cursor), el patrón es componer capacidades en skills cargadas bajo demanda en vez de inflar el set de tools. Towards AI · Sourcegraph
-
AWS congela Bedrock Agents "Classic" para nuevos clientes
Desde el 30 de julio, Amazon renombró su servicio a Bedrock Agents Classic y lo cerró a nuevas cuentas (bloquea CreateAgent e InvokeInlineAgent y congela el catálogo de modelos), empujando a AgentCore como el camino para agentes de producción. Si construís sobre AWS, conviene auditar qué workloads siguen en Classic y empezar a testear los flujos equivalentes en AgentCore. (AI Agent Store)
-
Crogl libera un agente SOC autónomo gratis
Crogl puso su Enterprise AI SOC Agent como descarga gratuita, desplegable en minutos dentro del propio entorno (incluso on-prem y air-gapped), sin normalización de esquemas: investiga alertas, hace threat hunting y documenta cada paso manteniendo al analista humano en control. Buen candidato para probar automatización agéntica sobre una cola de incidentes real sin lock-in de SaaS. (AI Agent Store)
-
Cequence suma controles zero-trust para agentes
Cequence Security liberó cuatro capacidades nuevas en su AI Gateway —AI Discovery, API Registry, LLM Registry y Skill Registry— más Agent Personas que atan la "descripción de puesto" de un agente a su modelo, tools y guardrails. AI Discovery descubre agentes, proveedores de IA y servidores MCP ya corriendo desde los logs existentes, y el API Registry permite que los agentes llamen APIs aprobadas sin manejar credenciales crudas. Útil para encontrar "shadow agents" en producción. (AI Agent Store)
-
Bedrock Data lanza "Agent DLP" para inspeccionar tool calls MCP
Nueva capacidad de prevención de pérdida de datos en runtime, pensada para agentes autónomos: se ubica inline en el gateway del agente e inspecciona bidireccionalmente las llamadas y respuestas de tools MCP en tiempo real, con integración nativa a AWS AgentCore y LiteLLM. Da visibilidad sobre qué datos sensibles salen hacia herramientas externas. (AI Agent Store)
-
Colibri: motor de inferencia en C puro que corre GLM-5.2 (744B) en ~25GB de RAM
Sin dependencias, streamea los "expertos" del MoE desde disco a demanda para correr un modelo enorme en una máquina de consumo. Interesante para quien quiera experimentar con MoE grandes sin GPU de datacenter. Analytics Vidhya – trending
-
deer-flow (ByteDance) y herdr: harnesses de agentes
deer-flow es un harness open-source de "super-agente" de largo horizonte para research/coding/creación con sandboxes y subagentes; herdr es un multiplexor que vive en la terminal para orquestar varios agentes en paralelo. Útiles como scaffolding para tareas agénticas multi-paso. Analytics Vidhya · OSSInsight trending
-
stitch-skills (Google Labs): librería de "Agent Skills" cross-tool
Skills que siguen el estándar abierto de Agent Skills, compatibles con Gemini CLI, Claude Code y Cursor — señal de que el stack agéntico se está consolidando alrededor de MCP + skills portables. Bueno para reutilizar capacidades entre herramientas. Analytics Vidhya
Analytics Vidhya Google Claude Gemini Claude Code Gemini CLI MCP
-
Guía práctica: tooling de inferencia local comparado (llama.cpp, Ollama, vLLM, SGLang)
Repaso actualizado a julio de cuándo conviene cada motor para servir modelos localmente — referencia útil para decidir stack de serving según throughput vs. simplicidad. DEV Community
-
Colibri: correr un MoE de 744B en una máquina de consumo
Un motor de inferencia diminuto y en C puro que permite ejecutar GLM-5.2 (744B de parámetros MoE) en ~25 GB de RAM. Es lo más accionable para quien quiera experimentar con modelos grandes localmente sin depender de la nube. OSSInsight — Trending AI
-
LMCache: más throughput en inferencia LLM
Capa de KV cache de alta velocidad diseñada para acelerar el throughput de inferencia; encaja con stacks tipo vLLM para serving local de producción. Útil si estás optimizando latencia/costo de serving. OSSInsight — Trending AI
-
Grok Build (xAI) — agente de coding open-source
xAI liberó el CLI/TUI que corre el mismo loop de agente detrás de su stack de coding. Suma a la ola de "harnesses" de agentes que domina GitHub este mes (junto a bytedance/deer-flow para tareas de largo horizonte). Vale probarlo si estás armando scaffolding de agentes de coding. Analytics Vidhya
-
MCP como primitiva de facto
El tooling de Model Context Protocol sigue generando tracción: servidores especializados que dan a los agentes control de sistemas locales, browsers y librerías de skills (p. ej. DesktopCommanderMCP, y el inspector oficial para testear servidores MCP). Si construís agentes, skills + memoria + sandboxing + MCP ya son ciudadanos de primera clase. Build Fast with AI
-
Patrón práctico: AI gateway / routing multi-modelo
Reforzado hoy por el consejo de Nadella: una capa de abstracción que rutee cada request al modelo mejor para la tarea (por costo, capacidad y capability) es la estrategia de resiliencia del momento, dado que ningún modelo único es la elección permanente para todo. Build Fast with AI
-
Correr Kimi K3 localmente: MXFP4 y llama.cpp
Con los pesos abiertos de Kimi K3 ya publicados (~1,4 TB en MXFP4), la comunidad está armando guías para self-hosting. La ruta práctica: GGUF + llama.cpp (sin paso extra de conversión/cuantización, se apunta el server al archivo) o vLLM/SGLang para serving. El Hub de Hugging Face (org ggml-org) concentra las conversiones oficiales. Accionable para quien quiera evaluar un frontier open-weight sin depender de API. explainx · dev.to — guía inference tools
explainx dev.to — guía inference tools Hugging Face Kimi vLLM llama.cpp
-
Hugging Face transformers v5.13.0 se alinea con la última vLLM
El release trae fixes de generación, attention, cache, cuantización y serving orientados a habilitar transformers con la versión más reciente de vLLM. Útil si servís modelos y venías peleando compatibilidades entre ambas libs. Nota de ecosistema: TGI está en modo mantenimiento y redirige a vLLM, SGLang, llama.cpp y MLX. Releasebot — Hugging Face
-
OpenViking: base de contexto "self-evolving" para agentes (memoria + RAG + skills)
Entre lo que está explotando en GitHub Trending de julio, el proyecto de Volcengine unifica memoria de agente, RAG de conocimiento y skills en una sola base de contexto que se auto-actualiza. Interesante como scaffolding de memoria para agentes de larga duración. Analytics Vidhya — Top GitHub repos julio 2026
-
OpenManus y el auge del tooling de agentes/MCP
El foco de la comunidad se corrió de "mejores LLMs" a "mejores apps de IA": frameworks agénticos, servidores MCP y dev-tools. OpenManus (FoundationAgents) se posiciona como alternativa totalmente abierta a los sistemas de agentes cerrados, y OpenWiki (equipo de LangChain) es una CLI que genera y mantiene documentación "AI-friendly" de tu codebase automáticamente. Analytics Vidhya · Startup Corners — GitHub Trending
Analytics Vidhya Startup Corners — GitHub Trending GitHub MCP
-
Paper: MosaicKV — compresión dinámica 2D del KV cache para long-context
Un arXiv reciente aborda el serving de LLMs de contexto largo con compresión dinámica del KV cache en dos dimensiones, apuntando a bajar el costo de memoria de inferencia sin degradar demasiado la calidad. Relevante para quien sirve modelos con ventanas grandes y pelea con el peso del KV cache. arXiv — listado cs.CL
-
"Unhobbling" en Claude Code: menos prompt, igual (o mejor) rendimiento
El mismo día del lanzamiento de Opus 5 (24/07), el equipo de Claude Code publicó que removieron >80% del system prompt para Opus 5 y Fable 5 sin pérdida medible en evals de código. La lección de context engineering: no se trata de mejores few-shots sino de borrar restricciones que hoy generan instrucciones en conflicto y desperdician tokens. Accionable para cualquiera que mantenga prompts de agentes largos. explainx · anthropic
-
TurboQuant: compresión de KV cache sin calibración
Técnica que comprime la KV cache usando coordenadas polares y reduce el uso de memoria hasta 6x con mínima pérdida de exactitud. Es online y calibration-free, ideal para inferencia en vivo y contextos largos —relevante justo cuando modelos como Kimi K3 empujan ventanas de 1M. dev.to
-
OpenWiki (LangChain): documentación "AI-friendly" automática
CLI que genera y mantiene documentación de tu codebase pensada para que agentes de IA naveguen y mantengan el proyecto. Útil para equipos que ya trabajan con agentes de código sobre repos grandes. analyticsvidhya
-
OpenClaw sigue explotando en GitHub
El asistente agéntico autohospedado (corre en tu infraestructura, se conecta nativamente a 50+ herramientas como WhatsApp, Slack o Discord sin enrutar datos por APIs externas) pasó de ~9k a +382k estrellas en 2026. Opción interesante si te importa mantener los datos on-prem. fungies · analyticsvidhya
-
"Harness engineering" se consolida como disciplina propia
El término separa cuatro capas que se venían mezclando —prompt engineering, context engineering, loop engineering y harness engineering— y ya tiene guías consolidadas y listas curadas. El modelo de referencia que circula descompone un harness en ~15 módulos (instruction manager, context builder, model adapter, tool registry, permission resolver) más un loop agéntico canónico con presupuestos, disparadores de compactación y condiciones de parada. Si estás armando agentes en producción, es el vocabulario que conviene adoptar. Anthropic — Effective harnesses for long-running agents · awesome-harness-engineering · ExplainX — context vs prompt vs loop vs harness
Anthropic — Effective harnesses for long-running agents awesome-harness-engineering ExplainX — context vs prompt vs loop vs harness Anthropic
-
El contexto como presupuesto de memoria, no como depósito
La práctica que más tracción está ganando: tratar la ventana de contexto como memoria de trabajo con presupuesto, y puentear entre sesiones con un archivo de progreso persistente (claude-progress.txt o equivalente) junto al historial de git, en vez de intentar meter todo en una sola ventana. Se combina con la división en agentes especializados —Planner que expande el prompt en un spec, Generator que implementa, Evaluator que testea y devuelve feedback. Anthropic · Harness Engineering Best Practices (gist)
Anthropic Harness Engineering Best Practices (gist) Anthropic
-
Repos que están explotando: DeerFlow 2.0, OpenWiki y Strix
DeerFlow sacó un rewrite desde cero en la v2.0 y llegó al #1 de GitHub Trending. OpenWiki, del equipo de LangChain, es un CLI que genera y mantiene documentación pensada para que la lean agentes, no humanos. Strix es una herramienta open-source de pentesting con IA que valida vulnerabilidades con PoCs reales e incluye proxy HTTP, sandbox de Python e integración con CI/CD. El patrón de julio: el centro de gravedad se movió de los modelos a la infraestructura de agentes. Analytics Vidhya · OSSInsight — trending AI
-
TurboQuant: compresión de KV cache en coordenadas polares
La técnica logra reducir hasta 6x el uso de memoria del KV cache con pérdida mínima de precisión, alcanzando 2,5-3,5 bits efectivos y sin necesidad de calibración; algunas implementaciones reportan 8x de speedup en el cómputo de logits de atención sobre H100. Complementa el camino ya conocido de Marlin, que corre pesos GPTQ 2,5x más rápido solo por kernels CUDA optimizados. Ganancias de inferencia sin tocar el modelo. dasroot — Inference Engine Showdown
-
AgenticDataBench: benchmark para agentes de datos
Cubre 15 dominios y cinco casos de uso reales de fintech B2B, evaluando flujos de data science realistas con etiquetas de grano fino, y viene con testbed en GitHub y dataset en Hugging Face para reproducir las tareas. Útil si estás midiendo agentes que tocan datos reales en vez de solo código. Let's Data Science