El Compilado Hilos Temas Archivo RSS

Temas · modelo

Claude Code

Seguir Claude Code por RSS

Noticias
65
Briefings
49
Primera
Última
  1. Técnicas y repos

    Repos: mattpocock/skills sumó 736 estrellas en el día con un set de skills sobre disciplina de ingeniería, no sobre generar código (30/09)

    La tesis del repo es que los agentes fallan siempre por lo mismo: arrancan desalineados, escriben de más, dejan bugs y degradan la arquitectura. Las skills atacan cada una de esas: /grill-me interroga al usuario hasta que el objetivo está claro antes de tocar código, /tdd arma el ciclo de test primero, y hay skills invocadas por el modelo para debugging, revisión y mejora de arquitectura, más herramientas de modelado de dominio que bajan la verbosidad estableciendo vocabulario compartido. Funciona con Claude Code, Codex y otros agentes, y se instala como plugin de Claude Code o con npx skills@latest add mattpocock/skills si se prefieren los archivos editables. GitHub

    GitHub GitHub Claude

  2. Técnicas y repos

    SoL-Pi: Nvidia bajó entre 44,7% y 49% el consumo de tokens de un agente de código optimizando el harness, no el modelo (26/09)

    El harness es la capa de control que decide cómo el agente percibe el estado, ejecuta acciones y digiere el feedback, y acá un agente de investigación exploró 152 variantes en más de 3.000 corridas sobre 535 entornos ejecutables, 495 pares issue-PR de GitHub y 40 casos sintéticos. Salieron cuatro mecanismos concretos y copiables: Action Fusion, que junta pasos consecutivos en una sola llamada; Online Context Compact, que recorta el contexto acumulado solo; ObservationPack, que archiva salidas de herramientas dejando un resumen corto; y un reductor que destila logs de error con modelos más baratos preservando la evidencia. El ahorro declarado va de 8,75 a 13,50 dólares por hora contra Codex o Claude Code. El asterisco importa: midieron sobre EdgeBench con 40 tareas reservadas, y en Terminal-Bench 4 sobre CPU el rendimiento empeora, con resultados mezclados en verificación formal en Lean 4. The Decoder · arXiv

    The Decoder arXiv GitHub Nvidia Claude

  3. Técnicas y repos

    Skills: mattpocock/skills sumó 583 estrellas y superpowers otras 468, los dos apuntando al mismo hueco (26/09)

    El primero son unas 20 skills MIT que su autor usa a diario —TDD, revisión de código, debugging, análisis de arquitectura, escritura de specs— cada una con su SKILL.md, instalables como plugin de Claude Code o con npx skills@latest add mattpocock/skills. superpowers va más lejos y codifica una metodología completa: RED-GREEN-REFACTOR, planificación en tareas de 2 a 5 minutos, desarrollo por subagentes y verificación por evidencia en vez de por suposición, con las skills activándose solas según contexto. Corre en Claude Code, Codex, Cursor, Gemini CLI y Copilot CLI, así que se puede probar sin cambiar de herramienta. mattpocock/skills · superpowers

    mattpocock/skills superpowers Claude Gemini GitHub Copilot Gemini CLI

  4. Técnicas y repos

    AX duplicó sus estrellas en un día y arrastró consigo al runtime que tiene debajo (22/09)

    Sigue de ayer: el orquestador de agentes de Google pasó de unas 3.700 estrellas a 6.888, con 2.324 sumadas hoy, y es el que más crece en las tendencias de GitHub por estrellas del día. Lo nuevo es que Agent Substrate, la pieza sobre la que AX ejecuta los sandboxes, quedó segunda con 498 estrellas hoy, y ahí están los números que explican el diseño: promete diez veces más densidad que un runtime de contenedores estándar, reanudaciones por debajo de 500 milisegundos y más de 500 activaciones de suspensión y reanudación por segundo, con aislamiento de kernel y de red de confianza cero sobre microVMs o gVisor. La apuesta de fondo es que las aplicaciones tipo agente están ociosas la mayor parte del tiempo, así que se puede multiplexar mucho: la demo muestra unos 250 actores con estado repartidos sobre apenas 8 pods de Kubernetes. Es agnóstico del harness, y soporta explícitamente Claude Code, Codex, ADK, LangChain y servidores MCP como actores sandboxeados. GitHub / ax · GitHub / Agent Substrate

    GitHub / ax GitHub / Agent Substrate Google GitHub Claude MCP

  5. IA

    Qwen sacó Qwen3.8-Omni-Flash, su primer multimodal pensado para agentes, a una quinta parte del precio de Gemini Flash (19/09)

    Procesa audio y video juntos, saca conclusiones y usa herramientas por su cuenta para editar vlogs, traducir videos cortos o resumir películas, con una ventana de contexto de un millón de tokens. En tareas de audio y video, Qwen dice que queda cerca de Gemini 3.8 Flash. El dato que importa es el precio: 0,15 dólares por millón de tokens de entrada y 0,47 de salida, contra 0,75 y 3,75 de Gemini 3.8 Flash, que además duplica tarifas el 1 de enero de 2027. Qwen estima menos de un centavo por hora de audio de entrada y unos 0,20 por video 720p con audio a un cuadro por segundo. Además liberó Qwen-MM-Plugins, que le suman edición de video, reconocimiento de hablante y notas en PDF de videos a agentes como Claude Code, Gemini CLI y Qwen Code, y Qwen-Live Harness para interacción en vivo con cámara y micrófono. The Decoder · Qwen

    The Decoder Qwen Claude Gemini Qwen Gemini CLI

  6. Técnicas y repos

    Unity sacó plugins oficiales para Claude Code y Codex para que los agentes dejen de copiar tutoriales de versiones viejas (19/09)

    El problema que resuelve es concreto y conocido por cualquiera que haya intentado que un agente escriba código de Unity: los agentes de propósito general se apoyan en posts de foro y tutoriales de versiones anteriores del motor, cuyo código compila pero no hace lo que debería. Los plugins traen skills que escriben y mantienen los equipos de Unity. La versión de Codex arranca con 31 skills para interfaces, gráficos 2D, el pipeline de render URP, audio, navegación, física, compras dentro de la app, multijugador y localización; una skill arma proyectos nuevos completos con editor, control de versiones y paquetes, y otra migra proyectos viejos a URP. Corren sobre Unity 6 o superior y se instalan con un clic desde el directorio de plugins de Codex o vía npm en Claude Code. El patrón vale más allá de Unity: cuando el conocimiento de un framework envejece rápido, el dueño del framework publicando sus propias skills es mejor solución que esperar a que el modelo se actualice. The Decoder · Unity / Claude Code · Unity / Codex

    The Decoder Unity / Claude Code Unity / Codex Claude npm

  7. Técnicas y repos Hilo 6

    ECC llegó al tope de tendencias: 263.000 estrellas y un sistema de plan-test-implement-review-verify-remember-improve instalable de una (20/09)

    263.300 acumuladas, 39.401 forks, 1.012 en el día, licencia MIT. La propuesta es instalar una vez el proceso de ingeniería en vez de reconstruirlo en cada prompt: 68 agentes especializados en planificación, revisión, reparación de builds, seguridad y arquitectura, 292 skills, 94 shims de comandos legacy, más hooks, reglas, memoria y AgentShield, su escáner de seguridad. La frase que resume el diseño es "optimizá la ventana de contexto, persistí todo lo demás". Funciona mejor con Claude Code, tiene camino de sincronización soportado para Codex y adaptadores con capacidades limitadas para Cursor, OpenCode, Gemini, Zed, Copilot, Qwen y otros; conviene mirar la matriz de soporte antes de asumir paridad. Se instala con npx ecc-universal@2.2.2 setup o con /plugin install ecc@ecc adentro de Claude Code, y el propio repo advierte contra apilar métodos de instalación en la misma herramienta. GitHub

    GitHub GitHub Claude Gemini Qwen GitHub Copilot

  8. Ciberseguridad Hilo 3

    Plugin4Shell deja que el dueño del repositorio de un plugin cambie el código que instalan cuatro agentes de código, incluso con la versión fijada por hash (18/09)

    Air Security encontró que Claude Code, Codex, GitHub Copilot y Gemini CLI buscan el snapshot fijado por el marketplace pero nunca verifican que el código que terminan teniendo coincida con ese hash. En un host que permita nombres de rama con forma de hash de commit, el dueño del repo apunta ese nombre a otro código y el agente lo instala mientras sigue informando que está en la versión bloqueada; como un plugin corre con los mismos permisos que la persona, el código cambiado llega a sus archivos, credenciales guardadas y sistemas. GitHub no permite esos nombres, así que un plugin instalado desde GitHub no queda expuesto a esta variante —y los catálogos por defecto de estos agentes apuntan todos a GitHub—, pero sí funciona en Bitbucket o en un git propio, que los agentes también soportan. Anthropic lo corrigió en Claude Code 2.1.179 y OpenAI en Codex 0.146.0; Copilot no tiene arreglo y Google no va a parchear el Gemini CLI, que está retirando. Air construyó el ataque en mayo y avisó en junio; al 18 de septiembre no había CVE asignado ni aviso de seguridad de ninguno de los cuatro, ni señal de uso real. The Hacker News · Air Security

    The Hacker News Air Security OpenAI Anthropic Google GitHub Claude Gemini GitHub Copilot Gemini CLI

  9. Técnicas y repos Hilo 3

    Anthropic rehízo Projects en Claude Code y ahora un coordinador reparte el trabajo en hilos paralelos, cada uno con su sesión en la nube (17/09)

    El flujo nuevo es describir un objetivo y dejar que el coordinador lo parta: cada hilo corre como sesión propia, puede abrir pull requests y correr tests, y el progreso se sigue desde el chat principal o hilo por hilo, también desde el celular. Con el tiempo Claude construye una memoria compartida entre hilos, y una biblioteca junta todos los archivos subidos y los resultados. La beta está abierta a suscriptores Pro y Max seleccionados que usen sesiones en la nube; Team y Enterprise vienen después, y la ejecución local está anunciada como próxima. Conviene leerlo junto a lo de ayer: el desarrollador de Codex que puso número al "impuesto de coordinación" argumentaba que más de dos sub-agentes en paralelo queman tokens sin ganancia de calidad, y su alternativa era exactamente esto —delegar a hilos separados que avisen recién al terminar en vez de sondear estado todo el tiempo—. La diferencia entre ambas posturas es quién controla cuántos tokens se queman. The Decoder · Anthropic

    The Decoder Anthropic Anthropic Claude

  10. Técnicas y repos Hilo 3

    Tencent Cloud liberó Octop, un asistente de IA multiagente y multiusuario que corre entero en tu máquina (18/09)

    571 estrellas en el día, 3.793 acumuladas, licencia MIT. Es un proceso único en Python que sirve dashboard web, CLI, canales de mensajería —Feishu, DingTalk, QQ, Discord, WeCom— y cron, todo contra una misma base de control bajo ~/.octop/ (SQLite por defecto, PostgreSQL opcional), y el estado se reconstruye entero desde esa base al reiniciar. Lo que vale copiar son las decisiones de arquitectura: en vez de una cola externa o un broker, todas las superficies pasan por un único procesador en proceso; la memoria de cada agente viaja con su workspace; y la seguridad viene de fábrica con aislamiento JWT por usuario, aprobación de herramientas, reglas de allow/deny para comandos de shell editables por el usuario y redacción de PII antes de que los datos salgan del workspace. También hace ACP en las dos direcciones: expone tu agente a Zed u OpenCode, y delega hacia Claude Code, Codex, OpenCode o CodeBuddy con puertas de permiso. Está construido sobre una pila propia —harness-agent, harness-gateway, harness-memory, harness-browser— que Tencent dice estar preparando para abrir. GitHub

    GitHub GitHub Claude

  11. Técnicas y repos Hilo 3

    Tencent liberó BrowserSkill, que le presta a un agente tu navegador ya logueado en vez de pedirle que abra uno limpio (17/09)

    1.350 estrellas en el día, licencia MIT. La idea resuelve el problema más aburrido y más caro de la automatización de navegador: mantener cuentas de prueba y sesiones separadas. BrowserSkill conecta Cursor, Claude Code, Codex, DeepSeek Harness y cualquier agente que pueda llamar a una shell, a través de la CLI bsk más una extensión de Chrome o Edge, con soporte para macOS, Linux y Windows. Las decisiones de diseño son las que vale copiar. Las tareas del agente corren en una ventana separada y visible, así que se puede seguir usando el navegador propio mientras tanto. Si el agente necesita tocar una pestaña que ya está abierta, tiene que pedirla prestada explícitamente, devolverla al terminar y no tocar el resto. Y hay human-in-the-loop incorporado: cuando la tarea choca con un captcha, un login o un diálogo de confirmación, el agente pide que la persona tome el control y después sigue. La versión 0.3.0 endureció esto último: los flags que permitían saltear la confirmación de préstamo de pestañas o desactivar los pedidos de ayuda ya no lo hacen. GitHub

    GitHub DeepSeek GitHub Claude Windows Linux Chrome

  12. Técnicas y repos

    Atlas propone control de versiones para agentes: correr Claude Code, Codex y su propio agente en paralelo sobre una memoria compartida (15/09)

    1.091 estrellas en el día, 4.477 acumuladas, MIT, escrito en Rust sobre Tauri, con macOS como plataforma soportada. El diagnóstico que hace es el que cualquiera que use dos agentes reconoce: los agentes escriben una porción grande del código y no guardan nada del razonamiento detrás, y cambiar de agente pierde el hilo. Su respuesta concreta: una decisión que tomó Claude Code aparece en el próximo prompt de Codex, porque ambos corren como subprocesos externos sobre ACP y pasan por el mismo camino de envío, donde Atlas inyecta memoria compartida, coincidencias semánticas embebidas en el dispositivo, y un "fact pack" curado más la cola de la sesión anterior en el primer mensaje. Los checkpoints son la parte más lograda: cada commit queda ligado a la sesión que lo produjo, aunque lo hayas hecho desde la terminal con Atlas cerrado, y los enlaces sobreviven a rebases y amends por reconciliación de patch-id —cuando un squash vuelve el vínculo genuinamente ambiguo, lo deja huérfano en vez de adivinar—. Todo local por defecto, con los secretos depurados antes de escribir a disco y no antes de subir. GitHub · Atlas

    GitHub Atlas GitHub Claude

  13. Técnicas y repos

    alphaXiv liberó OpenResearch, que convierte agentes de código en agentes de investigación (15/09)

    568 estrellas en el día sobre 2.942 acumuladas, en Rust. La premisa es que el andamiaje que ya existe para agentes de programación —bucle de herramientas, lectura y escritura de archivos, ejecución— sirve igual de bien para el trabajo de investigación si se le cambian las herramientas y el contexto, en vez de construir un agente de investigación desde cero. Para quien tenga un flujo con Claude Code o Codex andando, es la propuesta más barata de probar de las tres de hoy: no reemplaza nada, reapunta lo que ya está instalado. Conviene tomarlo como proyecto joven en tracción, con la calidad todavía por medir contra los productos de deep research de los laboratorios. GitHub

    GitHub GitHub Claude

  14. Técnicas y repos Hilo 6

    Alibaba liberó el revisor de código que usa internamente, y el aporte grande no es la herramienta sino el argumento de arquitectura que trae con benchmark propio (13-14/09)

    Open Code Review venía siendo el asistente oficial de revisión de código de Alibaba Group: dos años de uso, decenas de miles de desarrolladores, millones de defectos encontrados. Ahora salió como CLI en Go bajo Apache-2.0, compatible con endpoints de OpenAI y Anthropic, y trepó a lo más alto de tendencias con 443 estrellas en un día sobre 22.300 acumuladas. El diagnóstico que hacen sobre los agentes de propósito general es el que le sirve a cualquiera que arme un flujo así: en changesets grandes el agente "corta camino" y revisa solo algunos archivos; los issues reportados no coinciden con la ubicación real del código porque las líneas se corren; y la calidad oscila fuerte ante variaciones menores del prompt. Su respuesta es un híbrido: lo que no puede fallar lo resuelve ingeniería determinista —selección de archivos, agrupamiento de archivos relacionados en una misma unidad de revisión que corre como subagente con contexto aislado, matching de reglas por características del archivo con motor de plantillas, y módulos externos de posicionamiento y reflexión de comentarios—, y le deja al agente solo la decisión dinámica y la búsqueda de contexto. El número que respalda el diseño sale de AACR-Bench, un benchmark de 50 repos populares, 200 pull requests reales, 10 lenguajes y 1.505 issues anotados y validados por más de 80 ingenieros senior: contra Claude Code con el mismo modelo de base, mejor precisión y F1 consumiendo alrededor de un noveno de los tokens, con menor recall como concesión deliberada a favor de menos ruido. GitHub · Hugging Face · Open Code Review

    GitHub Hugging Face Open Code Review OpenAI Anthropic Alibaba Hugging Face GitHub Claude

  15. Técnicas y repos

    Un repo que junta los system prompts extraídos de los modelos de frontera pasó las 700 estrellas en un día (14/09)

    system_prompts_leaks mantiene actualizada una colección de prompts de sistema extraídos de Claude Fable 5.1, Opus 5, Claude Design y Claude Code; de ChatGPT con GPT-6 Astra y Codex; de Gemini 3.8 Flash, 3.1 Pro y Antigravity; de Grok, Cursor y Kimi, entre otros. La utilidad práctica no es el morbo sino la comparación: son documentos escritos por gente que tiene acceso a las evaluaciones internas del modelo, así que leer cómo un laboratorio estructura instrucciones, define herramientas y acota el comportamiento es probablemente la mejor documentación disponible sobre cómo se le habla a ese modelo en particular. Se cruza directo con lo que recomendaba OpenAI el viernes sobre sacar andamios en vez de agregarlos, y con la nota de Anthropic sobre haber recortado 80% del prompt de sistema de Claude Code. La advertencia obvia: son extracciones, no publicaciones oficiales, así que pueden estar incompletas o desactualizadas respecto de lo que corre hoy en producción. GitHub

    GitHub OpenAI Anthropic GitHub GPT Claude Gemini Grok Kimi

  16. Ciberseguridad

    Irán usó Claude para armar recomendaciones de blancos contra la flota estadounidense, y una célula hutí para tres programas de misiles (12/09)

    Es la otra mitad del mismo reporte. El método iraní es el que más conviene entender porque no requiere ningún secreto: cruzar identificadores de transpondedores de barcos y aviones que son públicos con imágenes satelitales comerciales e información sobre movimientos navales, y hasta extraer nombres de personal militar estadounidense de los epígrafes de fotos publicadas oficialmente. Una unidad ligada a la seguridad iraní además analizó 155.216 tweets para perfilar y vigilar a 6.388 opositores en un año. La célula en el norte de Yemen usó Claude Code para un cohete guiado, un misil balístico multietapa con alcance declarado de más de 2.000 kilómetros y una familia R2000 que incluía una variante de vehículo de planeo hipersónico; Anthropic dice que no llegaron a poner en servicio ningún dispositivo operativo, aunque sí hicieron una prueba fallida del cohete guiado. La empresa bloqueó las cuentas, agregó mecanismos de detección y compartió los hallazgos con autoridades. Tom's Hardware · SecurityWeek · The War Zone

    Tom's Hardware SecurityWeek The War Zone Anthropic Claude

  17. Ciberseguridad

    Anthropic publicó ocho meses de abuso de Claude: ShinyHunters escaneó 1,8 millones de APKs de Android buscando secretos hardcodeados (11/09)

    El pipeline corría en diez workers EC2 de AWS, bajaba los APKs de varias tiendas, los descompilaba y los pasaba por TruffleHog, con los hallazgos verificados ruteándose en tiempo real a un grupo de Telegram organizado en más de cien tipos de fuente. De ahí salieron las credenciales de acceso inicial que el actor usó para "la mayor parte de las brechas confirmadas". Los números de velocidad son el dato nuevo: 34 horas para extraer más de 2.100 juegos de tokens de Azure AD de más de 40 tenants corporativos, con los agentes haciendo "casi todo el trabajo", y en otro caso menos de tres horas desde un token de desarrollador robado hasta control administrativo total. El grupo ruso Midnight Blizzard automatizó su operación con skills de Claude Code y montó un lazo de realimentación que reconstruía el malware cada vez que un producto de seguridad lo detectaba; el grupo chino GTG-10007 corría flujos autónomos de búsqueda de vulnerabilidades mientras los operadores humanos estaban ausentes, y encontró varias fallas desconocidas en un producto de seguridad importante. BleepingComputer · Anthropic

    BleepingComputer Anthropic Anthropic Amazon Claude ShinyHunters

  18. Técnicas y repos

    Un benchmark con más de 1.500 dólares en tokens concluye que RTK no abarata el coding agéntico (11/09)

    RTK —Rust Token Killer, más de 79.000 estrellas en GitHub— filtra y comprime la salida de la terminal antes de que la lea el agente, y circulan posts prometiendo recortes del 60% al 90%. Quesma lo corrió sobre Terminal-Bench 2.1 con Claude Code sobre Fable 5.0 y OpenCode sobre DeepSeek V4 Pro, cinco intentos por tarea con y sin RTK, 1.740 intentos en total. Medido por tarea, Fable quedó 1% más caro —indistinguible de cero— y DeepSeek 17% más caro en promedio. El ahorro aparente de Fable en el total venía casi enteramente de una sola tarea. La explicación mecánica es la útil: la salida de terminal era apenas 7% del input de Fable, el contexto se cachea después de cada turno y esas lecturas cuestan una décima parte, y RTK no toca las herramientas Read, Grep y Glob. Además, menos texto por turno no compensa si hay más turnos: DeepSeek tuvo 7% menos input por turno pero 18% más turnos. Y rtk gain no mide plata sino bytes removidos sobre cuatro: en un caso contó 120,5 millones de tokens "ahorrados" comparando un head -1 contra el archivo entero. Quesma · Hacker News

    Quesma Hacker News DeepSeek GitHub Claude

  19. Técnicas y repos

    El repo i-have-adhd explotó a 31.500 estrellas: una skill de diez reglas para que el agente de código no entierre la respuesta (08/09)

    Es una skill instalable en Claude Code, Codex, Cursor, opencode, Gemini y Qwen, y todo el contenido son diez reglas: arrancar por la próxima acción, numerar los pasos, cerrar con un paso concreto, suprimir tangentes, reestablecer el estado en cada turno, dar estimaciones en minutos, hacer visibles los avances, reportar errores sin dramatismo, cortar las listas en cinco ítems y no escribir preámbulo, resumen ni cierre. El README muestra el antes y el después sobre el mismo diagnóstico, y la diferencia es de tres párrafos a dos comandos. Vale menos como herramienta que como evidencia de qué tan lejos llega editar el formato de salida sin tocar el modelo. GitHub · Hacker News

    GitHub Hacker News GitHub Claude Gemini Qwen

  20. Técnicas y repos

    OKF Agent Memory: memoria persistente para agentes de código que vive en el propio repo, en Markdown y sin base vectorial (06/09)

    Apareció en Hacker News y propone algo deliberadamente aburrido: guardar el conocimiento del proyecto como archivos Markdown con frontmatter YAML en un directorio knowledge/, versionados por Git, siguiendo el formato abierto OKF v0.2 de Google. La búsqueda es BM25 léxica en memoria, sin embeddings, lo que según sus benchmarks da menos de 300 microsegundos por consulta y costo cero de API contra los 150-800 ms de una pila con base vectorial. Trae CLI en Go sin dependencias, servidor MCP por stdio para enchufar a Claude Code o Cursor, y un comando bootstrap que arma la estructura completa en cualquier repo. La idea de fondo es divulgación progresiva: índices jerárquicos y grafo de enlaces para que el agente cargue solo los conceptos que necesita, más una regla de "buscar antes de escribir" para evitar duplicar conceptos. Está muy verde —un solo commit, tres estrellas— así que conviene mirarlo por el diseño más que por la madurez, pero el planteo de que la memoria del agente tiene que ser auditable con git diff es la parte que se puede robar sin instalar nada. GitHub · Hacker News

    GitHub Hacker News Google GitHub Claude MCP

  21. Técnicas y repos

    Armature midió 16.893 sesiones de Claude Code, Codex y Cursor eligiendo servicios de terceros, y los tres coinciden apenas en el 42% de los casos (03/09)

    El experimento es serio: 75 repositorios en 10 lenguajes con nombres de empresa, historiales de git y claves de API falsos pero lockfiles reales verificados contra npm, 1.163 variaciones de prompt según cuatro perfiles —vibe coder, junior, senior, ingeniero de empresa grande—, sandboxes efímeros rotando entre tres proveedores, y un "humano simulado" en el loop porque pedir implementación directa sesgaba a los agentes a construir todo a mano. Publicaron las trazas completas. Lo accionable son los patrones: Cursor decide mirando la web en dos tercios de las sesiones, Codex busca en el 94% pero en nueve de cada diez consultas usa operadores como site: para acotar a dominios confiables, y Claude Code se apoya en sus priors y busca solo el 30% de las veces —aunque sube a ~80% en categorías nuevas donde sus priors son débiles— y construye in-house casi el doble que los otros dos. El contexto del repositorio pesa más que la calidad del producto: con el mismo pedido en cuatro lenguajes salieron cuatro proveedores de email distintos, Resend en TypeScript, SendGrid en Python, Postmark en Go y Azure ACS en Java. Y ser mencionado no es ser elegido: LangChain es el framework más citado con 194 menciones y fue elegido cuatro veces; PayPal se citó 139 veces y ganó cero. Armature · Hacker News

    Armature Hacker News Claude npm

  22. Ciberseguridad Hilo 3

    GitSpawn: ocho fallas hacen que siete agentes de código ejecuten comandos que vienen adentro del repositorio, sin sandbox y sin pedir permiso (02/09)

    El mecanismo es viejo y aburrido, que es justamente por qué funciona: core.fsmonitor es una opción de rendimiento de Git cuyo valor es un comando que Git corre para saber qué archivos cambiaron, y Git la lee del.git/config del propio repositorio. Cualquier operación que refresque el índice —git status, git diff— lo ejecuta, y los agentes llaman a esos comandos en segundo plano al arrancar para saber en qué rama están. En Claude Code y Hermes Agent el payload dispara antes de que se acepte el prompt de confianza del workspace; en Qwen Code, antes de autenticarse; en Grok Build, con la primera tecla. No aplica a un git clone normal: hace falta que el repositorio llegue como archivos con su directorio.git intacto, o sea un ZIP compartido, un disco de red, una carpeta sincronizada o un pendrive. Ya hay fixes en goose 1.44.0, Codex CLI 0.131.0 y Claude Code 2.1.196; seguían vivos Hermes Agent, Qwen Code, Grok Build y un segundo camino en Claude Code vía claude ultrareview, que Manifold reconfirmó el 1 de septiembre. OpenAI publicó tres CVEs propios el mismo día. La mitigación casera es una línea: git config --global core.fsmonitor false. The Hacker News · Manifold Security

    The Hacker News Manifold Security OpenAI Claude Grok Qwen

  23. IA

    Anthropic lanza Claude Fable 5.1 y Mythos 5.1: el mismo modelo con dos niveles de salvaguardas, 25% más barato y con resultados científicos que valen mirar (01/09)

    Fable 5.1 está disponible en todas las plataformas; Mythos 5.1 es idéntico pero con salvaguardas más permisivas y solo llega por dos programas de acceso verificado, uno de ciberdefensa y otro de ciencias de la vida armado con el gobierno de Estados Unidos. La baja de precio no viene del token de entrada ni de salida —siguen en USD 10 y USD 50 por millón— sino de las lecturas de caché, que bajaron 75% a USD 0,25 por millón: eso da ~25% menos en cargas típicas y hasta ~45% en trabajo agéntico pesado en contexto. En benchmarks salta de 24,7% a 52,6% en Terminal-Bench-Science 0.1 y de 42,0% a 55,8% en Terminal-Bench 4.0 (60,9% con Mythos). Lo más concreto está en la sección científica: Mythos 5.1 diseñó binders de proteínas con afinidades diez veces mejores que las mejores entradas de las competencias de Adaptyv Bio en tres targets, con una tasa de acierto cercana al 50% sobre 12 targets contra el 10-15% habitual, y escribió kernels de GPU que aceleran siete modelos open source de biología hasta 2,5 veces con salidas idénticas. Fable 5.1 además entrenó una red que produjo un mapa de elevación nuevo de un tercio de Venus con detalle de 2 a 3 km, publicado bajo Creative Commons. También cambian las salvaguardas: ahora Fable 5.1 puede usarse para descubrir vulnerabilidades de software —no para desarrollar exploits—, con unas 60% menos intervenciones por sesión en Claude Code. Anthropic · TechCrunch · The Decoder

    Anthropic TechCrunch The Decoder Anthropic Claude

  24. IA

    Anthropic cancela el aumento de precio de Claude Sonnet 5, que iba a entrar en vigor mañana (31/08)

    Sigue de lo de ayer, pero para el otro lado: mientras los límites semanales de Claude Code bajan un 17% efectivo el 14 de septiembre, en la API la decisión fue no tocar nada. El precio de USD 2 por millón de tokens de entrada y USD 10 de salida se había anunciado en el lanzamiento como introductorio y válido hasta el 31 de agosto de 2026 —o sea, hoy—, con un salto programado a USD 3 / USD 15 desde el 1 de septiembre. La documentación de la plataforma ahora dice explícitamente que ese aumento "no ocurrirá" y que el precio introductorio pasa a ser el estándar. Para quien tenga cargas de trabajo grandes sobre Sonnet 5 el efecto práctico es que el presupuesto de mañana no sube un 50%: el batch queda en USD 1 / USD 5 y el cache hit en USD 0,20 por millón. Documentación de Anthropic

    Documentación de Anthropic Anthropic Claude

  25. IA

    Anthropic sube 25% los límites de Claude Code sobre la línea base y termina cortando 17% de lo que hay hoy (29/08)

    El anuncio, confirmado por la cuenta oficial de Claude en X, dice que a partir del 14 de septiembre los límites semanales base de los planes Pro, Max, Team y Enterprise suben 25% de forma permanente. La letra chica es que hoy está activo un boost temporal del 50% que vence exactamente ese día, así que en términos de capacidad real disponible el cambio es una baja del 17%. Anthropic dice estar trabajando en cambios que hagan sentir que "estás sacando más de Claude" y en más control y transparencia sobre el consumo. En paralelo siguen llegando mejoras técnicas a la herramienta, incluidas optimizaciones de rendimiento y una función de feedback automático: cuando algo falla, Claude genera un reporte de bug que el usuario puede revisar y enviar, con la opción de adjuntar el log de la conversación, y se puede desactivar desde los ajustes. The Decoder · BleepingComputer

    The Decoder BleepingComputer Anthropic Claude

  26. Técnicas y repos

    Los agentes de coding no tienen noción del tiempo y tampoco saben que no la tienen (30/08)

    El estudio lo hicieron dos investigadores independientes dentro del programa MATS sobre Claude Code y Codex, con 200 tareas de ProgramBench más 18 benchmarks propios. Antes de cada tarea el agente estimaba cuánto iba a tardar; después la resolvía y reportaba cuánto había pasado. En ProgramBench los dos contestaban alrededor de 90 minutos sin importar la dificultad, y en la segunda ronda Claude se pasó 3x en promedio y Codex entre 6x y 10x, con el error más grande en las tareas cortas. El dato que más importa para armar un harness es que el mismo modelo se comporta distinto según el entorno: Claude Code sigue trabajando hasta creer que terminó, con una mediana de unos 90 minutos, mientras Codex corta a la media hora casi sin importar la tarea, y el mismo modelo da 2,5 veces más pasos en Claude Code que en Codex. La autoevaluación es igual de mala: los modelos más viejos se calificaron 20 puntos por encima del resultado real, y en un caso ambos estimaron 70% de éxito cuando los puntajes reales fueron 7% y 14,5%. La solución es barata y es lo accionable de todo esto: cuando les dieron una herramienta que reporta el tiempo transcurrido, acertaron casi siempre. The Decoder · LessWrong

    The Decoder LessWrong Claude

  27. Técnicas y repos

    Praxist gana MLE-bench a un doceavo del costo y pasó de cero a 1.400 estrellas en menos de un día (27/08)

    Es el sistema de investigación autónoma de Sapient Intelligence, los del HRM. Sobre las 75 tareas de MLE-bench con el grader oficial saca 60 medallas —80,0%—, 49 de ellas de oro, contra 55 medallas (73,3%) y 34 de oro de un baseline de Claude Code corriendo sobre Claude Opus 4.8. El número que conviene mirar es el otro: gastó USD 3.054 en modelo contra USD 38.370 del baseline, unas doce veces menos. Se instala en una línea (pip install "praxist[agents,codex]" && praxist setup --interactive), trae nueve skills empaquetadas y corre sobre Codex o Claude Code, así que se puede probar encima del setup que ya tenés. La letra chica: la licencia es Fair Source 1.0, gratis solo para organizaciones que facturen menos de USD 1 millón al año; arriba de eso hay que negociar licencia comercial. GitHub · arXiv 2608.25955

    GitHub arXiv 2608.25955 GitHub Claude

  28. Técnicas y repos

    FrontierChallenge: los mejores agentes completan solo 20,6% de los flujos científicos, y tres de cada cuatro corridas fallidas terminan diciendo que terminaron

    El benchmark tiene 300 workflows científicos de punta a punta; en este paper liberan y evalúan 97, repartidos entre química cuántica, dinámica molecular, caracterización de materiales, química analítica, ciencias de la vida y electroquímica/ambiente. Cada tarea define entradas fijas y un paquete de entregables requeridos, y se mide con dos números en vez de uno: Pass Rate, la fracción de tareas que cumple el criterio de completitud, y Avg. Score, que captura el progreso parcial. Evaluaron doce modelos de frontera con tres scaffolds y ninguna configuración pasó de 20 de 97 tareas. La brecha entre las dos métricas es el hallazgo: en química analítica el Avg. Score llegó a 87,6 con un Pass Rate máximo de 4%, y en electroquímica/ambiente 94,9 de score con 0% de pass. Y entre las trayectorias de Claude Code que no pasaron, 75,5% igual cerró afirmando haber completado la tarea. La conclusión aplica a cualquiera que ponga agentes a producir entregables: ni el puntaje parcial alto ni la declaración de completitud son señal de que el trabajo esté hecho. arXiv 2608.24979 · Leaderboard · GitHub

    arXiv 2608.24979 Leaderboard GitHub GitHub Claude

  29. Técnicas y repos

    JIT-Agent entrena un modelo que fabrica el harness a medida de la tarea, y le saca +20 puntos a GLM-5.2 sin tocar el modelo base

    La premisa continúa el argumento que viene ganando terreno hace semanas —la capacidad del agente no la determina solo el modelo— y le agrega el paso siguiente: si el harness (gestión de memoria, estrategia de planificación, protocolo de acciones, orquestación de herramientas y skills) domina la contribución del modelo, entonces diseñarlo a mano, tarea por tarea, no escala. Los autores formalizan el harness como un artefacto componible y generable por máquina bajo un protocolo fijo de cuatro módulos, y entrenan un modelo para que lo sintetice al vuelo para cualquier LLM agéntico de estantería, lo repare cuando la ejecución se cae, y se autoevolucione destilando señales de rendimiento de un archivo creciente de configuraciones previas. Con JIT-Agent de asistente, DeepSeek-V4-Flash supera a GPT-5.6 en DeepSearchQA (+9,1) y OdysseyBench (+4,3), y GLM-5.2 gana hasta 20,2 puntos. Los harnesses generados compiten de igual a igual con runtimes maduros como OpenCode y Claude Code. Hay código y dataset publicados. arXiv 2608.25593 · GitHub · Sitio del proyecto

    arXiv 2608.25593 GitHub Sitio del proyecto GitHub GPT Claude

  30. Ciberseguridad

    Los grupos estatales chinos más que duplicaron sus ataques desde que usan IA, y DeepSeek es el favorito (24/08)

    Lo dice la firma taiwanesa TeamT5 vía Bloomberg, y la razón que da su analista jefe Charles Li es incómodamente concreta: DeepSeek es "relativamente potente con muy pocas barreras de ciberseguridad". Los casos que citan: Grimfengxi lo usó para escribir código de exploits, Huapi se apoyó en un modelo chino que probablemente sea DeepSeek, y Teleboyi lo usó para juntar direcciones IP y mapear dominios. ChatGPT aparece en al menos un caso —CyCraft encontró evidencia de que lo usaron para armar un módulo de descifrado de una base de datos de Signal— y el grupo Slime22 usó Claude Code para moverse dentro de los sistemas de una empresa taiwanesa. El marco que ayuda a calibrar: el AI Safety Institute británico midió que las capacidades cibernéticas de los modelos abiertos saltaron fuerte, aunque para ataques totalmente autónomos siguen varios meses atrás de los de frontera occidentales. The Decoder · Bloomberg

    The Decoder Bloomberg DeepSeek GPT Claude

  31. Técnicas y repos

    SWE-bench Science: el mejor agente no llega al 50% arreglando software científico, y el conocimiento del dominio no siempre ayuda (21/08)

    El benchmark del equipo OpenMOSS junta 119 tareas de 98 repositorios de GitHub en 20 dominios científicos, organizadas en tres paradigmas —guiadas por issue, exploratorias de experto e integración de ingeniería—, y el mejor resultado es Claude Code con Opus-5 (max) por debajo de 50% de pass@1. El argumento de por qué importa: cuando el software es parte del instrumento científico, un bug no rompe solo el programa, contamina la evidencia sobre la que se apoya una conclusión. Los autores catalogan cuatro mecanismos de falla recurrentes: déficit de conocimiento o abstracción científica, exploración mal orientada o arreglo superficial, cobertura incompleta del arreglo o de la integración, y fallas para generalizar más allá de los casos observados. La ablación es lo más útil: quitar la guía científica explícita dejando el contexto de repositorio muestra que el conocimiento no es uniformemente beneficioso —bien anclado acota la reparación y mejora promedio y eficiencia de tokens, mal alineado induce anclaje y no mejora el arreglo exacto. La suite de tests privada, que vive en la imagen del verificador y nunca ve el agente, es lo que impide aprobar editando aserciones: un modelo pasó las 119 reproducciones públicas y solo 35 de las privadas. arXiv 2608.19799 · GitHub · Leaderboard

    arXiv 2608.19799 GitHub Leaderboard GitHub Claude

  32. Técnicas y repos

    Claude Code sumó un comando /design que arma mockups de interfaz en la terminal antes de escribir código (18/08)

    Anthropic liberó un preview temprano: se escribe algo como "/design a few options for {feature}" y Claude genera varios borradores como artboards, de los que se elige uno, se edita y recién ahí se construye. Según el desarrollador Nate Parrott, lee el código existente, respeta el estilo visual actual del proyecto y devuelve mockups compartibles como Artifacts. El editor y el prompting vienen de Claude Design y ahora están integrados directamente en Claude Code. La limitación declarada: los diseños se arrastran al paso de build, pero todavía hay que guardarlos a mano. Se activa con claude update. The Decoder · Nate Parrott en X

    The Decoder Nate Parrott en X Anthropic Claude

  33. Técnicas y repos

    Un dev escribió con Claude Code el driver de macOS que HP nunca hizo para su propia impresora (19/08)

    Kuberwastaken publicó en GitHub un paquete que hace funcionar la HP Laser 1008a en macOS de Apple Silicon con Cmd-P desde cualquier aplicación, sin terminal ni scripts por trabajo. El problema de base es concreto: esa familia de impresoras son Samsung SPL3 rebadgeadas que no hablan PostScript ni PCL, no funcionan con los drivers open source SPL/QPDL ni con AirPrint, y HP nunca sacó driver de macOS. La solución que armó apoya el rastertospl de la propia HP —el mismo que usa el Unified Linux Driver— metiéndolo adentro de un contenedor Linux mínimo que entrega el resultado por USB. La instalación es un solo comando si ya tenés Homebrew. Las advertencias que él mismo marca: es lento del reposo a la primera impresión, Colima tiene que estar corriendo, y puede hacer falta ajustar el USB product ID. Sirve también para los modelos 1003, 1006 y 1008. Tom's Hardware · GitHub

    Tom's Hardware GitHub Apple GitHub Samsung Claude Linux

  34. Técnicas y repos Hilo 4

    ClawGym II: hacer RL sobre el agente entero sin abrir el harness, con Claude Code y OpenClaw como entorno (17/08)

    El framework de la Renmin University y colaboradores trata al harness como caja negra: aísla cada tarea con su harness en sandboxes efímeros para hacer rollouts concurrentes en masa, mete un proxy de serving en el límite del modelo para capturar todas las llamadas, y reorganiza esas llamadas en árboles de prefijos para reconstruir las trayectorias multi-turno. Sobre esa estructura adaptan PPO y GRPO. Con Qwen3-30A3B el Pass@1 en ClawGym-Bench sube 9,98 puntos vía OpenClaw y 14,81 vía Claude Code, y se mantiene estable a lo largo de 200 a 400 pasos de optimización, con ganancias también en JobBench y OfficeQA. Lo más aprovechable es el "mix-harness training": un solo modelo optimizado en simultáneo contra harnesses distintos, en vez de uno por herramienta. Publicaron código de SFT y RL, 13,5K tareas, 24,5K trayectorias y tres checkpoints abiertos de 4B, 8B y 30A3. arXiv 2608.16798 · GitHub

    arXiv 2608.16798 GitHub GitHub Claude

  35. IA

    Claude se cayó 36 minutos y arrastró a la API, Claude Code y Cowork (16/08)

    El incidente arrancó a las 21:58 UTC con usuarios que no podían autenticarse en claude.ai, Claude Code y Claude Cowork, y cuatro minutos después Anthropic lo amplió a performance degradada en claude.ai y platform.claude.com. A las 22:22 UTC había un fix desplegado sobre los cinco servicios afectados —incluida la API que carga el tráfico de terceros y empresas— y a las 22:34 el incidente quedó cerrado. Anthropic no publicó causa raíz. Lo que importa para quien tiene agentes corriendo desatendidos: la caída empezó por autenticación y se propagó al plano de datos, así que un reintento ciego no alcanza como estrategia. BleepingComputer · Unite.AI · Claude Status

    BleepingComputer Unite.AI Claude Status Anthropic Claude

  36. Técnicas y repos

    El auto mode pasó a ser el default de Claude Code, y los datos que lo justifican son el verdadero hallazgo (14/08)

    Desde el 14 las sesiones nuevas de Pro, Max y Team arrancan en auto mode: cada llamada a herramienta la evalúa un clasificador en lugar de pedir aprobación manual. Los números internos que publicó Anthropic explican por qué, y valen más que el cambio en sí: los usuarios aprueban el 97% de los prompts de permiso, el 49,5% de los usuarios activos de CLI ya se había armado una regla de allow para Bash y el 62% había usado bypassPermissions o "don't ask again". En un estudio con 1.053 testers profesionales pagos, el clasificador detectó el 89% de los comandos peligrosos deliberados contra el 13,6% de los revisores humanos. Si el agente se traba —tres bloqueos seguidos, o veinte en la sesión— vuelve a aprobación manual, y Anthropic absorbe los tokens extra del clasificador. La contracara que marcan los analistas es real: el clasificador es un punto único de falla, y revisar cuatro horas de output desatendido es una habilidad que casi ningún equipo construyó. Anthropic · InfoWorld · Documentación

    Anthropic InfoWorld Documentación Anthropic Claude

  37. Técnicas y repos

    "State of Open Models: Summer 2026" de Hugging Face: los agentes ya son el usuario número uno del Hub (14/08)

    El reporte semestral trae tres datos que cambian cómo conviene pensar el ecosistema abierto. Primero, el tráfico agéntico se volvió dominante y es volátil: Claude Code fue el 44,4% en julio, pero venía de 6,4% en mayo y 67,8% en abril — no hay titular estable. Segundo, Qwen se consolidó como el modelo base de la comunidad con 151.448 derivados, 2,6× la huella de Meta. Tercero, y lo más útil para decidir dónde invertir tiempo: la capa de runtime crece entre 3 y 7 veces más rápido que el core de modelado (repos con librería gguf +464%, mlx +148%, contra +16% de transformers). Bonus contraintuitivo: de los top 25 por descargas y los top 25 por likes, solo un repo aparece en ambas listas. Hugging Face

    Hugging Face Meta Hugging Face Claude Qwen

  38. Técnicas y repos

    Agent Plugins v1.0.0: el estándar de plugins para agentes ya es implementable

    (working draft publicado el 11/8, con adopción moviéndose en las últimas horas). Especificación con schemas JSON canónicos, guías para autores y clientes, y matriz de compatibilidad que abarca OpenAI, AWS, Cursor, GitHub y VS Code. Si mantenés tooling para agentes, es el momento de revisar el draft y validar tus manifests contra los schemas. explainx.ai - Sin más novedades verificables de las últimas 24h en esta categoría. Contexto de la semana: en GitHub trending siguen dominando los visual builders de agentes (Langflow, Dify, Flowise) y crece la acción Claude Code Security Review de Anthropic para revisar PRs con Claude. OSSInsight · startupcorners (digest 9/8) --- Fuentes agregadoras usadas para ítems sin cobertura primaria accesible: Tech Startups (13/8), que cita Reuters, Bloomberg, WSJ, FT, SecurityWeek y TNW. Ítems no verificables u older de 24h fueron omitidos.

    explainx.ai OSSInsight startupcorners (digest 9/8) OpenAI Anthropic Amazon GitHub Claude

  39. IA

    Un Claude experimental mejoró una cota del problema de Riemann orquestando ~60 subagentes

    Anthropic reveló que una versión de investigación no publicada de Claude elevó la cota inferior de la fracción de ceros de la función zeta que cumplen la hipótesis de Riemann de 41,6% a 67,2%, sintetizando papers recientes. Corrió dentro de Claude Code en dos sesiones: 31M de tokens de salida, 650 ideas iniciales, ~60 subagentes y 2.400 comandos de shell. Lo presentan como evidencia del enfoque de orquestación de agentes para matemática dura. Anthropic

    Anthropic Anthropic Claude

  40. Técnicas y repos

    Docker Sandboxes: entornos descartables y aislados para agentes de IA

    (portada de HN hoy, 346 puntos). Docker lanzó un producto para correr agentes con acceso a shell y filesystem dentro de sandboxes efímeros, atacando el problema #1 de los agentes autónomos: ejecutar código generado por el modelo sin exponer tu máquina. Si corrés agentes tipo Claude Code u OpenClaw en local, es una capa de aislamiento lista para usar. Docker · HN (214 comentarios)

    Docker HN (214 comentarios) Claude

  41. Técnicas y repos

    semantica: infraestructura graph-native para contexto y auditoría de agentes, #1 en GitHub Trending

    (hoy). Se autodefine como "el Palantir open source para agentes": construye knowledge graphs con provenance W3C PROV-O, registra cada decisión del agente como nodo consultable (record_decision, trace_decision_chain) y razona en forma determinística sin LLM. Incluye MCP server y plugins para Claude Code, Cursor y Windsurf; apunta a dominios regulados donde "¿por qué decidió eso la IA?" tiene que tener respuesta auditable. pip install semantica. GitHub

    GitHub GitHub Claude MCP

  42. Ciberseguridad

    Fallos críticos en Claude Code, Gemini CLI y OpenAI Codex: un GitHub issue basta

    Presentado en Black Hat USA (5 ago) por Novee Security, un issue de GitHub abierto por una cuenta sin privilegios alcanzó para ejecutar código en los CI runners de los repos de coding-agent de Anthropic y Google, y para secuestrar la siguiente corrida del agente en OpenAI. En Claude Code, un git push --receive-pack malicioso bypasseó 23 checks (y un segundo bypass usó tac para leer archivos y exfiltrar una API key invertida) — CVE-2026-54316. En Gemini CLI, una inyección de comando OS vía.gemini/.env obtuvo CVSS 10.0 (CVE-2026-12537). En Codex, un AGENTS.md escribible persistía instrucciones del atacante entre etapas. Los tres vendors publicaron mitigaciones, pero configuraciones default similares siguen expuestas. (The Hacker News, eSecurity Planet)

    The Hacker News eSecurity Planet OpenAI Anthropic Google GitHub Claude Gemini Gemini CLI

  43. IA

    Meta lanza Muse Code, agente de coding en terminal con Muse Spark 1.2

    (5 ago). Meta Superintelligence Labs publicó en beta un agente que planifica cambios, escribe código y valida resultados sobre repos grandes, compitiendo de lleno con Claude Code y Codex. Corre sobre el nuevo modelo Muse Spark 1.2. Fuente: LLM Stats / TechCrunch.

    LLM Stats / TechCrunch Meta Claude

  44. Ciberseguridad

    Gusano npm en keyv envenena cientos de paquetes

    El 4 de agosto un gusano roba-credenciales que apareció en keyv@6.0.0 (127M descargas semanales) se propagó más allá de los namespaces Keyv/Cacheable: Aikido reporta 868+ paquetes en 1.381 versiones, con más de 2.000 millones de instalaciones mensuales combinadas. Un script preinstall roba tokens de GitHub, credenciales cloud y claves privadas, republica versiones troyanizadas con el token npm robado, y planta hooks de persistencia en Claude Code y VS Code. Las releases maliciosas pasaban los chequeos de provenance/attestation de npm. Acción: auditar lockfiles, rotar credenciales y activar ignore-scripts. The Hacker News · Aikido · SafeDep

    The Hacker News Aikido SafeDep GitHub Claude npm

  45. Técnicas y repos

    Microsoft Research libera Orchard, framework abierto para agentes a escala

    Publicado el 4 de agosto. Su núcleo es Orchard Env, un servicio de entornos aislados sobre Kubernetes que permite entrenar y evaluar agentes dentro de los harnesses reales de deployment (Claude Code, Codex, OpenClaw), cerrando la brecha entrenamiento-producción. Incluye tres recetas (Orchard-SWE, Orchard-GUI, Orchard-Claw) con mejoras medibles en ingeniería de software, automatización de navegador y asistentes, y liberan datos de entrenamiento y métodos de eval completos. Accionable si hacés RL o evals de agentes sin depender de cloud propietario. Microsoft Research · AI Business

    Microsoft Research AI Business Microsoft Claude

  46. Técnicas y repos

    El "unhobbling" del prompt como técnica: menos contexto, mismo rendimiento

    Sigue ganando tracción la práctica que Anthropic aplicó con Opus 5/Fable 5 —recortar más del 80% del system prompt de Claude Code sin pérdida medible en evals de código—. La lección accionable: en agentes de producción, borrar restricciones y few-shots redundantes suele mejorar más que agregar instrucciones, porque todo modelo frontier se degrada a medida que crece el contexto, mucho antes de llenar la ventana. explainx.ai · Developers Digest

    explainx.ai Developers Digest Anthropic Claude

  47. Ciberseguridad

    Falla CVSS 10.0 en Ruflo (RufRoot): RCE sin autenticación en un harness para Claude Code y Codex

    Investigadores de Noma Security reportaron CVE-2026-59726, una vulnerabilidad de severidad máxima en Ruflo, un meta-harness open source para Anthropic Claude Code y OpenAI Codex. Afecta a todas las versiones previas a la 3.16.3 y permite ejecución remota de código sin autenticar, además de "envenenar" la memoria del agente y pivotear a pipelines de CI/CD. Es trivialmente explotable: parchear de inmediato y auditar accesos. (The Hacker News, Techmaniacs)

    The Hacker News Techmaniacs OpenAI Anthropic Claude

  48. Técnicas y repos

    stitch-skills (Google Labs): librería de "Agent Skills" cross-tool

    Skills que siguen el estándar abierto de Agent Skills, compatibles con Gemini CLI, Claude Code y Cursor — señal de que el stack agéntico se está consolidando alrededor de MCP + skills portables. Bueno para reutilizar capacidades entre herramientas. Analytics Vidhya

    Analytics Vidhya Google Claude Gemini Gemini CLI MCP

  49. Técnicas y repos

    "Unhobbling" en Claude Code: menos prompt, igual (o mejor) rendimiento

    El mismo día del lanzamiento de Opus 5 (24/07), el equipo de Claude Code publicó que removieron >80% del system prompt para Opus 5 y Fable 5 sin pérdida medible en evals de código. La lección de context engineering: no se trata de mejores few-shots sino de borrar restricciones que hoy generan instrucciones en conflicto y desperdician tokens. Accionable para cualquiera que mantenga prompts de agentes largos. explainx · anthropic

    explainx anthropic Claude

  50. Ciberseguridad Hilo 17

    Nuevas oleadas del worm Shai-Hulud golpean npm y PyPI

    Más de 100 paquetes fueron comprometidos en nuevas campañas del gusano autorreplicante que roba tokens de GitHub y npm, credenciales de AWS/GCP/Azure, tokens de Kubernetes y Vault, y luego reinyecta la dependencia maliciosa en paquetes donde la víctima tiene permisos de publicación. TeamPCP escaló con "Miasma", que se inyecta en los SessionStart hooks de 13 herramientas de coding con IA (incluidas Claude Code, GitHub Copilot y Gemini CLI). Riesgo directo para pipelines CI/CD y entornos de desarrollo. SecurityWeek · Orca Security

    SecurityWeek Orca Security Amazon GitHub Claude Gemini GitHub Copilot Gemini CLI npm PyPI Shai-Hulud

  51. IA Hilo 3

    EE.UU. levanta los controles de exportación y Fable 5 vuelve a estar global

    El Departamento de Comercio de EE.UU. retiró (30 jun) la restricción que durante ~18 días había dejado offline a modelos como Fable 5 y Mythos 5 para nacionales extranjeros. Desde el 1 de julio, Fable 5 volvió a estar disponible en Claude.ai, la API, Claude Code y Cowork. Señala cuán expuestas están las plataformas de IA a decisiones regulatorias. Resumen NeuralBuddies

    Resumen NeuralBuddies Claude

  52. Ciberseguridad Hilo 17

    Cadena de suministro: el gusano "Miasma" ataca herramientas de coding con IA

    El grupo TeamPCP (UNC6780) desplegó Miasma, un worm autopropagante que se inyecta en los hooks SessionStart de 13 herramientas de coding con IA (incluidas Claude Code, GitHub Copilot y Gemini CLI), falsifica firmas de procedencia SLSA para pasar npm audit y usa GitHub como canal C2. Ejemplo de cómo los atacantes apuntan al tooling de desarrollo con IA. The Hacker News

    The Hacker News GitHub Claude Gemini GitHub Copilot Gemini CLI npm Shai-Hulud

  53. IA

    Anthropic revierte un código de tracking en Claude Code tras cuestionamientos

    Anthropic dio marcha atrás con una función de Claude Code luego del escrutinio sobre rastreo vinculado a zonas horarias y posibles conexiones con empresas tecnológicas chinas, según Semafor. El episodio muestra la tensión entre el screening de seguridad, los controles de exportación y la confianza de los desarrolladores, que corren estas herramientas dentro de flujos de trabajo sensibles. Semafor vía TechStartups

    Semafor vía TechStartups Anthropic Claude

  54. Ciberseguridad Hilo 17

    "Miasma": un gusano de cadena de suministro que ataca herramientas de coding con IA

    El grupo TeamPCP liberó en junio Miasma, un worm que se auto-propaga inyectándose en los hooks SessionStart de 13 herramientas de coding con IA, entre ellas Claude Code, GitHub Copilot y Gemini CLI. Falsifica firmas de procedencia SLSA para pasar los chequeos de npm audit, usa GitHub como canal de comando y control, e incluye un DEADMAN_SWITCH que borra la máquina del desarrollador si se revocan los tokens antes de aislar la red. Orca Security · Tenable

    Orca Security Tenable GitHub Claude Gemini GitHub Copilot Gemini CLI npm Shai-Hulud

  55. IA Hilo 3

    Anthropic lanza Claude Sonnet 5

    El 30 de junio Anthropic presentó Claude Sonnet 5, descrito como su modelo Sonnet más agéntico, con mejoras sustanciales sobre Sonnet 4.6 en razonamiento, uso de herramientas, código y trabajo de conocimiento. Ya es el modelo por defecto en Claude Code, trae ventana de contexto nativa de 1M de tokens y precio promocional de $2/$10 por millón de tokens hasta el 31 de agosto. Análisis independientes lo ubican rindiendo cerca de Opus 4.8 a una fracción del costo, lo que lo posiciona como una de las mejores relaciones calidad/precio del mercado. Anthropic Newsroom · Releasebot · Javadex

    Anthropic Newsroom Releasebot Javadex Anthropic Claude

  56. IA Hilo 3

    EE.UU. levanta los controles de exportación sobre Fable 5 y Mythos 5

    El Departamento de Comercio retiró las restricciones de exportación sobre los modelos Claude Fable 5 y Mythos 5, cerrando un enfrentamiento entre Anthropic y la administración Trump. Fable 5 vuelve a estar disponible para usuarios globales en la plataforma Claude, Claude.ai y Claude Code, y se incluye hasta en el 50% de los límites semanales de uso para planes Pro, Max y Team hasta el 7 de julio. Es relevante porque marca un giro en la política de exportación de modelos de frontera de EE.UU. CNBC

    CNBC Anthropic Claude

  57. Ciberseguridad Hilo 17

    Nuevos ataques a la cadena de suministro en npm y PyPI (Shai-Hulud "Hades" y Miasma)

    Más de 100 paquetes de npm y PyPI fueron alcanzados por nuevas variantes de Shai-Hulud, incluida una identificada por la cadena "Hades – The End for the Damned" en PyPI. En paralelo, el gusano autopropagante Miasma (UNC6780/TeamPCP) se inyecta en los hooks SessionStart de 13 herramientas de coding con IA —incluyendo Claude Code, GitHub Copilot y Gemini CLI—, falsifica firmas de procedencia SLSA y usa GitHub como canal de C2. Los desarrolladores deben auditar dependencias y rotar tokens. SecurityWeek · Tenable

    SecurityWeek Tenable GitHub Claude Gemini GitHub Copilot Gemini CLI npm PyPI Shai-Hulud

  58. Ciberseguridad Hilo 17

    Campaña Miasma: worm autopropagante contra el ecosistema npm y herramientas de IA

    El grupo TeamPCP (UNC6780) liberó en junio Miasma, que se inyecta en los hooks SessionStart de 13 herramientas de coding con IA (Claude Code, GitHub Copilot, Gemini CLI, entre otras), forja firmas de provenance SLSA para pasar npm audit, usa GitHub como canal C2 e incluye un "deadman switch" destructivo. Para el 5 de junio había al menos 57 paquetes npm y +300 versiones maliciosas; arrancó comprometiendo 32 paquetes del namespace @redhat-cloud-services. Es de los primeros worms que apuntan directamente al tooling de desarrollo con IA. The Hacker News · Phoenix Security

    The Hacker News Phoenix Security GitHub Claude Gemini GitHub Copilot Gemini CLI npm Shai-Hulud

  59. Ciberseguridad Hilo 17

    Worm de cadena de suministro "Miasma/Shai-Hulud" golpea npm y PyPI

    Nuevas oleadas comprometieron más de 100 paquetes en npm y PyPI. El worm Miasma (atribuido a UNC6780) se autopropaga inyectándose en los hooks SessionStart de 13 herramientas de coding con IA —incluidas Claude Code, GitHub Copilot y Gemini CLI—, falsifica firmas de procedencia SLSA para pasar npm audit, usa GitHub como canal de C2 y trae un "deadman switch" que borra máquinas de desarrolladores. Importa porque ataca directamente el tooling de los desarrolladores y la confianza en los registros de paquetes. SecurityWeek · Orca Security

    SecurityWeek Orca Security GitHub Claude Gemini GitHub Copilot Gemini CLI npm PyPI Shai-Hulud

  60. Ciberseguridad Hilo 17

    Gusanos Miasma y Hades golpean npm y PyPI

    Una oleada de ataques a la cadena de suministro comprometió cientos de paquetes: Miasma, un gusano autopropagable que se inyecta en los hooks SessionStart de 13 herramientas de coding con IA (Claude Code, GitHub Copilot, Gemini CLI), falsifica firmas de procedencia SLSA para pasar npm audit y lleva un "DEADMAN_SWITCH" que borra máquinas si se revocan tokens. En paralelo, la variante Hades de Shai-Hulud golpeó PyPI en dos olas (19 + 29 paquetes). Importa por la sofisticación: provenance falsificado, autopropagación y targeting directo de entornos de desarrollo con IA. SecurityWeek · Phoenix Security

    SecurityWeek Phoenix Security GitHub Claude Gemini GitHub Copilot Gemini CLI npm PyPI Shai-Hulud

  61. Ciberseguridad Hilo 17

    Supply chain: el gusano Miasma y nuevas olas de Shai-Hulud/Hades

    Continúa la presión sobre npm y PyPI. "Miasma" —un gusano autopropagante que se inyecta en los hooks SessionStart de 13 herramientas de IA para coding (incluidas Claude Code, GitHub Copilot y Gemini CLI), forja provenance SLSA y usa GitHub como canal C2— afectó a decenas de paquetes npm. En paralelo, una nueva variante de Shai-Hulud ("Hades") golpeó alrededor de dos docenas de paquetes PyPI con un archivo *-setup.pth que se ejecuta al iniciar Python. Unit 42 · SecurityWeek

    Unit 42 SecurityWeek GitHub Claude Gemini GitHub Copilot Gemini CLI npm PyPI Shai-Hulud

  62. IA

    Anthropic mueve dos líneas a la vez

    Claude Mythos 5 pasó a disponibilidad general y Claude Fable 5 entró en preview cerrado con partners (sin fecha de GA al 10/06). Por separado, habilitaron la ventana de contexto de 1M de tokens para Opus 4.6 y Sonnet 4.6 en Claude Code sin header beta, sin recargo y con precio plano. llm-stats · Build This Now

    llm-stats Build This Now Anthropic Claude

  63. Ciberseguridad Hilo 17

    Gusano "Miasma" / Shai-Hulud en npm y PyPI

    Campaña activa que comprometió 100+ paquetes entre npm y PyPI. Ejecuta un payload ofuscado de 4.2 MB vía hook preinstall y se auto-propaga inyectándose en los hooks de 13 herramientas de coding con IA (Claude Code, GitHub Copilot, Gemini CLI), llegando a forjar firmas SLSA para pasar npm audit. Variante en PyPI ("Hades") usa archivos *-setup.pth que se ejecutan al arrancar Python. Revisar dependencias y pipelines CI/CD. SecurityWeek · Phoenix Security · Tenable

    SecurityWeek Phoenix Security Tenable GitHub Claude Gemini GitHub Copilot Gemini CLI npm PyPI Shai-Hulud