El Compilado Hilos Temas Archivo RSS

Temas · tema

llama.cpp

Seguir llama.cpp por RSS

Noticias
4
Briefings
3
Primera
Última
  1. IA Hilo 4

    Meta lanza Muse Glimmer, modelo agéntico open-weight de 30B que corre en una laptop

    Es una destilación de Muse Spark 1.2 bajo licencia Apache 2.0, pensada para agentes locales "always-on": coding, function calling y razonamiento multi-paso sin depender de la nube. Meta reporta mejoras de velocidad de decodificación de 3,1× en una RTX 5090 y 1,8× en M5 Max; ya está en Hugging Face con soporte para llama.cpp y Ollama. Zuckerberg acompañó el release con una defensa del open source y de la destilación como motor de progreso. Meta AI Research · CNBC · HN (157 comentarios)

    Meta AI Research CNBC HN (157 comentarios) Meta Hugging Face

  2. Técnicas y repos

    Guía práctica: tooling de inferencia local comparado (llama.cpp, Ollama, vLLM, SGLang)

    Repaso actualizado a julio de cuándo conviene cada motor para servir modelos localmente — referencia útil para decidir stack de serving según throughput vs. simplicidad. DEV Community

    DEV Community vLLM

  3. Técnicas y repos

    Correr Kimi K3 localmente: MXFP4 y llama.cpp

    Con los pesos abiertos de Kimi K3 ya publicados (~1,4 TB en MXFP4), la comunidad está armando guías para self-hosting. La ruta práctica: GGUF + llama.cpp (sin paso extra de conversión/cuantización, se apunta el server al archivo) o vLLM/SGLang para serving. El Hub de Hugging Face (org ggml-org) concentra las conversiones oficiales. Accionable para quien quiera evaluar un frontier open-weight sin depender de API. explainx · dev.to — guía inference tools

    explainx dev.to — guía inference tools Hugging Face Kimi vLLM

  4. Técnicas y repos

    Hugging Face transformers v5.13.0 se alinea con la última vLLM

    El release trae fixes de generación, attention, cache, cuantización y serving orientados a habilitar transformers con la versión más reciente de vLLM. Útil si servís modelos y venías peleando compatibilidades entre ambas libs. Nota de ecosistema: TGI está en modo mantenimiento y redirige a vLLM, SGLang, llama.cpp y MLX. Releasebot — Hugging Face

    Releasebot — Hugging Face Hugging Face vLLM