El Compilado Hilos Temas Archivo RSS

Hilos · 3 noticias en 14 días

colibrì trepó a 33.000 estrellas proponiendo algo que suena imposible: correr modelos MoE de frontera desde el disco, en C puro y sin dependencias (15/09)

Noticias
3
Briefings
3
Empieza
Última
  1. Técnicas y repos

    slotstream corre un MoE de 104 GB en una Mac de 48 GB a ~12 tokens por segundo, transmitiendo los expertos desde el SSD (02/09)

    Es un binario único en Swift sobre MLX, con los endpoints de chat y generate compatibles con Ollama y con los SDK de OpenAI, y llegó a la portada de Hacker News. El truco es que casi todos los bytes del modelo están en dos lugares: 68 GB de expertos ruteados (512 por capa, 10 activos por token) y una tabla de n-gramas de 32 GB; el tronco denso son apenas 3,8 GB y queda residente. Los expertos se leen con pread a un pool fijo de slots compartido por las 48 capas, así que las capas calientes le piden slots a las frías. El detalle que conviene copiar es el de la planificación de memoria: el autor barrió gigabyte por gigabyte y encontró que 33 GB es la rodilla —nada entre 34 y 84 GB mejora ni la velocidad de decodificación ni el prefill—, así que una Mac de 128 GB pide lo mismo que una de 48. El tamaño del caché cambia la velocidad, nunca la salida: la equivalencia byte a byte entre un caché de 4 GB y uno de 24 GB es un test permanente. Está medido en una sola máquina, un M5 Pro de 48 GB; el resto de la tabla es extrapolación. GitHub · Hacker News

    GitHub Hacker News OpenAI GitHub

  2. Técnicas y repos

    El motor de inferencia colibri explotó en GitHub con más de 3.100 estrellas en un día (13/09)

    El repo no es nuevo, pero el salto de tracción de hoy lo pone arriba de la lista de tendencias y vale mirarlo por lo que propone: correr modelos MoE de frontera —de 744.000 millones a 2,8 billones de parámetros— en hardware de consumo, en C puro y sin dependencias, tratando almacenamiento, RAM y VRAM como una sola jerarquía de inferencia. La idea central es hacer streaming de los expertos desde disco en lugar de tenerlos todos en RAM, así que un NVMe rápido pasa a ser el factor que más determina los tokens por segundo. Hoy soporta ocho familias, entre ellas GLM-5.2, GLM-5.3-Flash, Kimi K3, DeepSeek V4 Flash, Qwen3.8-Flash-Next, Qwen3.6 y OLMoE, con la jerarquía de memoria manejada por LRU más un conjunto de pines aprendido. Conviene tomarlo como lo que es —un proyecto en movimiento, con trabajo abierto en formatos, compresión, placement, scheduling, kernels y KV—, no como un reemplazo de producción de vLLM o llama.cpp. GitHub · Colibri

    GitHub Colibri DeepSeek GitHub Kimi vLLM llama.cpp

  3. Técnicas y repos

    colibrì trepó a 33.000 estrellas proponiendo algo que suena imposible: correr modelos MoE de frontera desde el disco, en C puro y sin dependencias (15/09)

    El repo sumó 2.035 estrellas en el día y la idea que lo mueve merece atención aunque uno nunca lo instale. Un modelo Mixture-of-Experts de 744 mil millones de parámetros activa solo unos 40 mil millones por token, y de esos apenas ~11 GB cambian de un token al siguiente. colibrì toma esa observación en serio: la parte densa —atención, expertos compartidos, embeddings, unos 17B de parámetros— se queda residente en RAM en int4, unos 9,9 GB, y los 19.456 expertos ruteados viven en NVMe y se transmiten bajo demanda. La analogía que usa el autor es la de un JIT: los parámetros no son estado a sostener, son datos a preparar justo cuando el router prueba que hacen falta, y eso funciona porque el ruteo tiene estructura medible —resulta 71,6% predecible un layer por adelantado, lo que habilita el prefetch—. Los números son honestos y modestos: 1,8 tok/s en un escritorio CPU-only de 128 GB, 1,07 tok/s en una caja con una sola RTX 5070 Ti, y 0,05-0,1 tok/s en frío en la máquina de 25 GB de RAM y doce núcleos donde nació el proyecto. Declara soporte para GLM-5.2, Inkling (975B), Kimi K3 (2,8T), DeepSeek V4 Flash, Qwen3.8-Flash-Next y OLMoE. Truco que vale más allá del repo: si tenés un segundo SSD, poner una copia completa del modelo ahí y rutear los expertos por hash entre ambos suma el ancho de banda de las dos unidades —un par de 9 GB/s + 3 GB/s lee ~33% más rápido que el disco veloz solo—. GitHub

    GitHub DeepSeek GitHub Kimi

El hilo se arma solo en cada build: junta noticias de días distintos que nombran a la misma entidad y repiten vocabulario que casi no aparece en el resto del archivo. Nadie lo edita a mano, así que puede dejar afuera una noticia o sumar una de al lado.