La distancia entre los modelos que se publican y las máquinas que tiene la mayoría ha sido el problema entero de los pesos abiertos este año. Dos lanzamientos de esta semana la acortan desde direcciones opuestas.

FreeToken, publicado el viernes, es lo que su README llama un motor de servicio mixture-of-experts nativo del borde, de investigadores de UC Berkeley y el MIT con Ion Stoica, Matei Zaharia, Song Han y Kurt Keutzer entre los autores, con licencia Apache 2.0 en GitHub como FlashML-org/FreeToken y artículo en arXiv 2608.16157. La idea es la planificación, no la compresión. La descarga estática de expertos frena la GPU cada vez que un experto necesario no está residente, así que FreeToken usa lo que el artículo llama una política q estrella, repartiendo el cómputo de cada token entre los núcleos de la CPU y los núcleos tensoriales de la GPU según el rendimiento PCIe medido, con un formato de pesos rápido y doble búfer de capa completa para que la transmisión de pesos se solape con el cálculo, y un gestor de memoria elástico que mueve VRAM entre la caché KV y las ranuras de expertos en tiempo de ejecución. InfoQ recoge las cifras: Qwen3.6-35B a unos 39 tokens por segundo en un portátil RTX 4060 de 8 GB, DeepSeek-V4-Flash con 284.000 millones de parámetros en un sobremesa RTX 5090, GLM-5.2 con 753.000 millones en una sola GPU de estación de trabajo, y una decodificación de 3 a 4 veces más rápida con un prellenado de 6 a 30 veces más rápido frente a Ollama y llama.cpp. El soporte cubre las series RTX 30, 40 y 50 en Linux y Windows, con pesos MXFP4, NVFP4, FP8 y BF16.

La otra dirección es la cuantización. Unsloth publicó el jueves un GGUF de 3 bits de GLM-5.3-Flash, el modelo que Z.ai reveló esta semana como el Ox Alpha que estuvo seis días en lo alto de OpenRouter. AI Times sitúa el archivo en unos 120 GB, alrededor de un 81 por ciento menos que la versión en precisión completa, funcionando en una máquina de 128 GB como un Mac Studio o una estación de trabajo sin GPU, y Unsloth afirma un 82 por ciento del rendimiento del modelo BF16 mediante cuantización selectiva por capas con vigilancia de la divergencia KL para mantener cercana la distribución de salida. Esa afirmación es del propio proveedor, igual que la línea de la ficha de Z.ai según la cual GLM-5.3-Flash se acerca a Claude Opus 4.8 en pruebas de programación y agénticas.

Junta las dos y el panorama práctico cambia. Un modelo multimodal de 320.000 millones de parámetros con pesos MIT, un motor que trata a una GPU de consumo y a su CPU anfitriona como un único problema de planificación, y una cuantización que mete todo eso en la memoria del sistema: el escalón de frontera todavía no es local, pero el de debajo ya corre en un buen sobremesa. Lo que hay que vigilar es si pruebas independientes reproducen las cifras de rendimiento, y cuánta calidad cuesta realmente el camino de 3 bits en trabajo real y no en perplejidad.