El equipo de Transformers presenta compatibilidad con checkpoints GGUF, un formato popularizado por llama.cpp que empaqueta pesos y metadatos y ofrece distintos niveles de cuantización. La integración busca permitir su carga desde las APIs habituales de Transformers y aprovechar kernels de ggml para acercar el rendimiento de la inferencia local. Como ejemplo, el artículo compara tamaños de archivo de variantes de un modelo Qwen: la versión Q4_K_M ocupa menos que la referencia BF16. Ese ahorro facilita que ciertos modelos quepan en equipos con memoria limitada, pero la precisión y la calidad resultantes dependen del modelo y la tarea. La primera ruta descrita se centra en Apple Silicon y en arquitecturas compatibles, con Transformers en su rama de desarrollo y requisitos concretos de PyTorch y kernels. No debe leerse como soporte universal para todos los modelos GGUF. Imagen ilustrativa: servidores en rack; no muestra una máquina ejecutando Transformers o llama.cpp.
Transformers incorpora soporte para modelos GGUF de llama.cpp
Fuente principal:
Hugging Face Blog →
Hugging Face Blog →
