El equipo de ggml ha añadido a llama.cpp soporte para modelos de decisión mediante un nuevo endpoint, /v1/systemone. La función recibe una descripción del estado y preguntas con opciones; devuelve probabilidades para cada alternativa en una sola pasada de inferencia. La entrada puede ser texto, datos estructurados o una captura de pantalla.

Según los autores, los modelos compatibles van de 144 millones a 27.000 millones de parámetros. En una prueba publicada con una NVIDIA RTX PRO 6000, registraron latencias de entre 3 y 43 milisegundos, según el modelo. Son resultados de ese equipo y configuración, no una garantía de rendimiento general.

La novedad acerca esta clase de modelos a despliegues locales. Antes de elegir uno conviene revisar la licencia de sus pesos: el catálogo citado por los autores incluye opciones con condiciones diferentes, incluso de uso no comercial. Fuente principal: blog de Hugging Face, publicación del equipo de ggml.