Liquid AI ha publicado LFM2.5-VL-DSpark, un modelo auxiliar de decodificación especulativa pensado para trabajar junto a LFM2.5-VL-3B. En la explicación técnica, la empresa dice que el borrador añade unos 280 millones de parámetros y propone bloques de tokens que el modelo principal verifica. Liquid AI reporta hasta 3,13 veces más velocidad de decodificación en dispositivo y hasta 2,66 veces en una GPU H100. Sus cifras de extremo a extremo son menores: hasta 2,62 veces en el primer entorno y 2,27 veces en H100. Son mediciones publicadas por la propia compañía sobre tareas y equipos concretos, no una garantía para cualquier uso. La limitación clave está en la carga visual: la técnica acelera la generación de texto, pero no la codificación de la imagen ni el preprocesamiento del prompt. En trabajos donde esas fases pesan mucho, la mejora total puede reducirse. El modelo se presenta como experimental y el artículo cita compatibilidad con llama.cpp, MLX-VLM y SGLang. Imagen ilustrativa: GPU del superordenador MareNostrum 5; no representa una prueba de Liquid AI.