Liquid AI ha anunciado en el blog de Hugging Face dos modelos de decisión abiertos: d1-3B y d1-omni-600M, este último todavía experimental. A diferencia de un asistente que genera una respuesta palabra a palabra, estos modelos producen una decisión estructurada en una sola pasada. El primero acepta texto e imágenes; el segundo admite texto combinado con imagen o audio. Según las mediciones de la empresa, d1-3B obtuvo 48,57 puntos en Decision Index 0.2.1. En otra comparación sobre siete conjuntos de datos públicos, su media fue 82,9 frente a 81,1 de Decider 4B. Los autores también informan de 16 milisegundos para una pregunta en un Jetson AGX Thor y 50 milisegundos en un Orin Nano. Son cifras de los equipos y pruebas especificados, no tiempos universales para cualquier aplicación. La limitación importante es que Liquid AI no publica en este anuncio resultados de benchmark de visión ni de audio comparables: reconoce que la parte visual de Decision Index 0.3 es privada y que faltan pruebas de decisiones por audio. Por eso, el rendimiento de esas modalidades queda menos documentado que el de texto. Imagen ilustrativa: placa con un NVIDIA Jetson Orin NX fotografiada en Computex 2025. No representa los dispositivos concretos ni las pruebas de Liquid AI.
Liquid AI publica dos modelos de decisión multimodal para equipos pequeños
Imagen ilustrativa: 4300streetcar · CC BY 4.0
Fuente principal:
Hugging Face Blog →
Hugging Face Blog →
