
Los drafters DSpark para LFM2.5 ya están disponibles para tres modelos de Liquid AI: LFM2.5-1.2B-Instruct, LFM2.5-2.6B y LFM2.5-8B-A1B. Su función es añadir decodificación especulativa para generar texto con menor latencia, sin modificar la secuencia emitida por el modelo objetivo cuando se utiliza decodificación voraz.
El sistema incorpora un modelo auxiliar de unos 300 millones de parámetros que propone nueve tokens por bloque. Después, el modelo LFM2.5 comprueba ese conjunto en una única pasada. Liquid AI comunica mejoras de hasta 3,18 veces en una NVIDIA H100 y de hasta 2,87 veces en un MacBook Pro con M4 Max, aunque el resultado depende del modelo y de la carga de trabajo.
DSpark añade aproximadamente 300 millones de parámetros y puede acelerar la decodificación hasta 3,18 veces en una H100. Con decodificación voraz, la salida coincide con la del modelo LFM2.5 funcionando sin el drafter.
Cómo funciona DSpark en LFM2.5
La decodificación especulativa separa la generación en dos funciones. El drafter produce una propuesta de varios tokens y el modelo principal verifica el bloque completo. Los tokens aceptados evitan parte del coste de generar cada posición de forma individual, mientras que los rechazados se vuelven a calcular con el modelo objetivo.
Los drafters DSpark tienen entre 295,7 y 327,7 millones de parámetros, según el modelo al que acompañan. Su arquitectura utiliza cinco capas de atención completa, un tamaño oculto de 2048, 32 cabezas de atención agrupadas en ocho cabezas de claves y valores, y bloques de nueve tokens. Las ponderaciones del vocabulario se reutilizan desde el modelo objetivo al cargar el sistema.
El rendimiento depende del tipo de tarea
Las mediciones comunicadas se realizaron con SGLang en una H100 y con llama.cpp, Metal y pesos GGUF en FP16 en un MacBook Pro con M4 Max. La configuración usó tamaño de lote 1, bloques de nueve tokens y temperatura cero, con pruebas en MATH500, HumanEval, MBPP, GSM8K y MT-Bench.
- LFM2.5-1.2B-Instruct: mejora media de 2,10 veces en H100 y de 2,54 veces en M4 Max.
- LFM2.5-2.6B: mejora media de 2,67 veces en H100 y de 2,27 veces en M4 Max.
- LFM2.5-8B-A1B: mejora media de 2,54 veces en H100, pero solo de 1,18 veces en M4 Max.
La aceptación marca una diferencia importante. En el LFM2.5-8B-A1B, DSpark acepta una media de 8,27 tokens de cada 10 en MATH500, donde llega a 3,18 veces más velocidad, pero baja a 4,02 en GSM8K. En el caso del modelo con mezcla de expertos, Liquid AI atribuye el rendimiento más limitado en el M4 Max a la implementación actual de MoE en el backend Metal de llama.cpp y al tráfico adicional de pesos durante la verificación.
Acceso y casos de uso
Los checkpoints se distribuyen en formatos Safetensors y GGUF. El uso requiere alojar los modelos por cuenta propia con una compilación de SGLang o llama.cpp compatible con DSpark para objetivos LFM2.5. En el momento del lanzamiento, los drafters no se sirven mediante un proveedor de inferencia alojada en Hugging Face.
El beneficio más claro aparece en asistentes locales, agentes que realizan varias llamadas a herramientas, copilotos sin conexión y aplicaciones que ejecutan el modelo en dispositivos propios. Liquid AI comunica una reducción media del 57 % en la latencia de escenarios de llamadas a varias herramientas con LFM2.5-2.6B, una cifra que debe comprobarse con las trazas y cargas de cada aplicación.
Este enfoque se suma a otras vías para ejecutar modelos fuera de PyTorch, como TensorRT Model Connect de NVIDIA, aunque DSpark se centra específicamente en acelerar la generación mediante un modelo auxiliar.
Qué supone para quienes ejecutan modelos localmente
DSpark ofrece una forma de reducir el tiempo de respuesta sin cambiar la salida voraz del modelo principal, a cambio de añadir memoria y complejidad de despliegue. No es una mejora uniforme: los resultados oscilan entre 1,04 y 3,18 veces según la tarea, el hardware y la tasa de aceptación de tokens.
Por ahora, la propuesta está orientada al alojamiento propio y su utilidad práctica dependerá de la compatibilidad de las implementaciones, de la memoria disponible y de los patrones reales de generación. Las cifras anunciadas sirven como referencia inicial, pero quedan por contrastar en más equipos y cargas independientes.
Encuentra más IA en nuestra sección de IA o suscríbete a Guslok – Guías 100% en YouTube para más contenido.