
Needle 2 modelo de uso de herramientas es la nueva propuesta abierta de Cactus Compute para ejecutar llamadas a funciones, acciones sobre dispositivos y extracción estructurada sin depender de un servidor. Tiene 45 millones de parámetros y se distribuye como un único binario de 14 MB.
El modelo está orientado a hardware sin GPU ni NPU. Según las cifras comunicadas por el equipo, una sesión completa ocupa aproximadamente 28 MB de RAM, mientras que el motor puede funcionar en teléfonos económicos, dispositivos IoT, wearables, sistemas de robótica y otros equipos con recursos limitados.
Un modelo de 45 millones de parámetros, entrenado y desplegado en CQ2-bit, que integra pesos y motor C++ en un binario de 14 MB y mantiene la memoria cerca de 28 MB durante la sesión.
Diseñado para llamadas a funciones, no para conversación abierta
La propuesta de Needle 2 se centra en transformar frases imprecisas en llamadas que encajen con firmas de funciones tipadas. Cactus Compute plantea que esta tarea no requiere conocimiento general del mundo ni generación de texto abierta, lo que permite reducir el tamaño del modelo y dirigirlo a acciones concretas.
Entre sus usos se incluyen el control por voz de electrodomésticos, la extracción de campos en recibos y facturas, el etiquetado mediante valores cerrados y el enrutamiento local. Una aplicación puede ejecutar la acción en el dispositivo y recurrir a la nube únicamente cuando la confianza queda por debajo del umbral definido.
El modelo se ofrece mediante binarios precompilados y una biblioteca estática para macOS, Linux en varias arquitecturas, Windows, Android, iOS, watchOS, tvOS y WebAssembly. Cactus también indica que Pebble ya utiliza Needle de forma local en la aplicación Index 01 para acciones de voz sin conexión.
Un motor integrado y con memoria acotada
Los pesos se entrenan y despliegan en CQ2-bit, una cuantización de dos bits que, en este caso, forma parte del entrenamiento y no se aplica solo después. Los códigos se expanden dentro de registros vectoriales y se combinan con productos enteros, mientras el binario selecciona al arrancar el nivel de instrucciones disponible: desde SDOT, NEON y AVX2 hasta vectores RISC-V, SIMD de WebAssembly o ejecución escalar.
El motor incorpora una gramática generada a partir de los esquemas JSON. Esta gramática restringe los tokens válidos y puede evitar hasta el 98 % de la proyección del vocabulario en tokens estructurales. La atención utiliza una ventana deslizante de 256 tokens y conserva como memoria KV las instrucciones del sistema y las declaraciones de herramientas, con el objetivo de mantener estable el consumo de RAM aunque crezca la conversación.
Selección de herramientas y confianza
Cuando se declaran cinco herramientas o menos, todas se presentan directamente al modelo. Si hay más, un módulo de recuperación compara la consulta con las representaciones de cada esquema y deja accesibles solo las cinco opciones principales. Las restantes no quedan simplemente peor posicionadas: permanecen fuera del conjunto que puede utilizarse en ese turno.
Cada respuesta incluye una puntuación de confianza calculada a partir de un clasificador calibrado y de la probabilidad de los tokens de la llamada. Las peticiones fuera de contexto pueden producir una llamada vacía, []. Así, el producto puede decidir si ejecuta la acción, vuelve a preguntar o deriva la solicitud a un servicio remoto.
Rendimiento y evaluación comunicados por Cactus
Needle 2 emplea una arquitectura de 27 capas y anchura 512, con una red de atención simplificada, GQA, memoria de pares clave-valor basada en n-gramas y conexiones hiperconectadas de varios carriles. El equipo cifra su coste en 70 MFLOPs por token, con 35 millones de sus 45 millones de parámetros activos en multiplicaciones de matrices.
Las velocidades declaradas alcanzan 500 tokens por segundo en una Raspberry Pi 5, entre 400 y 1.500 en Meta Quest 3S y Apple Vision Pro, y entre 300 y 700 en teléfonos de menos de 200 dólares. Son cifras del fabricante y pueden variar según el dispositivo, el núcleo seleccionado y la carga de trabajo.
En cinco benchmarks públicos de llamadas a funciones, Cactus utiliza coincidencia exacta estricta ordenada, que exige acertar los nombres, el orden y todos los argumentos. Needle 2 lidera las dos divisiones de Seal-Tools y obtiene un 98,3 % de precisión en nombres de funciones en Mobile Actions. En BFCL v4 queda por detrás con un 42,6 % global y registra un 93,4 % de salidas bien formadas sobre 3.641 casos.
La propia evaluación advierte de dos factores: las líneas de referencia se ejecutan en f16 mediante vLLM, mientras Needle 2 lo hace con su motor distribuido en CQ2-bit, y el modelo está especializado en acciones de dispositivos de consumo, no en API generales o empresariales. Por tanto, los resultados describen mejor su ámbito objetivo que una clasificación universal de modelos.
Qué aporta a los dispositivos sin conexión
Needle 2 ofrece una vía compacta para añadir acciones estructuradas a productos donde instalar un runtime adicional, mantener una conexión constante o enviar audio a la nube supone un problema. Su combinación de gramática, recuperación y confianza también facilita definir qué ocurre cuando una petición no encaja con las herramientas disponibles.
Queda por comprobar cómo se comporta fuera de los escenarios de dispositivos para los que ha sido entrenado y cómo evolucionan sus resultados con evaluaciones independientes. Aun así, el binario único y el techo de memoria cercano a 28 MB convierten a Needle 2 en una opción especialmente enfocada a firmware, electrónica de consumo y automatización local.
Encuentra más IA en nuestra sección de IA o suscríbete a Guslok – Guías 100% en YouTube para más contenido.


