Resumen:
Recientemente, el desarrollador Cactus Compute lanzó un modelo liviano de IA llamado Needle 2.
El modelo tiene solo 14 MB de tamaño y está profundamente optimizado para el entorno del procesador de Raspberry Pi 5. Puede convertir instrucciones en lenguaje natural en llamadas a funciones preestablecidas en tiempo real sin la necesidad de una placa de expansión de aceleración de IA.

Según el blog oficial de Raspberry Pi, Needle 2 no es un robot de chat tradicional de uso general, sino un modelo dedicado centrado en la ejecución de comandos del lado del dispositivo. Cuando el usuario ingresa para encender la luz LED, el sistema solo tarda 78 milisegundos en completar todo el proceso, desde el reconocimiento hasta la ejecución, logrando una respuesta casi instantánea.
En términos de rendimiento y uso de recursos, Needle 2 también demuestra una eficiencia extrema. En la medición real de Raspberry Pi 5 (versión de memoria de 8 GB), la memoria que ocupa este modelo en funcionamiento es de solo unos 28 MB. Incluso si se ejecuta el programa de demostración completo de Python, el consumo total de memoria es de sólo 46,4 MB.
Este diseño liviano permite que el modelo esté completamente separado de la API de la nube y el entorno de red, y lograr un control inteligente puramente local en el borde.

En términos de características de hardware y llamadas de interfaz, Needle 2 está profundamente vinculado al hardware subyacente a través del sistema de anotación Python. Los desarrolladores solo necesitan agregar etiquetas específicas al código de función existente, y el modelo puede capturar automáticamente el nombre de la función, la descripción y los tipos de parámetros, y crear una especificación de llamada.
Por ejemplo, el tiempo de respuesta de una instrucción para consultar la temperatura del procesador es de 149 milisegundos y el sistema devolverá con precisión el valor Celsius. Todo el proceso se completa completamente dentro del procesador local.
Sin embargo, cabe señalar que el modelo es muy restringido en cuanto a juicio lógico. Para preguntas irrelevantes que no pueden coincidir con la función preestablecida (como "¿Dónde está la capital de Francia?"), Needle 2 devolverá un valor nulo dentro de 92 milisegundos en lugar de responder a la fuerza.
Actualmente, los pesos del modelo de Needle 2 se han publicado en la plataforma Hugging Face y el código relevante también es de código abierto en GitHub siguiendo el protocolo Apache 2.0.
Comentarios