Volver al inicio

Needle 3: el micromodelo de 8 megabytes que supera a los gigantes en el dispositivo

El Needle 3 de Cactus Compute funciona en 8 a 29 MB y corta un solo conjunto de pesos de 2 a 20 capas — una escalera de inteligencia que empaqueta llamadas a herramientas, extracción estructurada y embeddings en un único modelo en el dispositivo para teléfonos, relojes y hubs sin nube.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — qiZITfI0wQE
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Un archivo más pequeño que el icono de una app que vence a modelos diez veces mayores suena a marketing, pero Needle 3 afirma exactamente eso. Su porción utilizable más pequeña, a 4 capas, pesa unos 8 MB, y la versión completa de 20 capas son 29 MB. Sin internet, sin salto a un servidor, sin esperas — el modelo corre directamente en el dispositivo. El vídeo desmonta ese titular pieza por pieza para ver dónde se sostiene y dónde estira.

El equipo detrás es Cactus Compute, un pequeño equipo de San Francisco respaldado por Y Combinator. Su tesis es contundente: la inteligencia respaldada por la nube es potente pero exige conexión, cuesta dinero en cada llamada y mueve tus datos a otro lugar antes de responder. Construyen modelos y un motor de inferencia para saltarse todo eso, poniendo la inteligencia en el hardware de tu mano o de tu muñeca. No es un experimento aislado — llevan un tiempo publicando herramientas de código abierto para móvil y edge, y Needle ya va por su tercera generación.

El linaje muestra una iteración rápida. Needle 1 llegó a principios de este año como un modelo de 26 millones de parámetros presentado como una porción destilada de la capacidad de llamada a herramientas de Gemini, lo bastante pequeño para un teléfono económico y totalmente abierto desde el primer día. Needle 2 creció a 45 millones de parámetros pero se mantuvo en solo 14 MB en disco, usando una ventana deslizante de 256 tokens con definiciones de herramientas fijadas como referencias, limitando la memoria a unos 28 MB sin importar cuánto durara la conversación. El equipo fue claro en su momento: era un especialista, no un generalista — no para chats largos ni ensayos, sino para elegir la función correcta y rellenar los argumentos bien.

La tracción del proyecto sugiere que no es un lanzamiento desechable. El repositorio de GitHub supera las 11.300 estrellas con más de 700 forks y decenas de contribuidores; la licencia pasó recientemente de MIT a Apache 2.0 y el registro de commits muestra correcciones del motor y del manejo de estado interno aterrizando en el último día o dos. Diecisiete versiones etiquetadas y actividad diaria apuntan a una atención sostenida más que a una única entrega.

La señal externa más fuerte viene del despliegue. Pebble, la empresa detrás de los relojes inteligentes y el anillo sin pantalla Pebble Index Ring, ya ejecuta Cactus Needle dentro de su app. El argumento del fundador es simple: un anillo sin pantalla debe ejecutar un comando hablado cada vez, con o sin conectividad, así que ejecutan el modelo localmente en lugar de depender de la nube. La huella se mantiene minúscula mientras el rendimiento aguanta — una prueba de producto real más allá de las tablas de benchmarks.

Needle 3 afirma cubrir tres trabajos en un solo modelo, todo en el dispositivo. El primero es la llamada a herramientas: le das al modelo las funciones que expone tu app con descripciones, y lee lo que dice el usuario y decide qué función o funciones llamar y qué argumentos rellenar. Si una sola frase pide dos cosas, devuelve dos llamadas en el orden correcto; si nada coincide, devuelve una lista vacía en lugar de adivinar, así la app sabe no hacer nada en vez de hacer lo incorrecto.

El ejemplo concreto del vídeo lo deja claro: decir «Baja la luz del dormitorio y cierra con llave» a una app de hogar inteligente se convierte en dos llamadas — una para bajar las luces, otra para cerrar las puertas — ejecutadas de inmediato en el dispositivo sin ida y vuelta a un hub o a la nube. Esa ejecución instantánea sin conexión es justo el momento para el que Needle está diseñado, sobre todo cuando los comandos de voz nunca deben perderse porque la red se cayó.

El segundo trabajo es la extracción estructurada. Declaras la forma que quieres, entregas texto desordenado, y Needle devuelve los campos exactos como datos tipados. Extraer un nombre de proveedor, un importe total y una fecha de vencimiento de una factura, o detalles clave de una confirmación de reserva, una notificación del teléfono o un formulario, son los ejemplos canónicos. La fiabilidad viene de una gramática de decodificación compilada desde el esquema que restringe la generación, de modo que la salida se garantiza que parsea y se mantiene dentro de los valores permitidos. El equipo señala que este enfoque se generaliza a la clasificación, ya que un enum convierte el mismo mecanismo en un etiquetador.

El tercer trabajo es el embedding de texto. El mismo modelo puede convertir una frase en un vector — una huella numérica del significado — para que la app pueda buscar, emparejar y enrutar totalmente en el dispositivo. Podría ser encontrar la nota correcta entre cientos, elegir la herramienta más cercana para una petición vaga, o notar que dos alertas dicen lo mismo y fusionarlas. En un reloj donde el espacio de pantalla y la atención escasean, mantener esa lógica local es especialmente valioso; de lo contrario, cada consulta paga un viaje de ida y vuelta a la nube.

Empaquetar tres capacidades normalmente separadas en un solo binario pequeño, si se sostiene, elimina una complejidad real para los desarrolladores. Lo que distingue a Needle 3 es lo que Cactus llama la escalera de inteligencia: un solo conjunto de pesos donde cada profundidad de 2 a 20 capas es en sí misma un modelo completo y utilizable, cada uno más capaz que el de abajo. Un desarrollador puede entregar una porción de 4 capas de 8 MB y 29 millones de parámetros para un reloj, o la versión completa de 20 capas de 29 MB para un teléfono insignia, todo desde la misma ejecución de entrenamiento. Las profundidades se entrenan juntas para que las subredes más pequeñas hereden capacidad del proceso completo, y cada profundidad puede afinarse de forma independiente después.

Varias apuestas arquitectónicas lo hacen posible. El bloque feed-forward estándar se sustituye por un MLP Monarch Hadamard, la atención usa grouped-query attention con embeddings de posición rotatorios y toques ligeros de convolución causal, y la pieza más inusual es lo que Cactus llama un engram — una búsqueda en memoria hash donde una gran parte de los parámetros vive como patrones memorizados en lugar de cómputo activo, lo que explica que un modelo de 121 millones de parámetros se comporte computacionalmente más cerca de uno de 50 millones. Múltiples hiperconexiones paralelas también dejan que la información fluya por varios carriles a la vez. En conjunto, Cactus afirma que estas decisiones reducen las operaciones en coma flotante por token en más del doble frente a un transformador estándar de la misma forma, lo que se traduce directamente en menos consumo de batería y menos calor. El equipo también señala con honestidad que compartir pesos entre tamaños no es nuevo en investigación; lo que se siente nuevo es entregarlo tan pulido para los dispositivos diminutos a los que apuntan.

Antes de aceptar el titular, ayuda ver cómo se midió. Para la llamada a herramientas, Cactus usó Mobile Actions con 961 filas de comandos de teléfono mapeados a intents de Android, DroidCall con 200 filas donde algunas peticiones requieren dos llamadas en orden correcto, y Berkeley BFCL v4 con 3.641 filas que también comprueba abstenerse de llamar cuando no aplica ninguna herramienta. Para extracción usaron DSDC8, Snips Gold y SNIPS 7way, puntuados como micro-F1 de campos. La configuración de comparación importa: las líneas base corrieron a 16 bits completos vía un motor estándar, DeepSeek V4 Flash se consultó vía su API en la nube, y las propias subredes de Needle a 20, 16, 8 y 4 capas corrieron como los binarios reales cuantizados a 2 bits que se entregan a los desarrolladores. Needle se mide así en su forma más comprimida y entregable, mientras las líneas base se miden en su punto más fuerte y sin comprimir. El vídeo lo enmarca como una respuesta justa de «lo que entregarías hoy», aunque señala que no es una comparación de compresión en igualdad de condiciones.

En ese marco, la afirmación del titular es que Needle 3 supera a modelos diez veces mayores en las pruebas de llamada a herramientas móviles y mantiene el ritmo con modelos dos a tres veces mayores en extracción. La afirmación más ruidosa de «supera a DeepSeek V4 Flash» es más estrecha: el ajuste fino sobre el conjunto DroidCall vía la Cactus Platform eleva cada subred entre 18 y 36 puntos, y desde 4 capas hacia arriba la porción afinada supera a DeepSeek V4 Flash en DroidCall y Mobile Actions. En Mobile Actions, la instantánea es DeepSeek V4 Flash 88,4, Needle 3 completo de 20 capas 86,0, LFM2.5 1.2B 82,4, Qwen3.5 0.8B 76,0, FunctionGemma 270M 65,1 y el modelo en el dispositivo de Apple 57,6. No es una afirmación de que un modelo de 29 millones de parámetros piense mejor que un modelo de frontera en general; es una victoria de tarea estrecha afinada, distinta de vencer a un modelo de frontera de frente, pero genuinamente útil si tu app solo necesita esa tarea estrecha de forma fiable y sin conexión.

La rampa de entrada es deliberadamente simple. Instalas el paquete de Python, descargas el modelo una vez desde Hugging Face y lo guardas en caché local, y luego decoras una función Python normal — su firma aporta los tipos de argumentos y su docstring se convierte en la descripción que lee el modelo. Una única llamada run maneja el bucle: Needle elige la herramienta apropiada, ejecuta tu función, incorpora el valor devuelto y responde con una réplica consolidada con el resultado de la ejecución. Cuando una descripción no basta, los triggers ayudan: expresiones regulares comparadas con la frase del usuario pueden bloquear la decodificación a una herramienta específica y garantizar una llamada incluso por debajo del umbral de confianza normal, útil para frases como «enciende las luces» que nunca deben perderse ni enrutarse mal. Para extracción el flujo es simétrico: declaras la forma con un modelo Pydantic y llamas a extract con texto desordenado y la forma, recibiendo un objeto tipado sin parsing manual. Cada respuesta vuelve como un único objeto JSON consistente con las llamadas a funciones, una traza de razonamiento escrita, una puntuación de confianza calibrada y cifras de rendimiento como velocidad de prefill y decode más memoria pico. La cabeza de confianza tiene un suelo integrado en 0,1 — todo lo que quede por debajo se mueve a un campo suppressed-calls en lugar de ejecutarse — y Cactus sugiere un uso de tres niveles: por encima de unos 0,7 ejecutar de inmediato, en el medio mostrar y confirmar, y cuando no se devuelve nada tratarlo como un rechazo porque el modelo no encontró herramienta aplicable.

La cobertura es inusualmente amplia. Cactus entrega motores preconstruidos de menos de 1 MB cada uno para macOS, cinco arquitecturas Linux, Windows, tres arquitecturas Android, iOS, tvOS, watchOS, una build WebAssembly para navegador e incluso un componente WASI para objetivos embebidos especializados. Esa amplitud señala la intención de encajar en casi cualquier categoría de dispositivo, no solo teléfonos. Los pesos de Needle 3 están en Hugging Face y el código fuente completo más el motor viven en GitHub, libres de descargar y ejecutar. El negocio vive un piso más arriba: la Cactus Platform ofrece conjuntos de datos curados, la cuantización a 2 bits que reduce el modelo entregado, diseño y seguimiento de evaluaciones, e infraestructura de ajuste fino a profundidad completa sobre el pipeline propio de Cactus. En otras palabras, el modelo abierto gratuito es un punto de partida sólido, y la plataforma de pago es donde un equipo lo moldea a sus propias herramientas y caso de uso sin construir una pila de entrenamiento desde cero. Ese patrón de open-core más infraestructura de pago suele ser más sano que un lanzamiento gratuito sin ruta de ingresos — le da a Cactus un incentivo para seguir mejorando Needle porque los ingresos dependen de los desarrolladores que quieren ir más lejos, no solo descargar una vez.

Visualization: nodesdaily AI

Comentario de la IA

""Lo que más me llama la atención de Needle 3 no es solo el tamaño, sino la forma en que cada decisión de diseño se mide en batería y calor; la escalera de inteligencia llevaba años en los papers, y Cactus la hizo entregable y medible en un reloj real.""

Evaluación de la IA

Fortaleciendo el argumento contrario, que un pequeño especialista venza a un gran generalista en una tarea estrecha no es sorprendente — es el resultado esperado. DeepSeek V4 Flash está entrenado para chat amplio, código, razonamiento y contexto largo; en suites de intents de teléfono de 961 filas para Mobile Actions y 200 filas para DroidCall, la mayor parte de esa amplitud queda inactiva. Tomar un especialista de 29 millones de parámetros, afinarlo sobre esa misma distribución estrecha para una subida de 18 a 36 puntos y luego comparar en la misma suite inclina naturalmente hacia el especialista. Eso no hace que la victoria carezca de sentido; para un producto que solo necesita esa tarea estrecha sin conexión, llamar a un gran modelo general es simplemente un desperdicio.

Dos limitaciones merecen peso. Primera, todas las puntuaciones de Needle en la tabla se miden a través del binario real cuantizado a 2 bits, mientras las líneas base se miden a 16 bits completos. Es la elección correcta para «lo que entregarías hoy», pero no es una comparación con compresión igualada. Una arquitectura que pierde poco a 2 bits podría ganar aún más a 16 bits, o podría ser al revés. Segunda, Needle brilla dentro de su distribución de entrenamiento — acciones de dispositivos de consumo para hogar inteligente, móvil y wearables, más el relleno estructurado de campos. Fuera de eso, las ganancias se desvanecen: en las superficies de llamada no Python y las categorías de API empresariales de BFCL v4, la generalización cae, con la brecha concentrada en las porciones de SDK de Java y JavaScript donde el conjunto de entrenamiento nunca ha estado.

En cuanto a verificabilidad, lee la tabla con equilibrio. Las 11.300 estrellas en GitHub y el despliegue en vivo en el anillo Pebble son dos señales fuera de los benchmarks y ambas apuntan en positivo, mostrando mantenimiento y confianza de producto más allá de un gráfico. Aun así, la curación de benchmarks es liderada por la propia empresa, y la suite de una empresa siempre será amable con su propio modelo. El corpus de preentrenamiento de 115 mil millones de tokens y los detalles del pipeline Cactus Quants de 2 bits siguen siendo propietarios, lo que hace difícil una replicación externa exacta. Los 18 a 36 puntos extra del ajuste fino del lado de la plataforma plantean una pregunta justa: ¿aparecería la misma subida con los mismos datos fuera de la plataforma?

La conclusión práctica aterriza en un umbral claro. Si necesitas que un comando de voz o un texto corto se convierta en una acción de dispositivo fiable sin conexión — hogar inteligente, wearable, robot o producto de clase microcontrolador — Needle 3 es un contendiente serio, sobre todo con JSON garantizado por gramática, una cabeza de confianza calibrada y triggers regex para frases que no deben perderse nunca. Si necesitas conversación larga, preguntas y respuestas abiertas, escritura creativa o una cobertura amplia de API más allá de Python, esta no es esa herramienta y Cactus no la presenta como tal. La decisión más sana no es elegir solo por el 86,0 en Mobile Actions sino medir directamente con tus propias definiciones de herramientas y tus propios textos de facturas y notificaciones entre la porción de 4 capas y la de 20 capas.

Fuentes

6 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

needle 3 · cactus compute · ia en el dispositivo · escalera de inteligencia · ia de borde

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…