Volver al inicio

27 mil millones de parámetros en una mano: cómo Khadas Mind Pro alcanzó 44 tokens/s

Khadas Mind Pro ejecutó Qwen3 27B en una mano con Panther Lake Core Ultra X7 358H y ARC B390; con la cuantificación y el modelo de borrador adecuados, la misma caja saltó de 5 tok/s a 44 tok/s, un salto de 9x.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — 1_8pzU44n-M
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Comenzó con una simple curiosidad: ¿puede una caja que cabe en una mano ejecutar un modelo de IA serio? La respuesta es sí, pero esa no es la sorpresa. En el mismo Khadas Mind Pro y el mismo Qwen3 27B, la configuración más lenta se arrastró por debajo de 5 tok/s, mientras que la más rápida alcanzó 44 tok/s; el procesamiento de prompts saltó 56 veces, de 17 a más de 900. La diferencia no fue un hardware nuevo, sino la configuración de software adecuada.

La caja es el Khadas Mind Pro. En su interior se encuentra el Intel Panther Lake Core Ultra X7 358H: 16 núcleos híbridos, 12 gráficos integrados ARC B390 basados en Xe3, 64 GB de LPDDR5X a 8533 MT/s, además de un SSD PCIe 4.0 de 2 TB. Intel posiciona la plataforma para hasta 180 TOPS de IA local. Notebookcheck encontró un rendimiento de CPU muy alto y una iGPU entre un 60 y un 80 por ciento más potente que las generaciones anteriores, con el bloque gráfico consumiendo entre 30 y 40 W dentro de un paquete de 50 W. Presentado en el CES 2026, es la caja X7 más pequeña que la compañía ha fabricado.

El truco es la modularidad. Khadas Mind Link es un conector magnético propietario que acopla la caja a una base y expone un enlace PCIe 4.0 x8 nativo, teóricamente de 15,8 GB/s. La base Mind Graphics 2 alberga una NVIDIA RTX 5060 Ti de escritorio de 16 GB GDDR7, una GPU de 180 W con una fuente de alimentación de 350 W. También añade dos HDMI 2.1b, DisplayPort 2.1b, dos USB-A 3.2 Gen2, USB-C de 40 Gbps, 2.5 GbE y un lector SD 4.0. El precio es elevado: la caja comienza en 1.799 dólares y recientemente ha subido a 2.599, la base cuesta 1.349; la tarjeta sola ronda los 570. El enlace supera con creces el límite de 80 Gbps de Thunderbolt 5, pero cuánto de esa velocidad importa es otra cuestión.

La carga fue Qwen3 27B, un popular modelo abierto de 27 mil millones de parámetros. El primer paquete fue Q4_K_M: 4 bits con K para el nuevo esquema de escalado y M para protección media, pesando 17,66 GB. El segundo fue IQ4_XS: todavía de 4 bits pero más compacto con calibración imatrix, bajando a 13 GB y cabiendo completamente en 16 GB de VRAM. El modelo no es un bulto sino un pastel de unas 62 capas; el flag NGL de llama.cpp decide cuántas capas se copian a la VRAM. Los paquetes GGUF de Unsloth en Hugging Face muestran la brecha práctica entre las dos compresiones.

Sin acoplar, la caja funciona de cuatro maneras: CPU, Vulkan, SYCL y OpenVINO. El procesamiento de prompts medido fue de 17 tok/s en CPU y 446 tok/s con OpenVINO, una brecha de 27x. La generación se mantuvo entre 2,6 y 5,7 tok/s: CPU por debajo de cinco, Vulkan 5,4, SYCL 5,7, OpenVINO 2,6. La razón es la memoria: cada token transmite los 18 GB de pesos, y los gráficos integrados comparten un pool con la CPU. El ancho de banda real se desvía de las matemáticas: 17,66 GB por 5,42 tok/s equivale a unos 100 GB/s. El nuevo controlador de Intel puede abrir la memoria compartida al 93 por ciento, pero sigue siendo DDR compartida a la velocidad del sistema, no VRAM dedicada; el cuello de botella persiste.

La solución es dejar de producir una palabra por pasada. La decodificación especulativa utiliza un modelo de borrador pequeño y rápido que adivina algunos tokens por adelantado; el modelo grande los verifica en una sola pasada y cada suposición aceptada es casi gratuita. Algunos paquetes Qwen envían el borrador de 1,5 GB justo al lado del modelo. En gráficos integrados, esto duplicó la salida de 5 a 11 tok/s de forma gratuita. Ambos dispositivos alcanzaron un pico en la profundidad del borrador Nmax 3, aunque uno es cinco veces más rápido. Empujar a Nmax 8 bajó a 3,5 tok/s, más lento que sin borrador. llama.cpp ya tiene 3 por defecto, así que déjelo así.

Añadir la GPU discreta se volvió complicado. Con 17,6 GB, el modelo desbordó la tarjeta de 16 GB en 1,7 GB. El barrido NGL contó la historia: 0 capas 4,54 tok/s, 48 capas cerca de 11, 56 capas cerca de 14, luego 60 capas colapsaron a 0,82 tok/s, un precipicio de 17x y un muro. Esas cuatro capas adicionales obligaron al controlador a mover capas de entrada y salida para cada palabra. El antiguo flag tutorial NGL 99 anula el ajuste automático; el automático dio 10,48 tok/s mientras que el ajustado a mano 56 dio 14, por lo que el flag ciego puede costar 16x. La curva no es una pendiente suave sino un precipicio que solo se libera en el último paso; las últimas capas son las más importantes.

La solución fue reducir el modelo. Cambiar Q4_K_M a IQ4_XS ahorró 4,5 GB y lo hizo completamente residente en 16 GB. La recompensa fue doble: procesamiento de prompts de 474 a 943, generación de 14 a 27. Una descarga superó todo el barrido de capas. ¿Disminuyó la calidad? En la prosa inglesa de WikiText-2, la perplejidad se mantuvo alrededor de 6,8 para ambos paquetes, el más pequeño incluso un poco mejor, dentro del ruido. Pero el límite es claro: los dos archivos provenían de cuantificadores diferentes, por lo que la prueba comparó esos archivos, no Q4 versus IQ4 en general; y la perplejidad solo verifica la predicción del siguiente token en prosa, no código, matemáticas o razonamiento largo. Pruebe su propia carga de trabajo.

¿Realmente importa Mind Link? En papel es una tubería de 15,8 GB/s; en la práctica, la generación necesita de 2 a 19 MB/s y promedia 2 MB/s, aproximadamente el 0,01 por ciento de la tubería. Tendría que hacer el enlace 8.000 veces más lento antes de que se convirtiera en el cuello de botella. Thunderbolt es cinco veces más lento en papel, pero cinco frente a 8.000 no es una comparación cercana. Para la generación de LLM no hace ninguna diferencia; para los juegos podría. El único momento en que el ancho de banda importa es la carga: mover 17 GB en unos 3 segundos es un movimiento de datos real, luego la tarjeta permanece casi inactiva.

Las mediciones se perdieron durante un día entero porque un proceso invisible mantuvo 18,5 GB como rehenes; llama-bench permaneció residente después de la eliminación y cada lectura posterior se redujo a la mitad sin previo aviso. Con una segunda GPU presente, OpenVINO volvió silenciosamente a la CPU y causó un error 30x; la variable de entorno quiere GPU.0 con el cero. La caja tiene una batería UPS incorporada; bajo carga pesada, un cable de 30 W la agotó lentamente hasta el apagado, solucionado con un cable de 100 W. Una base Austar OCuLink se bloqueó dos veces al mover el modelo a la VRAM, el controlador de pantalla se rindió. Linux aún no se ha probado por preocupación sobre el controlador de enlace especial. El video cuenta estas trampas a propósito para que no caigas en ellas.

Ponga todas las configuraciones una al lado de la otra y la imagen es nítida: CPU sola por debajo de cinco, integrada 5,5, más borrador 11, discreta dividida 14, completamente residente 27, más borrador 44 tok/s; nueve veces de la más lenta a la más rápida. El procesamiento de prompts pasó de 17 a más de 900, 56x. Tres victorias son gratuitas: haz que quepa, activa el borrador, elimina el flag tutorial. Solo una victoria cuesta dinero: compra VRAM. La lección es comprar VRAM, no ancho de banda; verifica el ajuste antes de comprar, no pegues NGL 99 a ciegas y habilita el borrador solo para una caja de un solo usuario; con dos usuarios, desactívalo porque las suposiciones compiten con los usuarios reales por la misma pasada.

Visualization: nodesdaily AI

Comentario de la IA

""Lo que me sorprendió no es que funcione, sino que el mismo hardware vaya 9 veces más rápido con la configuración correcta; el ajuste en la VRAM fue el factor decisivo entre el estancamiento y la velocidad.""

Evaluación de la IA

Siendo objetivo, el contraargumento es fuerte: una caja de mano más una base de mil dólares supera los tres mil y, incluso a 44 tok/s, una API en la nube sigue siendo más rápida y barata; por 10-20 dólares al mes puedes saltar entre GPT, Claude y Gemini, por lo que esto sigue siendo un pasatiempo de nicho. El ARC B390 compite con una RTX 4050 Laptop de 60W en juegos, pero no es un campeón en relación precio-rendimiento; como señala Notebookcheck, la RAM está soldada, las actualizaciones son mínimas y los accesorios son caros. La escala y la frescura de la nube no son superadas por este escritorio solo.

Mucho quedó sin probar. La perplejidad solo verifica la predicción del siguiente token en prosa inglesa; el daño al código, las matemáticas y el razonamiento largo permanece invisible, sin embargo, es por eso que muchos ejecutan un 27B localmente. La limitación térmica, el ruido del ventilador, la duración de la batería y la configuración superior de 96 GB nunca se midieron. Un modelo, dos archivos, dos cuantificadores es demasiado estrecho para una afirmación general. La nota de que un borrador perjudica con dos usuarios simultáneos porque las suposiciones compiten con los usuarios reales por la misma pasada no fue evaluada; Linux sigue siendo una pregunta abierta.

En cuanto a la verificabilidad, me mantengo cauteloso: el video no está patrocinado por Khadas, pero es una muestra de producto y contiene un anuncio intermedio para Abacus ChatLM; los números son de un solo dispositivo, una sola ejecución. La afirmación de 44 tok/s requiere IQ4_XS completamente residente más el borrador y su tasa de aceptación varía con el prompt; necesita una nueva ejecución independiente. Los precios también son volátiles: la caja pasó de 1.799 a 2.599, la base cuesta 1.349; el desbloqueo de memoria compartida al 93 por ciento es flexibilidad de capacidad, no velocidad, y el ancho de banda compartido aún no puede igualar la VRAM dedicada bajo carga pesada. El titular del 93 por ciento de TopCPU se refiere a la capacidad, no al rendimiento.

Mi opinión es práctica: si la privacidad y el uso sin conexión son mi prioridad y mi modelo cabe en 16 GB, esta caja se convierte en una estación de escritorio sensata; si necesito un contexto largo, la máxima calidad o compartir en equipo, la API en la nube sigue siendo más saludable y barata. Antes de comprar, verifique que su modelo quepa, no descarte la cuantificación pesada a ciegas, pero pruébela en su propia carga de trabajo, elimine NGL 99 y deje que el ajuste automático se ejecute o intente un ajuste manual alrededor de 56, y manténgase en Nmax 3. Yo usaría esta configuración para un asistente de codificación de un solo usuario y desactivaría el borrador en un servidor multiusuario.

Fuentes

10 enlaces; 1 de ellos también citados por 2 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

khadas · panther lake · arc b390 · qwen3 · cuantificación · llama.cpp · vram

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…