Volver al inicio

Un Millón de Tokens Sin Tarjeta Gráfica: ¿Qué Puede Hacer un Modelo de 4 Mil Millones?

El Spark X 2.5 gratuito de 4 mil millones de parámetros se abre de verdad en un procesador sin tarjeta, pero leer todo el millón lleva horas incluso en la máquina rápida.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — mt1WiI_o1N4
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Un millón de tokens son varios libros gruesos juntos, y este modelo lo promete en un formato de bolsillo. La edición gratuita de 4 mil millones de parámetros cabe en un archivo comprimido de 2,6 GB en cuatro bits. La pregunta surge de inmediato: ¿puede un ordenador común sin tarjeta gráfica ejecutarlo de verdad? La respuesta corta se parte en dos. El modelo se abre, sí; pero usar todo el millón a diario, no.

La identidad del modelo aclara el panorama. Esta versión abierta del equipo Spark de iFLYTEK, junto a su hermano pequeño de 1700 millones de parámetros, figura entre los raros diseños con ventana nativa del millón en el dispositivo. Cubre más de 200 idiomas y usa una atención híbrida eficiente: capas de ventana deslizante alternadas con capas de atención completa. Los detalles están documentados en la ficha alojada en huggingface.co.

La primera condición sin tarjeta es un motor reciente. Tras el lanzamiento, el modelo fallaba en las versiones estándar de llama.cpp con un error de arquitectura desconocida, y el soporte oficial llegó el 6 de septiembre. La ficha lista versiones mínimas para llama.cpp, Ollama y LM Studio, y el fabricante publica el modelo en Ollama con su propia cuenta. La elección del archivo también cuenta: la etiqueta por defecto descarga 8,2 GB, mientras que la opción sensata para memoria modesta es el archivo de 2,6 GB. Verifiqué esta división en la página del modelo en ollama.com.

Hay dos velocidades distintas que no deben confundirse. La lectura digiere su texto, la escritura genera la respuesta. En una caja Xeon de ocho núcleos, la escritura avanzaba a 6 tokens por segundo y la lectura se movía entre 30 y 36. En una máquina ARM de dieciocho núcleos, la escritura llegaba a 47 y la lectura hasta 254. Lo notable es que añadir hilos ayudaba a la lectura pero hundía la escritura en ese chip ARM: pico con seis hilos y caída bajo 7 con dieciséis hilos en competencia. Todas estas cifras vienen de instrucciones cortas y nada dicen de documentos gigantes. Un tropiezo fácil acecha porque el producto anuncia un techo del millón. El primer probador vio que el motor apuntaba a todo el millón por defecto y tuvo que limitar el tamaño del contexto a mano. Escriba usted el número en lugar del defecto. Que estos defectos silenciosos duelen lo confirma la guía de contexto de Ollama en neuralgist.com, donde el cliente elige una ventana pequeña según la memoria.

Para entender el coste en memoria de una instrucción masiva, mire los pequeños registros guardados durante la lectura. Esta entrada de caché KV por token sirve para mirar atrás. Según el cálculo, un millón de tokens pide 39 GB solo de caché, algo más de 41 GB con el modelo. Un escritorio con 64 GB de RAM Aloja así todo el documento. Una máquina de 32 GB solo pasa con caché comprimida de precio desconocido, y 16 GB choca hacia unos cientos de miles de tokens.

La factura se mantiene razonable gracias al diseño. Si las 36 capas guardaran todo el texto, el cálculo apuntaría a 155 GB. Pero 27 capas solo guardan los últimos 512 tokens, y apenas nueve capas de atención completa conservan todo el historial. llama.cpp usa ese ahorro por defecto. En el estándar de 16 bits, el coste baja a 36 KB por token: 1,2 GB en 32K, 4,8 GB en 128K y menos de 39 GB en el millón. Las cifras idénticas de una ficha GGUF comunitaria y la reserva de 1,3 GB medida en 128K con cuatro bits lo confirman; la página GGUF en huggingface.co da el detalle de archivos.

Incluso con memoria suficiente, la factura real llega en espera. Nadie ha cronometrado una instrucción larga en procesador para este modelo, así que cada duración larga es un cálculo derivado de velocidades cortas medidas. En el equipo ARM de dieciocho núcleos, 32K toma 3 minutos, 128K unos 20 minutos y el millón cerca de 13 horas. En la caja Xeon de ocho núcleos con cuatro hilos, se infla a 4 días. La causa es el coste cuadrático de la atención : en las nueve capas completas, cada token compara toda la caché previa. El cálculo iguala el resto del trabajo en 51K y multiplica por 20 en el millón. Las notas de arquitectura de caché en deepwiki.com explican este fondo. La brecha con una tarjeta pequeña impresiona. En la medición del autor del GGUF, una tarjeta pequeña leía 1684 tokens por segundo en instrucción corta y 557 en 131K tokens completos, pero terminaba en 4 minutos. La misma carga pide 20 minutos en el procesador ARM rápido y dos horas y media en el servidor de ocho núcleos. Incluso la marca más rápida en procesador hallada fuera, en núcleos eficientes Apple M4 Max a 345 tokens por segundo, da 9 horas y media para un millón. Con RAM suficiente, la ventana del millón es sobre todo un problema de espera; decenas de miles de tokens se leen en minutos.

Aun aceptando la espera, ¿aguantan las respuestas? En su propia tabla, el modelo logra 56,3 en la prueba de razonamiento de contexto largo de ArtificialAnalysis, con documentos de 100K tokens por pregunta, frente a 57,0 del rival Qwen3.5-4B. Dos reservas obligatorias: la cifra viene del vendedor que califica su modelo, no de un laboratorio independiente, y 100K es un décimo del millón. Más allá, no hay puntuaciones de recuperación ni pruebas de aguja publicadas. Lo que mide la prueba lo explica la tabla larga en artificialanalysis.ai.

Antes del millón, una trampa diaria espera: el modo de razonamiento. El modelo escribe primero un borrador oculto antes de la respuesta final. Al ritmo de la máquina de ocho núcleos, cada millar de tokens de monólogo cuesta casi 3 minutos. En una tarea de código de los debates de HuggingFace, el modelo quemó todo el presupuesto de 800 tokens en 233 segundos dentro de su cabeza, sin entregar una línea de código. En una suma de compras, se atascó en el límite de 4096 tokens, y luego resolvió lo mismo en 549 tokens con el modo apagado. Un bucle de 10000 tokens sobre un nombre de parámetro en 128K significaría media hora de espera en ese Xeon. Desactive la reflexión para tareas rápidas y resérvela para razonar en profundidad con paciencia.

Entonces, ¿puede un ordenador sin tarjeta gráfica ejecutar una IA del millón de tokens? Sí al modelo, pero no rotundo al millón en la práctica diaria. Se abre de verdad en un procesador común, y un escritorio de 64 GB Aloja el texto entero en el papel, pero el obstáculo decisivo no es la memoria sino la espera. Incluso en la máquina rápida, el cálculo da 13 horas de ventilador para leer la instrucción, sin prueba publicada de que las respuestas aguanten más allá de 100K. La gran excepción es la aceleración: una tarjeta pequeña leyó 131K tokens en 4 minutos donde el procesador rápido pedía 20 minutos. En procesador, tome el archivo oficial de 2,6 GB en cuatro bits con un motor reciente, reduzca la ventana a decenas de miles y apague la reflexión para ir rápido. El contexto industrial de este lanzamiento lo da el reportaje sobre iFlytek en yangtzeer.com, presentado como el primer modelo abierto chino del millón hacia el borde.

Visualization: nodesdaily AI

Momentos clave

  1. Promesa del millón y veredicto dividido
  2. Versiones del motor y elección del archivo
  3. Mediciones en Xeon y ARM
  4. Memoria y capas híbridas
  5. Aritmética de la espera
  6. Comparación con tarjeta gráfica
  7. Puntuación y límite de 100K
  8. Trampas del modo de razonamiento y ajustes

Comentario de la IA

"El millón de tokens suena mágico, pero tras esta prueba el número que me queda es el tiempo de espera. Que el modelo arranque impresiona, aunque el contexto completo en procesador es un ejercicio de paciencia, no de uso diario."

Evaluación de la IA

El contrapunto más fuerte es que lento no significa inútil. Un modelo sin conexión que mantiene los documentos en la máquina vale mucho para trabajos sensibles. Una cola de resúmenes durante la noche hace aceptables 13 horas de lectura. Para teléfonos, robots y PC de campo sin tarjeta gráfica, un modelo pequeño y abierto con agentes locales ya es una victoria.

Las lagunas son reales. Nadie ha cronometrado un millón de tokens en procesador, así que todas las duraciones largas son aritmética derivada de velocidades cortas. No hay evidencia independiente más allá de 100K tokens, ni puntuaciones de recuperación ni pruebas de aguja. El coste en precisión de la caché comprimida sigue sin medirse, y la idea de que 32 GB Alojan el millón depende de esa incógnita. Confiar en la ventana completa antes de cerrar estos huecos es especulación.

Sobre la posición del ponente: The Stack no ejecutó el modelo; las mediciones pertenecen a los probadores de la página de HuggingFace y al probador independiente Javier Canete. Los tiempos largos, las tablas de memoria y el punto de 51K son su propia aritmética. Esa transparencia ayuda porque distingue lo medido de lo calculado. Aun así, la aritmética puede subestimar las ralentizaciones reales. Las notas de memoria de llama.cpp en deepwiki.com explican bien este comportamiento de la caché híbrida.

El consejo práctico es claro. En una máquina sin tarjeta, tome el archivo oficial de 2,6 GB en cuatro bits con un motor reciente, mantenga la ventana en decenas de miles de tokens y desactive el modo de razonamiento para tareas rápidas. Si alimentar documentos a escala de biblioteca es rutina, incluso una tarjeta pequeña pasa de horas a minutos. Lea el millón como una hoja de ruta, no como el ajuste de hoy.

Fuentes

7 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

inteligencia artificial · modelo local · contexto largo · inferencia en cpu · memoria · código abierto

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…