Retour au fil

Un Million de Tokens Sans Carte Graphique : Que Peut Vraiment un Modèle de 4 Milliards ?

Le Spark X 2.5 gratuit à 4 milliards de paramètres s'ouvre vraiment sur un processeur sans carte, mais lire tout le million prend des heures même sur la machine rapide.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — mt1WiI_o1N4
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Un million de tokens représente plusieurs gros livres tenus ensemble, et ce modèle le promet dans un format de poche. L'édition gratuite à 4 milliards de paramètres tient dans un fichier compressé de 2,6 Go en quatre bits. La question suit aussitôt: un ordinateur ordinaire sans carte graphique peut-il vraiment l'exécuter? La réponse courte se coupe en deux. Le modèle s'ouvre, oui; mais exploiter tout le million au quotidien, non.

L'identité du modèle clarifie le tableau. Cette version ouverte de l'équipe Spark d'iFLYTEK, avec son petit frère à 1,7 milliard de paramètres, compte parmi les rares architectures à fenêtre native d'un million sur appareil. Elle couvre plus de 200 langues et utilise une attention hybride économe: des couches à fenêtre glissante alternent avec des couches à attention complète. Les détails sont documentés sur la fiche du modèle hébergée sur huggingface.co.

La première condition sans carte est un moteur récent. Juste après la sortie, le modèle échouait sur les versions standard de llama.cpp avec une erreur d'architecture inconnue, et le support officiel est arrivé le 6 septembre. La fiche liste les versions minimales pour llama.cpp, Ollama et LM Studio, et le fabricant publie le modèle sur Ollama sous son propre compte. Le choix du fichier compte aussi: l'étiquette par défaut télécharge 8,2 Go, tandis que le choix raisonnable pour une mémoire modeste est le fichier de 2,6 Go. J'ai vérifié ce partage sur la page du modèle sur ollama.com.

Il y a deux vitesses distinctes à ne pas confondre. La lecture digère votre texte, l'écriture génère la réponse. Sur un boîtier Xeon à huit coeurs, l'écriture rampait à 6 tokens par seconde et la lecture se situait entre 30 et 36. Sur une machine ARM à dix-huit coeurs, l'écriture montait à 47 et la lecture jusqu'à 254. Fait notable, ajouter des fils aidait la lecture mais écrasait l'écriture sur cette puce ARM: pic à six fils puis chute sous 7 avec seize fils en concurrence. Tous ces chiffres viennent de requêtes courtes et ne disent rien des documents géants. Un piège facile guette car le produit affiche un plafond d'un million. Le premier testeur a vu le moteur viser tout le million par défaut et a dû limiter la taille du contexte à la main. Écrivez vous-même le nombre au lieu du défaut. Que ces défauts silencieux causent des maux de tête est confirmé par le guide du contexte Ollama sur neuralgist.com, où le client choisit une petite fenêtre selon la mémoire.

Pour saisir le coût mémoire d'une requête massive, regardez les petits enregistrements conservés pendant la lecture. Cette entrée de cache KV par token sert aux regards en arrière. Selon le calcul, un million de tokens demande 39 Go de cache seul, un peu plus de 41 Go avec le modèle. Un bureau à 64 Go de RAM tient donc tout le document. Une machine de 32 Go ne passe qu'avec un cache compressé au prix inconnu, et 16 Go bute vers quelques centaines de milliers de tokens.

La facture reste raisonnable grâce à la conception. Si les 36 couches gardaient tout le texte, le calcul pointerait vers 155 Go. Or 27 couches ne gardent que les 512 derniers tokens, et seules neuf couches à attention complète conservent tout l'historique. llama.cpp utilise cette économie par défaut. Au standard 16 bits, le coût tombe à 36 Ko par token: 1,2 Go à 32K, 4,8 Go à 128K et moins de 39 Go au million. Les chiffres identiques d'une fiche GGUF communautaire et la réserve de 1,3 Go mesurée à 128K en quatre bits confirment; la page GGUF sur huggingface.co donne le détail des fichiers.

Même avec assez de mémoire, la vraie facture arrive en attente. Personne n'a chronométré une longue requête sur processeur pour ce modèle, donc chaque longue durée est un calcul dérivé des vitesses courtes mesurées. Sur la machine ARM à dix-huit coeurs, 32K prend 3 minutes, 128K environ 20 minutes et le million près de 13 heures. Sur le Xeon à huit coeurs avec quatre fils, cela gonfle à 4 jours. La cause est le coût quadratique de l'attention : dans les neuf couches complètes, chaque token compare tout le cache précédent. Le calcul égalise les autres travaux à 51K et multiplie par 20 au million. Les notes d'architecture du cache sur deepwiki.com expliquent cet arrière-plan. L'écart avec une petite carte graphique frappe. Dans la mesure de l'auteur du GGUF, une petite carte lisait 1684 tokens par seconde sur requête courte et 557 sur 131K tokens entiers, mais finissait en 4 minutes. La même charge demande 20 minutes sur le processeur ARM rapide et deux heures et demie sur le serveur à huit coeurs. Même le record processeur trouvé ailleurs, sur coeurs efficaces Apple M4 Max à 345 tokens par seconde, donne 9 heures et demie pour un million. Avec assez de RAM, la fenêtre d'un million est surtout un problème d'attente; des dizaines de milliers de tokens se lisent en minutes.

Même en acceptant l'attente, les réponses tiennent-elles? Sur son propre tableau, le modèle obtient 56,3 au test de raisonnement long contexte d'ArtificialAnalysis, avec 100K tokens de documents par question, contre 57,0 pour le rival Qwen3.5-4B. Deux réserves obligatoires: le chiffre vient du vendeur qui note son modèle, pas d'un laboratoire indépendant, et 100K vaut un dixième du million. Au-delà, aucun score de récupération ni test d'aiguille publié. Ce que mesure le test est expliqué par le classement long contexte sur artificialanalysis.ai.

Avant le million, un piège quotidien attend: le mode réflexion. Le modèle écrit d'abord un brouillon caché avant la réponse finale. Au rythme de la machine à huit coeurs, chaque millier de tokens de monologue coûte près de 3 minutes. Dans une tâche de code des discussions HuggingFace, le modèle a brûlé tout le budget de 800 tokens en 233 secondes dans sa tête, sans livrer une ligne de code. Sur une somme d'achats, il a calé à la limite de 4096 tokens, puis résolu le même problème en 549 tokens une fois le mode coupé. Une boucle de 10000 tokens sur un nom de paramètre à 128K signifierait une demi-heure d'attente sur ce Xeon. Coupez la réflexion pour les tâches rapides et gardez-la pour le raisonnement profond avec patience.

Alors, un ordinateur sans carte graphique peut-il exécuter une IA à un million de tokens? Oui pour le modèle, mais non net pour le million au quotidien. Il s'ouvre vraiment sur un processeur ordinaire, et un bureau à 64 Go tient le texte entier sur le papier, mais l'obstacle décisif n'est pas la mémoire, c'est l'attente. Même sur la machine rapide, le calcul donne 13 heures de ventilateur pour lire la requête, sans preuve publiée que les réponses tiennent au-delà de 100K. La grande exception est l'accélération: une petite carte a lu 131K tokens en 4 minutes là où le processeur rapide demandait 20 minutes. Sur processeur, prenez le fichier officiel de 2,6 Go en quatre bits sur un moteur récent, réduisez la fenêtre à des dizaines de milliers et coupez la réflexion pour aller vite. Le contexte industriel de ce lancement est donné par le reportage iFlytek sur yangtzeer.com, présenté comme le premier modèle ouvert chinois à un million vers l'embarqué.

Visualization: nodesdaily AI

Moments clés

  1. Promesse d'un million et verdict partagé
  2. Versions moteur et choix du fichier
  3. Mesures Xeon et ARM
  4. Mémoire et couches hybrides
  5. Arithmétique de l'attente
  6. Comparaison avec carte graphique
  7. Score et limite des 100K
  8. Pièges du mode réflexion et réglages

Commentaire de l’IA

"Le million de tokens fait rêver, mais après ce test le chiffre qui me reste en tête est le temps d'attente. Le modèle tourne vraiment, pourtant tout le contexte sur processeur relève de la patience, pas du quotidien."

Évaluation de l’IA

Le contrepoint le plus fort est que lent ne veut pas dire inutile. Un modèle hors ligne qui garde les documents sur la machine est précieux pour les usages sensibles. Un traitement par lots pendant la nuit rend 13 heures de lecture acceptables. Pour les téléphones, les robots et les PC de terrain sans carte graphique, un petit modèle ouvert qui fait tourner des agents en local est déjà une victoire.

Les lacunes sont réelles. Aucune mesure publiée pour un million de tokens sur processeur, donc toutes les longues durées sont des calculs dérivés des vitesses sur requêtes courtes. Aucune preuve indépendante au-delà de 100K tokens, aucun score de récupération ni test d'aiguille. Le coût en précision du cache compressé reste inconnu, et l'idée qu'une machine de 32 Go tient le million repose sur cette inconnue. Faire confiance à la fenêtre entière avant de combler ces vides serait spéculatif.

Sur la position de l'intervenant: The Stack n'a pas exécuté le modèle; les mesures appartiennent aux testeurs de la page HuggingFace et au testeur indépendant Javier Canete. Les durées longues, les tableaux mémoire et le point à 51K sont son arithmétique. Cette transparence est utile car on distingue le mesuré du calculé. L'arithmétique peut toutefois sous-estimer les ralentissements réels. Les notes mémoire de llama.cpp sur deepwiki.com éclairent bien ce comportement du cache hybride.

Le conseil pratique est clair. Sur une machine sans carte, prenez le fichier officiel de 2,6 Go en quatre bits sur un moteur récent, gardez la fenêtre à des dizaines de milliers de tokens et coupez le mode réflexion pour les tâches rapides. Pour des documents à l'échelle d'une bibliothèque, même une petite carte graphique fait passer des heures aux minutes. Lisez le million comme une feuille de route, pas comme le réglage du jour.

Sources

7 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

intelligence artificielle · modèle local · long contexte · inférence cpu · mémoire · open source

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…