Retour au fil

Qwen 3.8 27B sur une seule carte 8 Go : mieux que prévu

Red Stapler fait tourner Qwen 3.8 27B sur une seule RTX 4060 8 Go et le teste avec quatre projets de création web : générations en un seul essai sans boucle d'agent, des attentes d'une heure, et des résultats comparés côte à côte avec Opus 4.6.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — ye50BbXEczo
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

L'affirmation d'ouverture est simple : Qwen 3.8 27B tourne sur une seule RTX 4060 avec 8 Go, et chaque élément montré a été produit en un seul essai, sans boucle d'agent. L'auteur reconnaît d'emblée que la configuration était lente et capricieuse au début, mais trouve tout de même remarquable qu'un modèle de cette classe produise un travail abouti sur une carte aussi modeste. L'épisode promet la recette complète : l'installation, les choix de harnais et de paramètres, puis les résultats finaux aux côtés de Claude Opus.

Le contexte, c'est le moment du modèle : Qwen 3.8 est sorti environ deux semaines plus tôt et est vite devenu le sujet favori de la communauté. Malgré sa taille relativement modeste de 27 milliards de paramètres, il est décrit comme égalant Opus 4.6 sur plusieurs benchmarks de code et d'agents, le dépassant parfois. La plupart des guides recommandent des cartes de 24 Go pour lui ; cette vidéo sonde plutôt le bas de la fourchette.

L'observation clé vient du graphique de quantification : la version IQ4XS reste à environ six pour cent du modèle de base tout en le réduisant à environ 14 Go. Cela met les cartes milieu de gamme de 16 Go dans la course. La vidéo va un cran plus loin : et 8 Go — trop lent pour s'en soucier ? Il est temps de tester.

La configuration est frugale de bout en bout : le fichier IQ4XS d'Unsloth, une fenêtre de 70K tokens jugée largement suffisante pour un petit projet, et un cache KV quantifié en 4 bits pour économiser la mémoire de contexte. Environ 26 couches sont confiées au GPU, maintenant l'utilisation totale autour de 7 Go avec de la marge pour l'OS.

Les réglages fins se poursuivent : le pool de threads CPU est calé sur le nombre de cœurs physiques (six sur la machine de l'auteur), et le décodage spéculatif tourne en mode MTP avec au maximum deux tokens de brouillon. Le mode réflexion est activé avec le budget de raisonnement supprimé, pour une raison concrète — le modèle peut dépenser quelque 20K tokens juste pour réfléchir à un prompt de site web de taille moyenne, donc un plafond l'interromprait en pleine pensée. L'échantillonnage suit les valeurs partagées par la communauté : température 1, top K 20, pénalité de répétition 1, min P zéro.

Le choix du harnais est traité comme une question de premier ordre sur 8 Go : l'outil avec le prompt système intégré le plus léger l'emporte, et c'est Pi. La logique est simple — la carte étant déjà à sa limite mémoire, le gonflement du harnais taxe directement le contexte et la vitesse, donc le runner le plus léger évite d'alourdir la petite carte.

Le premier travail est une landing page 3D sur le thème de Minecraft. Environ une heure après le lancement, la génération se bloque en boucle pendant l'écriture, et Pi interrompt l'appel d'écriture. En creusant, deux correctifs apparaissent : le timeout HTTP est désactivé parce que la génération est si lente que les limites normales tuent le travail, et le nombre maximal de tokens de sortie est relevé pour que les gros fichiers passent. Le prompt est relancé et aboutit après deux heures et demie à environ 4,2 tokens par seconde, démarrant près de six et ralentissant à mesure que le contexte grandit.

Les trois autres travaux se terminent plus vite : une scène de ville néon cyberpunk en Three.js en environ une heure et demie à cinq tokens par seconde, un prompt détaillé de site personnel en environ deux heures à 4,6, et une landing page de design d'intérieur en une heure et demie à cinq. Le même prompt est aussi envoyé à Opus 4.6, et la vidéo aligne les deux sorties côte à côte à chaque fois.

Le verdict est audacieux : Qwen 3.8 change la donne pour les modèles locaux. Sur 8 Go, le rythme est encore jugé trop lent pour un usage quotidien, mais la qualité de sortie d'un modèle de cette taille est jugée solide — dans certains tests meilleure que le côté Opus 4.6. La projection avancée est qu'une carte de 16 Go atteint environ 12 à 14 tokens par seconde à 70K de contexte, ce qui compte comme pratique.

Une question de clôture reçoit une réponse directe : pourquoi pas la version 3 bits sur la machine 8 Go ? Avec un délestage CPU important, elle tournait plus lentement que la version 4 bits, les quantifications non divisibles par deux payant une pénalité de vitesse. La conclusion : rester dans la bande 4 bits pour ce type de configuration hybride.

Visualization: nodesdaily AI

Commentaire de l’IA

""Pour moi, cette vidéo sort le débat sur les modèles locaux des tableaux de benchmarks abstraits pour l'installer sur un vrai bureau : avec une carte 8 Go, de la patience et les bons réglages, un modèle de classe 27B livre un vrai travail.""

Évaluation de l’IA

Pour défendre l'autre camp : les travaux de landing page en un seul essai flattent les modèles locaux, et les modèles frontaux payants prennent l'avantage dans des dépôts multi-fichiers en désordre et un usage d'outils sur la longue durée. D'après mon expérience, la vidéo ne teste jamais ce scénario, donc je lis son verdict meilleur qu'Opus sur certains tests comme limité à ce genre de page.

La liste des lacunes est longue : 1,5 à 2,5 heures d'horloge par travail, quatre à cinq tokens par seconde, des réglages fragiles comme les timeouts et les plafonds de sortie, et le compromis du contexte 70K avec KV en 4 bits. La projection de 12 à 14 tokens pour les cartes 16 Go n'est jamais mesurée dans cet épisode, elle reste donc la projection de l'auteur, et la pénalité 3 bits est l'observation d'une seule machine, pas une règle générale.

Pour la vérification, j'adosse le tableau à des sources indépendantes : l'affirmation IQ4XS à la page Unsloth et au benchmark Quesma, le débordement de réflexion à une note indépendante sur le sur-raisonnement, le choix de Pi à sa documentation officielle, et la faisabilité 8 Go à une page externe de test de compatibilité. Je reverrais chaque chiffre de la vidéo face à ces sources au moment de décider ; les fichiers de quantification sont rafraîchis en quelques semaines.

Mon bilan : une option réelle pour les apprenants, les bidouilleurs, tous ceux qui gardent leurs données en local, et les propriétaires de cartes 16 Go — pas pour le travail sous délai ni pour 8 Go comme machine de tous les jours. Il y a aussi la dette d'audit liée à donner des pouvoirs de terminal à un runner : utiliser un harnais open source, c'est accepter de lire ce qu'il exécute.

Sources

7 liens ; 1 d’entre eux sont aussi cités par 2 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

qwen 3.8 · 27b · 8gb · modèle local

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…