Retour au fil

Nous avons testé le modèle d'IA le plus dangereux au monde : ce que font réellement les modèles sans refus

Doruk Yalcinsoy a transformé un modèle open source non censuré en agent piloté via Telegram. Cette variante de Qwen sans refus s'attaque aux tâches que les modèles fermés évitent, des pentests sur soi-même aux simulations de rivaux.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — phXn6pGtV5Q
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

La vidéo s'ouvre sur un dilemme : fallait-il même la publier ? Yalcinsoy raconte que sa question la plus difficile posée au modèle est revenue sous forme d'une explication continue et ininterrompue, et que c'est cette fluidité même qui l'a fait hésiter. Son raisonnement est direct : puisque ce savoir est déjà disponible gratuitement en accès public, un spectateur bien intentionné est plus en sécurité en l'apprenant pour se défendre qu'en restant dans l'ignorance.

Derrière cela se cache la mécanique de refus des modèles fermés. Claude ou ChatGPT peuvent refuser les demandes qui heurtent la politique de l'entreprise, l'éthique ou la sensibilité politique. L'exemple de la vidéo est frappant : un parent demandant une automatisation qui falsifie la présence scolaire de son enfant essuie un refus. Même dans les zones grises, c'est le modèle lui-même qui devient le décideur.

L'alternative présentée est cette même mécanique dont le circuit de refus a été retiré. On prend les poids ouverts, on supprime les couches qui produisent les refus, et ce qui reste répond sur tous les sujets. La version citée dans la vidéo est une variante non censurée basée sur Qwen ; le choix des paramètres suit la mémoire de la machine, avec une version plus grande sur un ordinateur à forte mémoire et une plus petite sur un ordinateur portable modeste.

La partie la plus pratique concerne la solution matérielle. Ceux qui manquent de mémoire installent le modèle sur un serveur ; la vidéo pointe vers des environnements de type Kaggle offrant un quota mensuel d'heures GPU gratuites où le modèle attend, prêt à l'emploi. L'accès à un modèle non censuré est présenté comme une tâche d'installation, non comme un achat.

L'étape suivante consiste à transformer le modèle en agent. Des frameworks d'agents de type Hermes sont suggérés, avec l'astuce que toute la configuration peut être dictée étape par étape en demandant à un outil comme ChatGPT. Telegram devient la surface de contrôle, et le bot est nommé Yaramaz, « espiègle » en turc, car il pourrait réellement causer des dégâts si on l'orientait dans ce sens.

Le test en direct est une tentative d'attaque contre son propre site. Yalcinsoy demande au bot de tenter de pirater son site web et de produire un rapport, rappelant que les modèles fermés répondraient à la même demande par de longues justifications de refus. Dans la démo, le petit modèle n'exécute pas l'intrusion lui-même mais énumère les vecteurs d'attaque ; le point souligné par la vidéo est le non-refus, pas le résultat. La mémoire limitée du bot Telegram est ouvertement désignée comme le facteur limitant.

La liste des usages de bonne foi est la partie la plus riche. Auditer son propre site, interface ou plateforme, faire remonter des vulnérabilités, simuler comment un rival vous ruinerait ou comment un escroc tromperait votre employé — tout cela apparaît comme des exercices légitimes. La préparation aux crises et aux catastrophes, l'analyse des pires scénarios sans complaisance et l'examen impitoyable des dépendances en matière d'investissement et de partenariat figurent sur la même liste.

La vidéo y trace une nuance subtile : la flatterie. Yalcinsoy soutient que les modèles de chat populaires glissent vers la flagornerie pour garder l'utilisateur en conversation, tandis que ces modèles épurés parlent franchement sans flatter l'ego de personne. Sur les investissements, les partenariats et les dépendances, il trouve cette franchise plus utile.

L'avantage de la localité a son propre chapitre. Les contrats, les états financiers et les données qui ne doivent jamais fuir peuvent être traités sur la machine de leur propriétaire sans toucher au cloud — présenté comme la promesse commune de tous les modèles open source, pas seulement des non censurés. Comme les données ne quittent jamais l'appareil, la confidentialité est préservée et l'expérimentation reste bon marché.

Le volet des menaces est raconté avec la même franchise. Un message qui vous parvient, un fil de discussion ou un ton menaçant peut provenir d'un modèle plutôt que d'une personne. La vidéo rappelle aux spectateurs que les modèles de synthèse vocale ne font que prononcer des répliques d'abord écrites par des modèles de texte comme celui-ci ; faux proches, chantage à grande échelle, des milliers de textes de persuasion personnalisés, clonage de style et mensonges assurés sont listés comme formes concrètes de ce risque.

La conclusion porte sur l'affirmation que cette transformation n'a presque pas commencé. Yalcinsoy dit que le partage est un devoir même si cela fâche certains, car c'est simplement la réalité, et laisse au public deux phrases : n'en faites pas un mauvais usage, mais n'ayez pas peur de l'essayer non plus. Le postulat que ses spectateurs sont des apprenants bien intentionnés inscrit toute cette publication dans un acte de responsabilité sociale.

Commentaire de l’IA

""À mon sens, la vraie phrase de la vidéo est celle-ci : le danger ne réside pas dans le modèle lui-même, mais dans le fait qu'une fois le circuit de refus retiré, toute l'autorité passe à l'utilisateur. C'est pourquoi je considère les modèles non censurés comme une question de compréhension et de supervision, et non d'interdiction.""

Sources

6 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

modèle non censuré · open source · pentest · agent ia · sécurité

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…