Morgan Dutemple
← Retour au blog
IA

Qwen 3.8 uncensored : ce n'est pas Alibaba qui a retiré les garde-fous

puce IA lumineuse sur un circuit imprimé, éclairage vert
Photo par Immo Wegmann sur Unsplash
Morgan Dutemple
·Delivery Manager & Expert Transformation Digitale

Guillaume Champeau s'interroge sur X à propos de "cette publication par Alibaba d'un Qwen 3.8 débarrassé de tout guardrail, qui obéit donc à absolument tous les ordres qu'on lui donne sans préjuger de leur bienfondé". La question qu'il pose est réelle, mais l'attribution est inexacte : Alibaba n'a publié aucun modèle sans garde-fou. Ce qui circule sous le nom "Qwen 3.8 uncensored" est une version modifiée par un tiers, sortie 72 heures après la publication officielle. Ce guide explique ce qui s'est vraiment passé, comment fonctionne la technique utilisée, et comment repérer ce type de modification avant de télécharger un modèle IA.

Chronologie des faits

DateÉvénementActeur
14 août 2026Publication de Qwen3.8-27B, licence Apache 2.0, garde-fous d'alignement standardsAlibaba (Qwen team)
14-17 août 2026Plus de 3 millions de téléchargements sur Hugging FaceCommunauté
15 août 2026Publication de Qwen3.8-27B-Uncensored, garde-fous retirés par ablitérationOrcaRouter (société tierce)
15 août 2026Tweet qualifiant la version modifiée de "scary"Gregor Zunic
18 août 2026Tweet questionnant l'attribution à Alibaba et la légitimité des garde-fous IAGuillaume Champeau

Le point de départ de la confusion tient dans ce tableau : trois jours seulement séparent la publication du modèle officiel de sa version modifiée, ce qui laisse peu de temps à l'information de circuler correctement avant que les deux versions ne soient confondues dans la conversation publique.

Ce qu'Alibaba a réellement publié le 14 août 2026

Qwen3.8-27B est un modèle dense de 27 milliards de paramètres, sous licence Apache 2.0, qui a dépassé 3 millions de téléchargements en trois jours sur Hugging Face. Comme les précédentes générations Qwen, il embarque des garde-fous d'alignement standards, y compris sur les sujets sensibles pour la Chine. Rien dans cette publication ne retire de garde-fou : le modèle qu'Alibaba a mis en ligne refuse toujours les demandes qu'un modèle aligné refuse habituellement.

Ce qui s'est passé 72 heures plus tard

Le 15 août 2026, OrcaRouter, une société commerciale qui propose une API de routage de modèles, publie sur Hugging Face une version baptisée Qwen3.8-27B-Uncensored. La fiche du modèle est étonnamment franche sur ce qu'elle a produit : le modèle "se conformera aux demandes nuisibles, contraires à l'éthique, offensantes ou illégales", sans garde-fou significatif intégré, et son déploiement public y est présenté comme "strictement interdit sans couches de modération supplémentaires". Les usages déclarés comme légitimes par la fiche elle-même sont la recherche en interprétabilité, les tests adversariaux en environnement contrôlé, et l'évaluation de robustesse, pas un usage grand public.

C'est ce dérivé, pas la publication d'Alibaba, que le chercheur Gregor Zunic a qualifié de "scary" dans le tweet cité par Guillaume Champeau : "it will just do anything you ask it to do on the web, no gates."

Comment fonctionne l'ablitération, expliquée simplement

La technique utilisée par OrcaRouter s'appelle l'ablitération, documentée par le chercheur Andy Arditi et ses coauteurs en 2024. Pour la comprendre sans entrer dans les mathématiques, il faut d'abord savoir qu'un modèle de langage aligné ne "refuse" pas au sens humain du terme : le refus est un comportement appris pendant l'entraînement, encodé dans les poids du modèle comme n'importe quel autre comportement.

Les chercheurs ont montré que ce comportement de refus correspond, dans les représentations internes du modèle, à une direction mathématique quasiment unique : une sorte d'interrupteur diffus, présent dans les mêmes zones à chaque fois qu'une demande est jugée problématique. L'ablitération consiste à repérer cette direction, puis à l'orthogonaliser, c'est-à-dire à la neutraliser mathématiquement, dans les matrices de poids concernées, 131 dans le cas de ce modèle, réparties entre couches d'attention, projections et embedding.

Le résultat pratique : le modèle garde ses performances générales presque intactes (le score MMLU d'OrcaRouter est identique à celui du modèle officiel) mais perd son réflexe de refus, y compris pour des requêtes formulées à partir d'une image. Aucune donnée d'entraînement nuisible n'a été ajoutée : le comportement problématique n'a pas été enseigné au modèle, seulement démasqué en retirant ce qui le bridait.

Comparatif : modèle officiel contre version ablitérée

CritèreQwen3.8-27B (Alibaba)Qwen3.8-27B-Uncensored (OrcaRouter)
ÉditeurAlibaba, équipe QwenOrcaRouter, société tierce
Garde-fous d'alignementPrésents, standardsRetirés par ablitération
LicenceApache 2.0Dérivée, avec avertissement d'usage
Usage prévu déclaréGénéral, grand publicRecherche, tests contrôlés uniquement
Refus de requêtes nuisiblesOui, comportement par défautNon, quasi absent
Performance générale (MMLU)RéférenceIdentique
Responsabilité en cas de déploiementEncadrée par les conditions AlibabaExplicitement rejetée sur l'utilisateur

Tuto : comment repérer si un modèle IA a été modifié avant de le télécharger

Voici la démarche à suivre sur Hugging Face ou toute autre plateforme de modèles avant d'intégrer un modèle à poids ouverts dans un usage professionnel.

Étape 1, vérifier l'organisation qui publie le modèle. Un modèle publié directement sous le compte officiel de l'éditeur (Qwen, Meta, Mistral) porte en général un badge de vérification. Un modèle publié par un compte tiers, même s'il porte le nom du modèle d'origine dans son titre, n'engage que ce compte tiers.

Étape 2, lire le champ "base model" de la fiche. Sur Hugging Face, ce champ indique explicitement de quel modèle le fichier dérive. Sa présence signale un dérivé, pas une publication d'origine.

Étape 3, chercher les mots qui signalent une modification de l'alignement. "Uncensored", "abliterated", "unaligned", "jailbroken" dans le nom ou la description du modèle indiquent presque toujours une intervention volontaire sur le comportement de refus.

Étape 4, lire la section limitations et avertissements de la fiche. Une fiche sérieuse, comme celle d'OrcaRouter dans ce cas précis, indique explicitement l'absence de garde-fou et les usages interdits. L'absence totale de cette section sur un modèle qui se présente comme "uncensored" est un signal d'alerte supplémentaire, pas une garantie de sécurité.

Étape 5, vérifier la date de publication par rapport au modèle d'origine. Un dérivé publié dans les jours suivant la sortie d'un modèle très commenté a de fortes chances d'être une réaction rapide (ablitération, quantification, fine-tuning communautaire) plutôt qu'un travail de fond validé.

Étape 6, ne jamais déployer publiquement un modèle dont la fiche déconseille ce déploiement. C'est explicitement le cas ici : la fiche d'OrcaRouter interdit un usage public sans couche de modération supplémentaire. Ignorer cet avertissement transfère l'entière responsabilité légale et opérationnelle vers celui qui déploie.

Pourquoi la distinction compte pour l'open weight

Un modèle à poids ouverts est publié une fois, mais ses poids restent modifiables indéfiniment par quiconque les télécharge. L'alignement d'un éditeur n'est donc jamais une propriété permanente du modèle : c'est un réglage par défaut, que n'importe quel tiers disposant de quelques GPU peut retirer chirurgicalement en quelques jours, sans avoir besoin de réentraîner le modèle depuis zéro. J'ai déjà détaillé cette différence entre frontière, open source, open weight et modèle fermé : la publication des poids, pas du code d'entraînement, est ce qui rend ce genre d'opération possible sur un modèle comme Qwen, alors qu'elle ne l'est pas sur un modèle fermé accessible uniquement par API.

La vraie question posée par Champeau

Une fois l'attribution corrigée, la question que pose Guillaume Champeau reste entière, et elle ne se limite pas à ce cas précis. D'un côté, il note que cet épisode va renforcer deux discours réglementaires convergents : le discours américain qui traite les modèles à poids ouverts comme des armes potentielles dont il faudrait réguler voire interdire l'export, et le discours européen qui traite l'IA comme un risque systémique nécessitant une régulation de l'usage. De l'autre, il pose une question plus dérangeante : une machine est censée obéir aux humains qui l'utilisent, alors l'idée même d'intégrer des mécanismes qui font qu'une IA juge la légalité ou la moralité d'un ordre avant de choisir d'obéir ou non pose, selon lui, des questions qu'il ne faut pas sous-estimer, et qui peuvent être en soi contestables.

Cette deuxième objection n'a pas de réponse consensuelle aujourd'hui. Le refus par défaut d'un modèle aligné n'est jamais un jugement moral autonome : c'est un comportement entraîné, reflet des choix de l'éditeur, pas une conscience qui évalue une situation. Mais le fait que ce comportement soit entraînable, et donc retirable, place la responsabilité de ce jugement sur celui qui distribue le modèle, et non sur une supposée capacité de discernement de la machine elle-même.

Ce que je retiens

L'ablitération démontre qu'un engagement de sécurité pris par un éditeur de modèle à poids ouverts est un point de départ, pas une garantie durable. La question à se poser face à un modèle open weight n'est donc pas seulement "refuse-t-il les demandes nuisibles à la sortie", mais "à quelle vitesse, et par qui, ce refus peut-il être retiré". Sur ce terrain, la réponse est déjà connue : 72 heures, et une société qui vend par ailleurs de l'accès API à ces mêmes modèles. Ce n'est pas un problème qu'un embargo sur l'export de poids réglerait à lui seul, tant que la technique d'ablitération elle-même reste publique. C'est aussi le débat au cœur de mon article sur la bascule géopolitique de l'IA que la France ne peut plus ignorer : la nationalité de l'éditeur d'un modèle ouvert dit peu de choses sur ce que ce modèle deviendra une fois entre les mains de quelqu'un d'autre.

Pour aller plus loin : frontière, open source, open weight, fermé : ce que ces mots veulent vraiment dire en IA

Questions fréquentes

Qwen 3.8 uncensored a-t-il été publié par Alibaba ?

Non. Alibaba a publié Qwen3.8-27B le 14 août 2026 avec ses garde-fous d'alignement standards. La version "uncensored" a été publiée le surlendemain par OrcaRouter, une société tierce, via une modification technique appelée ablitération.

Qu'est-ce que l'ablitération d'un modèle de langage ?

C'est une technique qui isole, dans les représentations internes d'un modèle, la direction mathématique unique responsable du comportement de refus, puis la retire des matrices de poids concernées. Le modèle garde ses capacités générales mais perd son réflexe de refus face aux demandes nuisibles.

Comment savoir si un modèle IA que je télécharge a été modifié ?

Vérifiez l'organisation qui publie le modèle, cherchez le champ "base model" sur sa fiche, repérez les mots comme "uncensored" ou "abliterated" dans son nom, et lisez la section limitations. Un modèle dérivé publié quelques jours après un modèle très commenté est presque toujours une réaction rapide, pas une publication d'origine.

Cette technique remet-elle en cause la sécurité de tous les modèles à poids ouverts ?

Dans son principe, oui : tout modèle dont les poids sont publiés peut en théorie subir le même traitement, puisque l'ablitération ne nécessite pas de réentraîner le modèle depuis zéro, seulement d'identifier et de retirer une direction de refus déjà présente dans ses poids.

Utiliser un modèle ablitéré est-il illégal ?

Non, télécharger ou étudier un tel modèle n'est pas illégal en soi, et des usages de recherche sont explicitement reconnus légitimes par la fiche d'OrcaRouter elle-même. C'est le déploiement public sans garde-fou, ou l'usage pour produire un contenu lui-même illégal, qui engage la responsabilité de celui qui l'utilise, pas le modèle en tant que tel.

Morgan Dutemple

À propos de l'auteur

Morgan Dutemple

Delivery Manager à Rennes. Je pilote des projets de transformation digitale, SEO/GEO et accessibilité RGAA pour des clients grands comptes. Ce blog est le reflet de ce que je rencontre sur le terrain.