Pourquoi les détecteurs de texte IA se trompent sur vous
Les détecteurs de texte IA ne mesurent pas une origine, mais un écart à une norme stylistique, et pénalisent les rédacteurs non-natifs et neuro-atypiques.
Soumettez la Genèse à un détecteur de texte IA. Le verdict tombe : 88,2 % de probabilité générée par une intelligence artificielle, selon ZeroGPT (Curtis Alexander, Medium ↗). Testez Matthieu 5 : 77,52 % (capture Threads ↗), confirmé par une seconde source indépendante (Awesome Agents ↗). Un texte rédigé des siècles avant l’existence des Large Language Models (LLM, larges modèles de langage), classé « généré par IA ».
Aussi les détecteurs de texte IA ne mesurent pas une origine, ils mesurent un écart à une norme stylistique. Ce qu’ils sanctionnent (phrases régulières, vocabulaire soutenu, structure prévisible) recouvre exactement les marqueurs de la rédaction en langue seconde et, dans une moindre mesure, de la rédaction neuro-atypique. Le mécanisme de détection a changé depuis 2023, le problème qu’il pose n’a pas disparu, et personne ne l’a encore vraiment mesuré sur des textes français.
Les détecteurs de texte IA ne mesurent pas une origine, ils mesurent un écart à une norme stylistique.
Ce que mesure (vraiment) un détecteur
Le cas biblique n’est pas isolé. La Constitution américaine est signalée entre 60 % et 99 % selon les outils (Analytics Vidhya, Decrypt). Un conte de deux villes de Dickens obtient 70 % chez Turnitin, testé par un étudiant curieux (Milong Zhao, Academic Integrity in the AI Era, UC Davis First-Year Composition Journal (PDF) ↗, même si ce chiffre de 70 % remonte en réalité à un post Reddit anonyme de 2023, repris par Zhao sans vérification indépendante, la chaîne relais fragilise le chiffre précis mais pas le motif qu’il illustre). Le point commun de ces trois textes n’est pas leur ancienneté, c’est leur surreprésentation dans les corpus d’entraînement des modèles. Edward Tian, fondateur de GPTZero, l’explique directement : « The US Constitution is a text fed repeatedly into the training data of many large language models. As a result, many of these large language models are trained to generate similar text to the Constitution and other frequently used training texts » (cité par Benj Edwards, Ars Technica, 14 juillet 2023 ↗, « La Constitution américaine est un texte réinjecté à répétition dans les données d’entraînement de nombreux larges modèles de langage. En conséquence, beaucoup de ces modèles sont entraînés à générer un texte proche de celui de la Constitution et d’autres textes d’entraînement fréquemment utilisés », traduction libre). Un texte massivement réinjecté dans l’entraînement finit par ressembler au style que le modèle reproduit, le détecteur confond alors la source du modèle avec la source du texte qu’il évalue.
Cette explication décrit un mécanisme de 2023, pas la génération de détecteurs actuellement en service (voir plus bas), qui reposait sur deux mesures statistiques : la perplexity (la prévisibilité d’un mot compte tenu de ce qui précède) et la burstiness (la variation de longueur et de complexité entre les phrases). Un texte humain varie, hésite, prend des détours. Un texte généré lisse ces aspérités. Liang et ses coauteurs, dans une étude peer-reviewed publiée dans Patterns (Cell Press), ont mesuré que 61,3 % des essais TOEFL (Test of English as a Foreign Language) rédigés par des locuteurs non-natifs étaient classés « générés par IA » par sept détecteurs différents, contre une précision quasiment parfaite sur des essais d’étudiants américains (Liang, Yuksekgonul, Mao, Wu, Zou, Patterns, 2023, DOI 10.1016/j.patter.2023.100779 ↗). Plus de 97 % des copies non-natives ont été signalées par au moins un détecteur. Le mécanisme identifié : une perplexité plus basse, c’est-à-dire une expression linguistique statistiquement plus restreinte, pas moins correcte, moins variée.

Mais la génération 2026 de détecteurs a changé de méthode. Al Ali et ses coauteurs répliquent l’étude de Liang sur le tchèque et ne trouvent aucun biais systématique (Al Ali, Helcl, Libovický, arXiv 2602.05769, 2026 ↗) : dans cette langue, la perplexité des locuteurs non-natifs n’est pas plus basse que celle des locuteurs natifs. Plus significatif encore, les auteurs montrent que les détecteurs contemporains ne s’appuient déjà plus sur la perplexité seule. Deux conséquences directes. D’abord, décrire un détecteur par « il mesure perplexity et burstiness » décrit l’état de l’art de 2023, pas celui de 2026 (daté explicitement, ce mécanisme reste vrai historiquement mais il est partiellement obsolète). Ensuite, le biais anglophone pourrait être spécifique à l’anglais, ce qui laisse la question de sa transposition au français ouverte.
Le premier faux positif : écrire comme allophone
Le sourcing du biais non-natif est solide et univoque : publié par une revue scientifique à comité de lecture, avec une approche quantitive rigoureuse, reproduit par des tiers (Analytics Vidhya, Stealth Optional, Sensei Enterprises citent des taux convergents pour la Constitution). Le mécanisme est le suivant : une moindre variation stylistique perçue engendre davantage de suspicion algorithmique. Turnitin lui-même a dû réviser le taux de faux positifs qu’il communiquait officiellement, passant de « moins de 1 % » à environ 4 % au niveau de la phrase (Turnitin, billet officiel ↗ ; confirmé par la déclaration nommée d’Annie Chechitelli, Chief Product Officer de Turnitin, dans Inside Higher Ed ↗). OpenAI, de son côté, a retiré son propre classificateur de détection en juillet 2023, invoquant un « faible taux de précision » (annonce officielle OpenAI ↗).
Sur Hacker News (agrégateur communautaire de discussions tech), un fil de 966 commentaires cristallise le pain point (discussion HN ↗) : « ESL speakers tend to be a lot stiffer and structured with the way they create their sentences », le mécanisme non-natif expliqué sans le réduire à « mauvais anglais ». Un autre témoignage nomme le paradoxe : l’usage d’un outil d’accessibilité comme Grammarly, censé aider au respect de la bonne syntaxe, devient une preuve à charge, frappant en premier ceux qui en dépendent le plus, locuteurs allophones ou personnes dyslexiques.
Le second faux positif : une mesure plus fragile pour les neurodivergents
Sur le biais neurodivergent, le sourcing disponible commande une prudence que le premier faux positif ne demande pas. J’ai identifié une seule étude empirique, portant spécifiquement sur l’autisme : l’écart entre un corpus de textes « probablement rédigés par des personnes autistes » et un corpus Reddit général est statistiquement significatif, mais moins de 2 % de chacun des deux corpus est signalé comme généré par IA (Chambers, Kelley, AIED 2025, Springer LNCS 15879 ↗), un ordre de grandeur bien en-dessous des 61 % mesurés par Liang sur le biais non-natif. Rien n’a été mesuré sur le TDAH, la dyslexie ou le haut potentiel intellectuel (HPI) : les affirmations qui circulent sur ces profils remontent à des témoignages individuels, jamais à une mesure par sous-groupe.
Mettre le biais neurodivergent et le biais non-natif sur le même plan, comme le font plusieurs guides de vulgarisation, est précisément le raccourci que la seule étude disponible interdit. Cette réserve me paraissait nécessaire.
Sur mon propre usage de l’anglais, j’observe également ce schéma des allophones : je sur-utilise des tournures figées, apprises comme des blocs même quand elles ont été assimilées à l’oral. Vous vous souvenez de ces phrases connues par coeur parce qu’entendues et répétées 50 fois au labo langues ? « Where is Brian ? » et bien la réponse est uninamique : « Brian is in the kitchen ! ». On peut faire l’hypothèse que ce mécanisme (le figement des formules et non leur incorrection) est ce que le détecteur capte chez un locuteur non-natif, indépendamment de la langue testée. Reste à vérifier si les études disponibles (toutes en anglais à ma connaissance) portent sur ce même mécanisme ou sur autre chose : le sourcing actuel ne me permet pas de trancher mais je fais l’hypothèse que ces mécanismes se retrouvent en français.
Une seconde hypothèse, distincte de la première et tout aussi non testée : le français, langue structurellement proche de l’anglais, hériterait davantage de calques que des langues plus éloignées. Si cette hypothèse tient, le français devrait montrer un biais plus marqué que le tchèque testé par Al Ali, ou d’une langue asiatique. Le calque le plus reconnaissable : « Ce n’est pas X, c’est Y », contraste binaire qui structure une part disproportionnée de la prose générée par IA, au point d’être catalogué comme marqueur à part entière par slop-detector. Il y a des versions bien plus riches et pertinentes pour détecter l’utilisation et les patterns de l’IA, la mienne s’appuie sur des heuristiques rustiques et ne fait appel à aucun serveur : je compte des occurrences de motifs connus (contrastes binaires, gonflement lexical) plutôt que d’entraîner un classifieur sur un corpus.
Pourquoi ce phénomène est structurel
Ruha Benjamin, dans Race After Technology ↗, forge le concept de New Jim Code pour nommer un mécanisme transposable ici sans reprendre son objet racial : un système technique qui reproduit une inégalité existante tout en se présentant comme plus objectif que ce qu’il remplace. Sa thèse centrale, appliquée aux détecteurs de texte, prend cette forme : le biais n’est pas un bug isolé à corriger, il est l’empreinte d’une norme statistique dans le système lui-même. Un détecteur entraîné pour repérer l’écart à un style majoritaire reproduira structurellement cet écart contre quiconque s’en éloigne, quelle que soit la raison de cet éloignement.
C’est là que le désaccord académique devient le point le plus utile. Liang attribue le biais à un mécanisme identifiable (la perplexity), donc en principe susceptible d’être corrigé en changeant de métrique. Garland soutient l’inverse : la contrainte est structurelle. Un détecteur ne connaît jamais la distribution d’écriture propre à chaque individu : il compare un texte à une moyenne de population. Dans une population suffisamment diverse, une partie des textes humains recoupe forcément la zone où se trouvent les textes générés, quel que soit leur style, standard ou non : l’hypothèse « ceci est humain » devient composite par construction, et tout détecteur suffisamment utile pour signaler quelque chose produira nécessairement des faux positifs, indépendamment de la qualité du modèle (Garland, arXiv 2603.20254, 2026 ↗). Pudasaini et ses coauteurs renforcent cette lecture par un autre chemin : un F1-score de 0,97 (soit environ 97 cas correctement classés sur 100, faux positifs et faux négatifs confondus) en domaine d’entraînement s’effondre hors domaine (Pudasaini, Miralles-Pechuán, Lillis, Llorens Salvador, arXiv 2603.23146, 2026 ↗), signe que les détecteurs apprennent des artefacts de corpus, pas une signature propre à la machine. Si Garland a raison, améliorer les détecteurs ne résout rien : cela déplace le seuil de déclenchement et non le mécanisme.
Ma position : Garland a raison, tant que la source du texte reste un LLM. Un large modèle de langage ne connaît pas la communauté de locuteurs qui produit le texte, il n’a aucun accès à qui parle, quand, dans quel rapport social. Changer de métrique de détection ne corrige rien à ça : le détecteur pourrait devenir parfait sur le corpus d’aujourd’hui, il resterait aveugle à ce que la génération suivante de modèles produira, parce que le problème n’est pas dans le détecteur, il est dans ce que le modèle ignore structurellement (voir plus bas, section suivante).
J’appuie cette position sur ce que j’observe dans l’encadrement de mémoires ou de travaux d’une certaine longueur. Les étudiants utilisent les outils mis à disposition par leur établissement pour « humaniser » les textes signalés comme étant issus d’une IA que ça soit réellement le cas, d’une tournure stéréotypique ou de scorie d’un copier-coller malheureux issu de notes de lecture. L’étudiant consciencieux gomme les aspérités. Le texte devient-il davantage de lui ou n’est-il qu’une variante ajustée manuellement du texte produit par l’IA initialement, tel le bateau de Thésée à l’issue de son périple, dont les réparations successives font qu’il n’y a plus une seule pièce d’origine ?

Est-ce toujours le bateau de Thésée ?, retouché par IA et inspiré de #filosofix : « LE BATEAU DE THÉSÉE » ↗
Pourquoi le LLM produit du slop, indépendemment de la capacité du détecteur l’identifier
Le désaccord Liang/Garland porte sur la fiabilité du détecteur. Une question distincte reste ouverte : pourquoi le texte généré est-il plat en premier lieu ? Un LLM est entraîné à prédire le token le plus probable compte tenu de ce qui précède. Mécaniquement, cela le pousse vers la formule déjà vue plutôt que vers l’expression singulière, ce n’est pas un défaut de réglage, c’est la fonction objectif elle-même qui produit ce lissage. Pour simplifier, le LLM est entraîné à proposer le texte statistiquement le plus acceptable, un peu comme un mélange méthodique de pâtes à modelé de couleurs différentes produit systématiquement du marron…
Un large modèle de langage est d’abord un modèle de langue, pas de conversation : il manque, par construction, des fonctions que la linguistique attribue au langage parlé en situation (la fonction phatique (maintenir le contact, les hésitations, les redites d’une vraie conversation), la fonction performative (l’acte que l’énoncé accomplit, pas seulement ce qu’il décrit)) : un langage est situé historiquement et sociologiquement dans une communauté de locuteurs ; le modèle ne connaît le métalangage de cette communauté que si on le lui a montré en quantité, jusqu’au fine-tuning sur corpus dédié dans les cas extrêmes. Sans ce signal, il écrit nécessairement quelque chose de plus fade, de plus « moyen », donc plus idiomatique, au sens des formules toutes faites plutôt que de la langue vivante (tout comme les « bras de fer » repris au moindre différends entre deux parties par les journalistes pressés de finir leur article, ou « le clap de fin », qui, sur LinkedIn, annonce nécessairement un « nouveau défi professionnel » (ou une de ses variantes).
C’est un terrain distinct de la sycophancy (flagornerie), mais un travail récent en interprétabilité illustre le même type de mécanisme caché : un ensemble restreint de têtes d’attention porte un signal « cet énoncé est faux » qui reste actif même quand le modèle choisit d’acquiescer à une affirmation fausse sous pression sociale : le modèle ne se trompe pas, il choisit la déférence (Pandey, arXiv 2604.19117, 2026 ↗). Ce papier ne dit rien du slop stylistique : il documente un circuit de déférence, pas de style. Mais il illustre un principe transposable : un comportement de surface (ici l’accord, là la formule générique) peut avoir une cause structurelle identifiable, indépendante de la qualité du modèle. Rien à ce jour, en revanche, ne prouve que le mécanisme du slop stylistique partage un circuit avec celui de la sycophancy : le rapprochement reste au stade hypothèse de travail.
Cette hypothèse explique aussi un symptôme devenu courant : les traitements post-génération de type « humanize », qui consistent à demander à un algorithme de retirer les formules mécaniques, produites par un algorithme. Passer une couche de correction ne traite pas la cause ; selon l’usage (création ou synthèse/reformulation), les enjeux ne sont d’ailleurs pas les mêmes. Ce n’est pas un problème en soi de retirer les symptômes : c’est un problème de croire que ça règle la cause.
Le langage courant absorbe déjà ce type de fadeur ailleurs, sans avoir besoin de l’IA : le « parler creux sans peine » du monde du management (on « adresse » un problème, une situation « à date ») remplit un deck sans rien dire de formellement attaquable - à l’instar d’un LLM… Ce qu’un de mes collègues appelle, à juste titre, « faire de l’eau tiède ». Aucun LLM non entraîné sur un corpus dédié n’utilisera spontanément « du coup » comme mot de liaison, mais l’usage massif du LLM concourt à propager ce même type de fantaisie lexicale, au même titre que la novlangue managériale avant lui. J’ajouterai une autre interrogation : quels sont les impacts sur notre style d’une pratique régulière du prompting et d’une lecture régulière des réponses ? Et sur notre pensée ? On sait, au moins depuis Friedrich Kittler (Gramophone, Film, Typewriter ↗, 1999) sur Nietzsche (qui, contraint par ses migraines à taper les yeux fermés sur sa machine à écrire Malling-Hansen, est passé de l’argumentation développée à l’aphorisme, du raisonnement suivi au style télégraphique) que le moyen utilisé pour écrire a un impact direct sur ce qu’on écrit (j’aurais pu parler du style « SMS » - tkt, dsl, mdr, le rewording par correcteur automatique qui uniformise les tournures…).
Ce qui est moins testé : le français
Je n’ai identifié aucune étude académique qui mesure ce biais sur un corpus francophone. Le corpus scientifique disponible est anglophone, plus un article tchèque qui infirme la généralisation. Cette absence de sourcing académique n’est pas une absence de ces mécanismes : les détecteurs commandés en français existent, sont utilisés, et produisent des verdicts, comme l’instinct d’un lecteur qui repère un texte généré sans savoir nommer pourquoi. Mais un usage qui « fonctionne » à l’échelle individuelle n’est pas une mesure objective : l’absence de sourcing reste réelle, et elle interdit d’affirmer que le biais anglophone se reproduit à l’identique sur des textes français.
Le terrain éditorial français, lui, a produit quatre guides de reconnaissance du texte généré (Loumina, cours-ndrc, Daria Décrypte, Squid Impact). Tous couvrent le même territoire : catalogue de tics stylistiques, formules d’ouverture suspectes, tirets cadratins, structures ternaires. Aucun n’aborde la réciproque, à savoir que ces mêmes marqueurs, appliqués comme test, produisent des faux positifs sur des rédacteurs humains bien réels. La page Wikipédia anglophone « Signs of AI writing », que TechCrunch salue comme la meilleure référence du genre (TechCrunch, 2025-11-20 ↗), pose elle-même la précaution que les guides français omettent : elle se déclare explicitement descriptive, pas prescriptive : des observations, pas des règles.
Ce qui reste utilisable
Un détecteur répond honnêtement à une question précise et restreinte : sur son propre corpus de comparaison, tel texte s’écarte-t-il statistiquement de la norme observée ? Turnitin documentant son propre taux de faux positifs sur ses propres données en est l’usage le plus défendable. Ce à quoi détecteur ne peut pas répondre honnêtement, c’est à la question qu’on lui pose en pratique : cette personne a-t-elle écrit ce texte elle-même ? Entre les deux questions, il faut refuser la substitution.
Un utilisateur avancé intégrant un détecteur dans un pipeline de modération verra ici l’anti-pattern précis : utiliser un score de similarité statistique comme preuve d’origine. Un professionnel confronté à une accusation portée par ce type d’outil trouvera les termes pour nommer ce qui cloche sans nier que certains usages du texte généré posent un vrai problème. Un consultant repérera dans la démonstration d’Al Ali un exemple concret d’un principe plus général : une mesure vraie sur un corpus ne se généralise pas automatiquement à un autre corpus, même quand rien dans l’intuition ne le laissait présager.
Pour qui utilise un LLM pour produire ou reformuler du texte au quotidien, le point utile n’est pas de savoir si un détecteur va le trahir, c’est de comprendre pourquoi le texte généré a cette texture reconnaissable. Un modèle de langage produit la suite de mots la plus probable compte tenu de ce qui précède (pas la meilleure, la plus probable).
Les réponses de LLM reprennent le même principe que la pizza d’une grande chaîne : optimisées pour ne déplaire à personne, elles ne sont les « meilleures pizzas » de personne.
Une fois ce mécanisme compris, deux niveaux de réponse existent. Le premier consiste à traquer les patterns après coup, avec un détecteur de tics comme celui mentionné plus haut. Le tiret cadratin ne sortira pas indemne de ce débat, tant il est devenu le marqueur d’un texte généré alors qu’il s’agit aussi d’une mise en forme automatique dans Office 365 et, fondamentalement, une très belle façon de présenter une aposition. Le second va plus loin : au lieu de corriger le symptôme après génération, documenter en amont sa propre voix, un fichier de règles et d’exemples type charte éditoriale (my-voice.md, ou voice.md), qui contraint le modèle à écrire dans un registre spécifique plutôt que dans le registre moyen qu’il produit par défaut. C’est un aspect que je vous encourage à explorer pour éviter d’avoir à réécrire la moitié des e.mails de réponse/résumé que votre LLM préféré vous propose. Le projet voice.md ↗ (en anglais) formalise l’idée en gabarit réutilisable, avec une syntaxe lisible par la machine et leur justification en prose, une base de départ si vous partez de zéro.
Ce que j’en retiens
Un détecteur de texte IA ne sait pas dire qui a écrit. Il sait dire qui s’écarte le moins de la moyenne d’un corpus qu’il n’a jamais vu. Le glissement se produit dans l’usage : la question « ce texte s’écarte-t-il statistiquement d’une norme ? » devient en pratique « cette personne a-t-elle triché quand il s’y conforme trop ? », et personne ne décide explicitement de faire ce glissement, il se produit par défaut, dès qu’une institution convertit une incertitude statistique en sanction.
Le biais allophone est solidement mesuré (61,3 % des essais TOEFL). Le biais neuro-atypique l’est beaucoup moins (moins de 2 % de signalement dans la seule étude disponible), et cette différence d’ordre de grandeur compte : je préfère dire « on ne sait pas encore » que de mettre les deux sur le même plan pour renforcer une thèse qui n’en a pas besoin.
Sur le fond, je penche pour la lecture structurelle de Garland plutôt que pour la lecture de Liang s’autorisant à penser qu’on peut corriger le problème à la source, tant que la source du texte reste un LLM : un modèle ne connaît pas la communauté de locuteurs qui produit le texte qu’il génère, donc améliorer le détecteur déplace le seuil sans toucher la cause. Mon hypothèse principale est qu’on arrive à ajouter des dispositifs de corrections en sortie.
Ce qui m’intéresse le plus, en revanche, n’est pas le détecteur, c’est ce que sa généralisation fait à l’écriture elle-même : des étudiants qui gomment les aspérités de leur propre texte pour échapper au soupçon, une écriture qui converge vers la moyenne pour de mauvaises raisons. Documenter sa voix en amont (charte éditoriale, exemples vers un my-voice.md) me semble plus utile que traquer les tics après coup, mais les deux répondent à des besoins différents, et le second reste nécessaire tant que le premier n’est pas généralisé.
Documenter sa voix en amont me semble plus utile que traquer les tics après coup.
Pour prolonger
- Face aux IAGen : « enseigner le processus, pas le résultat ! » : le même geste de gommage des aspérités, vu du côté de l’enseignant plutôt que du détecteur.
- Thinking Fast, Slow and Artificial : ce que l’écriture qui converge vers la moyenne fait à la pensée elle-même.
- Écrire avec l’IA : ce que la machine fait mieux que moi : si le texte fini ne dit pas comment il a été produit, il reste une seule source possible, l’auteur.
PS : les fans de Benjamin Tranié seront évidemment déçus par cet article s’ils s’attendaient à une autre acception de « Slop ».
PPS : je remercie Gary A. pour son post sur l’emoji « doigt » comme marqueur efficace de détection de contenu IA sur LinkedIn ↗.
Les opinions exprimées ici sont personnelles et n'engagent pas mon employeur.