Le Bureau des attributions
Une accusation litteraire vous arrive avec un pourcentage. Posez-le ici. Vous obtiendrez le chiffre que l'accusateur ne donne jamais, la probabilite que la personne visee soit innocente.
Une accusation litteraire vous arrive avec un pourcentage. Posez-le ici. Vous obtiendrez le chiffre que l'accusateur ne donne jamais, la probabilite que la personne visee soit innocente.
z/S SYSTEMS · Instrument numéro 1
Une accusation littéraire vous arrive avec un pourcentage. Posez-le ici. Vous obtiendrez le chiffre que l'accusateur ne donne jamais · la probabilité que la personne visée soit innocente.
En pourcentage. Deux mesures existent, et tout le débat tient dans l'écart entre elles.
Le premier chiffre vient de Pangram Labs, sur des essais académiques. Le deuxième vient de l'étude de Stanford publiée dans la revue Patterns, sur des copies de candidats étrangers au TOEFL. Le troisième d'une évaluation de l'université du Maryland citée par l'éditeur lui-même. Un taux de faux positifs n'existe pas dans l'absolu · il existe pour une population. Utiliser celui de la population A pour accuser un membre de la population B est la faute qui fait tout basculer.
Zéro signifie que chaque passage est un tirage indépendant, ce qui est l'hypothèse de l'accusation. Un signifie que le style est le même partout, donc qu'une erreur se répète pour la même cause. La réalité d'un roman écrit par une seule main est très proche de un.
C'est la probabilité a priori, celle qu'on ignore toujours et qui décide de tout. Inconnue à ce jour · aucune mesure publiée.
Il corrige deux fautes, et une seule d'entre elles est une faute de calcul.
La première est arithmétique. Multiplier un taux d'erreur par lui-même vingt fois suppose vingt tirages indépendants. Vingt extraits d'un même roman d'un même auteur ne sont pas indépendants · un détecteur stylométrique réagit à des traits stables sur tout le livre, donc les erreurs se répètent par la même cause. L'instrument remplace le nombre d'essais par un nombre d'épreuves effectivement indépendantes, selon la formule classique 1 + (n moins 1) fois (1 moins la corrélation). Avec une corrélation de 0,98 sur vingt passages, vous ne tenez pas vingt preuves. Vous en tenez une et demie.
La seconde est logique, et c'est la plus grave. Un taux de faux positifs répond à la question « combien de textes humains sont signalés ». Ce n'est pas la question posée quand on accuse quelqu'un. La question posée est « ce texte-ci étant signalé, quelle chance y a-t-il qu'il soit humain ». La réponse dépend de la part de romans réellement écrits par machine, que personne n'a mesurée. Le théorème de Bayes fait le reste, et il retourne souvent le verdict.
Et il y a une troisième faute, qui n'est ni arithmétique ni logique · elle est de méthode. Un taux de faux positifs n'existe pas dans l'absolu. Il existe pour une population donnée. Celui de 0,0041 % a été mesuré sur des essais académiques. Appliqué à un romancier qui écrit dans une langue apprise à l'école, relu par deux maisons d'édition, il ne veut plus rien dire. La ligne du seuil, dans le tableau, donne le chiffre décisif · il suffit que le taux réel dépasse environ 0,7 % pour que le doute devienne raisonnable. Les taux mesurés sur des scripteurs non natifs sont de 61 %. Cliquez sur le deuxième bouton et regardez le verdict se retourner.
Honnêteté de l'instrument. C'est un modèle, pas un oracle. La corrélation intra-texte n'est pas publiée par les éditeurs de détecteurs, la part a priori de romans écrits par machine n'est mesurée par personne, et l'approximation par épreuves effectives est une borne de bon sens, pas un théorème. Cet outil ne dit donc jamais qui a écrit un livre. Il dit une chose plus modeste et plus utile · de combien l'accusation se trompe quand elle prétend le savoir. Si vous avez de meilleurs paramètres, changez-les. Le code est dans la page, il n'envoie rien, il ne garde rien.
z/S · HYPOTHESIS · PROPHECY · NUMBER