Lecture des écarts
Ce que les scores racontent.
Un bon détecteur ne doit pas seulement repérer ChatGPT dans un texte brut. Il doit aussi rester fiable quand l'IA est retravaillée, mélangée avec de l'humain ou intégrée dans des formats professionnels.
Les textes humains ne suffisent pas à départager le marché.
Sur les contenus entièrement humains, plusieurs détecteurs restent très proches : Lucide atteint 100%, Pangram et Winston 99%, GPTZero 96%.
L'IA brute varie fortement selon le modèle.
Lucide atteint 100% sur Fable, GPT-5.5, Opus, Mistral et DeepSeek. Les écarts chez les concurrents apparaissent surtout sur Fable et QuillBot.
Les textes humanisés créent la vraie séparation.
Lucide reste à 100% sur les textes humanisés, contre 91% pour Pangram, 82% pour GPTZero et 65% pour Originality.
Le mix IA + humain est le test le plus exigeant.
Lucide obtient 84% sur les textes mixtes. Les autres détecteurs décrochent nettement : Pangram 60%, GPTZero 54%, Winston 9% et QuillBot 0%.