3 · RECHERCHE
Préprint : près d'un tiers du web filtré serait du texte généré par IA, avec un effet sur l'entraînement des modèles
Lundi 5 octobre 2026 · 3 sources · 10 min de lecture
31 %
de tokens classés IA en août 2026
800
modèles entraînés pour l'étude
1,6×
calcul requis sans filtrage (estimation)
CE QUI S'EST PASSÉ
Le 30 septembre, des chercheurs ont déposé sur arXiv un préprint, c'est-à-dire une étude non encore relue par des pairs. Après un filtrage de qualité (FineWeb), le détecteur Pangram classe 27,5 % des tokens du web de juin 2026 comme générés par IA, puis 31,1 % en août. Les auteurs ont entraîné 800 modèles de langage, en variant la part de texte d'IA. Pour les modèles disposant de peu de données, ce texte aide d'abord un peu, puis nuit ; pour ceux entraînés avec beaucoup de texte humain, il augmente l'erreur presque immédiatement. Les auteurs estiment qu'entraîner sur le web non filtré à 31,1 % de texte d'IA demande 1,6 fois plus de calcul qu'avec le seul texte humain. Ils recommandent de filtrer le texte d'IA quand la cible est le texte humain. L'étude n'a pas fait l'objet d'une relecture indépendante, et la part de 31 % est une estimation de détecteur.
Qu'est-ce qu'un « token », et pourquoi le texte d'IA pose-t-il question ?
Un token (jeton) est un fragment de texte, souvent un mot ou un morceau de mot, que le modèle lit et produit ; un mot courant en compte en général un à deux. Un grand modèle de langage s'entraîne en lisant d'énormes quantités de texte pour prédire la suite. Si une part croissante de ce texte vient lui-même de modèles, la question est de savoir s'il apprend aussi bien. Démontré ici : sur des modèles de 19,9 à 973 millions de paramètres, un effet mesuré sur l'erreur. Non démontré : que le résultat vaille pour les très grands modèles actuels, ce que les auteurs eux-mêmes limitent à l'échelle testée.
LES POINTS DE VUE
CE QUE ÇA CHANGE
Pour les entreprises qui entraînent des modèles, trier le texte humain et le texte d'IA devient une étape de coût. Pour les utilisateurs, aucun effet direct à court terme.
ET APRÈS ?
- 1
Les auteurs publient le corpus WildAI de 83 milliards de tokens, les 800 modèles et le code
- 2
une relecture par des pairs reste à venir
