← IA & Tech du lundi 5 octobre 2026Éclairage IA & TechSujet 3 sur 2

3 · RECHERCHE

Préprint : près d'un tiers du web filtré serait du texte généré par IA, avec un effet sur l'entraînement des modèles

Lundi 5 octobre 2026 · 3 sources · 10 min de lecture

Une puce électronique (illustration)Une puce électronique (illustration)

31 %

de tokens classés IA en août 2026

800

modèles entraînés pour l'étude

1,6×

calcul requis sans filtrage (estimation)

CE QUI S'EST PASSÉ

Le 30 septembre, des chercheurs ont déposé sur arXiv un préprint, c'est-à-dire une étude non encore relue par des pairs. Après un filtrage de qualité (FineWeb), le détecteur Pangram classe 27,5 % des tokens du web de juin 2026 comme générés par IA, puis 31,1 % en août. Les auteurs ont entraîné 800 modèles de langage, en variant la part de texte d'IA. Pour les modèles disposant de peu de données, ce texte aide d'abord un peu, puis nuit ; pour ceux entraînés avec beaucoup de texte humain, il augmente l'erreur presque immédiatement. Les auteurs estiment qu'entraîner sur le web non filtré à 31,1 % de texte d'IA demande 1,6 fois plus de calcul qu'avec le seul texte humain. Ils recommandent de filtrer le texte d'IA quand la cible est le texte humain. L'étude n'a pas fait l'objet d'une relecture indépendante, et la part de 31 % est une estimation de détecteur.

L'ÉCLAIRAGE

Qu'est-ce qu'un « token », et pourquoi le texte d'IA pose-t-il question ?

Un token (jeton) est un fragment de texte, souvent un mot ou un morceau de mot, que le modèle lit et produit ; un mot courant en compte en général un à deux. Un grand modèle de langage s'entraîne en lisant d'énormes quantités de texte pour prédire la suite. Si une part croissante de ce texte vient lui-même de modèles, la question est de savoir s'il apprend aussi bien. Démontré ici : sur des modèles de 19,9 à 973 millions de paramètres, un effet mesuré sur l'erreur. Non démontré : que le résultat vaille pour les très grands modèles actuels, ce que les auteurs eux-mêmes limitent à l'échelle testée.

LES POINTS DE VUE

CE QUE ÇA CHANGE

Pour les entreprises qui entraînent des modèles, trier le texte humain et le texte d'IA devient une étape de coût. Pour les utilisateurs, aucun effet direct à court terme.

ET APRÈS ?

  1. 1

    Les auteurs publient le corpus WildAI de 83 milliards de tokens, les 800 modèles et le code

  2. 2

    une relecture par des pairs reste à venir

Sujets complémentaires

ÉGALEMENT DANS L'ÉDITION IA & TECH DU JOUR

Vous avez décroché de l'actualité ? On reprend depuis le début.

Un sujet, son contexte, les faits et les différentes positions. Chaque matin, gratuitement, dans votre boîte mail.