TL;DR

Résultat clé : une étude de Google Research acceptée lors de l’AAAI-26 a révélé que les benchmarks standards en matière d’IA utilisent trop peu d’évaluateurs humains, ce qui rend les comparaisons de modèles statistiquement peu fiables. Problème central : le vote majoritaire parmi trois à cinq évaluateurs efface les désaccords humains significatifs, cachant des informations qui pourraient changer le modèle d’IA le mieux classé. Solution recommandée : plus de dix évaluateurs par exemple sont nécessaires, et la stratégie d’allocation budgétaire compte plus que la taille totale du budget. Nouvel outil : l’équipe a publié VET, un simulateur open source qui aide les concepteurs de référence à optimiser les budgets des évaluateurs avant d’engager des ressources d’annotation. Contexte plus large : l’étude s’ajoute à l’examen croissant des méthodes d’évaluation de l’IA, à la suite de critiques antérieures des plates-formes de référence participatives en 2025.

Les références d’IA qui comparent des modèles de langage collectent généralement trois à cinq évaluations humaines par exemple de test et choisissent un gagnant par vote majoritaire. Google Research a révélé dans une étude publiée fin mars 2026 que cette approche efface systématiquement le désaccord même qu’elle devrait mesurer, ce qui compromet la fiabilité des évaluations qui éclairent les décisions de produits dans l’ensemble du secteur.

Acceptée lors de la Conférence AAAI sur l’intelligence artificielle, l’étude intitulée”Forest vs Tree” réalisée par des chercheurs de Google Research et du Rochester Institute of Technology démontre que le nombre standard de trois à cinq évaluateurs est statistiquement insuffisant pour des comparaisons fiables de modèles d’IA. La manière dont les budgets d’annotation sont répartis entre l’ampleur (plus d’exemples de tests) et la profondeur (plus d’évaluateurs par exemple) est aussi importante que le budget lui-même, et de nombreux benchmarks se trompent sur cette répartition. Pour obtenir des résultats statistiquement fiables qui reflètent l’éventail des opinions humaines, plus de dix évaluateurs par exemple sont généralement nécessaires.

Comment l’allocation budgétaire modifie les résultats

À la base, l’étude expose un compromis entre deux objectifs d’évaluation légitimes. Pour les mesures basées sur la précision qui reposent sur un accord de vote majoritaire, une approche large est la plus efficace : de nombreux exemples de tests avec quelques évaluateurs chacun. Pour les mesures tenant compte de la distribution, comme la variation totale, qui capturent l’ensemble de l’opinion humaine, l’inverse est vrai : moins d’exemples de tests mais significativement plus d’évaluateurs par élément.

Les benchmarks actuels suivent majoritairement le premier modèle, ratissant un large réseau à travers les exemples de tests tout en ne collectant qu’une fine couche de jugement humain pour chacun. Deux éléments peuvent recevoir le même label de vote majoritaire tout en ayant des distributions de réponses très différentes en dessous. Cela pourrait refléter un accord quasi unanime parmi les évaluateurs ; un autre pourrait refléter une étroite répartition 3-2.

En regroupant les deux en une seule étiquette, le vote majoritaire traite le consensus confiant et les marges minces comme des rasoirs comme identiques, cachant des informations qui pourraient changer quel modèle d’IA semble le plus performant. Pour les applications sensibles à la sécurité, ces signaux perdus représentent l’écart entre un modèle qui gère bien les cas faciles et un autre qui échoue dans les cas difficiles.

Pour illustrer le problème, les auteurs de l’étude soulignent la détection de la toxicité :

“Les deux commentaires reçoivent la même étiquette”Toxique”par vote majoritaire, même si les évaluateurs dans le second cas sont en désaccord significatif. Les tests de référence standard ignorent entièrement cette différence.”

Auteurs de l’étude Google Research (via Google Research)

Considérez un test de modération de contenu dans lequel cinq évaluateurs évaluent si une publication sur les réseaux sociaux est offensante. Si tous les cinq conviennent qu’un poste est nuisible, ce consensus a des implications différentes pour la formation des modèles qu’une répartition 3-2 où l’origine culturelle ou l’expérience personnelle est à l’origine du désaccord. Lors d’un vote majoritaire, les deux cas produisent la même étiquette binaire, et un modèle formé sur cette étiquette n’apprend rien sur la nature contestée du deuxième exemple.

Un solde budgétaire incorrect peut produire des conclusions peu fiables, même avec un budget d’annotation beaucoup plus important. Au cours de leurs expériences, les chercheurs ont testé des échelles de 100 à 50 000 éléments et des tailles de foule de 1 à 500 évaluateurs par élément. Quatre ensembles de données réels ont ancré l’analyse : Toxicité (107 620 commentaires, 17 280 évaluateurs), DICES (350 conversations, 123 évaluateurs), D3code (4 554 éléments, 4 309 évaluateurs de 21 pays) et Emplois (2 000 tweets, 5 évaluateurs chacun).

Recherche Google – Processus d’évaluation de modèle avec illustration de la vérité terrain (Source : Google)

Adapté à la distribution. les mesures nécessitaient le plus petit budget global pour produire des résultats fiables, ce qui suggère que la capture des désaccords humains n’est pas intrinsèquement plus coûteuse, mais simplement allouée différemment. Des résultats fiables peuvent souvent être obtenus avec environ 1 000 annotations au total, mais seulement si le budget est correctement réparti entre les exemples de tests et les évaluateurs. Dans une expérience, un budget mal alloué de 10 000 annotations a produit des classements moins fiables qu’un budget bien alloué de seulement 1 000, soulignant que la stratégie compte plus que l’échelle.

La métaphore de l’étude « forêt contre arbre » capture cette dynamique : l’évaluation basée sur la précision ressemble à l’observation d’une forêt d’en haut, donnant la priorité à la couverture plutôt qu’aux détails, tandis que l’évaluation sensible à la distribution ressemble à un examen attentif d’arbres individuels, obtenant des informations plus riches au prix d’arpenter moins. Aucune des deux approches n’est universellement supérieure ; le bon choix dépend entièrement de ce qu’un indice de référence tente de mesurer. Les concepteurs de benchmarks qui choisissent la mauvaise stratégie risquent de tirer des conclusions qui ne seraient pas reproductibles si l’évaluation était réexécutée avec des évaluateurs différents.

Un outil open source pour la conception de benchmarks

Pour aider les concepteurs de benchmarks à naviguer dans ce compromis, l’équipe a créé un simulateur open source appelé Boîte à outils d’estimation de la variance (VET) qui reproduit les modèles d’évaluation humaine à l’aide d’ensembles de données réels. Calibré sur cinq ensembles de données réels couvrant la détection de la toxicité, la sécurité des chatbots et l’évaluation de l’offensive interculturelle, l’EFP permet aux chercheurs de tester des milliers de combinaisons sur différents budgets totaux et nombres d’évaluateurs. L’exécution de simulations avant d’engager des ressources d’annotation permet aux concepteurs de benchmarks de déterminer la répartition optimale pour leur objectif d’évaluation spécifique sans perdre de temps et d’argent dans des campagnes d’essais et d’erreurs.

Plutôt que de prescrire une formule unique, l’EFP tient compte du fait que différentes mesures d’évaluation réagissent différemment aux changements en termes d’ampleur et de profondeur. Un benchmark mesurant une précision simple peut nécessiter 500 éléments notés par trois personnes chacun, tandis qu’un benchmark mesurant la diversité des opinions sur les mêmes données peut nécessiter 50 items notés par 20 personnes chacun. L’EFP remplace les conjectures par des décisions d’attribution basées sur des données et fondées sur le comportement empirique des évaluateurs.

Les chercheurs de Google Flip Korn et Chris Welty ont dirigé l’étude aux côtés du doctorant Deepak Pandita et du professeur Christopher Homan du Rochester Institute of Technology. Korn et Welty ont décrit l’objectif comme étant d’obtenir « des résultats vraiment fiables qui reflètent les nuances humaines ». Le code source de l’EFP est accessible au public sur GitHub, et l’article complet est accessible sur arXiv.

Un chœur croissant de critiques de référence

L’étude arrive dans un contexte de scepticisme plus large à l’égard des méthodes d’évaluation de l’IA. En avril 2025, des universitaires et des spécialistes de l’éthique de l’IA ont défié les plateformes de référence participatives comme LMArena, remettant en question leur équité et leur méthodologie. À peu près à la même époque, LMArena a été lancée en tant que société autonome issue du projet original Chatbot Arena, reflétant à la fois un intérêt commercial croissant pour l’analyse comparative et un examen minutieux accru de ses méthodes. Par ailleurs, une étude de juillet 2025 a révélé de profondes failles dans la conception des benchmarks qui pourraient gonfler considérablement les estimations de performances.

Lorsque ces critiques remettaient en question ce que mesurent les benchmarks, cette étude de Google Research se concentre sur la couche de jugement humain en dessous, se demandant si les benchmarks collectent suffisamment de données humaines pour mesurer quoi que ce soit de manière fiable. Ensemble, les résultats dressent le portrait d’un écosystème d’évaluation dans lequel ni les mesures ni les données humaines qui les alimentent n’ont suivi le rythme de l’évolution rapide des modèles qu’ils sont censés évaluer.

Lorsque les évaluations humaines décident quel modèle d’IA arrive en tête, les enjeux s’étendent au-delà des classements universitaires. Les entreprises utilisent les résultats des benchmarks pour commercialiser leurs produits, les investisseurs s’appuient sur eux pour évaluer les startups, et les régulateurs commencent à y faire référence dans les discussions politiques sur la sécurité et les seuils de capacité de l’IA.

Avec des systèmes d’IA de plus en plus déployés dans des applications à enjeux élevés, de la modération de contenu au tri médical, l’écart entre la façon dont les benchmarks évaluent les modèles et la façon dont les humains perçoivent leurs résultats dans la pratique a de réelles conséquences. Un modèle qui semble bien gérer le contenu toxique sous un critère de vote majoritaire pourrait avoir de mauvais résultats dans les cas extrêmes où les évaluateurs ne sont véritablement pas d’accord sur ce qui est considéré comme nocif. Le déploiement d’un tel modèle dans des communautés multilingues, où les normes culturelles autour du caractère offensant varient considérablement, pourrait produire une application incohérente que le benchmark n’avait pas prévu.

Adopter les résultats de l’étude signifie reconnaître que le nombre typique d’un à cinq évaluateurs par exemple est souvent insuffisant pour des comparaisons de modèles reproductibles. Tant que les concepteurs de référence ne prendront pas en compte l’ensemble du jugement humain plutôt que de le regrouper en un seul vote, les évaluations déterminant les modèles d’IA qui arriveront sur le marché resteront fondamentalement peu fiables. Les outils open source comme l’EFP offrent une voie pratique à suivre, mais la communauté de l’évaluation de l’IA doit d’abord reconnaître que ses méthodes actuelles sont systématiquement incomplètes.

Categories: IT Info