Humanity's Last Exam

test de performance (benchmark) de modèles de langage

Humanity's Last Exam (HLE) est un test de performance pour l’évaluation des modèles de langage composée de 2 500 questions couvrant un large éventail de sujets. Il est créé conjointement par le Center for AI Safety et Scale AI et dévoilé publiquement le [1].

Création

modifier

Le rapport annuel 2025 de l'IA Index de l'Institute for Human-Centered Artificial Intelligence (HAI) de l'université Stanford cite Humanity's Last Exam comme l'un des « épreuves de référence les plus difficiles » développés en réponse aux épreuves d'IA populaires ayant atteint un « plafond »[2]. Le test est décrit comme le fruit de l'imagination de Dan Hendrycks, chercheur en apprentissage automatique et directeur du Center for AI Safety, qui déclare avoir été inspiré pour créer le test après une conversation avec Elon Musk, qui pensait que les épreuves de modèles de langage existants, tels que le MMLU, étaient trop faciles. Hendrycks travaille avec Scale AI pour compiler les questions[3].

Les questions sont collectées auprès d'experts en la matière de diverses institutions à travers le monde[4]. Elles sont d'abord filtrées par les principaux modèles d'IA ; si les modèles ne parviennent pas à y répondre ou font pire que deviner au hasard pour les questions à choix multiples, ils sont examinés par des experts humains en deux tours et approuvés pour être inclus dans l'ensemble de données. Les auteurs des questions les mieux notées reçoivent un prix d'un montant de 500 000 dollars américains : 5 000 $ pour chacune des 50 meilleures questions et 500 $ pour les 500 suivantes.

Après la publication initiale dans la revue Nature, le [1], un programme de récompenses aux bugs, basé sur les commentaires de la communauté, est lancé pour identifier et supprimer les erreurs majeures dans l'ensemble de données[5].

Composition

modifier

Le test comprend 2 500 questions[6], classées selon les principales disciplines suivantes :

Environ 14 % des questions requièrent la compréhension de textes et d’images, ce qui exige une capacité multimodale des modèles. 24 % des questions sont à choix multiples ; les autres sont des questions à réponse courte et à correspondance exacte. Un ensemble privé est également maintenu pour tester le surapprentissage du test [5].

Un exemple de question[3] :

« Les colibris (Apodiformes) possèdent de manière unique un os ovale bilatéralement apparié, un sésamoïde enchâssé dans la partie caudolatérale de l’aponévrose cruciforme élargie d’insertion du m. depressor caudae. Combien de tendons appariés sont soutenus par cet os sésamoïde ? Répondez par un nombre. »

Résultats

modifier
Performances de différents modèles sur l'épreuve
Organisation Modèle Précision (%) ↑ Erreur d'étalonnage (%) ↓
Google DeepMind Aperçu de Gemini 2.5 Pro (06-05) 21,64 72
OpenAI o3 (élevé) 20,32 34
Anthropic Claude Opus 4 10,72 73
Meta AI Llama 4 Maverick 5,68 83
Mistral AI Mistral Medium 3 4,52 77
Amazon Web Services Nova Pro 4,40 80
Source : Scale AI, 5 juin 2025.
Performances de divers modèles non multimodaux sur le sous-ensemble textuel de l'épreuve
Organisation Modèle Précision (%) ↑ Erreur d'étalonnage (%) ↓
DeepSeek DeepSeek-R1-0528 14,04 78
OpenAI o3-mini (élevé) 13,37 80
Alibaba Cloud Qwen3-235B-A22B 11,75 74
Amazon Web Services Nova Micro 4,41 84
Source : Scale AI, 3 juin 2025.

Voir aussi

modifier

Références

modifier
(en) Cet article est partiellement ou en totalité issu de l’article de Wikipédia en anglais intitulé « Humanity's Last Exam » (voir la liste des auteurs).
  1. 1 2 (en) Long Phan, Alice Gatti, Nathaniel Li et Adam Khoja, « A benchmark of expert-level academic questions to assess AI capabilities », Nature, vol. 649, no 8099, , p. 1139–1146 (ISSN 1476-4687, PMID 41606155, PMCID 12851929, DOI 10.1038/s41586-025-09962-4, lire en ligne, consulté le )
  2. (en) Nestor Maslej et Loredana Fattorini, « The AI Index 2025 Annual Report », Institute for Human-Centered AI, , p. 141–142
  3. 1 2 (en-US) Kevin Roose, « When A.I. Passes This Test, Look Out » [archive du ], New York Times, (consulté le )
  4. (en) Jeffrey Dastin et Katie Paul, « AI experts ready 'Humanity's Last Exam' to stump powerful tech » [archive du ], Reuters, (consulté le )
  5. 1 2 (en) Long Phan, Alice Gatti, Ziwen Han, Nathaniel Li, Josephina Hu et al., « Humanity's Last Exam », .
  6. (en-US) Cami Rosso, « 'Humanity's Last Exam' Exposes AI's Strengths and Weaknesses | Psychology Today », sur www.psychologytoday.com (consulté le )

Articles connexes

modifier

Liens externes

modifier