TL;DR

Percée : GPT-5.4 Pro d’OpenAI a résolu un problème mathématique ouvert qui avait résisté aux efforts humains depuis 2019, vérifié indépendamment par Epoch AI. Capacité plus large : trois autres modèles d’IA d’Anthropic, Google et OpenAI ont également résolu le même problème, suggérant une capacité de raisonnement mathématique partagée. Progrès de référence: les scores de FrontierMath sont passés de 5 % sous GPT-4 en 2024 à 50 % sous GPT-5.4 Pro en mars 2026. Réaction des experts: les mathématiciens restent divisés, Terence Tao voyant un potentiel de collaboration tandis que Joel David Hamkins qualifie l’utilité de l’IA de « fondamentalement nulle » pour ses recherches.

GPT-5.4 Pro d’OpenAI a résolu un problème mathématique ouvert que les chercheurs humains ne pouvaient pas résoudre depuis 2019, selon une vérification indépendante réalisée par Epoch AI. Contribué par les mathématiciens Will Brian et Paul Larson dans un article de 2019, le problème de l’hypergraphe de style Ramsey marque la première fois qu’un modèle d’IA produit une nouvelle solution à un problème véritablement ouvert sur le benchmark FrontierMath d’Epoch AI.

Selon Epoch AI, les scores de FrontierMath sont obtenus. sont passés d’environ 5 % sous GPT-4 en 2024 à 50 % sous GPT-5.4 Pro en mars 2026, reflétant l’accélération rapide du raisonnement mathématique de l’IA. Kevin Barreto et Liam Price ont d’abord obtenu une solution de GPT-5.4 Pro.

OpenAI a lancé le modèle le 5 mars en tant que système à usage général plutôt que spécialisé pour les mathématiques.

La solution et sa signification

À la base, le problème demande des limites inférieures améliorées sur une séquence. H(n) apparaissant dans l’étude de la convergence simultanée d’ensembles de séries infinies. Epoch AI a placé le problème dans la catégorie Modérément intéressant. Le benchmark utilise une taxonomie de difficulté structurée sur trois niveaux : un échauffement avec des constructions connues, un défi unique sans construction connue qui résiste aux approches par force brute et un problème complet nécessitant un algorithme général pour toutes les valeurs de n.

En s’appuyant sur ce cadre, la solution de GPT-5.4 Pro élimine une inefficacité dans les constructions de limite inférieure existantes et reflète la complexité de la construction de limite supérieure, produisant des limites correspondantes. Pour les problèmes de la théorie de Ramsey, parvenir à faire correspondre les limites inférieures et supérieures représente un résultat particulièrement important, car les écarts entre les limites en combinatoire peuvent persister pendant des décennies.

Le contributeur du problème, Will Brian, a confirmé la solution et l’a évaluée comme pouvant être publiée dans une revue spécialisée standard, susceptible de générer de nouvelles questions pour des recherches plus approfondies. Brian avait déjà réfléchi à la possibilité que l’approche de l’IA puisse fonctionner, mais il la pensait trop difficile à mettre en œuvre.

“C’est une solution passionnante à un problème que je trouve très intéressant. Je m’étais déjà demandé si l’approche de l’IA pourrait être possible, mais cela semblait difficile à mettre en œuvre. Maintenant, je vois que cela fonctionne parfaitement.”

Will Brian, contributeur du problème (via Epoch AI)

L’évaluation de la publiabilité de Brian positionne ce résultat différemment des réalisations mathématiques antérieures en IA, qui produisaient souvent des solutions correctes mais banales à des problèmes connus. Une nouvelle construction digne d’un journal suggère que les systèmes d’IA commencent à contribuer à des travaux qui répondent aux normes des mathématiques évaluées par les pairs, et ne se contentent pas de passer des tests de référence automatisés.

Un signal de capacité plus large

GPT-5.4 Pro a été le premier à résoudre le problème, mais il n’est pas le seul. Trois autres modèles d’IA l’ont également résolu en utilisant l’échafaudage général d’Epoch AI pour les tests.

Opus 4.6 (max) d’Anthropic, Gemini 3.1 Pro de Google et GPT-5.4 (xhigh) d’OpenAI se sont tous révélés capables de trouver une construction valide lors de certaines tentatives.

Epoch AI a développé l’échafaudage après la résolution initiale de GPT-5.4 Pro pour tester systématiquement si d’autres modèles frontières pouvaient reproduire le modèle résultat. Les quatre modèles se sont avérés capables de trouver une construction valide lors de certaines tentatives.

En conséquence, la capacité de raisonnement mathématique sous-jacente semble partagée entre les principaux systèmes d’IA plutôt que confinée à un seul modèle.

De plus, GPT-4 a obtenu un score d’environ 5 % sur les problèmes FrontierMath du premier cycle au niveau postdoctoral en 2024, selon Epoch AI. GPT-5.4 Pro obtient désormais un score de 50 % sur ces mêmes niveaux, soit une multiplication par dix en moins de deux ans.

Sur les problèmes de niveau 4 de niveau recherche, GPT-5.4 Pro obtient un score de 38 %. Depuis Noël 2025, 15 problèmes mathématiques ouverts sont passés de non résolus à résolus, dont 11 (73 %) sont attribués à l’implication de l’IA.

Résoudre un problème ouvert diffère fondamentalement d’obtenir de bons résultats sur des problèmes avec des réponses connues, car cela nécessite de générer un nouveau raisonnement plutôt que de faire correspondre des modèles avec des données d’entraînement. Une multiplication par dix des scores de FrontierMath sur deux ans, combinée à quatre modèles indépendants résolvant le même problème ouvert, indique que le raisonnement mathématique s’améliore en tant que capacité générale de Frontier AI.

Jalons mathématiques antérieurs de l’IA

La couverture récente illustre la progression rapide. En janvier, GPT-5.2 Pro a résolu un problème mathématique vieux de plusieurs décennies, bien que les experts aient noté à la fois ses promesses et ses contraintes.

Les derniers résultats de GPT-5.4 Pro représentent un bond substantiel par rapport aux références de janvier, en particulier sur les niveaux de problèmes les plus difficiles. De plus, en octobre 2025, OpenAI a retiré une fausse affirmation de percée mathématique après un contrecoup, rendant les résultats vérifiés de manière indépendante comme la confirmation d’Epoch AI plus significatifs.

Contrairement aux systèmes spécialement conçus, GPT-5.4 Pro a résolu un problème sans réponse existante. Contrairement à AlphaProof de Google DeepMind, qui a résolu les problèmes de l’OMI avec des solutions connues, GPT-5.4 Pro est un modèle à usage général qui n’est pas adapté à la résolution de problèmes mathématiques.

Les mathématiciens s’expriment

Les réactions de la communauté mathématique vont de l’optimisme au profond scepticisme. Terence Tao, lauréat de la médaille Fields, a soutenu que l’IA répond à une contrainte fondamentale en matière de ressources dans la recherche mathématique, une contrainte qui limite les problèmes qui reçoivent une attention sérieuse.

De l’avis de Tao, si les modèles peuvent produire de manière fiable des constructions valides pour des problèmes ouverts, ils pourraient servir de collaborateurs puissants pour les mathématiciens en activité, générant des preuves candidates que les humains vérifieraient et affineraient ensuite.

« Nous sommes tellement limités en ressources par l’attention des experts dont nous disposons, que nous n’y prêtons pas attention. 99 % de tous les problèmes que nous pourrions étudier. optimisme. Kevin Buzzard, mathématicien à l’Imperial College de Londres, a reconnu les progrès mais a averti que les mathématiciens ne regardaient pas encore par-dessus leurs épaules, qualifiant ces développements de « pousses vertes ». La propre classification d’Epoch AI du problème résolu comme modérément intéressant, plutôt que très intéressant ou exceptionnellement intéressant, renforce ce point.

Du côté sceptique, Joel David Hamkins, professeur de logique à Notre Dame, a trouvé les outils d’IA totalement inutiles pour ses propres recherches, décrivant leur utilité comme « fondamentalement nulle ». Pour les logiciens travaillant sur des questions fondamentales plutôt que sur des constructions combinatoires, les capacités actuelles de l’IA peuvent offrir peu de valeur pratique.

Entre-temps, Brian prévoit de rédiger la solution pour publication, en incluant éventuellement des travaux de suivi stimulés par les idées de l’IA. Barreto et Price ont la possibilité d’être coauteurs de tout article résultant, une reconnaissance du rôle joué par l’ingénierie rapide dans l’obtention du résultat. Geby Jaff a également trouvé une solution peu de temps après.

Un deuxième chercheur reproduisant indépendamment le résultat suggère que la capacité du modèle était robuste plutôt que le résultat d’un succès ponctuel. La co-auteur entre les ingénieurs humains et les avancées mathématiques assistées par l’IA soulève de nouvelles questions sur le crédit et l’attribution dans les mathématiques évaluées par les pairs.

La volonté de Brian d’inclure Barreto et Price comme coauteurs suggère que la communauté mathématique commence à se pencher sur ces questions en pratique, pas seulement en théorie. Pour Epoch AI, le résultat valide FrontierMath : Open Problems en tant que référence capable de suivre de véritables progrès mathématiques au-delà des ensembles de tests sélectionnés.

Categories: IT Info