Un problème ouvert, en mathématiques, est une question que personne n'a su trancher, parfois depuis des siècles. Le 6 octobre, OpenAI a publié sur GitHub, la grande plateforme de partage de code, 722 manuscrits qui prétendent résoudre un grand nombre de ces problèmes. Ils ont été produits par un modèle interne, que l'entreprise n'a pas mis à la disposition du public.
Les 722 manuscrits sont regroupés en 372 familles de résultats apparentés. Ils sont issus d'une évaluation portant sur environ 4 000 problèmes de recherche : OpenAI a soumis ces questions à son modèle, puis trié les résultats selon leur importance. Beaucoup de démonstrations sont accompagnées d'une version écrite en Lean, un langage de programmation qui permet à un ordinateur de vérifier une preuve étape par étape. Une preuve passée en Lean ne repose donc plus sur la seule relecture humaine. Le dépôt prévient toutefois que les résultats en sont « à des stades de vérification différents » et que tous n'ont pas leur version Lean. OpenAI dit avoir consulté le groupe consultatif indépendant sur les mathématiques et l'IA de l'Institute for Advanced Study pour décider de la manière de publier.
Le plus frappant tient au changement d'échelle. Le 8 septembre, OpenAI avait annoncé une solution au problème de Navier-Stokes, l'un des sept « problèmes du millénaire » distingués par l'institut Clay. Ces équations décrivent l'écoulement des fluides, et servent à concevoir des avions ou à prévoir le temps. Pour les résoudre, l'entreprise avait mobilisé de l'ordre de 10 000 agents travaillant en parallèle pendant 88 heures, puis 17 heures de plus pour la vérification en Lean. Cette fois, chaque résultat a demandé en moyenne l'équivalent de trois heures de réflexion de ChatGPT Pro, selon OpenAI. AINews y voit l'aspect le plus stupéfiant de l'annonce. Un résultat de recherche ne demande plus une opération exceptionnelle, mais un calcul presque ordinaire.
Le résultat le plus commenté porte le numéro 003. Il est baptisé « hypothèse quasi-Riemann », en référence à la conjecture de Riemann, qui porte sur la répartition des nombres premiers. Levent Alpöge, mathématicien chez Anthropic, avait obtenu en septembre, avec un modèle de son entreprise, un résultat concurrent sur les fluides. Il a salué ce travail, ainsi qu'un autre sur les « zéros de Siegel », et écrit sur X qu'il s'agit « évidemment du moment le plus important de l'histoire des mathématiques » (propos traduits). Il a précisé ensuite qu'il jugeait ainsi dix ans de progrès, dont cette publication donne la mesure. Une analyse relayée par AINews estime qu'environ un cinquième des résultats sont des réfutations, c'est-à-dire des contre-exemples qui prouvent qu'une conjecture est fausse. Son auteur y voit un démenti à l'idée que l'IA ne gagnerait en mathématiques que par une recherche en force brute, en essayant des millions de cas.
Les réserves sont nombreuses. Will Depue, qui a créé un site pour suivre les travaux humains cités par ces manuscrits, s'étonne qu'aucun résultat des laboratoires d'IA n'ait encore révélé d'erreur grave, et parie que « quelques-uns » de ceux-ci ne résisteront pas à l'examen. Le chiffre qui circule, et qui figure dans le titre même d'AINews, veut que 90 des 500 plus grands problèmes ouverts soient résolus. Il vient d'un commentaire sur Hacker News, lui-même fondé sur un classement établi par des modèles de langage qui comparent les problèmes deux à deux : il faut le prendre avec précaution. François Chollet, chercheur en IA, pose une question plus profonde. En mathématiques comme en programmation, on peut vérifier automatiquement qu'une réponse est juste, ce qui permet d'entraîner un modèle par essais et erreurs. Chollet demande si ces progrès s'étendront aux domaines où aucun arbitre automatique n'existe, ou s'ils y resteront bridés par le manque de données humaines.
Pour qui travaille avec l'IA sans être mathématicien, la leçon dépasse les nombres premiers. Produire un résultat devient bon marché, mais le vérifier reste lent et coûteux. Le même jour, The Download signalait qu'arXiv, le grand dépôt de prépublications scientifiques, limite désormais les soumissions : elles ont doublé en deux ans, gonflées par des textes médiocres produits par IA, selon 404 Media. Les deux nouvelles posent la même question : qui relit ? OpenAI annonce financer des ateliers et des conférences pour aider les mathématiciens à comprendre ces résultats, et dit travailler à publier « de manière responsable » le modèle qui les a produits. Devant une annonce du type « l'IA a résolu tel problème », le réflexe utile reste de demander qui a vérifié, et comment : une machine, des pairs, ou personne encore.