Benchmark
Deuxième mesure : 27 modèles face à 64 questions d'analyste financier
Sept modèles répondent juste aux soixante-quatre questions, dont un à 0,001 $ la question. Huit autres en ratent près d'une sur trois ou bien davantage, presque toujours sur un calcul — et deux inventent une réponse là où il n'y en a pas.
Le hub publie sa deuxième mesure, dans un deuxième métier : la finance. Vingt-sept modèles ont répondu aux mêmes soixante-quatre questions, posées sur cinquante-quatre rapports de trente sociétés cotées américaines.
C'est le premier étage du travail d'un analyste financier : ouvrir un rapport à la bonne page et en tirer un indicateur ou un jugement. Les questions viennent de FinanceBench et ont été écrites par des analystes, chacune avec sa réponse et la page qui la prouve. Calculer une marge d'EBITDA ou un cycle de conversion de trésorerie, dire si une marge s'améliore, nommer le segment qui a freiné la croissance, reconnaître qu'un indicateur n'a pas de sens pour une banque.
Ce que ça donne :
- Sept modèles sur vingt-sept répondent juste aux soixante-quatre questions. Le moins cher, DeepSeek V4.1 Flash, coûte 0,001 $ la question — trente fois moins que GPT-6 Astra, qui fait le même score.
- Huit modèles échouent sur près d'une question sur trois ou bien davantage, et c'est le calcul qui les arrête. Nova Pro et Nova Lite n'en réussissent qu'un sur trente-deux.
- Une question sépare les sept premiers des suivants : la marge d'EBITDA de Netflix, ratée par dix-sept modèles sur vingt-sept. Sept d'entre eux ajoutent l'amortissement des contenus aux amortissements que la question demande, et trouvent 56,8 % au lieu de 5,4 %.
- Deux modèles inventent. Sur les trois questions dont la bonne réponse est « il n'y en a pas », Nova Pro fabrique deux réponses et Nova Lite une. Les vingt-cinq autres s'abstiennent.
Ce que ce classement ne dit pas : lequel des sept premiers est le meilleur. Ils ont le même score, et le tableau ne les range que par prix, puis par rapidité. Nous avons essayé de les départager sur quarante questions plus dures. Le milieu du classement changeait selon la façon de compter ; nous ne publions donc pas ce départage.
Comment une réponse est vérifiée : un nombre est juste à 0,5 % près de celui de l'analyste, un oui ou non doit être le bon, un poste doit porter le nom qu'il a sur la page. Aucune IA ne note une IA.
Nous avons corrigé trois choses après avoir lu les réponses, et nous le disons. Trois questions ont été écartées parce que leur échelle était ambiguë : la référence était un ratio, 0,01, quand la plupart des modèles répondaient en pourcentage, autour de 1,42, comme notre consigne les y invitait. La question mesurait l'échelle choisie, pas le calcul. Une liste de réponses acceptées était trop étroite et refusait douze réponses justes. Et une règle retirait une question du test dès qu'un modèle n'y répondait pas, ce qui faisait sortir les plus dures.
Les limites de cette mesure : la bonne page est fournie, alors qu'un analyste doit d'abord la trouver dans un rapport de plusieurs centaines de pages. Les sociétés sont célèbres et le jeu de questions est public depuis 2023 : un modèle peut en connaître des chiffres par cœur. Rédiger une note, prévoir ou défendre un avis ne sont pas notés. Et l'arbitrage humain des trois hallucinations n'a pas encore été joué.