Aller au contenu
WorkBench.ai

Analyse

Un point d'écart, c'est un ex æquo

Vingt-cinq factures ne départagent pas deux modèles séparés d'un point. Le hub publie la marge d'erreur de ses scores, et le dit quand un classement ne tranche pas.

Un classement donne envie de lire les rangs comme une vérité : le premier est meilleur que le deuxième, qui est meilleur que le troisième. Sur un jeu de vingt-cinq factures, c'est souvent faux.

Faites le calcul à l'échelle d'un document. Avec vingt-cinq factures, une seule facture ratée déplace de quatre points la part des factures traitées sans relecture. Deux modèles séparés par un écart de cet ordre se distinguent par un seul document — peut-être un scan un peu plus penché que les autres. Rejouez le test avec vingt-cinq autres factures, et l'ordre peut s'inverser.

C'est ce que mesure la marge d'erreur : la demi-largeur de l'intervalle de confiance à 95 % autour de l'exactitude, en points. Un score de 90 % avec une marge de ± 3 points signifie que la valeur qu'on obtiendrait sur un jeu beaucoup plus grand se situe vraisemblablement entre 87 et 93.

La règle du hub est simple : deux modèles séparés par moins que la plus grande de leurs deux marges ne sont pas départagés. Le rang les range, parce qu'il faut bien un ordre pour afficher un tableau ; il ne les distingue pas.

Le site le signale de deux façons. Dans les tableaux, la marge accompagne le score chaque fois qu'elle est publiée : « ± 2,1 ». Et dans les points à retenir d'un benchmark, quand l'écart entre les deux premiers est inférieur à la marge, c'est écrit : ce test ne les départage pas.

L'indice métier a lui aussi sa marge, combinée à partir de celles des benchmarks qui le composent. Elle se resserre à mesure que des benchmarks s'ajoutent : plusieurs tests en disent plus long qu'un seul. Tant qu'un seul benchmark est mesuré, la marge de l'indice est celle de ce benchmark, ni plus ni moins.

La marge ne corrige pas tout. Elle décrit le hasard du tirage des documents, pas les limites du protocole : un seul prompt, des images plutôt que des PDF, aucun réglage par modèle. Elle dit seulement jusqu'où un écart mérite confiance.

Conséquence pratique : ne choisissez pas un modèle pour un point d'écart. Quand deux modèles sont ex æquo en exactitude, ce sont les autres colonnes qui décident — le coût, le temps et, surtout, les hallucinations.