Analyse
Quatre mesures, jamais une seule note
Exactitude, coût, temps, hallucinations : le hub ne les fond jamais en un score unique. Un modèle peut être premier en exactitude et inutilisable parce qu'il invente.
Une note sur cent est commode. Elle tient dans un titre, elle désigne un vainqueur. Elle cache aussi ce qui compte au moment de choisir.
Prenez deux modèles. Le premier lit une facture un peu mieux que le second, mais quand une case est vide, il lui arrive de la remplir. Le second fait quelques erreurs de plus et laisse vide ce qui est vide. Une moyenne pondérée placerait le premier devant. Votre comptable choisirait le second : une case vide se voit, alors qu'un montant de TVA inventé passe la relecture et part dans les écritures.
C'est pourquoi le hub publie quatre mesures, côte à côte :
- Sans relecture : la part des cas traités sans qu'un humain ait rien à corriger.
- Exactitude : les points obtenus sur l'ensemble des éléments notés, pondérés par ce que coûte une erreur.
- Hallucinations : les éléments inventés là où la source ne contient rien.
- Coût et temps : par cas de test, aux tarifs publics du jour du test ; le temps est une médiane, pour qu'un seul appel lent ne fausse pas tout.
Elles ne répondent pas à la même question. L'exactitude dit si le modèle sait faire. Le taux sans relecture dit combien de travail il vous reste. Les hallucinations disent si vous pouvez lui faire confiance quand personne ne regarde. Le coût et le temps disent si l'ensemble tient encore à dix mille documents par mois.
Aucune formule ne pèse ces quatre réponses à votre place. Un cabinet qui traite trois cents factures par mois n'a pas les contraintes d'une plateforme qui en reçoit cent mille : pour l'un le prix est un détail, pour l'autre il décide de tout. Le poids de chaque mesure dépend de votre cas, et c'est à vous de le fixer.
Il existe pourtant un chiffre d'ensemble sur le site : l'indice métier. Il n'agrège qu'une seule des quatre mesures, l'exactitude. Pour chaque métier, on fait la moyenne de l'exactitude du modèle sur les benchmarks de ce métier ; l'indice est la moyenne de ces scores, chaque métier pesant autant que les autres, qu'il compte deux benchmarks ou trois.
L'indice ne dit donc rien du coût, du temps ni des hallucinations, qui restent dans leurs colonnes. Il sert à repérer les modèles qui tiennent tous les postes. Pour choisir, ouvrez le classement du métier qui vous concerne, et lisez les quatre colonnes.