Un ingénieur fixe un écran où défile un classement. Des noms de systèmes, des colonnes de chiffres, des flèches vertes et rouges qui montent et descendent au fil des mises à jour. Il n'a jamais vu ces algorithmes « en vrai », il ne sait pas ce qu'ils font concrètement ni comment ils se comportent devant un cas tordu que personne n'a pensé à tester. Et pourtant, ce tableau va orienter des choix d'investissement, des recrutements, des architectures entières de produits. C'est le genre de scène qui a donné naissance à des outils comme Evalgo : des dispositifs pensés pour transformer le jugement, forcément flou, qu'on porte sur un algorithme, en une note lisible d'un coup d'œil.
L'idée semble d'une simplicité désarmante. On fait tourner un modèle sur une série de problèmes, on compare ses réponses à des réponses attendues, on additionne les points. Mais dès qu'on y regarde de plus près, noter un algorithme ressemble moins à corriger une copie qu'à juger un plongeon olympique : la performance est multidimensionnelle, le jury est partial, et le geste le plus spectaculaire n'est pas toujours le plus juste.
Le mirage du chiffre unique
La première tentation de toute grille d'évaluation est de se résumer en un seul nombre. Un score global, une médaille, un podium. Cette compression a un mérite réel : elle permet de comparer d'un regard des systèmes que personne n'a le temps d'examiner en détail. Mais elle paie ce confort d'un prix caché. Un algorithme excellent sur neuf critères et médiocre sur un dixième peut finir mieux classé qu'un algorithme équilibré, simplement parce que la pondération choisie favorise ses forces. Le classement ne ment pas techniquement — il raconte une histoire particulière, celle que dessinent les poids qu'on lui a donnés, et cette histoire n'est jamais neutre.
C'est là que réside le premier apprentissage que des outils comme Evalgo rendent visible : une note n'est jamais une photographie du réel, c'est un compte rendu de ce que l'on a décidé de regarder. Changer les critères, c'est changer le vainqueur, sans qu'un seul algorithme n'ait été modifié.
Quand l'examen devient la matière
Il existe un phénomène bien connu de quiconque a un jour préparé un concours plutôt qu'appris une matière : dès qu'un test devient l'enjeu, on finit par optimiser pour le test, pas pour ce qu'il est censé mesurer. Les algorithmes n'échappent pas à cette dérive, et elle est même plus rapide chez eux, puisqu'on peut les entraîner directement sur les données qui ressemblent à celles du benchmark. Un système peut alors devenir remarquablement bon à répondre aux questions d'un examen précis, sans que cela ne dise grand-chose de sa capacité à se débrouiller face à une situation inédite.
Ce n'est pas l'algorithme qui triche : c'est l'évaluation qui, à force d'être connue, cesse d'évaluer ce qu'elle prétendait évaluer.
Cette tension n'est pas un défaut de conception qu'on pourrait corriger une fois pour toutes. Elle est structurelle : toute mesure publique et répétée finit par influencer ce qu'elle mesure. La seule parade durable consiste à renouveler sans cesse les épreuves, à multiplier les angles, à accepter qu'un système d'évaluation a une durée de vie, comme un mot de passe qu'il faut changer régulièrement.
Ce que la note ne voit pas
Un algorithme peut obtenir un excellent score et se révéler, à l'usage, franchement irritant. Il répond juste, mais lentement. Il répond juste, mais de façon incompréhensible pour l'utilisateur qui doit ensuite justifier la décision. Il répond juste dans quatre-vingt-dix-neuf cas sur cent, et se trompe massivement sur le centième, celui qui touche justement les personnes les plus vulnérables du système. Aucune de ces dimensions — la latence perçue, la clarté, la distribution des erreurs — ne tient facilement dans une colonne de tableur.
C'est pour cela que les grilles les plus honnêtes, celles qui essaient réellement d'éclairer plutôt que de trancher, finissent toujours par ressembler moins à un examen qu'à un portrait. Elles acceptent la contradiction : ce système est rapide mais fragile, celui-là est robuste mais coûteux, un troisième est brillant sur l'exception et médiocre sur la routine. Réduire ce portrait à une seule note, c'est gagner en lisibilité ce qu'on perd en vérité.
Le juge a toujours un point de vue
On oublie souvent qu'évaluer suppose de choisir des exemples, et que ce choix trahit une vision du monde. Des questions rédigées par des ingénieurs valoriseront naturellement la rigueur technique. Des questions rédigées par des enseignants valoriseront la pédagogie. Des questions rédigées dans une langue, une culture, un contexte socio-économique donné, avantageront mécaniquement les systèmes entraînés sur des données similaires. Le biais d'évaluation n'est donc pas un accident qu'on corrige en ajoutant plus de tests : il est constitutif de l'acte même de tester, puisque tester, c'est décider par avance de ce qui compte.
Reconnaître cela ne condamne pas l'exercice à l'arbitraire. Cela invite plutôt à traiter chaque score comme une opinion argumentée plutôt que comme un verdict. Une bonne évaluation gagne à afficher sa méthode aussi clairement que son résultat : sur quoi porte-t-elle, qui l'a construite, que laisse-t-elle délibérément de côté. Le chiffre devient alors un point de départ pour la discussion, et non son point final.
Apprendre à lire un classement
Ce qui rend ce genre de dispositif utile, au fond, dépasse largement le monde des algorithmes et de la recherche à la demande. On y retrouve exactement les mêmes pièges que dans n'importe quel système de notation humain : les palmarès d'universités qui façonnent les stratégies de recrutement des établissements plutôt que la qualité de l'enseignement, les indicateurs de performance au travail qui poussent à soigner le tableau de bord plutôt que le travail lui-même, les étoiles laissées sur une plateforme qui reflètent autant l'humeur du client que la qualité réelle du service.
La leçon commune à toutes ces situations tient en une posture, presque un réflexe : ne jamais prendre un score pour argent comptant sans se demander ce qu'il a choisi de mesurer, et ce qu'il a, par construction, choisi d'ignorer. Un bon classement n'est pas celui qui donne la réponse la plus simple, mais celui qui rend visibles les compromis qu'il a fallu faire pour l'obtenir. À l'heure où les décisions s'appuient toujours davantage sur des systèmes automatisés, savoir lire une note comme on lit un argument — avec ses prémisses, ses angles morts, ses partis pris — devient moins un luxe d'expert qu'une hygiène de tous les jours, comme savoir mesurer son carbone.