Harnais d'évaluation
Définition
Système logiciel spécialisé qui exécute automatiquement une série de tâches normalisées ou de tests structurés sur un modèle ou un agent d'IA, gère son environnement d'exécution et évalue les résultats. Le harnais garantit la reproductibilité de l'environnement d'exécution et l'objectivité des résultats.
Compléments
Le harnais soumet d'une manière automatique des requêtes génératives ou des tâches de codage à un modèle ou un agent d'IA. Il interface aussi l'environnement logiciel, configure des bacs à sable sécurisés pour éviter toute action destructrice ou imprévue, alloue des outils (tels que des fureteurs web, une calculatrice, un calendrier, des logiciels spécialisés, l'accès aux bases de données ou à un système de fichiers, etc.). Le harnais observe et enregistre l'intégralité des requêtes, des appels de fonctions, des actions, des usages d'outils et des réponses générées au cours des tests. Il prend note des erreurs, du temps de calcul, de la consommation de jetons génératifs. Enfin, il attribue des scores et évalue avec des tests unitaires ou un modèle agissant comme juge pour déterminer si la tâche a été accomplie avec succès.
Un exemple de tests normalisés est le SWE-bench qui sert à évaluer la capacité des systèmes d'IA dans des tâches complexes de génie logiciel.
Ce terme est également utilisé en génie logiciel.
Français
harnais d'évaluation
harnais de test
harnais de banc d'essai
harnais d'agent d'IA
harnais de modèle d'IA
harnais
Anglais
evaluation harness
eval harness
benchmark harness
test harness
AI agent harness
AI model harness
harness-bench
harness
Sources
Matchpoint partners - harnais d'évaluation
Contributeurs: Claude Coulombe





