Harnais d'évaluation


Définition

Système logiciel spécialisé qui exécute automatiquement une série de tâches normalisées ou de tests structurés sur un modèle ou un agent d'IA, gère son environnement d'exécution et évalue les résultats. Le harnais garantit la reproductibilité de l'environnement d'exécution et l'objectivité des résultats.

Compléments

Le harnais soumet d'une manière automatique des requêtes génératives ou des tâches de codage à un modèle ou un agent d'IA. Il interface aussi l'environnement logiciel, configure des bacs à sable sécurisés pour éviter toute action destructrice ou imprévue, alloue des outils (tels que des fureteurs web, une calculatrice, un calendrier, des logiciels spécialisés, l'accès aux bases de données ou à un système de fichiers, etc.). Le harnais observe et enregistre l'intégralité des requêtes, des appels de fonctions, des actions, des usages d'outils et des réponses générées au cours des tests. Il prend note des erreurs, du temps de calcul, de la consommation de jetons génératifs. Enfin, il attribue des scores et évalue avec des tests unitaires ou un modèle agissant comme juge pour déterminer si la tâche a été accomplie avec succès.

Un exemple de tests normalisés est le SWE-bench qui sert à évaluer la capacité des systèmes d'IA dans des tâches complexes de génie logiciel.


Ce terme est également utilisé en génie logiciel.

Français

harnais d'évaluation

harnais de test

harnais de banc d'essai

harnais d'agent d'IA

harnais de modèle d'IA

harnais

Anglais

evaluation harness

eval harness

benchmark harness

test harness

AI agent harness

AI model harness

harness-bench

harness

Sources

Matchpoint partners - harnais d'évaluation

- Microsoft - harnais d’agent

GitHub EleutherAI - Evaluation Harness

arXiv - Harness-Bench

Categorie:GRAND LEXIQUE FRANÇAIS

Contributeurs: Claude Coulombe