« Harnais d'évaluation » : différence entre les versions
Aucun résumé des modifications |
Aucun résumé des modifications |
||
| (2 versions intermédiaires par le même utilisateur non affichées) | |||
| Ligne 1 : | Ligne 1 : | ||
==Définition== | ==Définition== | ||
Système logiciel spécialisé qui exécute automatiquement un [[Modèle d'intelligence artificielle|modèle]] ou un [[ | Système logiciel spécialisé qui exécute automatiquement une série de tâches normalisées ou de tests structurés sur un [[Modèle d'intelligence artificielle|modèle]] ou un [[agent d'IA]], gère son environnement d'exécution et évalue les résultats. Le harnais garantit la reproductibilité de l'environnement d'exécution et l'objectivité des résultats. | ||
== Compléments == | == Compléments == | ||
Le harnais soumet d'une manière automatique des [[Requête générative|requêtes génératives]] ou des tâches de codage à un [[Modèle d'intelligence artificielle|modèle]] ou un [[agent d'IA]]. Il | Le harnais soumet d'une manière automatique des [[Requête générative|requêtes génératives]] ou des tâches de codage à un [[Modèle d'intelligence artificielle|modèle]] ou un [[agent d'IA]]. Il interface aussi l'environnement logiciel, configure des bacs à sable sécurisés pour éviter toute action destructrice ou imprévue, alloue des outils (tels que des fureteurs web, une calculatrice, un calendrier, des logiciels spécialisés, l'accès aux bases de données ou à un système de fichiers, etc.). Le harnais observe et enregistre l'intégralité des requêtes, des appels de fonctions, des actions, des usages d'outils et des réponses générées au cours des tests. Il prend note des erreurs, du temps de calcul, de la consommation de [[Jeton textuel / jeton génératif|jetons génératifs]]. Enfin, il attribue des scores et évalue avec des tests unitaires ou un modèle agissant comme juge pour déterminer si la tâche a été accomplie avec succès. | ||
Un exemple de tests normalisés est le SWE-bench qui sert à évaluer la capacité des systèmes d'IA dans des tâches complexes de génie logiciel. | |||
<hr/> | <hr/> | ||
Ce terme est également utilisé en génie logiciel. | Ce terme est également utilisé en génie logiciel. | ||
==Français== | ==Français== | ||
| Ligne 16 : | Ligne 18 : | ||
'''harnais de banc d'essai''' | '''harnais de banc d'essai''' | ||
'''harnais d'agent d'IA''' | |||
'''harnais de modèle d'IA''' | |||
'''harnais | |||
==Anglais== | ==Anglais== | ||
| Ligne 26 : | Ligne 34 : | ||
'''test harness''' | '''test harness''' | ||
'''AI agent harness''' | |||
'''AI model harness''' | |||
'''harness-bench''' | '''harness-bench''' | ||
| Ligne 32 : | Ligne 44 : | ||
==Sources== | ==Sources== | ||
[https://www.matchpoint-partners.com/fr/practices/ai-evaluation-reliability-citations.html Matchpoint partners - harnais d'évaluation] | |||
[https://learn.microsoft.com/fr-fr/agent-framework/concepts/harness - Microsoft - harnais d’agent] | |||
[https://github.com/eleutherai/lm-evaluation-harness GitHub EleutherAI - Evaluation Harness] | |||
[https://arxiv.org/html/2605.27922v1 arXiv - Harness-Bench] | [https://arxiv.org/html/2605.27922v1 arXiv - Harness-Bench] | ||
[[Categorie:GRAND LEXIQUE FRANÇAIS]] | [[Categorie:GRAND LEXIQUE FRANÇAIS]] | ||
[[Catégorie:Publication]] | [[Catégorie:Publication]] | ||
Dernière version du 24 septembre 2026 à 02:04
Définition
Système logiciel spécialisé qui exécute automatiquement une série de tâches normalisées ou de tests structurés sur un modèle ou un agent d'IA, gère son environnement d'exécution et évalue les résultats. Le harnais garantit la reproductibilité de l'environnement d'exécution et l'objectivité des résultats.
Compléments
Le harnais soumet d'une manière automatique des requêtes génératives ou des tâches de codage à un modèle ou un agent d'IA. Il interface aussi l'environnement logiciel, configure des bacs à sable sécurisés pour éviter toute action destructrice ou imprévue, alloue des outils (tels que des fureteurs web, une calculatrice, un calendrier, des logiciels spécialisés, l'accès aux bases de données ou à un système de fichiers, etc.). Le harnais observe et enregistre l'intégralité des requêtes, des appels de fonctions, des actions, des usages d'outils et des réponses générées au cours des tests. Il prend note des erreurs, du temps de calcul, de la consommation de jetons génératifs. Enfin, il attribue des scores et évalue avec des tests unitaires ou un modèle agissant comme juge pour déterminer si la tâche a été accomplie avec succès.
Un exemple de tests normalisés est le SWE-bench qui sert à évaluer la capacité des systèmes d'IA dans des tâches complexes de génie logiciel.
Ce terme est également utilisé en génie logiciel.
Français
harnais d'évaluation
harnais de test
harnais de banc d'essai
harnais d'agent d'IA
harnais de modèle d'IA
harnais
Anglais
evaluation harness
eval harness
benchmark harness
test harness
AI agent harness
AI model harness
harness-bench
harness
Sources
Matchpoint partners - harnais d'évaluation
Contributeurs: Claude Coulombe





