« Harnais d'évaluation » : différence entre les versions


(Page créée avec « ==Définition== Système logiciel spécialisé qui exécute automatiquement un modèle ou un Agent d'IA sur une série de tâches normalisées ou tests, gère son environnement d'exécution et évalue les résultats. == Compléments == Le harnais soumet d'une manière automatique des requêtes génératives, des instructions ou des tâches de codage à un Modèle d'intelligence artificiell... »)
 
Aucun résumé des modifications
 
(6 versions intermédiaires par le même utilisateur non affichées)
Ligne 1 : Ligne 1 :
==Définition==
==Définition==


Système logiciel spécialisé qui exécute automatiquement un [[Modèle d'intelligence artificielle|modèle]] ou un [[Agent d'IA]] sur une série de tâches normalisées ou tests, gère son environnement d'exécution et évalue les résultats.
Système logiciel spécialisé qui exécute automatiquement une série de tâches normalisées ou de tests structurés sur un [[Modèle d'intelligence artificielle|modèle]] ou un [[agent d'IA]], gère son environnement d'exécution et évalue les résultats. Le harnais garantit la reproductibilité de l'environnement d'exécution et l'objectivité des résultats.


== Compléments ==
== Compléments ==


Le harnais soumet d'une manière automatique des [[Requête générative|requêtes génératives]], des instructions ou des tâches de codage à un [[Modèle d'intelligence artificielle|modèle]] ou un [[agent d'IA]]. Il gère aussi l'environnement logiciel, configure des bacs à sable sécurisés, alloue des outils (tels que des fureteurs web, une calculatrice, des logiciels spécialisés, l'accès à une BD ou à un système de fichiers, etc.). Le harnais enregistre la séquence complète des actions, des appels d'outils et des sorties générées au cours d'un test.
Le harnais soumet d'une manière automatique des [[Requête générative|requêtes génératives]] ou des tâches de codage à un [[Modèle d'intelligence artificielle|modèle]] ou un [[agent d'IA]]. Il interface aussi l'environnement logiciel, configure des bacs à sable sécurisés pour éviter toute action destructrice ou imprévue, alloue des outils (tels que des fureteurs web, une calculatrice, un calendrier, des logiciels spécialisés, l'accès aux bases de données ou à un système de fichiers, etc.). Le harnais observe et enregistre l'intégralité des requêtes, des appels de fonctions, des actions, des usages d'outils et des réponses générées au cours des tests. Il prend note des erreurs, du temps de calcul, de la consommation de [[Jeton textuel / jeton génératif|jetons génératifs]]. Enfin, il attribue des scores et évalue avec des tests unitaires ou un modèle agissant comme juge pour déterminer si la tâche a été accomplie avec succès.
 
Un exemple de tests normalisés est le SWE-bench qui sert à évaluer la capacité des systèmes d'IA dans des tâches complexes de génie logiciel.
<hr/>
Ce terme est également utilisé en génie logiciel.  


Enfin, il attribue des scores et évalue avec des tests unitaires ou un modèle agissant comme juge pour déterminer si la tâche a été accomplie avec succès.
==Français==
==Français==


Ligne 16 : Ligne 18 :


'''harnais de banc d'essai'''
'''harnais de banc d'essai'''
'''harnais d'agent d'IA'''
'''harnais de modèle d'IA'''
'''harnais


==Anglais==
==Anglais==
Ligne 26 : Ligne 34 :


'''test harness'''
'''test harness'''
'''AI agent harness'''
'''AI model harness'''


'''harness-bench'''
'''harness-bench'''
Ligne 32 : Ligne 44 :


==Sources==
==Sources==
[https://www.matchpoint-partners.com/fr/practices/ai-evaluation-reliability-citations.html Matchpoint partners - harnais d'évaluation]
[https://learn.microsoft.com/fr-fr/agent-framework/concepts/harness - Microsoft - harnais d’agent]


[https://github.com/eleutherai/lm-evaluation-harness GitHub EleutherAI - Evaluation Harness]
 
[https://arxiv.org/html/2605.27922v1 arXiv - Harness-Bench]
[https://arxiv.org/html/2605.27922v1 arXiv - Harness-Bench]


[[Categorie:GRAND LEXIQUE FRANÇAIS]]
[[Categorie:GRAND LEXIQUE FRANÇAIS]]
[[Catégorie:Publication]]
[[Catégorie:Publication]]

Dernière version du 24 septembre 2026 à 02:04

Définition

Système logiciel spécialisé qui exécute automatiquement une série de tâches normalisées ou de tests structurés sur un modèle ou un agent d'IA, gère son environnement d'exécution et évalue les résultats. Le harnais garantit la reproductibilité de l'environnement d'exécution et l'objectivité des résultats.

Compléments

Le harnais soumet d'une manière automatique des requêtes génératives ou des tâches de codage à un modèle ou un agent d'IA. Il interface aussi l'environnement logiciel, configure des bacs à sable sécurisés pour éviter toute action destructrice ou imprévue, alloue des outils (tels que des fureteurs web, une calculatrice, un calendrier, des logiciels spécialisés, l'accès aux bases de données ou à un système de fichiers, etc.). Le harnais observe et enregistre l'intégralité des requêtes, des appels de fonctions, des actions, des usages d'outils et des réponses générées au cours des tests. Il prend note des erreurs, du temps de calcul, de la consommation de jetons génératifs. Enfin, il attribue des scores et évalue avec des tests unitaires ou un modèle agissant comme juge pour déterminer si la tâche a été accomplie avec succès.

Un exemple de tests normalisés est le SWE-bench qui sert à évaluer la capacité des systèmes d'IA dans des tâches complexes de génie logiciel.


Ce terme est également utilisé en génie logiciel.

Français

harnais d'évaluation

harnais de test

harnais de banc d'essai

harnais d'agent d'IA

harnais de modèle d'IA

harnais

Anglais

evaluation harness

eval harness

benchmark harness

test harness

AI agent harness

AI model harness

harness-bench

harness

Sources

Matchpoint partners - harnais d'évaluation

- Microsoft - harnais d’agent

GitHub EleutherAI - Evaluation Harness

arXiv - Harness-Bench

Categorie:GRAND LEXIQUE FRANÇAIS

Contributeurs: Claude Coulombe