Évaluation de métriques de RAG dans un contexte applicatif


Date

Formats

Catégories

Contenu

Aujourd’hui, l’évaluation des systèmes de RAG (Retrieval Augmented Generation) repose, en grande partie, sur des métriques de type LLM-as-a-judge. Cependant la fiabilité de ces métriques est variable en fonction du contexte d’application. Il est donc utile, au début du développement d’un système de RAG, de réaliser une évaluation des métriques disponibles, afin de vérifier, qu’elles donnent des approximations acceptables des critères considérés, et qu’elles permettront, ainsi, de comparer de manière fiable les différentes itérations du système de RAG développé. Généralement, les métriques sont évaluées en mesurant leur corrélation à des notes données par des humains.

L’article Évaluation de métriques de RAG dans un contexte applicatif : une expérience, ses conclusions et ses limites, publié à EvalLLM 2026, rapporte une expérience visant à évaluer des métriques de RAG dans le contexte de l’évaluation d’une solution de RAG développée en internet sur de la documentation métier.

Le dépôt, sous licences MIT et CC-BY, contient le code et les données nécessaires à la reproduction des analyses, en partant des notes générées par les différentes métriques, et par les évaluateurs humains.