Utilisation de Distracteurs pour l’Evaluation des Connaissances Factuelles des Modèles de Langue
Date
Formats
Catégories
Contenu
Les paramètres des modèles de langue encodent un grand nombre de connaissances factuelles. L’évaluation précise de ces connaissances est essentielle pour comprendre et améliorer ces modèles. Dans la littérature, l’évaluation des connaissances factuelles se fait souvent sur la base de phrases à trous, ce qui peut mener à des conclusions erronées, en raison de la complexité du langage naturel (complétions hors sujet, existence de plusieurs réponses correctes, ou de différentes manières d’exprimer une même réponse). De plus, les méthodes d’évaluation actuelles s’appuient fortement sur des exemples de mises à jour synthétiques, elles sont limitées à un seul type de scénario de mise à jour, et surestiment souvent la qualité des mises à jour évaluées. Pour surmonter ces problèmes, ce projet s’appuie sur WikiFactDiff, un ensemble d’exemples de mises à jour extraites automatiquement, en comparant des versions de Wikidata à deux dates données, et l’intègre avec une évaluation à base de distracteurs.
Nous avons publié notre méthode à COLING 2025.
Le code pour reproduire les expériences est disponible sur GitHub, sous licence MIT.