Cours · 5 chapitres
Évaluation des LLM
Construis des évaluations de LLM fiables et exécutables : jeux de données de référence, évaluateurs déterministes, juges LLM calibrés, suites Inspect AI et contrôles CI. 5 chapitres, niveau avancé, pour les ingénieurs.
Ce que tu sauras faire
- Construire une évaluation LLM exécutable de zéro
- Concevoir des grilles d'évaluation résistantes aux biais
- Calibrer des juges LLM sur des notations humaines
- Lancer des suites d'évaluation avec Inspect AI
- Bloquer les fusions problématiques via les contrôles CI
- Fixer des seuils robustes face aux juges instables
Ce qu’il contient
- 1Évaluation LLM : point de départ
Une orientation de 12 minutes sur le skill path LLM Evaluation — le chapitre passerelle, puis les trois couches (juges, suites, gates) qui transforment l'eval-par-intuition en discipline qui livre.
- 2Fondamentaux des evals : ta première eval LLM en 30 minutes
Arrête de vérifier les sorties au feeling. Construis une eval exécutable — dataset doré, scorer déterministe, juge LLM — et lis le résultat comme un ingénieur.
- 3LLM-as-Judge : rubriques, biais et fiabilité
Concevoir des juges qui résistent aux biais CALM, calibrer contre des humains et mériter une place dans ton gate CI.
- 4Inspect AI : suites d'évaluation en production à grande échelle
Crée, exécute et visualise des suites d'évaluation de niveau frontier avec le framework open-source de UK AISI.
- 5Gating par Evals en CI : Bloquer les Mauvais Merges
Intègre des evals par PR dans GitHub Actions, choisis des seuils qui résistent à la flakiness, et décide quand une gate appartient à main.
Questions fréquentes
- Qu'est-ce que je vais apprendre dans ce cours sur l'évaluation de LLM ?
- Tu construis des évaluations sur trois niveaux : une première évaluation exécutable avec un jeu de données de référence et un évaluateur, des grilles d'évaluation LLM-as-judge fiables calibrées sur des notations humaines, et des suites d'évaluation intégrées à la CI comme contrôle de fusion. Le parcours s'appuie sur le framework open source Inspect AI de l'UK AISI et GitHub Actions.
- À qui s'adresse ce cours ?
- Il s'adresse aux ingénieurs qui développent des fonctionnalités IA en production et qui ont besoin de tester rigoureusement les sorties de LLM, plutôt que d'y aller au feeling. Le niveau est avancé, avec un focus sur l'ingénierie logicielle et la fiabilité de l'IA.
- Dois-je savoir coder pour suivre ce cours ?
- Oui. C'est un parcours d'ingénierie pratique qui implique d'écrire des scripts d'évaluation, de configurer le framework Inspect AI et de mettre en place des workflows GitHub Actions — être à l'aise avec le code et la CI est donc indispensable.
- Quelle est la durée du cours et y a-t-il un certificat ?
- Le parcours comprend 5 chapitres pour environ 100 minutes au total, avec une introduction de 12 minutes. À la fin, tu obtiens un certificat AI Academy by Anthropos.
- Ce cours est-il gratuit ?
- Non, c'est un parcours payant inclus dans un abonnement AI Academy by Anthropos.
Obtiens un certificat
Termine tous les chapitres pour recevoir ton certificat de réussite.