Cours · 5 chapitres

Évaluation des LLM

Construis des évaluations de LLM fiables et exécutables : jeux de données de référence, évaluateurs déterministes, juges LLM calibrés, suites Inspect AI et contrôles CI. 5 chapitres, niveau avancé, pour les ingénieurs.

Payantadvanced5 chapitres100 minAnglais + 6 languesCertificat à la fin

Ce que tu sauras faire

  • Construire une évaluation LLM exécutable de zéro
  • Concevoir des grilles d'évaluation résistantes aux biais
  • Calibrer des juges LLM sur des notations humaines
  • Lancer des suites d'évaluation avec Inspect AI
  • Bloquer les fusions problématiques via les contrôles CI
  • Fixer des seuils robustes face aux juges instables

Ce qu’il contient

  1. 1
    Évaluation LLM : point de départ

    Une orientation de 12 minutes sur le skill path LLM Evaluation — le chapitre passerelle, puis les trois couches (juges, suites, gates) qui transforment l'eval-par-intuition en discipline qui livre.

    12 min
  2. 2
    Fondamentaux des evals : ta première eval LLM en 30 minutes

    Arrête de vérifier les sorties au feeling. Construis une eval exécutable — dataset doré, scorer déterministe, juge LLM — et lis le résultat comme un ingénieur.

    22 min
  3. 3
    LLM-as-Judge : rubriques, biais et fiabilité

    Concevoir des juges qui résistent aux biais CALM, calibrer contre des humains et mériter une place dans ton gate CI.

    22 min
  4. 4
    Inspect AI : suites d'évaluation en production à grande échelle

    Crée, exécute et visualise des suites d'évaluation de niveau frontier avec le framework open-source de UK AISI.

    22 min
  5. 5
    Gating par Evals en CI : Bloquer les Mauvais Merges

    Intègre des evals par PR dans GitHub Actions, choisis des seuils qui résistent à la flakiness, et décide quand une gate appartient à main.

    22 min

Questions fréquentes

Qu'est-ce que je vais apprendre dans ce cours sur l'évaluation de LLM ?
Tu construis des évaluations sur trois niveaux : une première évaluation exécutable avec un jeu de données de référence et un évaluateur, des grilles d'évaluation LLM-as-judge fiables calibrées sur des notations humaines, et des suites d'évaluation intégrées à la CI comme contrôle de fusion. Le parcours s'appuie sur le framework open source Inspect AI de l'UK AISI et GitHub Actions.
À qui s'adresse ce cours ?
Il s'adresse aux ingénieurs qui développent des fonctionnalités IA en production et qui ont besoin de tester rigoureusement les sorties de LLM, plutôt que d'y aller au feeling. Le niveau est avancé, avec un focus sur l'ingénierie logicielle et la fiabilité de l'IA.
Dois-je savoir coder pour suivre ce cours ?
Oui. C'est un parcours d'ingénierie pratique qui implique d'écrire des scripts d'évaluation, de configurer le framework Inspect AI et de mettre en place des workflows GitHub Actions — être à l'aise avec le code et la CI est donc indispensable.
Quelle est la durée du cours et y a-t-il un certificat ?
Le parcours comprend 5 chapitres pour environ 100 minutes au total, avec une introduction de 12 minutes. À la fin, tu obtiens un certificat AI Academy by Anthropos.
Ce cours est-il gratuit ?
Non, c'est un parcours payant inclus dans un abonnement AI Academy by Anthropos.

Obtiens un certificat

Termine tous les chapitres pour recevoir ton certificat de réussite.