Cursus · 5 hoofdstukken

LLM-evaluatie

Bouw uitvoerbare LLM-evaluaties waar je op kunt vertrouwen: gouden datasets, deterministische scorers, gekalibreerde LLM-judges, Inspect AI-suites en CI-gates. 5 hoofdstukken, gevorderd, voor ontwikkelaars.

Betaaldadvanced5 hoofdstukken100 minEngels + 6 talenCertificaat bij afronding

Wat je zult kunnen

  • Bouw een uitvoerbare LLM-evaluatie van nul af
  • Ontwerp judge-rubrieken die bestand zijn tegen bias
  • Kalibreer LLM-judges aan de hand van menselijke beoordelingen
  • Voer evaluatiesuites uit met Inspect AI
  • Blokkeer slechte merges met CI-evaluaties
  • Stel drempelwaarden in die bestand zijn tegen onbetrouwbare judges

Wat erin zit

  1. 1
    LLM-evaluatie: begin hier

    Een oriëntatie van 12 minuten op het skill path LLM-evaluatie — het openingshoofdstuk, gevolgd door de drie lagen (judges, suites, gates) die eval-op-gevoel omzetten in een discipline die ook echt shipt.

    12 min
  2. 2
    Eval Foundations: Je eerste LLM-eval in 30 minuten

    Stop met outputs op gevoel beoordelen. Bouw een uitvoerbare eval — golden dataset, deterministische scorer, LLM-judge — en lees het resultaat als een engineer.

    22 min
  3. 3
    LLM-as-Judge: Rubrics, Bias en Betrouwbaarheid

    Ontwerp judges die CALM-biases overleven, kalibreer ze tegen mensen, en geef ze een plek in je CI-gate.

    22 min
  4. 4
    Inspect AI: Production Eval Suites op schaal

    Schrijf, draai en visualiseer eval suites op frontier-niveau met het open-source framework van UK AISI.

    22 min
  5. 5
    Eval-gating in CI: slechte merges blokkeren

    Koppel per-PR-evals aan GitHub Actions, kies drempels die bestand zijn tegen flakiness, en bepaal wanneer een gate thuishoort op main.

    22 min

Veelgestelde vragen

Wat leer ik in deze LLM-evaluatiecursus?
Je bouwt evaluaties op drie lagen: een eerste uitvoerbare evaluatie met een gouden dataset en scorer, betrouwbare LLM-as-judge-rubrieken gekalibreerd aan menselijke beoordelingen, en evaluatiesuites gekoppeld aan CI als merge-gate. Het leerpad gebruikt het open-source Inspect AI-framework van UK AISI en GitHub Actions.
Voor wie is deze cursus bedoeld?
De cursus is bedoeld voor ontwikkelaars die AI-functies bouwen voor productie en LLM-uitvoer grondig willen testen in plaats van op gevoel te beoordelen. Het niveau is gevorderd, met de nadruk op software-engineering en AI-betrouwbaarheid.
Moet ik kunnen programmeren om deze cursus te volgen?
Ja. Dit is een praktijkgericht engineeringpad waarbij je evaluatiescripts schrijft, het Inspect AI-framework configureert en GitHub Actions-workflows instelt. Vertrouwdheid met code en CI is vereist.
Hoe lang duurt de cursus en is er een certificaat?
Het leerpad bestaat uit 5 hoofdstukken met in totaal ongeveer 100 minuten, te beginnen met een oriëntatie van 12 minuten. Na afronding ontvang je een certificaat van AI Academy by Anthropos.
Is deze cursus gratis?
Nee, dit is een betaald leerpad dat is inbegrepen bij een abonnement op AI Academy by Anthropos.

Behaal een certificaat

Rond alle hoofdstukken af om je certificaat van afronding te ontvangen.