Cursus · 5 hoofdstukken
LLM-evaluatie
Bouw uitvoerbare LLM-evaluaties waar je op kunt vertrouwen: gouden datasets, deterministische scorers, gekalibreerde LLM-judges, Inspect AI-suites en CI-gates. 5 hoofdstukken, gevorderd, voor ontwikkelaars.
Wat je zult kunnen
- Bouw een uitvoerbare LLM-evaluatie van nul af
- Ontwerp judge-rubrieken die bestand zijn tegen bias
- Kalibreer LLM-judges aan de hand van menselijke beoordelingen
- Voer evaluatiesuites uit met Inspect AI
- Blokkeer slechte merges met CI-evaluaties
- Stel drempelwaarden in die bestand zijn tegen onbetrouwbare judges
Wat erin zit
- 1LLM-evaluatie: begin hier
Een oriëntatie van 12 minuten op het skill path LLM-evaluatie — het openingshoofdstuk, gevolgd door de drie lagen (judges, suites, gates) die eval-op-gevoel omzetten in een discipline die ook echt shipt.
- 2Eval Foundations: Je eerste LLM-eval in 30 minuten
Stop met outputs op gevoel beoordelen. Bouw een uitvoerbare eval — golden dataset, deterministische scorer, LLM-judge — en lees het resultaat als een engineer.
- 3LLM-as-Judge: Rubrics, Bias en Betrouwbaarheid
Ontwerp judges die CALM-biases overleven, kalibreer ze tegen mensen, en geef ze een plek in je CI-gate.
- 4Inspect AI: Production Eval Suites op schaal
Schrijf, draai en visualiseer eval suites op frontier-niveau met het open-source framework van UK AISI.
- 5Eval-gating in CI: slechte merges blokkeren
Koppel per-PR-evals aan GitHub Actions, kies drempels die bestand zijn tegen flakiness, en bepaal wanneer een gate thuishoort op main.
Veelgestelde vragen
- Wat leer ik in deze LLM-evaluatiecursus?
- Je bouwt evaluaties op drie lagen: een eerste uitvoerbare evaluatie met een gouden dataset en scorer, betrouwbare LLM-as-judge-rubrieken gekalibreerd aan menselijke beoordelingen, en evaluatiesuites gekoppeld aan CI als merge-gate. Het leerpad gebruikt het open-source Inspect AI-framework van UK AISI en GitHub Actions.
- Voor wie is deze cursus bedoeld?
- De cursus is bedoeld voor ontwikkelaars die AI-functies bouwen voor productie en LLM-uitvoer grondig willen testen in plaats van op gevoel te beoordelen. Het niveau is gevorderd, met de nadruk op software-engineering en AI-betrouwbaarheid.
- Moet ik kunnen programmeren om deze cursus te volgen?
- Ja. Dit is een praktijkgericht engineeringpad waarbij je evaluatiescripts schrijft, het Inspect AI-framework configureert en GitHub Actions-workflows instelt. Vertrouwdheid met code en CI is vereist.
- Hoe lang duurt de cursus en is er een certificaat?
- Het leerpad bestaat uit 5 hoofdstukken met in totaal ongeveer 100 minuten, te beginnen met een oriëntatie van 12 minuten. Na afronding ontvang je een certificaat van AI Academy by Anthropos.
- Is deze cursus gratis?
- Nee, dit is een betaald leerpad dat is inbegrepen bij een abonnement op AI Academy by Anthropos.
Behaal een certificaat
Rond alle hoofdstukken af om je certificaat van afronding te ontvangen.