Kurs · 5 Kapitel
LLM-Evaluierung
Lauffähige LLM-Evals erstellen, denen du vertrauen kannst: goldene Datensätze, deterministische Scorer, kalibrierte LLM-Judges, Inspect AI Suites und CI-Gates. 5 Kapitel, fortgeschritten, für Engineers.
Das wirst du können
- Lauffähige LLM-Eval von Grund auf erstellen
- Rubriken für Judges entwerfen, die Bias standhalten
- LLM-Judges gegen menschliche Bewertungen kalibrieren
- Eval-Suites mit Inspect AI ausführen
- Schlechte Merges mit CI-Evals blockieren
- Schwellenwerte setzen, die instabilen Judges standhalten
Was drin ist
- 1LLM-Evaluation: Hier starten
Eine 12-minütige Orientierung zum Skill Path LLM-Evaluation – das Gateway-Kapitel, dann die drei Schichten (Judges, Suites, Gates), die Eval-nach-Bauchgefühl in eine Disziplin verwandeln, die ausliefert.
- 2Eval-Grundlagen: Dein erstes LLM-Eval in 30 Minuten
Schluss mit Bauchgefühl-Checks. Baue ein lauffähiges Eval — Golden Dataset, deterministischer Scorer, LLM-Judge — und lies das Ergebnis wie ein Engineer.
- 3LLM-as-Judge: Rubrics, Bias und Reliabilität
Entwirf Judges, die CALM-Biases überleben, kalibriere sie gegen Menschen und verdiene ihnen einen Platz in deinem CI-Gate.
- 4Inspect AI: Produktionsreife Eval-Suiten im großen Maßstab
Erstelle, führe aus und visualisiere Frontier-Grade-Eval-Suiten mit dem Open-Source-Framework von UK AISI.
- 5Eval-Gating in CI: Schlechte Merges blockieren
Verdrahte Per-PR-Evals mit GitHub Actions, wähle Schwellenwerte, die Flakiness überstehen, und entscheide, wann ein Gate auf main gehört.
Häufige Fragen
- Was lerne ich in diesem LLM-Evaluierungskurs?
- Du baust Evaluierung auf drei Ebenen auf: eine erste lauffähige Eval mit einem goldenen Datensatz und Scorer, zuverlässige LLM-as-Judge-Rubriken, die gegen menschliche Bewertungen kalibriert sind, und Eval-Suites, die als Merge-Gate in CI eingebunden sind. Der Lernpfad nutzt das Open-Source-Framework Inspect AI von UK AISI sowie GitHub Actions.
- Für wen ist dieser Kurs geeignet?
- Der Kurs richtet sich an Engineers, die KI-Features für den Produktionseinsatz entwickeln und LLM-Ausgaben rigoros testen müssen, anstatt sich auf ihr Bauchgefühl zu verlassen. Das Niveau ist fortgeschritten, mit Fokus auf Software-Engineering und KI-Zuverlässigkeit.
- Muss ich programmieren können?
- Ja. Dies ist ein praxisorientierter Engineering-Lernpfad, bei dem du Eval-Skripte schreibst, das Inspect AI Framework konfigurierst und GitHub Actions Workflows einrichtest – Erfahrung mit Code und CI wird vorausgesetzt.
- Wie lang ist der Kurs und gibt es ein Zertifikat?
- Der Lernpfad umfasst 5 Kapitel mit insgesamt ca. 100 Minuten und beginnt mit einer 12-minütigen Einführung. Nach Abschluss erhältst du ein Zertifikat der AI Academy by Anthropos.
- Ist dieser Kurs kostenlos?
- Nein, dies ist ein kostenpflichtiger Lernpfad, der im Abonnement der AI Academy by Anthropos enthalten ist.
Zertifikat erhalten
Schließe alle Kapitel ab, um dein Abschlusszertifikat zu erhalten.