Kurs · 5 Kapitel

LLM-Evaluierung

Lauffähige LLM-Evals erstellen, denen du vertrauen kannst: goldene Datensätze, deterministische Scorer, kalibrierte LLM-Judges, Inspect AI Suites und CI-Gates. 5 Kapitel, fortgeschritten, für Engineers.

Kostenpflichtigadvanced5 Kapitel100 minEnglisch + 6 SprachenZertifikat nach Abschluss

Das wirst du können

  • Lauffähige LLM-Eval von Grund auf erstellen
  • Rubriken für Judges entwerfen, die Bias standhalten
  • LLM-Judges gegen menschliche Bewertungen kalibrieren
  • Eval-Suites mit Inspect AI ausführen
  • Schlechte Merges mit CI-Evals blockieren
  • Schwellenwerte setzen, die instabilen Judges standhalten

Was drin ist

  1. 1
    LLM-Evaluation: Hier starten

    Eine 12-minütige Orientierung zum Skill Path LLM-Evaluation – das Gateway-Kapitel, dann die drei Schichten (Judges, Suites, Gates), die Eval-nach-Bauchgefühl in eine Disziplin verwandeln, die ausliefert.

    12 min
  2. 2
    Eval-Grundlagen: Dein erstes LLM-Eval in 30 Minuten

    Schluss mit Bauchgefühl-Checks. Baue ein lauffähiges Eval — Golden Dataset, deterministischer Scorer, LLM-Judge — und lies das Ergebnis wie ein Engineer.

    22 min
  3. 3
    LLM-as-Judge: Rubrics, Bias und Reliabilität

    Entwirf Judges, die CALM-Biases überleben, kalibriere sie gegen Menschen und verdiene ihnen einen Platz in deinem CI-Gate.

    22 min
  4. 4
    Inspect AI: Produktionsreife Eval-Suiten im großen Maßstab

    Erstelle, führe aus und visualisiere Frontier-Grade-Eval-Suiten mit dem Open-Source-Framework von UK AISI.

    22 min
  5. 5
    Eval-Gating in CI: Schlechte Merges blockieren

    Verdrahte Per-PR-Evals mit GitHub Actions, wähle Schwellenwerte, die Flakiness überstehen, und entscheide, wann ein Gate auf main gehört.

    22 min

Häufige Fragen

Was lerne ich in diesem LLM-Evaluierungskurs?
Du baust Evaluierung auf drei Ebenen auf: eine erste lauffähige Eval mit einem goldenen Datensatz und Scorer, zuverlässige LLM-as-Judge-Rubriken, die gegen menschliche Bewertungen kalibriert sind, und Eval-Suites, die als Merge-Gate in CI eingebunden sind. Der Lernpfad nutzt das Open-Source-Framework Inspect AI von UK AISI sowie GitHub Actions.
Für wen ist dieser Kurs geeignet?
Der Kurs richtet sich an Engineers, die KI-Features für den Produktionseinsatz entwickeln und LLM-Ausgaben rigoros testen müssen, anstatt sich auf ihr Bauchgefühl zu verlassen. Das Niveau ist fortgeschritten, mit Fokus auf Software-Engineering und KI-Zuverlässigkeit.
Muss ich programmieren können?
Ja. Dies ist ein praxisorientierter Engineering-Lernpfad, bei dem du Eval-Skripte schreibst, das Inspect AI Framework konfigurierst und GitHub Actions Workflows einrichtest – Erfahrung mit Code und CI wird vorausgesetzt.
Wie lang ist der Kurs und gibt es ein Zertifikat?
Der Lernpfad umfasst 5 Kapitel mit insgesamt ca. 100 Minuten und beginnt mit einer 12-minütigen Einführung. Nach Abschluss erhältst du ein Zertifikat der AI Academy by Anthropos.
Ist dieser Kurs kostenlos?
Nein, dies ist ein kostenpflichtiger Lernpfad, der im Abonnement der AI Academy by Anthropos enthalten ist.

Zertifikat erhalten

Schließe alle Kapitel ab, um dein Abschlusszertifikat zu erhalten.