Kurs · 8 Kapitel

On-Call mit KI

Fight ordinary production outages with AI agents: wire one into your telemetry, triage, debug live, verify the root cause, and decide exactly what it may touch in prod. All hands-on work runs on a provided lab.

Kostenpflichtigpractitioner8 Kapitel150 minEnglisch + 6 SprachenZertifikat nach Abschluss

Das wirst du können

  • Verbinde einen schreibgeschützten Agenten mit deinen Logs, Metriken und Traces, und halte dasselbe Setup bereit für Datadog oder New Relic.
  • Verwandle eine rohe 3-Uhr-Alarmierung in unter zwei Minuten in ein belegtes Briefing mit vier Fragen.
  • Fahre mit einem Agenten eine Hypothesen-Schleife gegen einen echten, skriptgesteuerten Ausfall und behalte das Playbook, das ihn beim nächsten Mal wiederfindet.
  • Verfolge ein fehlerhaftes Deployment an seiner falschen Fährte vorbei bis zu einer Ursache, die ein Mensch in fünf Minuten überprüfen kann.
  • Verwandle ein unübersichtliches Fließtext-Runbook in Schritte, die ein Agent sicher ausführen kann, mit Freigabe-Gates dort, wo es darauf ankommt.
  • Schreibe die Policy, die entscheidet, was dein Agent lesen darf, was er vorschlagen darf und was er niemals allein tun darf.

Was drin ist

  1. 1
    On-Call mit KI: Hier starten

    Sieben Kapitel, ein Lab, und eine klare Grenze zwischen dem, was dein Agent heute lesen darf, und dem, was er sich später erst verdienen muss.

    10 min
  2. 2
    Dein Stack, bereit für den Agenten

    Verbinde einen schreibgeschützten Agenten mit deinen Logs, Metriken und Traces, und halte dasselbe Setup bereit für Datadog oder New Relic.

    20 min
  3. 3
    Alert-Triage mit einem Agenten

    Verwandle eine rohe 3-Uhr-Alarmierung in unter zwei Minuten in ein belegtes Briefing mit vier Fragen.

    20 min
  4. 4
    Live-Debugging unter Druck

    Fahre mit einem Agenten eine Hypothesen-Schleife gegen einen echten, skriptgesteuerten Ausfall und behalte das Playbook, das ihn beim nächsten Mal wiederfindet.

    20 min
  5. 5
    Root-Cause-Analyse, die standhält

    Verfolge ein fehlerhaftes Deployment an seiner falschen Fährte vorbei bis zu einer Ursache, die ein Mensch in fünf Minuten überprüfen kann.

    20 min
  6. 6
    Runbooks, die Agents ausführen können

    Verwandle ein unübersichtliches Fließtext-Runbook in Schritte, die ein Agent sicher ausführen kann, mit Freigabe-Gates dort, wo es darauf ankommt.

    20 min
  7. 7
    Guardrails: Was der Agent in Prod anfasst

    Schreibe die Policy, die entscheidet, was dein Agent lesen darf, was er vorschlagen darf und was er niemals allein tun darf.

    20 min
  8. 8
    Postmortems & die Lernschleife

    Entwirf ein blamefreies Postmortem mit einem Agent, lege es mit zugeordneten Action Items ab und verfolge, ob die Rotation tatsächlich besser wird.

    20 min

Zertifikat erhalten

Schließe alle Kapitel ab, um dein Abschlusszertifikat zu erhalten.