Kurs · 8 Kapitel
On-Call mit KI
Fight ordinary production outages with AI agents: wire one into your telemetry, triage, debug live, verify the root cause, and decide exactly what it may touch in prod. All hands-on work runs on a provided lab.
Das wirst du können
- Verbinde einen schreibgeschützten Agenten mit deinen Logs, Metriken und Traces, und halte dasselbe Setup bereit für Datadog oder New Relic.
- Verwandle eine rohe 3-Uhr-Alarmierung in unter zwei Minuten in ein belegtes Briefing mit vier Fragen.
- Fahre mit einem Agenten eine Hypothesen-Schleife gegen einen echten, skriptgesteuerten Ausfall und behalte das Playbook, das ihn beim nächsten Mal wiederfindet.
- Verfolge ein fehlerhaftes Deployment an seiner falschen Fährte vorbei bis zu einer Ursache, die ein Mensch in fünf Minuten überprüfen kann.
- Verwandle ein unübersichtliches Fließtext-Runbook in Schritte, die ein Agent sicher ausführen kann, mit Freigabe-Gates dort, wo es darauf ankommt.
- Schreibe die Policy, die entscheidet, was dein Agent lesen darf, was er vorschlagen darf und was er niemals allein tun darf.
Was drin ist
- 1On-Call mit KI: Hier starten
Sieben Kapitel, ein Lab, und eine klare Grenze zwischen dem, was dein Agent heute lesen darf, und dem, was er sich später erst verdienen muss.
- 2Dein Stack, bereit für den Agenten
Verbinde einen schreibgeschützten Agenten mit deinen Logs, Metriken und Traces, und halte dasselbe Setup bereit für Datadog oder New Relic.
- 3Alert-Triage mit einem Agenten
Verwandle eine rohe 3-Uhr-Alarmierung in unter zwei Minuten in ein belegtes Briefing mit vier Fragen.
- 4Live-Debugging unter Druck
Fahre mit einem Agenten eine Hypothesen-Schleife gegen einen echten, skriptgesteuerten Ausfall und behalte das Playbook, das ihn beim nächsten Mal wiederfindet.
- 5Root-Cause-Analyse, die standhält
Verfolge ein fehlerhaftes Deployment an seiner falschen Fährte vorbei bis zu einer Ursache, die ein Mensch in fünf Minuten überprüfen kann.
- 6Runbooks, die Agents ausführen können
Verwandle ein unübersichtliches Fließtext-Runbook in Schritte, die ein Agent sicher ausführen kann, mit Freigabe-Gates dort, wo es darauf ankommt.
- 7Guardrails: Was der Agent in Prod anfasst
Schreibe die Policy, die entscheidet, was dein Agent lesen darf, was er vorschlagen darf und was er niemals allein tun darf.
- 8Postmortems & die Lernschleife
Entwirf ein blamefreies Postmortem mit einem Agent, lege es mit zugeordneten Action Items ab und verfolge, ob die Rotation tatsächlich besser wird.
Zertifikat erhalten
Schließe alle Kapitel ab, um dein Abschlusszertifikat zu erhalten.