Kurs · 7 Kapitel
Servieren offener Modelle in Produktion
Self-hosting as an engineering discipline: vLLM, GPU math, OpenAI-compatible gateways, observability, the honest cost model, and hardening a shared GPU across tenants.
Das wirst du können
- Warum es ein anderes technisches Problem ist, ein Modell gleichzeitig für viele Nutzer zu bedienen, als es nur auf der eigenen Maschine laufen zu lassen.
- Parameterzahl und Kontextlänge in ein echtes VRAM-Budget verwandeln, statt zu raten und zusehen, wie ein Container beim Start abstürzt.
- Eine stabile Adresse vor zwei korrekt dimensionierten Backends, mit Routing, Failover und Health-Checks, die die Arbeit übernehmen, die kein Client selbst erledigen sollte.
- Ein vages Gefühl, dass Requests sich langsam anfühlen, in ein Perzentil-Ziel verwandeln, auf das man tatsächlich alarmieren kann, und dabei nachverfolgen, welcher Hop verantwortlich ist, wenn es verletzt wird.
- Warum der Stundensatz der GPU selten die Zahl ist, die die Kosten pro Token tatsächlich bestimmt, und was das SLO-Ziel aus Kapitel 4 im Stillen an reserviertem Spielraum kostet.
- Wie die virtuellen Schlüssel aus Kapitel 3 zu einer echten Isolationsgarantie werden, damit der Burst eines Mandanten nie im Stillen den Spielraum eines anderen aufbraucht.
Was drin ist
- 1Serving Open Models: Hier anfangen
Sechs Kapitel, die einen Open-Weight-Checkpoint von einem Container, der eine Anfrage beantwortet, zu einem Deployment führen, das echten Traffic, ein echtes Budget und mehr als einen Mandanten übersteht.
- 2vLLM & der Serving-Stack
Warum es ein anderes technisches Problem ist, ein Modell gleichzeitig für viele Nutzer zu bedienen, als es nur auf der eigenen Maschine laufen zu lassen.
- 3GPU-Sizing & Quantisierung im großen Maßstab
Parameterzahl und Kontextlänge in ein echtes VRAM-Budget verwandeln, statt zu raten und zusehen, wie ein Container beim Start abstürzt.
- 4Das OpenAI-kompatible Gateway
Eine stabile Adresse vor zwei korrekt dimensionierten Backends, mit Routing, Failover und Health-Checks, die die Arbeit übernehmen, die kein Client selbst erledigen sollte.
- 5Observability & SLOs für Inferenz
Ein vages Gefühl, dass Requests sich langsam anfühlen, in ein Perzentil-Ziel verwandeln, auf das man tatsächlich alarmieren kann, und dabei nachverfolgen, welcher Hop verantwortlich ist, wenn es verletzt wird.
- 6Das Kostenmodell, ehrlich
Warum der Stundensatz der GPU selten die Zahl ist, die die Kosten pro Token tatsächlich bestimmt, und was das SLO-Ziel aus Kapitel 4 im Stillen an reserviertem Spielraum kostet.
- 7Härtung & Mandantenfähigkeit
Wie die virtuellen Schlüssel aus Kapitel 3 zu einer echten Isolationsgarantie werden, damit der Burst eines Mandanten nie im Stillen den Spielraum eines anderen aufbraucht.
Zertifikat erhalten
Schließe alle Kapitel ab, um dein Abschlusszertifikat zu erhalten.