Kurs · 7 Kapitel

Servieren offener Modelle in Produktion

Self-hosting as an engineering discipline: vLLM, GPU math, OpenAI-compatible gateways, observability, the honest cost model, and hardening a shared GPU across tenants.

Kostenpflichtigadvanced7 Kapitel111 minEnglisch + 6 SprachenZertifikat nach Abschluss

Das wirst du können

  • Warum es ein anderes technisches Problem ist, ein Modell gleichzeitig für viele Nutzer zu bedienen, als es nur auf der eigenen Maschine laufen zu lassen.
  • Parameterzahl und Kontextlänge in ein echtes VRAM-Budget verwandeln, statt zu raten und zusehen, wie ein Container beim Start abstürzt.
  • Eine stabile Adresse vor zwei korrekt dimensionierten Backends, mit Routing, Failover und Health-Checks, die die Arbeit übernehmen, die kein Client selbst erledigen sollte.
  • Ein vages Gefühl, dass Requests sich langsam anfühlen, in ein Perzentil-Ziel verwandeln, auf das man tatsächlich alarmieren kann, und dabei nachverfolgen, welcher Hop verantwortlich ist, wenn es verletzt wird.
  • Warum der Stundensatz der GPU selten die Zahl ist, die die Kosten pro Token tatsächlich bestimmt, und was das SLO-Ziel aus Kapitel 4 im Stillen an reserviertem Spielraum kostet.
  • Wie die virtuellen Schlüssel aus Kapitel 3 zu einer echten Isolationsgarantie werden, damit der Burst eines Mandanten nie im Stillen den Spielraum eines anderen aufbraucht.

Was drin ist

  1. 1
    Serving Open Models: Hier anfangen

    Sechs Kapitel, die einen Open-Weight-Checkpoint von einem Container, der eine Anfrage beantwortet, zu einem Deployment führen, das echten Traffic, ein echtes Budget und mehr als einen Mandanten übersteht.

    10 min
  2. 2
    vLLM & der Serving-Stack

    Warum es ein anderes technisches Problem ist, ein Modell gleichzeitig für viele Nutzer zu bedienen, als es nur auf der eigenen Maschine laufen zu lassen.

    17 min
  3. 3
    GPU-Sizing & Quantisierung im großen Maßstab

    Parameterzahl und Kontextlänge in ein echtes VRAM-Budget verwandeln, statt zu raten und zusehen, wie ein Container beim Start abstürzt.

    17 min
  4. 4
    Das OpenAI-kompatible Gateway

    Eine stabile Adresse vor zwei korrekt dimensionierten Backends, mit Routing, Failover und Health-Checks, die die Arbeit übernehmen, die kein Client selbst erledigen sollte.

    16 min
  5. 5
    Observability & SLOs für Inferenz

    Ein vages Gefühl, dass Requests sich langsam anfühlen, in ein Perzentil-Ziel verwandeln, auf das man tatsächlich alarmieren kann, und dabei nachverfolgen, welcher Hop verantwortlich ist, wenn es verletzt wird.

    17 min
  6. 6
    Das Kostenmodell, ehrlich

    Warum der Stundensatz der GPU selten die Zahl ist, die die Kosten pro Token tatsächlich bestimmt, und was das SLO-Ziel aus Kapitel 4 im Stillen an reserviertem Spielraum kostet.

    17 min
  7. 7
    Härtung & Mandantenfähigkeit

    Wie die virtuellen Schlüssel aus Kapitel 3 zu einer echten Isolationsgarantie werden, damit der Burst eines Mandanten nie im Stillen den Spielraum eines anderen aufbraucht.

    17 min

Zertifikat erhalten

Schließe alle Kapitel ab, um dein Abschlusszertifikat zu erhalten.