Cursus · 7 hoofdstukken

Open modellen serveren in productie

Self-hosting as an engineering discipline: vLLM, GPU math, OpenAI-compatible gateways, observability, the honest cost model, and hardening a shared GPU across tenants.

Betaaldadvanced7 hoofdstukken111 minEngels + 6 talenCertificaat bij afronding

Wat je zult kunnen

  • Waarom een model tegelijk aan veel gebruikers serveren een heel ander technisch vraagstuk is dan het op je eigen machine draaien.
  • Van aantal parameters en contextlengte naar een echt VRAM-budget, in plaats van gokken en toekijken hoe een container bij het opstarten crasht.
  • Eén stabiel adres voor twee correct gesizede backends, waarbij routering, failover en health checks het werk doen dat geen enkele client zou moeten hoeven doen.
  • Van een vaag gevoel dat verzoeken traag aanvoelen naar een percentieldoel waar je daadwerkelijk op kunt alerten, en achterhalen welke hop verantwoordelijk is als het wordt overschreden.
  • Waarom het uurtarief van de GPU zelden het getal is dat de kost per token daadwerkelijk bepaalt, en wat het SLO-doel uit hoofdstuk 4 stilletjes kost aan gereserveerde headroom.
  • De virtuele sleutels van hoofdstuk 3 omzetten in een echte isolatiegarantie, zodat de burst van de ene tenant nooit stilletjes de headroom van een andere tenant opsoupeert.

Wat erin zit

  1. 1
    Open modellen serveren: begin hier

    Zes hoofdstukken die een open-weight checkpoint meenemen van een container die één verzoek beantwoordt naar een deployment die echt verkeer, een echt budget en meer dan één tenant overleeft.

    10 min
  2. 2
    vLLM en de serving-stack

    Waarom een model tegelijk aan veel gebruikers serveren een heel ander technisch vraagstuk is dan het op je eigen machine draaien.

    17 min
  3. 3
    GPU-sizing en quantization op schaal

    Van aantal parameters en contextlengte naar een echt VRAM-budget, in plaats van gokken en toekijken hoe een container bij het opstarten crasht.

    17 min
  4. 4
    De OpenAI-compatibele gateway

    Eén stabiel adres voor twee correct gesizede backends, waarbij routering, failover en health checks het werk doen dat geen enkele client zou moeten hoeven doen.

    16 min
  5. 5
    Observability en SLO's voor inferentie

    Van een vaag gevoel dat verzoeken traag aanvoelen naar een percentieldoel waar je daadwerkelijk op kunt alerten, en achterhalen welke hop verantwoordelijk is als het wordt overschreden.

    17 min
  6. 6
    Het eerlijke kostenmodel

    Waarom het uurtarief van de GPU zelden het getal is dat de kost per token daadwerkelijk bepaalt, en wat het SLO-doel uit hoofdstuk 4 stilletjes kost aan gereserveerde headroom.

    17 min
  7. 7
    Hardening en multi-tenancy

    De virtuele sleutels van hoofdstuk 3 omzetten in een echte isolatiegarantie, zodat de burst van de ene tenant nooit stilletjes de headroom van een andere tenant opsoupeert.

    17 min

Behaal een certificaat

Rond alle hoofdstukken af om je certificaat van afronding te ontvangen.