Cursus · 7 hoofdstukken
Open modellen serveren in productie
Self-hosting as an engineering discipline: vLLM, GPU math, OpenAI-compatible gateways, observability, the honest cost model, and hardening a shared GPU across tenants.
Wat je zult kunnen
- Waarom een model tegelijk aan veel gebruikers serveren een heel ander technisch vraagstuk is dan het op je eigen machine draaien.
- Van aantal parameters en contextlengte naar een echt VRAM-budget, in plaats van gokken en toekijken hoe een container bij het opstarten crasht.
- Eén stabiel adres voor twee correct gesizede backends, waarbij routering, failover en health checks het werk doen dat geen enkele client zou moeten hoeven doen.
- Van een vaag gevoel dat verzoeken traag aanvoelen naar een percentieldoel waar je daadwerkelijk op kunt alerten, en achterhalen welke hop verantwoordelijk is als het wordt overschreden.
- Waarom het uurtarief van de GPU zelden het getal is dat de kost per token daadwerkelijk bepaalt, en wat het SLO-doel uit hoofdstuk 4 stilletjes kost aan gereserveerde headroom.
- De virtuele sleutels van hoofdstuk 3 omzetten in een echte isolatiegarantie, zodat de burst van de ene tenant nooit stilletjes de headroom van een andere tenant opsoupeert.
Wat erin zit
- 1Open modellen serveren: begin hier
Zes hoofdstukken die een open-weight checkpoint meenemen van een container die één verzoek beantwoordt naar een deployment die echt verkeer, een echt budget en meer dan één tenant overleeft.
- 2vLLM en de serving-stack
Waarom een model tegelijk aan veel gebruikers serveren een heel ander technisch vraagstuk is dan het op je eigen machine draaien.
- 3GPU-sizing en quantization op schaal
Van aantal parameters en contextlengte naar een echt VRAM-budget, in plaats van gokken en toekijken hoe een container bij het opstarten crasht.
- 4De OpenAI-compatibele gateway
Eén stabiel adres voor twee correct gesizede backends, waarbij routering, failover en health checks het werk doen dat geen enkele client zou moeten hoeven doen.
- 5Observability en SLO's voor inferentie
Van een vaag gevoel dat verzoeken traag aanvoelen naar een percentieldoel waar je daadwerkelijk op kunt alerten, en achterhalen welke hop verantwoordelijk is als het wordt overschreden.
- 6Het eerlijke kostenmodel
Waarom het uurtarief van de GPU zelden het getal is dat de kost per token daadwerkelijk bepaalt, en wat het SLO-doel uit hoofdstuk 4 stilletjes kost aan gereserveerde headroom.
- 7Hardening en multi-tenancy
De virtuele sleutels van hoofdstuk 3 omzetten in een echte isolatiegarantie, zodat de burst van de ene tenant nooit stilletjes de headroom van een andere tenant opsoupeert.
Behaal een certificaat
Rond alle hoofdstukken af om je certificaat van afronding te ontvangen.