Cours · 7 chapitres
Servir des modèles open source en production
Self-hosting as an engineering discipline: vLLM, GPU math, OpenAI-compatible gateways, observability, the honest cost model, and hardening a shared GPU across tenants.
Ce que tu sauras faire
- Pourquoi servir un modèle à de nombreux utilisateurs en même temps est un problème d'ingénierie différent de celui de le faire tourner sur sa propre machine.
- Transformer un nombre de paramètres et une longueur de contexte en un vrai budget VRAM, plutôt que deviner et regarder un conteneur planter au démarrage.
- Une adresse stable devant deux backends correctement dimensionnés, avec routage, failover et vérifications de santé faisant le travail qu'aucun client ne devrait avoir à faire.
- Transformer une impression vague que les requêtes sont lentes en une cible de percentile réellement exploitable pour une alerte, et tracer quel saut est responsable en cas de dépassement.
- Pourquoi le tarif horaire du GPU est rarement le chiffre qui détermine réellement le coût par token, et ce que la cible SLO du chapitre 4 coûte discrètement en marge réservée.
- Transformer les clés virtuelles du chapitre 3 en une véritable garantie d'isolation, pour qu'un pic d'un locataire ne puisse jamais discrètement dépenser la marge d'un autre.
Ce qu’il contient
- 1Servir des modèles open source : commencez ici
Six chapitres qui font passer un checkpoint à poids ouverts d'un conteneur qui répond à une seule requête à un déploiement qui survit à un trafic réel, un budget réel, et plus d'un locataire.
- 2vLLM et la stack de serving
Pourquoi servir un modèle à de nombreux utilisateurs en même temps est un problème d'ingénierie différent de celui de le faire tourner sur sa propre machine.
- 3Dimensionnement GPU et quantification
Transformer un nombre de paramètres et une longueur de contexte en un vrai budget VRAM, plutôt que deviner et regarder un conteneur planter au démarrage.
- 4Le gateway compatible OpenAI
Une adresse stable devant deux backends correctement dimensionnés, avec routage, failover et vérifications de santé faisant le travail qu'aucun client ne devrait avoir à faire.
- 5Observabilité et SLO pour l'inférence
Transformer une impression vague que les requêtes sont lentes en une cible de percentile réellement exploitable pour une alerte, et tracer quel saut est responsable en cas de dépassement.
- 6Le modèle de coût, honnêtement
Pourquoi le tarif horaire du GPU est rarement le chiffre qui détermine réellement le coût par token, et ce que la cible SLO du chapitre 4 coûte discrètement en marge réservée.
- 7Durcissement et multi-location
Transformer les clés virtuelles du chapitre 3 en une véritable garantie d'isolation, pour qu'un pic d'un locataire ne puisse jamais discrètement dépenser la marge d'un autre.
Obtiens un certificat
Termine tous les chapitres pour recevoir ton certificat de réussite.