Cours · 7 chapitres

Servir des modèles open source en production

Self-hosting as an engineering discipline: vLLM, GPU math, OpenAI-compatible gateways, observability, the honest cost model, and hardening a shared GPU across tenants.

Payantadvanced7 chapitres111 minAnglais + 6 languesCertificat à la fin

Ce que tu sauras faire

  • Pourquoi servir un modèle à de nombreux utilisateurs en même temps est un problème d'ingénierie différent de celui de le faire tourner sur sa propre machine.
  • Transformer un nombre de paramètres et une longueur de contexte en un vrai budget VRAM, plutôt que deviner et regarder un conteneur planter au démarrage.
  • Une adresse stable devant deux backends correctement dimensionnés, avec routage, failover et vérifications de santé faisant le travail qu'aucun client ne devrait avoir à faire.
  • Transformer une impression vague que les requêtes sont lentes en une cible de percentile réellement exploitable pour une alerte, et tracer quel saut est responsable en cas de dépassement.
  • Pourquoi le tarif horaire du GPU est rarement le chiffre qui détermine réellement le coût par token, et ce que la cible SLO du chapitre 4 coûte discrètement en marge réservée.
  • Transformer les clés virtuelles du chapitre 3 en une véritable garantie d'isolation, pour qu'un pic d'un locataire ne puisse jamais discrètement dépenser la marge d'un autre.

Ce qu’il contient

  1. 1
    Servir des modèles open source : commencez ici

    Six chapitres qui font passer un checkpoint à poids ouverts d'un conteneur qui répond à une seule requête à un déploiement qui survit à un trafic réel, un budget réel, et plus d'un locataire.

    10 min
  2. 2
    vLLM et la stack de serving

    Pourquoi servir un modèle à de nombreux utilisateurs en même temps est un problème d'ingénierie différent de celui de le faire tourner sur sa propre machine.

    17 min
  3. 3
    Dimensionnement GPU et quantification

    Transformer un nombre de paramètres et une longueur de contexte en un vrai budget VRAM, plutôt que deviner et regarder un conteneur planter au démarrage.

    17 min
  4. 4
    Le gateway compatible OpenAI

    Une adresse stable devant deux backends correctement dimensionnés, avec routage, failover et vérifications de santé faisant le travail qu'aucun client ne devrait avoir à faire.

    16 min
  5. 5
    Observabilité et SLO pour l'inférence

    Transformer une impression vague que les requêtes sont lentes en une cible de percentile réellement exploitable pour une alerte, et tracer quel saut est responsable en cas de dépassement.

    17 min
  6. 6
    Le modèle de coût, honnêtement

    Pourquoi le tarif horaire du GPU est rarement le chiffre qui détermine réellement le coût par token, et ce que la cible SLO du chapitre 4 coûte discrètement en marge réservée.

    17 min
  7. 7
    Durcissement et multi-location

    Transformer les clés virtuelles du chapitre 3 en une véritable garantie d'isolation, pour qu'un pic d'un locataire ne puisse jamais discrètement dépenser la marge d'un autre.

    17 min

Obtiens un certificat

Termine tous les chapitres pour recevoir ton certificat de réussite.