Corso · 7 capitoli
Serving di modelli open in produzione
Self-hosting as an engineering discipline: vLLM, GPU math, OpenAI-compatible gateways, observability, the honest cost model, and hardening a shared GPU across tenants.
Cosa saprai fare
- Perché servire un modello a molti utenti contemporaneamente è un problema ingegneristico diverso dal farlo girare sulla propria macchina.
- Trasformare il conteggio dei pesi e la lunghezza del contesto in un budget VRAM reale, invece di indovinare e guardare un container andare in crash all'avvio.
- Un unico indirizzo stabile davanti a due backend dimensionati correttamente, con routing, failover e health check che fanno il lavoro che nessun client dovrebbe dover fare.
- Trasformare una vaga sensazione che le richieste siano lente in un target di percentile su cui puoi davvero impostare un alert, e capire quale hop è responsabile quando viene violato.
- Perché la tariffa oraria della GPU è raramente il numero che determina davvero il costo per token, e cosa costa in silenzio, in margine riservato, il target SLO del capitolo 4.
- Trasformare le chiavi virtuali del capitolo 3 in una vera garanzia di isolamento, così che il picco di un tenant non possa mai spendere in silenzio il margine di un altro.
Cosa contiene
- 1Serving di modelli open in produzione: inizia qui
Sei capitoli che portano un checkpoint open-weight da un container che risponde a una richiesta a un deploy che sopravvive a traffico reale, a un budget reale, e a più di un tenant.
- 2vLLM e lo stack di serving
Perché servire un modello a molti utenti contemporaneamente è un problema ingegneristico diverso dal farlo girare sulla propria macchina.
- 3Dimensionamento GPU e quantizzazione su larga scala
Trasformare il conteggio dei pesi e la lunghezza del contesto in un budget VRAM reale, invece di indovinare e guardare un container andare in crash all'avvio.
- 4Il gateway compatibile OpenAI
Un unico indirizzo stabile davanti a due backend dimensionati correttamente, con routing, failover e health check che fanno il lavoro che nessun client dovrebbe dover fare.
- 5Osservabilità e SLO per l'inferenza
Trasformare una vaga sensazione che le richieste siano lente in un target di percentile su cui puoi davvero impostare un alert, e capire quale hop è responsabile quando viene violato.
- 6Il modello di costo, onestamente
Perché la tariffa oraria della GPU è raramente il numero che determina davvero il costo per token, e cosa costa in silenzio, in margine riservato, il target SLO del capitolo 4.
- 7Hardening e Multi-Tenancy
Trasformare le chiavi virtuali del capitolo 3 in una vera garanzia di isolamento, così che il picco di un tenant non possa mai spendere in silenzio il margine di un altro.
Ottieni un certificato
Completa tutti i capitoli per ricevere il tuo certificato di completamento.