Corso · 7 capitoli

Serving di modelli open in produzione

Self-hosting as an engineering discipline: vLLM, GPU math, OpenAI-compatible gateways, observability, the honest cost model, and hardening a shared GPU across tenants.

A pagamentoadvanced7 capitoli111 minInglese + 6 lingueCertificato al completamento

Cosa saprai fare

  • Perché servire un modello a molti utenti contemporaneamente è un problema ingegneristico diverso dal farlo girare sulla propria macchina.
  • Trasformare il conteggio dei pesi e la lunghezza del contesto in un budget VRAM reale, invece di indovinare e guardare un container andare in crash all'avvio.
  • Un unico indirizzo stabile davanti a due backend dimensionati correttamente, con routing, failover e health check che fanno il lavoro che nessun client dovrebbe dover fare.
  • Trasformare una vaga sensazione che le richieste siano lente in un target di percentile su cui puoi davvero impostare un alert, e capire quale hop è responsabile quando viene violato.
  • Perché la tariffa oraria della GPU è raramente il numero che determina davvero il costo per token, e cosa costa in silenzio, in margine riservato, il target SLO del capitolo 4.
  • Trasformare le chiavi virtuali del capitolo 3 in una vera garanzia di isolamento, così che il picco di un tenant non possa mai spendere in silenzio il margine di un altro.

Cosa contiene

  1. 1
    Serving di modelli open in produzione: inizia qui

    Sei capitoli che portano un checkpoint open-weight da un container che risponde a una richiesta a un deploy che sopravvive a traffico reale, a un budget reale, e a più di un tenant.

    10 min
  2. 2
    vLLM e lo stack di serving

    Perché servire un modello a molti utenti contemporaneamente è un problema ingegneristico diverso dal farlo girare sulla propria macchina.

    17 min
  3. 3
    Dimensionamento GPU e quantizzazione su larga scala

    Trasformare il conteggio dei pesi e la lunghezza del contesto in un budget VRAM reale, invece di indovinare e guardare un container andare in crash all'avvio.

    17 min
  4. 4
    Il gateway compatibile OpenAI

    Un unico indirizzo stabile davanti a due backend dimensionati correttamente, con routing, failover e health check che fanno il lavoro che nessun client dovrebbe dover fare.

    16 min
  5. 5
    Osservabilità e SLO per l'inferenza

    Trasformare una vaga sensazione che le richieste siano lente in un target di percentile su cui puoi davvero impostare un alert, e capire quale hop è responsabile quando viene violato.

    17 min
  6. 6
    Il modello di costo, onestamente

    Perché la tariffa oraria della GPU è raramente il numero che determina davvero il costo per token, e cosa costa in silenzio, in margine riservato, il target SLO del capitolo 4.

    17 min
  7. 7
    Hardening e Multi-Tenancy

    Trasformare le chiavi virtuali del capitolo 3 in una vera garanzia di isolamento, così che il picco di un tenant non possa mai spendere in silenzio il margine di un altro.

    17 min

Ottieni un certificato

Completa tutti i capitoli per ricevere il tuo certificato di completamento.