Curso · 7 capítulos
Serving de Modelos Abertos em Produção
Self-hosting as an engineering discipline: vLLM, GPU math, OpenAI-compatible gateways, observability, the honest cost model, and hardening a shared GPU across tenants.
O que você vai saber fazer
- Por que servir um modelo para muitos usuários ao mesmo tempo é um problema de engenharia diferente de rodar um sozinho na sua máquina.
- Transforme contagem de parâmetros e comprimento de contexto num orçamento de VRAM real, em vez de chutar e ver um container travar na inicialização.
- Um endereço estável na frente de dois backends corretamente dimensionados, com roteamento, failover e health checks fazendo o trabalho que nenhum cliente deveria precisar fazer.
- Transformando a sensação vaga de que as requisições parecem lentas numa meta de percentil sobre a qual você realmente consegue configurar alertas, e rastreando qual hop é responsável quando ela é violada.
- Por que a taxa horária da GPU raramente é o número que realmente determina o custo por token, e o que a meta de SLO do capítulo 4 custa silenciosamente em margem reservada.
- Transformando as chaves virtuais do capítulo 3 numa garantia de isolamento real, para que o pico de um tenant nunca consiga gastar silenciosamente a margem de outro.
O que tem dentro
- 1Serving de Modelos Abertos: Comece Aqui
Seis capítulos que levam um checkpoint de pesos abertos de um container que responde a uma única requisição até um deployment que sobrevive a tráfego real, a um orçamento real e a mais de um tenant.
- 2vLLM e a Stack de Serving
Por que servir um modelo para muitos usuários ao mesmo tempo é um problema de engenharia diferente de rodar um sozinho na sua máquina.
- 3Dimensionamento de GPU e Quantização em Escala
Transforme contagem de parâmetros e comprimento de contexto num orçamento de VRAM real, em vez de chutar e ver um container travar na inicialização.
- 4O Gateway Compatível com OpenAI
Um endereço estável na frente de dois backends corretamente dimensionados, com roteamento, failover e health checks fazendo o trabalho que nenhum cliente deveria precisar fazer.
- 5Observabilidade e SLOs para Inferência
Transformando a sensação vaga de que as requisições parecem lentas numa meta de percentil sobre a qual você realmente consegue configurar alertas, e rastreando qual hop é responsável quando ela é violada.
- 6O Modelo de Custo, Honestamente
Por que a taxa horária da GPU raramente é o número que realmente determina o custo por token, e o que a meta de SLO do capítulo 4 custa silenciosamente em margem reservada.
- 7Hardening e Multi-Tenancy
Transformando as chaves virtuais do capítulo 3 numa garantia de isolamento real, para que o pico de um tenant nunca consiga gastar silenciosamente a margem de outro.
Ganhe um certificado
Conclua todos os capítulos para receber seu certificado de conclusão.