Curso · 7 capítulos

Serving de Modelos Abertos em Produção

Self-hosting as an engineering discipline: vLLM, GPU math, OpenAI-compatible gateways, observability, the honest cost model, and hardening a shared GPU across tenants.

Pagoadvanced7 capítulos111 minInglês + 6 idiomasCertificado ao concluir

O que você vai saber fazer

  • Por que servir um modelo para muitos usuários ao mesmo tempo é um problema de engenharia diferente de rodar um sozinho na sua máquina.
  • Transforme contagem de parâmetros e comprimento de contexto num orçamento de VRAM real, em vez de chutar e ver um container travar na inicialização.
  • Um endereço estável na frente de dois backends corretamente dimensionados, com roteamento, failover e health checks fazendo o trabalho que nenhum cliente deveria precisar fazer.
  • Transformando a sensação vaga de que as requisições parecem lentas numa meta de percentil sobre a qual você realmente consegue configurar alertas, e rastreando qual hop é responsável quando ela é violada.
  • Por que a taxa horária da GPU raramente é o número que realmente determina o custo por token, e o que a meta de SLO do capítulo 4 custa silenciosamente em margem reservada.
  • Transformando as chaves virtuais do capítulo 3 numa garantia de isolamento real, para que o pico de um tenant nunca consiga gastar silenciosamente a margem de outro.

O que tem dentro

  1. 1
    Serving de Modelos Abertos: Comece Aqui

    Seis capítulos que levam um checkpoint de pesos abertos de um container que responde a uma única requisição até um deployment que sobrevive a tráfego real, a um orçamento real e a mais de um tenant.

    10 min
  2. 2
    vLLM e a Stack de Serving

    Por que servir um modelo para muitos usuários ao mesmo tempo é um problema de engenharia diferente de rodar um sozinho na sua máquina.

    17 min
  3. 3
    Dimensionamento de GPU e Quantização em Escala

    Transforme contagem de parâmetros e comprimento de contexto num orçamento de VRAM real, em vez de chutar e ver um container travar na inicialização.

    17 min
  4. 4
    O Gateway Compatível com OpenAI

    Um endereço estável na frente de dois backends corretamente dimensionados, com roteamento, failover e health checks fazendo o trabalho que nenhum cliente deveria precisar fazer.

    16 min
  5. 5
    Observabilidade e SLOs para Inferência

    Transformando a sensação vaga de que as requisições parecem lentas numa meta de percentil sobre a qual você realmente consegue configurar alertas, e rastreando qual hop é responsável quando ela é violada.

    17 min
  6. 6
    O Modelo de Custo, Honestamente

    Por que a taxa horária da GPU raramente é o número que realmente determina o custo por token, e o que a meta de SLO do capítulo 4 custa silenciosamente em margem reservada.

    17 min
  7. 7
    Hardening e Multi-Tenancy

    Transformando as chaves virtuais do capítulo 3 numa garantia de isolamento real, para que o pico de um tenant nunca consiga gastar silenciosamente a margem de outro.

    17 min

Ganhe um certificado

Conclua todos os capítulos para receber seu certificado de conclusão.