Curso · 7 capítulos

Servir modelos abiertos en producción

Self-hosting as an engineering discipline: vLLM, GPU math, OpenAI-compatible gateways, observability, the honest cost model, and hardening a shared GPU across tenants.

De pagoadvanced7 capítulos111 minInglés + 6 idiomasCertificado al completar

Lo que sabrás hacer

  • Por qué servir un modelo a muchos usuarios a la vez es un problema de ingeniería distinto al de ejecutarlo en tu propia máquina.
  • Convertir el número de parámetros y la longitud de contexto en un presupuesto real de VRAM, en lugar de adivinar y ver cómo un contenedor se cae al arrancar.
  • Una sola dirección estable delante de dos backends bien dimensionados, con enrutamiento, failover y health checks haciendo el trabajo que ningún cliente debería tener que hacer.
  • Convertir la sensación vaga de que las solicitudes van lentas en un objetivo de percentil sobre el que de verdad se puede alertar, y rastrear qué salto es responsable cuando se incumple.
  • Por qué la tarifa por hora de la GPU rara vez es el número que en realidad determina el costo por token, y lo que cuesta en silencio el objetivo de SLO del capítulo 4 en margen reservado.
  • Convertir las claves virtuales del capítulo 3 en una garantía de aislamiento real, para que la ráfaga de un inquilino nunca pueda gastarse en silencio el margen de otro.

Qué incluye

  1. 1
    Servir modelos abiertos: empieza aquí

    Seis capítulos que llevan un checkpoint de pesos abiertos desde un contenedor que responde una solicitud hasta un despliegue que sobrevive tráfico real, un presupuesto real, y más de un inquilino.

    10 min
  2. 2
    vLLM y la pila de serving

    Por qué servir un modelo a muchos usuarios a la vez es un problema de ingeniería distinto al de ejecutarlo en tu propia máquina.

    17 min
  3. 3
    Dimensionar la GPU y la cuantización

    Convertir el número de parámetros y la longitud de contexto en un presupuesto real de VRAM, en lugar de adivinar y ver cómo un contenedor se cae al arrancar.

    17 min
  4. 4
    El gateway compatible con OpenAI

    Una sola dirección estable delante de dos backends bien dimensionados, con enrutamiento, failover y health checks haciendo el trabajo que ningún cliente debería tener que hacer.

    16 min
  5. 5
    Observabilidad y SLOs para la inferencia

    Convertir la sensación vaga de que las solicitudes van lentas en un objetivo de percentil sobre el que de verdad se puede alertar, y rastrear qué salto es responsable cuando se incumple.

    17 min
  6. 6
    El modelo de costos, con honestidad

    Por qué la tarifa por hora de la GPU rara vez es el número que en realidad determina el costo por token, y lo que cuesta en silencio el objetivo de SLO del capítulo 4 en margen reservado.

    17 min
  7. 7
    Hardening y multiinquilinato

    Convertir las claves virtuales del capítulo 3 en una garantía de aislamiento real, para que la ráfaga de un inquilino nunca pueda gastarse en silencio el margen de otro.

    17 min

Consigue un certificado

Completa todos los capítulos para recibir tu certificado de finalización.