Curso · 7 capítulos
Servir modelos abiertos en producción
Self-hosting as an engineering discipline: vLLM, GPU math, OpenAI-compatible gateways, observability, the honest cost model, and hardening a shared GPU across tenants.
Lo que sabrás hacer
- Por qué servir un modelo a muchos usuarios a la vez es un problema de ingeniería distinto al de ejecutarlo en tu propia máquina.
- Convertir el número de parámetros y la longitud de contexto en un presupuesto real de VRAM, en lugar de adivinar y ver cómo un contenedor se cae al arrancar.
- Una sola dirección estable delante de dos backends bien dimensionados, con enrutamiento, failover y health checks haciendo el trabajo que ningún cliente debería tener que hacer.
- Convertir la sensación vaga de que las solicitudes van lentas en un objetivo de percentil sobre el que de verdad se puede alertar, y rastrear qué salto es responsable cuando se incumple.
- Por qué la tarifa por hora de la GPU rara vez es el número que en realidad determina el costo por token, y lo que cuesta en silencio el objetivo de SLO del capítulo 4 en margen reservado.
- Convertir las claves virtuales del capítulo 3 en una garantía de aislamiento real, para que la ráfaga de un inquilino nunca pueda gastarse en silencio el margen de otro.
Qué incluye
- 1Servir modelos abiertos: empieza aquí
Seis capítulos que llevan un checkpoint de pesos abiertos desde un contenedor que responde una solicitud hasta un despliegue que sobrevive tráfico real, un presupuesto real, y más de un inquilino.
- 2vLLM y la pila de serving
Por qué servir un modelo a muchos usuarios a la vez es un problema de ingeniería distinto al de ejecutarlo en tu propia máquina.
- 3Dimensionar la GPU y la cuantización
Convertir el número de parámetros y la longitud de contexto en un presupuesto real de VRAM, en lugar de adivinar y ver cómo un contenedor se cae al arrancar.
- 4El gateway compatible con OpenAI
Una sola dirección estable delante de dos backends bien dimensionados, con enrutamiento, failover y health checks haciendo el trabajo que ningún cliente debería tener que hacer.
- 5Observabilidad y SLOs para la inferencia
Convertir la sensación vaga de que las solicitudes van lentas en un objetivo de percentil sobre el que de verdad se puede alertar, y rastrear qué salto es responsable cuando se incumple.
- 6El modelo de costos, con honestidad
Por qué la tarifa por hora de la GPU rara vez es el número que en realidad determina el costo por token, y lo que cuesta en silencio el objetivo de SLO del capítulo 4 en margen reservado.
- 7Hardening y multiinquilinato
Convertir las claves virtuales del capítulo 3 en una garantía de aislamiento real, para que la ráfaga de un inquilino nunca pueda gastarse en silencio el margen de otro.
Consigue un certificado
Completa todos los capítulos para recibir tu certificado de finalización.