Convertir el número de parámetros y la longitud de contexto en un presupuesto real de VRAM, en lugar de adivinar y ver cómo un contenedor se cae al arrancar.
Parte de: Servir modelos abiertos en producción