Transforme contagem de parâmetros e comprimento de contexto num orçamento de VRAM real, em vez de chutar e ver um container travar na inicialização.
Parte de: Serving de Modelos Abertos em Produção