Van aantal parameters en contextlengte naar een echt VRAM-budget, in plaats van gokken en toekijken hoe een container bij het opstarten crasht.
Onderdeel van: Open modellen serveren in productie