Parâmetros não são gigabytes. Precisão e quantização definem o tamanho em VRAM, junto com o KV cache do contexto. CUDA e Tensor Cores aceleram matrizes — não criam memória.
Termos
Token: pedaço de texto. Context window: quantos tokens o modelo vê; estica KV cache. Quantização: menos bits, menos VRAM, possível perda. Batch: treino em paralelo, mais VRAM.
Por que GPU
As contas são matrizes densas. CPU faz, mas a GPU (com memória própria) é o recorte prático de LLM local.
IA local, on-premises, híbrida
Local/on-prem: o dado e a GPU estão no seu site. Híbrida: inferência aqui, treino ou modelo grande na nuvem. Ver IA local vs nuvem.
Quando não existe resposta universal
“X GB de VRAM” sem modelo, precisão e contexto é chute. Comece pela ficha do modelo e do framework (PyTorch, llama.cpp, etc.).