WAZ Corporate

IA

Quanto de VRAM para IA

Cabe o modelo, o KV cache e o batch. O número estampado na placa não é “memória somada” com a segunda GPU.

Quem publica
Central Técnica WAZ. Autor pessoa física: pendente de nomeação.
Revisor técnico
Pendente de nomeação.
Publicado
Atualizado
Tipo
Temporal — confira a ficha do fabricante na data da compra

Como as recomendações são estruturadas · Encontrou um erro técnico? Contato

Este guia é temporal (GPU, CPU, software ou IA). Números de geração não são permanentes.

    8–12 GB: experimentos pequenos. 24 GB: recorte comum de workstation atual para inferência quantizada — não uma lei. 32 GB: meio-termo em placas que existem nesse ponto; o que importa é caber pesos + KV cache. 48 GB+: modelos e contextos maiores. 96 GB: em geral server ou multi-GPU com paralelismo — não “24+24+24+24 numa mesa”. Confira a ficha do modelo; não inventamos um ranking WAZ de LLMs.

    O que muda o número

    Parâmetros, precisão (FP16 vs quantizado), context window, batch, framework e overhead. Sem isso, “X GB” é chute.

    Quantização

    Reduz VRAM e pode reduzir qualidade. Teste no seu caso.

    Para entender este assunto, veja também

    Compare também

    Próximo passo