Este guia é temporal (GPU, CPU, software ou IA). Números de geração não são permanentes.
Nada com esse termo. Abra o mapa da Central Técnica ou tente o software (Revit, SolidWorks), RAID ou VRAM.
8–12 GB: experimentos pequenos. 24 GB: recorte comum de workstation atual para inferência quantizada — não uma lei. 32 GB: meio-termo em placas que existem nesse ponto; o que importa é caber pesos + KV cache. 48 GB+: modelos e contextos maiores. 96 GB: em geral server ou multi-GPU com paralelismo — não “24+24+24+24 numa mesa”. Confira a ficha do modelo; não inventamos um ranking WAZ de LLMs.
O que muda o número
Parâmetros, precisão (FP16 vs quantizado), context window, batch, framework e overhead. Sem isso, “X GB” é chute.
Quantização
Reduz VRAM e pode reduzir qualidade. Teste no seu caso.