Este guia é temporal (GPU, CPU, software ou IA). Números de geração não são permanentes.
Nada com esse termo. Abra o mapa da Central Técnica ou tente o software (Revit, SolidWorks), RAID ou VRAM.
70B em FP16 pede dezenas de GB só de pesos, mais KV cache. Quantizado (ex. 4-bit) pode caber em menos VRAM, com outro perfil de qualidade. Contexto longo come de novo. Não publicamos um único número WAZ.
O que você precisa decidir
Precisão, quantização, context window, batch (se treinar), framework e se aceita qualidade menor. Inferência ≠ fine-tune.
Uma GPU ou servidor
Uma placa com VRAM grande simplifica. Duas menores só com paralelismo. Fila 24×7 e vários usuários: GPU server. RAM do sistema e NVMe importam para offload e pesos — não substituem VRAM.
Quando IA local não compensa
Uso esporádico, modelo que não cabe, equipe sem quem opera GPU. A nuvem paga o pico. Dado sensível puxa o outro lado.