Quanta VRAM Você Precisa para Executar LLMs Localmente?

A principal questão ao executar um LLM local é simples: ele caberá na sua GPU? A resposta depende do tamanho do modelo, da quantização e do comprimento do contexto. Este guia oferece um ponto de partida prático para escolher a quantidade adequada de VRAM.

Como a quantização afeta a VRAM

A quantização reduz a precisão usada para armazenar os pesos do modelo. A quantização em menor número de bits torna o modelo menor e usa menos VRAM, com alguma perda de qualidade.

Quant Bits por peso Uso típico
Q8_0 8 Qualidade muito alta
Q6_K ~6.6 Qualidade muito boa
Q5_K_M ~5.5 Bom equilíbrio entre qualidade e tamanho
Q4_K_M ~4.5 Bom equilíbrio entre tamanho e qualidade
Q3_K_M ~3.5 Menos VRAM, maior perda de qualidade

Q4_K_M é uma escolha comum quando a VRAM é limitada. Se você tiver mais VRAM disponível, Q5 ou Q6 permite executar o mesmo modelo com menos quantização.

VRAM aproximada por tamanho de modelo

Estas são estimativas brutas para os pesos do modelo. A quantidade real de VRAM necessária é maior, pois o runtime, o KV cache e o contexto também usam memória.

Tamanho do modelo Q8_0 Q6_K Q4_K_M Q3_K_M
4B ~5 GB ~4 GB ~3 GB ~2.5 GB
8B ~9 GB ~7 GB ~5.5 GB ~4.5 GB
12B ~13 GB ~10 GB ~8 GB ~6.5 GB
14B ~16 GB ~12 GB ~9 GB ~7.5 GB
27B ~30 GB ~22 GB ~17 GB ~13 GB
32B ~36 GB ~27 GB ~20 GB ~16 GB
70B ~80 GB ~60 GB ~42 GB ~34 GB

Estas são estimativas, não limites rígidos. Diferentes arquiteturas de modelo e formatos de quantização podem alterar o tamanho real.

O que diferentes quantidades de VRAM podem executar

VRAM Faixa prática Exemplos atuais
8 GB Modelos pequenos de cerca de 4B a 9B Gemma 4 E4B, Qwen3.5 9B
12 GB Modelos pequenos a médios de cerca de 9B a 14B Gemma 4 12B, Qwen3.5 9B
16 GB 12B a 27B com quantização menor Gemma 4 26B-A4B, Qwen3.6 27B em Q4
24 GB 27B a 35B em Q4 a Q6 Qwen3.8 27B, Gemma 4 31B
32 GB 27B a 35B com quantização maior Qwen3.8 27B, Gemma 4 31B
48 GB Modelos densos grandes com quantização menor Modelos da classe 70B em Q3 a Q4
80 GB Modelos densos grandes com quantização maior Modelos da classe 70B em Q4 a Q6

Estas faixas destinam-se a modelos cujos pesos possam caber na GPU. Modelos MoE grandes são diferentes: apenas alguns de seus parâmetros estão ativos para cada token, mas o modelo ainda precisa armazenar todo o seu conjunto de pesos. Portanto, um modelo com 100B ou mais parâmetros totais não cabe em um orçamento de VRAM de 100B simplesmente porque possui menos parâmetros ativos.

Modelos MoE

Os modelos Mixture-of-Experts (MoE) contêm múltiplos grupos de parâmetros chamados especialistas. Apenas alguns especialistas são usados para cada token, o que pode tornar a inferência mais eficiente do que um modelo denso com a mesma contagem total de parâmetros.

No entanto, os especialistas inativos ainda fazem parte do modelo. Modelos MoE grandes podem, portanto, requerer muito mais memória do que sua contagem de parâmetros ativos sugere. Modelos muito grandes podem necessitar de múltiplas GPUs ou offloading para a RAM do sistema.

O comprimento do contexto também usa VRAM

Os pesos do modelo são apenas parte do requisito de memória. O KV cache cresce conforme o contexto fica mais longo, então executar o mesmo modelo em um contexto de 64K pode requerer substancialmente mais VRAM do que executá-lo em 4K.

  • Contexto mais longo requer mais VRAM.
  • A precisão do KV cache afeta o uso de memória.
  • O tamanho do lote e usuários simultâneos também aumentam o uso de memória.
  • Deixe alguma VRAM disponível para o runtime em vez de preencher completamente a GPU com pesos do modelo.

Dicas práticas

  • Verifique o tamanho real do modelo quantizado que você deseja executar.
  • Não use o tamanho do arquivo do modelo como o requisito exato de VRAM. Deixe espaço para o KV cache e o runtime.
  • Se um modelo não couber inteiramente na VRAM, parte dele pode ser transferida para a RAM do sistema, mas a inferência geralmente será mais lenta.
  • Para cargas de trabalho de longo contexto ou agênticas, preveja mais VRAM do que apenas os pesos do modelo exigem.
  • Múltiplas GPUs podem dividir um modelo quando uma única GPU não tiver VRAM suficiente.

Execute no DaDesktop

Você não precisa comprar uma GPU para executar um LLM local. O DaDesktop oferece um desktop em nuvem com a VRAM de que você precisa, permitindo que você execute o modelo diretamente sem possuir o hardware.

Escolha a camada de VRAM que atende ao seu modelo, carregue-o e comece a usá-lo. Sem configuração, sem compra de hardware, sem problemas de driver. Veja as GPUs disponíveis para as opções.