Quanta VRAM Você Precisa para Executar LLMs Localmente?
A principal questão ao executar um LLM local é simples: ele caberá na sua GPU? A resposta depende do tamanho do modelo, da quantização e do comprimento do contexto. Este guia oferece um ponto de partida prático para escolher a quantidade adequada de VRAM.
Como a quantização afeta a VRAM
A quantização reduz a precisão usada para armazenar os pesos do modelo. A quantização em menor número de bits torna o modelo menor e usa menos VRAM, com alguma perda de qualidade.
| Quant | Bits por peso | Uso típico |
|---|---|---|
| Q8_0 | 8 | Qualidade muito alta |
| Q6_K | ~6.6 | Qualidade muito boa |
| Q5_K_M | ~5.5 | Bom equilíbrio entre qualidade e tamanho |
| Q4_K_M | ~4.5 | Bom equilíbrio entre tamanho e qualidade |
| Q3_K_M | ~3.5 | Menos VRAM, maior perda de qualidade |
Q4_K_M é uma escolha comum quando a VRAM é limitada. Se você tiver mais VRAM disponível, Q5 ou Q6 permite executar o mesmo modelo com menos quantização.
VRAM aproximada por tamanho de modelo
Estas são estimativas brutas para os pesos do modelo. A quantidade real de VRAM necessária é maior, pois o runtime, o KV cache e o contexto também usam memória.
| Tamanho do modelo | Q8_0 | Q6_K | Q4_K_M | Q3_K_M |
|---|---|---|---|---|
| 4B | ~5 GB | ~4 GB | ~3 GB | ~2.5 GB |
| 8B | ~9 GB | ~7 GB | ~5.5 GB | ~4.5 GB |
| 12B | ~13 GB | ~10 GB | ~8 GB | ~6.5 GB |
| 14B | ~16 GB | ~12 GB | ~9 GB | ~7.5 GB |
| 27B | ~30 GB | ~22 GB | ~17 GB | ~13 GB |
| 32B | ~36 GB | ~27 GB | ~20 GB | ~16 GB |
| 70B | ~80 GB | ~60 GB | ~42 GB | ~34 GB |
Estas são estimativas, não limites rígidos. Diferentes arquiteturas de modelo e formatos de quantização podem alterar o tamanho real.
O que diferentes quantidades de VRAM podem executar
| VRAM | Faixa prática | Exemplos atuais |
|---|---|---|
| 8 GB | Modelos pequenos de cerca de 4B a 9B | Gemma 4 E4B, Qwen3.5 9B |
| 12 GB | Modelos pequenos a médios de cerca de 9B a 14B | Gemma 4 12B, Qwen3.5 9B |
| 16 GB | 12B a 27B com quantização menor | Gemma 4 26B-A4B, Qwen3.6 27B em Q4 |
| 24 GB | 27B a 35B em Q4 a Q6 | Qwen3.8 27B, Gemma 4 31B |
| 32 GB | 27B a 35B com quantização maior | Qwen3.8 27B, Gemma 4 31B |
| 48 GB | Modelos densos grandes com quantização menor | Modelos da classe 70B em Q3 a Q4 |
| 80 GB | Modelos densos grandes com quantização maior | Modelos da classe 70B em Q4 a Q6 |
Estas faixas destinam-se a modelos cujos pesos possam caber na GPU. Modelos MoE grandes são diferentes: apenas alguns de seus parâmetros estão ativos para cada token, mas o modelo ainda precisa armazenar todo o seu conjunto de pesos. Portanto, um modelo com 100B ou mais parâmetros totais não cabe em um orçamento de VRAM de 100B simplesmente porque possui menos parâmetros ativos.
Modelos MoE
Os modelos Mixture-of-Experts (MoE) contêm múltiplos grupos de parâmetros chamados especialistas. Apenas alguns especialistas são usados para cada token, o que pode tornar a inferência mais eficiente do que um modelo denso com a mesma contagem total de parâmetros.
No entanto, os especialistas inativos ainda fazem parte do modelo. Modelos MoE grandes podem, portanto, requerer muito mais memória do que sua contagem de parâmetros ativos sugere. Modelos muito grandes podem necessitar de múltiplas GPUs ou offloading para a RAM do sistema.
O comprimento do contexto também usa VRAM
Os pesos do modelo são apenas parte do requisito de memória. O KV cache cresce conforme o contexto fica mais longo, então executar o mesmo modelo em um contexto de 64K pode requerer substancialmente mais VRAM do que executá-lo em 4K.
- Contexto mais longo requer mais VRAM.
- A precisão do KV cache afeta o uso de memória.
- O tamanho do lote e usuários simultâneos também aumentam o uso de memória.
- Deixe alguma VRAM disponível para o runtime em vez de preencher completamente a GPU com pesos do modelo.
Dicas práticas
- Verifique o tamanho real do modelo quantizado que você deseja executar.
- Não use o tamanho do arquivo do modelo como o requisito exato de VRAM. Deixe espaço para o KV cache e o runtime.
- Se um modelo não couber inteiramente na VRAM, parte dele pode ser transferida para a RAM do sistema, mas a inferência geralmente será mais lenta.
- Para cargas de trabalho de longo contexto ou agênticas, preveja mais VRAM do que apenas os pesos do modelo exigem.
- Múltiplas GPUs podem dividir um modelo quando uma única GPU não tiver VRAM suficiente.
Execute no DaDesktop
Você não precisa comprar uma GPU para executar um LLM local. O DaDesktop oferece um desktop em nuvem com a VRAM de que você precisa, permitindo que você execute o modelo diretamente sem possuir o hardware.
Escolha a camada de VRAM que atende ao seu modelo, carregue-o e comece a usá-lo. Sem configuração, sem compra de hardware, sem problemas de driver. Veja as GPUs disponíveis para as opções.