// data & ai · giornale tecnico MILANO ● LIVE 00:00:00

Quali LLM locali girano davvero su una singola GPU da 24GB nel 2026

Quali LLM locali stanno davvero su una singola GPU da 24GB nel 2026 e come si spende la VRAM tra pesi, KV cache e overhead: sei modelli e cosa resta fuori.

Una scheda da 24 GB è il pavimento pratico per fare inference locale seria: abbastanza per modelli capaci, abbastanza piccola da stare su una sola GPU (una RTX 3090 o 4090). Una guida di MarkTechPost spiega perché la vecchia mossa — spremere il più grosso quant da 70B sulla scheda — è ormai superata, e come conviene invece spendere quei 24 GB.

Come si consuma la VRAM

Tre voci mangiano memoria durante l’inference. I pesi del modello, la cui dimensione dipende da parametri e quantizzazione: a Q4_K_M ogni parametro costa circa 0,58 byte, quindi un 32B pesa circa 18-20 GB di soli pesi. La KV cache, che cresce con la lunghezza del contesto. E l’overhead runtime dello stack di serving, per cui una regola prudente aggiunge circa 1-2 GB a contesto breve. Attenzione ai MoE: ogni expert resta residente in VRAM anche se ne routano pochi per token, quindi la memoria va dimensionata sui parametri totali, mai su quelli attivi.

I modelli che entrano

La guida indica sei modelli con licenza permissiva (Apache 2.0 o MIT) che stanno su 24 GB a Q4_K_M con spazio per il contesto. Qwen3.6-27B, dense, è il default più forte per coding agentico (circa 16 GB). Qwen3.6-35B-A3B è un MoE con 35B totali e circa 3B attivi, il più veloce per uso generale (circa 20 GB, fit stretto). Gemma 4 26B, MoE con 3,8B attivi, è la scelta per input multimodale e 140+ lingue. Mistral Small 3.2 24B è l’assistente quotidiano più leggero (circa 14 GB). gpt-oss-20b, MoE open-weight in formato MXFP4 nativo, è il fallback per il reasoning (circa 14 GB). DeepSeek-R1-Distill-Qwen-32B offre il reasoning più profondo ma è il fit più stretto (circa 18-20 GB).

Restano fuori i frontier open del 2026 — GLM-5.2 (circa 753B totali), Kimi K2.7 (circa 1T), DeepSeek V4 e Mistral Large 3 — perché sono MoE server-class e la memoria traccia i parametri totali. Per farli girare servono rig multi-GPU o sistemi a memoria unificata. Il consiglio operativo: partire dal modello che matcha il proprio lavoro principale, non dal file più grande caricabile, tenendo il contesto sotto controllo. Tre runtime coprono quasi tutti i setup: Ollama per la via più semplice, llama.cpp per il controllo fine su GGUF e offload, vLLM per il throughput con carichi concorrenti.

In sintesi

  • 24 GB è il pavimento pratico: meglio modelli 20B-35B ben dimensionati che il più grosso quant da 70B.
  • Nei MoE la memoria traccia i parametri totali, non quelli attivi: ogni expert resta residente.
  • Q4_K_M è il default casalingo; GLM-5.2, Kimi K2.7, DeepSeek V4 e Mistral Large 3 restano server-class.

Fonte: Best Local LLMs You Can Run on a Single 24GB GPU in 2026: Qwen, Gemma, Mistral, DeepSeek Compared — marktechpost.com

Condividi X Facebook LinkedIn WhatsApp Email

// scritto da

Fernando

Hai qualcosa da aggiungere? Unisciti alla discussione.

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *

Altri dell'autore

dalla stessa firma