È la prima domanda di chi vuole provare l'AI in locale: che hardware serve? La risposta ha una formula semplice che permette di stimare tutto in trenta secondi, e alcune eccezioni che vale la pena conoscere.
La formula
La memoria necessaria per caricare un modello si stima così:
miliardi di parametri × byte per parametro = gigabyte richiesti
I byte per parametro dipendono dalla quantizzazione:
- FP16 (nessuna quantizzazione): 2 byte per parametro.
- Q8: circa 1 byte.
- Q5: circa 0,7 byte.
- Q4: circa 0,5-0,6 byte.
Esempi:
- Modello da 7 miliardi in Q4: 7 × 0,55 ≈ 4 GB.
- Modello da 14 miliardi in Q4: circa 8 GB.
- Modello da 32 miliardi in Q4: circa 18-19 GB.
- Modello da 70 miliardi in Q4: circa 40 GB.
A questo va aggiunto un margine del 20-30% per il contesto e per i dati temporanei di elaborazione.
Il contesto: la variabile che sorprende
Il modello occupa una quantità fissa di memoria, ma la finestra di contesto — la quantità di testo che il modello tiene presente — occupa memoria aggiuntiva che cresce con la lunghezza.
Questo è il motivo per cui un modello che funziona perfettamente con domande brevi può esaurire la memoria quando gli dai in pasto un documento di cinquanta pagine. Se ti succede, riduci la finestra di contesto nelle impostazioni oppure scegli un modello più piccolo.
VRAM o RAM: la differenza che conta
Un modello può girare sulla memoria della scheda video (VRAM) o sulla RAM di sistema. La differenza di velocità è enorme, e il motivo è la banda di memoria: una scheda video dedicata ha una banda molte volte superiore a quella della RAM di sistema.
In pratica:
- Tutto in VRAM: risposte fluide, decine di parole al secondo.
- Parzialmente in RAM: velocità che crolla drasticamente. È il caso in cui il modello "non ci sta" e viene diviso.
- Solo CPU e RAM: funziona, ma con attese di parecchi secondi per frase. Accettabile per provare, non per lavorare.
Il salto di prestazioni quando il modello entra interamente nella VRAM è netto: è la soglia da puntare quando si sceglie l'hardware.
Il caso particolare: Mac con Apple Silicon
I Mac recenti usano memoria unificata: processore e grafica condividono la stessa memoria, con una banda molto più alta della RAM di un PC tradizionale. Un Mac con 32 o 64 GB unificati può far girare modelli che su un PC richiederebbero una scheda video costosa.
Non raggiungono la velocità di una GPU dedicata di fascia alta, ma il rapporto fra dimensione del modello eseguibile e prezzo è ottimo, e i consumi sono bassissimi. Per chi lavora prevalentemente su Mac, è una strada molto sensata.
Cosa scegliere, in pratica
- Voglio solo provare: qualunque PC recente, modelli da 3-7 miliardi. Anche senza scheda video dedicata, con pazienza.
- Uso regolare, singolo utente: scheda video con 12-16 GB di VRAM. Copre bene i modelli da 13-14 miliardi ed è il punto di equilibrio fra spesa e utilità.
- Uso professionale su documenti: 24 GB di VRAM. Permette modelli da 32 miliardi con contesto ampio, che è dove i risultati diventano affidabili per il lavoro.
- Servizio condiviso in azienda: schede professionali con 48 GB o più, oppure due schede in parallelo. Qui si entra in un progetto vero, con dimensionamento su misura.
Un aspetto spesso trascurato: le schede usate
Per l'AI in locale conta soprattutto la quantità di VRAM, più della potenza pura di calcolo. Questo rende interessanti alcune schede di generazioni precedenti con molta memoria, che sul mercato dell'usato costano una frazione delle nuove. Vanno però valutate con attenzione: verifica il supporto driver e lo stato reale della scheda, come faresti per qualunque componente usato.
Due modelli piccoli o uno grande?
Se hai memoria limitata, la scelta migliore è quasi sempre un modello più grande quantizzato di più piuttosto che uno piccolo a piena precisione. Un modello da 14 miliardi in Q4 batte in genere uno da 7 miliardi in Q8, pur occupando una memoria simile.
Conclusione
Calcola parametri per byte della quantizzazione, aggiungi un terzo, e punta a stare dentro la VRAM: è tutto quello che serve per orientarsi. La soglia dove l'AI locale diventa davvero utile per lavorare è intorno ai 24 GB di memoria video. Se stai valutando una macchina per l'AI in azienda e vuoi capire cosa serve senza sovradimensionare, possiamo fare il conto insieme partendo dai vostri documenti reali.