Intelligenza Artificiale

Quanta memoria serve per far girare un modello AI in locale

La regola pratica: parametri per byte della quantizzazione, più un margine. Il resto sono dettagli.

È la prima domanda di chi vuole provare l'AI in locale: che hardware serve? La risposta ha una formula semplice che permette di stimare tutto in trenta secondi, e alcune eccezioni che vale la pena conoscere.

La formula

La memoria necessaria per caricare un modello si stima così:

miliardi di parametri × byte per parametro = gigabyte richiesti

I byte per parametro dipendono dalla quantizzazione:

Esempi:

A questo va aggiunto un margine del 20-30% per il contesto e per i dati temporanei di elaborazione.

Il contesto: la variabile che sorprende

Il modello occupa una quantità fissa di memoria, ma la finestra di contesto — la quantità di testo che il modello tiene presente — occupa memoria aggiuntiva che cresce con la lunghezza.

Questo è il motivo per cui un modello che funziona perfettamente con domande brevi può esaurire la memoria quando gli dai in pasto un documento di cinquanta pagine. Se ti succede, riduci la finestra di contesto nelle impostazioni oppure scegli un modello più piccolo.

VRAM o RAM: la differenza che conta

Un modello può girare sulla memoria della scheda video (VRAM) o sulla RAM di sistema. La differenza di velocità è enorme, e il motivo è la banda di memoria: una scheda video dedicata ha una banda molte volte superiore a quella della RAM di sistema.

In pratica:

Il salto di prestazioni quando il modello entra interamente nella VRAM è netto: è la soglia da puntare quando si sceglie l'hardware.

Il caso particolare: Mac con Apple Silicon

I Mac recenti usano memoria unificata: processore e grafica condividono la stessa memoria, con una banda molto più alta della RAM di un PC tradizionale. Un Mac con 32 o 64 GB unificati può far girare modelli che su un PC richiederebbero una scheda video costosa.

Non raggiungono la velocità di una GPU dedicata di fascia alta, ma il rapporto fra dimensione del modello eseguibile e prezzo è ottimo, e i consumi sono bassissimi. Per chi lavora prevalentemente su Mac, è una strada molto sensata.

Cosa scegliere, in pratica

Un aspetto spesso trascurato: le schede usate

Per l'AI in locale conta soprattutto la quantità di VRAM, più della potenza pura di calcolo. Questo rende interessanti alcune schede di generazioni precedenti con molta memoria, che sul mercato dell'usato costano una frazione delle nuove. Vanno però valutate con attenzione: verifica il supporto driver e lo stato reale della scheda, come faresti per qualunque componente usato.

Due modelli piccoli o uno grande?

Se hai memoria limitata, la scelta migliore è quasi sempre un modello più grande quantizzato di più piuttosto che uno piccolo a piena precisione. Un modello da 14 miliardi in Q4 batte in genere uno da 7 miliardi in Q8, pur occupando una memoria simile.

Conclusione

Calcola parametri per byte della quantizzazione, aggiungi un terzo, e punta a stare dentro la VRAM: è tutto quello che serve per orientarsi. La soglia dove l'AI locale diventa davvero utile per lavorare è intorno ai 24 GB di memoria video. Se stai valutando una macchina per l'AI in azienda e vuoi capire cosa serve senza sovradimensionare, possiamo fare il conto insieme partendo dai vostri documenti reali.

Servizi
Fibra
Gestione
Supporto
Contatti