Intelligenza Artificiale

Ollama: far girare un modello AI sul tuo PC, guida pratica

Tre comandi e hai un assistente che funziona senza internet e senza mandare niente a nessuno.

Far girare un modello linguistico sul proprio computer è diventato semplice. Ollama è lo strumento che ha reso la cosa alla portata di chiunque: si installa come un normale programma, scarica i modelli da solo e li espone sia da riga di comando sia via API. Vediamo come si usa davvero.

Perché in locale

Il contro va detto con onestà: i modelli che girano su un PC normale sono meno capaci di quelli commerciali più grandi. Per riassunti, estrazione dati, riscrittura e bozze funzionano benissimo; per ragionamenti complessi la differenza si sente.

Installazione

Scarica l'installer dal sito ufficiale di Ollama. È disponibile per Windows, macOS e Linux. Su Linux si installa anche con un singolo comando da terminale.

Dopo l'installazione, Ollama gira come servizio in background e mette a disposizione un endpoint locale sulla porta 11434. Non serve configurare nulla.

I comandi che servono

Apri il terminale (su Windows va bene il Prompt dei comandi o PowerShell).

Dentro la chat interattiva, /bye esce e /? mostra i comandi disponibili.

Quale modello scegliere

I nomi dei modelli includono quasi sempre il numero di parametri: 3B, 7B, 8B, 14B, 32B, 70B. Più è alto, più il modello è capace e più memoria richiede.

Regola pratica per orientarsi con la memoria video disponibile:

Senza scheda video dedicata i modelli girano comunque, usando processore e RAM di sistema, ma molto più lentamente. Per provare va bene; per lavorarci serve una GPU.

La quantizzazione, spiegata semplice

Accanto al nome dei modelli trovi sigle come Q4, Q5, Q8. Indicano quanto sono stati "compressi" i numeri interni del modello per occupare meno memoria.

Una regola utile: un modello più grande quantizzato a Q4 è quasi sempre migliore di un modello più piccolo a Q8, a parità di memoria occupata.

Usarlo da programma

Ollama espone un'API HTTP locale, quindi puoi integrarlo in uno script o in un gestionale con una normale richiesta POST a http://localhost:11434/api/generate, passando il nome del modello e il prompt in JSON. Offre anche un endpoint compatibile con il formato OpenAI, il che significa che molte librerie esistenti funzionano cambiando solo l'indirizzo.

È il modo con cui si costruiscono le automazioni utili: estrarre dati da fatture, classificare email, riassumere rapporti, preparare risposte.

Interfacce grafiche

Se il terminale non fa per te, esistono interfacce web che si collegano a Ollama e offrono una chat simile a quelle commerciali, con cronologia, più modelli e caricamento di documenti. Si installano di solito in un contenitore e si usano dal browser, anche dagli altri computer della rete.

Consigli pratici

Conclusione

Con Ollama si passa dall'idea di "AI in locale" a qualcosa di funzionante in un quarto d'ora. Il valore vero arriva quando lo si collega a un processo aziendale reale, dove i dati non possono uscire. Se vuoi valutare un assistente interno sui vostri documenti, senza che nulla lasci la vostra rete, è esattamente il tipo di progetto che seguiamo.

Servizi
Fibra
Gestione
Supporto
Contatti