I migliori modelli IA leggeri da usare in locale: un kit essenziale per il tuo portatile

Su un comune portatile con 16 GB di memoria, qwen3.5:4b-q4_K_M scrive già testi, spiega concetti e risponde alle domande di tutti i giorni, senza alcuna connessione a Internet. Lo abbiamo già incontrato nella seconda parte della serie: è un valido assistente generalista. Non è però il modello giusto anche per cercare nei tuoi file o svolgere un compito di programmazione. Pretendere che un solo download basti per tutto significa ritrovarsi con un modello a cui si chiede troppo, anziché con tre modelli piccoli, ciascuno utile a un compito preciso.

Avere il controllo dell’IA in locale significa fare scelte precise: quale modello usare, con quale motore eseguirlo, quale licenza scegliere e dove conservare i diversi dati. Se non hai ancora verificato quanta RAM o VRAM ha il tuo portatile, leggi prima quanta RAM serve al portatile per l’IA locale. Se non hai ancora installato Ollama, trovi le istruzioni nella guida per configurare il tuo primo provider di IA locale. Qui partiamo dal presupposto che tu abbia già fatto entrambe le cose: vediamo quali modelli scegliere e come valutarli.

I migliori modelli IA compatti da usare in locale, compito per compito

Un kit di IA locale utile copre tre compiti distinti, affidandone ciascuno a un modello diverso anziché chiedere tutto a uno solo.

Un assistente generalista per conversazioni quotidiane, bozze e domande rapide: qwen3.5:4b-q4_K_M. Il download è da 3,4 GB e il tag è lo stesso usato nella seconda parte.

Uno specialista compatto per compiti più circoscritti, come generare risposte in un formato strutturato o risolvere problemi di ragionamento con vincoli: granite4.2:3b. È uscito nell’agosto 2026, ha licenza Apache 2.0 e richiede un download da 2,2 GB. Nella sezione 6 trovi altri specialisti per programmazione, matematica, analisi delle immagini e traduzione, con cui puoi sostituire questo modello nel kit secondo il compito che devi svolgere.

Un modello per gli embedding per cercare nei tuoi documenti: embeddinggemma:300m. Il download è da 622 MB. Non serve per conversare: trasforma il testo in vettori su cui un’applicazione di ricerca effettua le ricerche. Lo spieghiamo nel dettaglio nella sezione 8.

I tre download occupano in tutto circa 6,2 GB su disco; questo dato non indica quanta memoria serva per tenerli tutti caricati. Se li tieni caricati contemporaneamente, potresti comunque superare la memoria libera del portatile. Carica un modello alla volta in base al compito, mettilo alla prova con un’attività concreta ed elimina quelli che non si dimostrano utili.

Quantizzazione: come cambiano precisione e dimensioni dei file

La quantizzazione si capisce meglio confrontando tre versioni dello stesso modello. Secondo il catalogo di Ollama, qwen3.5:9b-q4_K_M richiede un download da 6,6 GB, qwen3.5:9b-q8_0 da 11 GB e qwen3.5:9b-bf16 da 19 GB. Il modello e i pesi di partenza sono gli stessi; cambiano la precisione e le dimensioni dei file da scaricare.

Sono le dimensioni dei download riportate nel catalogo, non una garanzia della memoria che i modelli occuperanno una volta caricati. Una precisione inferiore riduce lo spazio occupato sul disco e spesso anche la memoria necessaria quando il modello è caricato. L’eventuale perdita di qualità nelle risposte, però, dipende dal modello, dal metodo di quantizzazione e dal compito: non escluderla a priori e non dare per scontato che il risparmio di spazio sia privo di compromessi.

Alla memoria occupata dai pesi devi aggiungere quella necessaria per la finestra di contesto e la relativa cache chiave-valore, oltre a quella usata da tutto il resto in esecuzione. La memoria che risparmi con la quantizzazione non garantisce, da sola, che tu possa caricare un modello più grande: provarci è solo più realistico che con il file a precisione piena.

Due etichette facili da fraintendere: rischi di scaricare il modello sbagliato

Nel catalogo, due etichette si prestano a equivoci: se le interpreti male, scarichi il modello sbagliato.

Prima trappola. Secondo la scheda di Google, Gemma 4 E2B ha 2,3 miliardi di parametri linguistici «effettivi». Il numero fa pensare a un file piccolo, ma su Ollama il download è di 7,2 GB: quasi i 7,6 GB del tag Q4 gemma4:12b. Per capire se hai spazio sufficiente sul portatile, guarda le dimensioni del download, non il numero di parametri sull’etichetta.

Seconda trappola. Se non specifichi la variante nel tag, rischi di scaricare un altro modello senza accorgertene. Se scarichi il solo granite4.2, ottieni il modello 8B da 5,3 GB, non il tag 3B da 2,2 GB della sezione 2. Con qwen3-embedding senza variante, il download è quello del modello 8B da 4,7 GB, non del tag 0,6B da 639 MB usato nella sezione 8.

Per evitare entrambi gli errori, scarica sempre il tag completo con la variante esatta, mai il solo nome della famiglia, e controlla le dimensioni del file scaricato prima di dare per scontato che sia il modello che volevi provare.

Ollama: 4.096 token di contesto per impostazione predefinita

Un limite massimo di 128K o 256K token riportato nel catalogo indica quanti token un modello può accettare in teoria. Non garantisce però che il tuo portatile con 16 GB di memoria riesca a gestire un contesto così ampio.

Ollama imposta un contesto di 4.096 token come valore predefinito. Puoi aumentarlo, ma sia un contesto più lungo sia più richieste in parallelo fanno crescere il consumo di memoria. Il valore num_ctx: 4096 usato nella seconda parte della serie corrisponde a questa impostazione prudente: non è stato scelto a caso per avere una cifra tonda.

Quando provi un modello nuovo, parti con un contesto tra 4K e 8K token e una sola sessione attiva per volta, tenendo d’occhio il consumo di memoria del sistema. Aumenta il contesto solo dopo aver verificato che il consumo resta stabile, non perché il catalogo indica un massimo teorico più alto.

Modelli IA specialistici compatti: il migliore dipende dal compito

Non esiste uno specialista migliore in assoluto: a guidare la scelta è il compito che devi svolgere. Ecco alcuni modelli compatti che vale la pena provare.

Programmazione: qwen2.5-coder:3b (1,9 GB) oppure il più grande qwen2.5-coder:7b (4,7 GB), entrambi con licenza Apache 2.0.

Matematica o logica con vincoli: phi4-mini:3.8b (2,5 GB), di Microsoft.

Domande su immagini e screenshot: gemma4:e2b (7,2 GB) oppure gemma4:12b Q4 (7,6 GB), entrambi con licenza Apache 2.0 e supporto dichiarato per input di testo e immagini.

Scrittura multilingue o traduzione: aya-expanse:8b (5,1 GB), progettato per 23 lingue.

Una precisazione sulle licenze va fatta subito, non relegata a una nota: Aya Expanse 8B ha una licenza CC-BY-NC-4.0 con condizioni aggiuntive, per uso non commerciale. Non considerarlo un’opzione predefinita senza restrizioni, al pari dei modelli con licenza Apache elencati sopra. Se nessuna delle quattro specializzazioni è adatta al tuo compito, granite4.2:3b della sezione 2 resta la scelta generalista per il ragionamento.

Prima di decidere, prova ogni modello su un compito tuo. Come l’assistente generalista, uno specialista merita un posto nel kit se ti aiuta a svolgere ciò che gli hai chiesto, non perché è in cima alla classifica di qualcun altro.

Cinque prove da ripetere prima di fidarti di un modello

Per valutare un modello, cinque prove brevi ti dicono più di qualsiasi pagina del catalogo. Ripetile con ogni candidato, usando materiale tuo.

1. Un riassunto fedele al testo. Dagli un appunto di 250 parole e chiedigli di individuare tre attività da svolgere e di riportare, per ciascuna, la frase dell’appunto da cui l’ha ricavata. Segna ogni affermazione che non trova riscontro nel testo.

2. Estrazione strutturata. Inventa cinque appuntamenti con nomi e date e chiedi una risposta in JSON che contenga esattamente i campi che hai indicato. Poi confronta tutti e cinque gli appuntamenti con l’elenco che hai scritto.

3. Correzione del codice. Dagli una piccola funzione che non supera un test, insieme al test stesso. Annota se, dopo la correzione, il test passa; usa lo stesso repository e lo stesso contesto per tutti i modelli che confronti.

4. Una coppia di lingue. Chiedi a una persona che legge con scioltezza in entrambe le lingue di verificare che la traduzione di un paragrafo realistico conservi nomi, numeri e sfumature. Non valutare la qualità multilingue sulla base di una richiesta formulata soltanto in inglese.

5. Una domanda su un’immagine, solo per i modelli che analizzano immagini. Mostra al modello un grafico o uno screenshot su cui puoi verificare la risposta e accertati che riceva l’immagine stessa, non solo il nome del file.

Per ogni prova, confronta la risposta con quella che già conosci e annota quanto è corretta, se il modello ha seguito le istruzioni e le eventuali informazioni inventate. Registra anche il tempo trascorso prima del primo risultato visibile, la durata complessiva, il numero di token e se il modello ha usato la CPU o la GPU. Valuta utilità e velocità separatamente: un modello che ragiona prima di rispondere può impiegare tempo a generare token che non vedrai.

RAG locale: una piccola aggiunta al kit per cercare nei tuoi documenti

Il modello per gli embedding della sezione 2 ha un solo compito: trasformare il testo in vettori che un’applicazione può usare per la ricerca. Da solo non risponde alle domande.

Prima i tuoi file vengono divisi in blocchi, poi un modello per gli embedding trasforma ogni blocco in un vettore, che viene conservato in un archivio vettoriale locale. Anche la tua domanda viene trasformata in un vettore: il sistema recupera i blocchi più vicini e solo allora un modello di chat risponde usando e citando i passaggi trovati.

Il modello di chat non è mai stato addestrato sui tuoi documenti: riceve soltanto ciò che la fase di ricerca gli fornisce quando fai la domanda.

Per fare una prova non serve una configurazione complessa: indicizza cinque appunti che hai già. Poi formula una domanda la cui risposta è in uno degli appunti e una seconda a cui nessuno dei cinque risponde. Se funziona, il sistema recupera e cita il passaggio giusto per la prima domanda; per la seconda ammette di non avere elementi per rispondere, invece di inventare una risposta. Valuta separatamente il recupero dei passaggi e la risposta finale.

Prima di scaricare il modello per gli embedding, controlla il tag esatto: embeddinggemma:300m oppure qwen3-embedding:0.6b. Come spiegato nella sezione 4, il solo nome della famiglia non basta a identificare la variante giusta.

Meno parametri attivi non significano meno pesi da conservare

Un modello con una sigla come «26B A4B» attiva solo una parte dei propri parametri per ogni token generato. I pesi di tutti i 26B parametri, però, vanno conservati da qualche parte oppure trasferiti man mano. Meno parametri attivi non significano né un file più piccolo né meno memoria occupata.

In questo kit non riportiamo dati di benchmark misurati per l’occasione. Un dato proveniente da un’altra fonte, come i circa 18,5 token al secondo riportati da una persona con un’insolita configurazione basata su un modello mixture-of-experts da 26B, una CPU meno recente e una GPU da 6 GB, va letto per quello che è: un risultato ottenuto sull’hardware di quella persona, non una prestazione da aspettarsi da ogni modello con quella sigla.

Il kit alla prova su due portatili reali

Abbiamo messo alla prova il kit su due portatili reali e attuali, gli stessi della seconda parte della serie: un modello Apple Silicon di fascia base e una workstation Windows con memoria grafica dedicata. Entrambi sono ricondizionati da professionisti, che li hanno anche testati e puliti; su refurbed sono coperti da una garanzia di 12 mesi. Ciascuno esegue senza difficoltà il kit di tre modelli descritto sopra, uno alla volta.

Il MacBook Air (2026) da 13 pollici con chip M5 ha 16 GB di memoria unificata nella configurazione standard ed è configurabile fino a 32 GB. Il Dell Precision 7730 dispone di 32 GB di memoria di sistema e 6 GB di VRAM NVIDIA dedicata, da considerare separatamente e non come un’unica memoria.

Non li citiamo per venderteli. Sono i due portatili su cui abbiamo condotto le prove per questa guida: hai così un riferimento concreto per confrontare il tuo portatile, anziché affidarti a una scheda tecnica promozionale.

Workstation mobile Dell Precision 7730 ricondizionata

Licenze e modelli nel kit: tieni solo ciò che serve

La licenza riguarda il modello esatto, non l’intera famiglia. Qwen3.5 4B, Qwen2.5-Coder, Granite 4.2 3B e Gemma 4 E2B hanno tutti una licenza Apache 2.0. Aya Expanse 8B ha invece una licenza CC-BY-NC-4.0 con condizioni aggiuntive, per uso non commerciale, come già segnalato nella sezione 6. Poter scaricare i pesi di un modello, essere autorizzato a usarli ai sensi del diritto d’autore ed «essere proprietario» del modello in sé sono tre cose diverse: consulta la scheda aggiornata del modello esatto che scarichi, non quella della famiglia.

Per tenere il kit piccolo, scegliere i modelli una volta non basta: bisogna rivedere la selezione nel tempo. ollama rm elimina un modello scaricato che non si è dimostrato utile: per esempio, puoi usare ollama rm aya-expanse:8b quando sai che non lo userai. ollama ls mostra quali modelli hai sul disco, mentre ollama ps mostra quelli caricati in memoria. I cataloghi cambiano: ricontrolla la tua selezione, senza affidarti a una decisione presa mesi fa.

Anche i modelli piccoli possono inventare un passaggio, perdere una sfumatura in un’altra lingua o scrivere codice che sembra corretto ma non supera il test. Metti alla prova tu stesso ogni consiglio di questa guida: nelle questioni importanti, non deve mai sostituire la valutazione di una persona esperta.

I migliori modelli IA compatti da usare in locale: domande frequenti

Posso usare i tre modelli del kit contemporaneamente? Su un portatile con 16 GB di memoria, probabilmente non sarebbe agevole. Carica il modello che ti serve per il compito del momento, poi passa a un altro, invece di tenere in memoria tutti insieme l’assistente generalista, lo specialista e il modello per gli embedding.

Serve una GPU per il modello per gli embedding? No. embeddinggemma:300m è abbastanza piccolo da poter essere provato anche solo con la CPU. Misura comunque quanto tempo impiega: non dare per scontato che sia istantaneo.

Un modello più grande dà sempre risposte migliori? No. A seconda del compito, può dare la risposta migliore un modello 4B oppure uno 9B. Per questo nella sezione 7 proponiamo cinque prove pratiche, invece di affidarci a un unico punteggio in classifica.

Un download Q4 offre una qualità sufficiente? Dipende dal compito. Se hai abbastanza memoria per provarli entrambi, confronta il tag Q4 e quello Q8 dello stesso modello su tre prove scelte da te: la sezione 3 spiega le differenze tra queste varianti.

Posso usare Aya Expanse in un progetto commerciale? Non darlo per scontato: la licenza CC-BY-NC-4.0 prevede l’uso non commerciale e condizioni aggiuntive. Verifica la scheda aggiornata del modello prima di presumere che sia consentito anche l’uso commerciale.

Il modello per gli embedding ha bisogno di Internet dopo il download? No. Una volta che i pesi sono sul disco, funziona offline come tutti gli altri modelli del kit.

Ora tocca a te: installa, prova e tieni il modello che ti serve

Sul portatile di cui hai valutato i requisiti nella prima parte e su cui hai configurato l’IA nella seconda, installa l’assistente 4B e uno specialista adatto a un compito che devi svolgere. Mettili entrambi alla prova con tre domande scelte da te, seguendo le indicazioni della sezione 7. Tieni quello che ti è utile ed elimina l’altro con ollama rm. Valuta di acquistare più memoria solo quando, svolgendo un compito concreto, scopri che è proprio quella a limitarti: la scheda tecnica da sola non basta.

Con questo si chiude la serie in tre parti. Se scopri che al tuo portatile serve prima di tutto più memoria, la categoria dei portatili è un buon punto di partenza.

MacBook Air ricondizionato aperto su una scrivania, pronto a usare in locale un piccolo kit di modelli IA

Iscriviti per la prima volta alla nostra newsletter e ottieni 15CHF di sconto!

Non farti più scappare le migliori offerte.

Per maggiori informazioni sull’uso dei dati personali, visita la nostra Normativa sulla privacy.