Ho a disposizione una workstation HP Z2, con processore Inter(R) Core(TM) i9-14900K, 64 GB di RAM, Scheda video NVIDIA RTX A4500 20 GB.
Su questa macchina ci ho installato Ollama e alcuni modelli.
Tramite il setup di ollama, ho provato a fare inferenza modificando la “ContextWindow” (Finestra di Contesto), uno dei parametri fondamentali affinché i modelli riescano fattivamente a realizzare un ragionamento compiuto e prolungato (non la semplice domanda, ma proprio una discussione, un lavoro, ecc.).
Più è grande la finestra di contesto, più il modello riuscirà ad immagazzinare informazioni ed elaborarle, ragionandoci sopra (se previsto il ragionamento).
Ma è chiaro che, all’aumentare di questa finestra, Ollama deve allocare sempre più risorse (in realtà, come si vedrà poi dalla tabella di comparazione, non sempre) hardware: prima andrà ad occupare la VRAM (la memoria della scheda video), quindi farà uno “split” e userà la RAM di sistema; nel mio caso specifico sono esattamente 20 GB (VRAM) e 64 GB (RAM).
Tuttavia, ho constatato alcuni aspetti fondamentali:
- Finché il modello gira totalmente in VRAM, le prestazioni sono ottime, al pari di un servizio online a pagamento (ChatGPT, Claude, Gemini, ecc.).
- Appena il contesto non riesce più ad essere allocato in VRAM, Ollama “spezza” e qui le prestazioni crollano, ma non solo perché …
- … ho constatato che anche i crash del modello si fanno MOLTO più probabili.
Quindi: scegliere la finestra di contesto in base al modello e al proprio hardware, diventa estremamente dirimente, fa la differenza tra “tirare fuori un lavoro anziché un fallimento”.
Da qui nasce la mia idea di fare una tabella comparativa dove, semplicemente, ho provato a fare inferenza su tre modelli che sto usando (siamo a Settembre 2026) con soddisfazione, ma variando la Finestra di Contesto dal minimo di 4K fino al massimo di 256K (4K, 8K, 16K, 32K, 64K, 128K, 256K).
Ecco il risultato:
| Name | ID | Size | Processor | Context |
|---|---|---|---|---|
| orcarouter/Qwen3.8-27B-Uncensored:iq4_xs | 84e6355d6764 | 34 GB | 48%/52% CPU/GPU | 262144 |
| orcarouter/Qwen3.8-27B-Uncensored:iq4_xs | 84e6355d6764 | 25 GB | 28%/72% CPU/GPU | 131072 |
| orcarouter/Qwen3.8-27B-Uncensored:iq4_xs | 84e6355d6764 | 20 GB | 10%/90% CPU/GPU | 65536 |
| orcarouter/Qwen3.8-27B-Uncensored:iq4_xs | 84e6355d6764 | 17 GB | 100% GPU | 32768 |
| orcarouter/Qwen3.8-27B-Uncensored:iq4_xs | 84e6355d6764 | 16 GB | 100% GPU | 16384 |
| orcarouter/Qwen3.8-27B-Uncensored:iq4_xs | 84e6355d6764 | 15 GB | 100% GPU | 8192 |
| orcarouter/Qwen3.8-27B-Uncensored:iq4_xs | 84e6355d6764 | 15 GB | 100% GPU | 4096 |
| gemma4:26b | 5571076f3d70 | 18 GB | 32%/68% CPU/GPU | 262144 |
| gemma4:26b | 5571076f3d70 | 18 GB | 17%/83% CPU/GPU | 131072 |
| gemma4:26b | 5571076f3d70 | 18 GB | 10%/90% CPU/GPU | 65536 |
| gemma4:26b | 5571076f3d70 | 17 GB | 100% GPU | 32768 |
| gemma4:26b | 5571076f3d70 | 17 GB | 100% GPU | 16384 |
| gemma4:26b | 5571076f3d70 | 17 GB | 100% GPU | 8192 |
| gemma4:26b | 5571076f3d70 | 17 GB | 100% GPU | 4096 |
| gpt-oss:20b | 17052f91a42e | 12 GB | 100% GPU | 131072 |
| gpt-oss:20b | 17052f91a42e | 12 GB | 100% GPU | 65536 |
| gpt-oss:20b | 17052f91a42e | 12 GB | 100% GPU | 32768 |
| gpt-oss:20b | 17052f91a42e | 12 GB | 100% GPU | 16384 |
| gpt-oss:20b | 17052f91a42e | 12 GB | 100% GPU | 8192 |
| gpt-oss:20b | 17052f91a42e | 12 GB | 100% GPU | 4096 |
| ornith-1.5:9b | e5df7dcdd8a2 | 14 GB | 100% GPU | 262144 |
| ornith-1.5:9b | e5df7dcdd8a2 | 9.9 GB | 100% GPU | 131072 |
| ornith-1.5:9b | e5df7dcdd8a2 | 7.8 GB | 100% GPU | 65536 |
| ornith-1.5:9b | e5df7dcdd8a2 | 6.7 GB | 100% GPU | 32768 |
| ornith-1.5:9b | e5df7dcdd8a2 | 6.1 GB | 100% GPU | 16384 |
| ornith-1.5:9b | e5df7dcdd8a2 | 5.8 GB | 100% GPU | 8192 |
| ornith-1.5:9b | e5df7dcdd8a2 | 5.6 GB | 100% GPU | 4096 |
Analizzando la tabella, si possono fare alcune considerazioni:
- Non è il numero di parametri a fare la differenza. Le diverse strutture interne degli LLM fanno una certa differenza, tant’è che “Qwen3.8:27b” è molto più esoso di risorse (da 64K in poi, prima sono analoghi) di un “Gemini4:26b” che ha “solo” 1b di differenza.
- Esiste un caso emblematico fornito da “gpt-oss:20b”, il quale, ha comunque una finestra massima di 128K, ma consuma comunque la stessa RAM, indipendentemente dal contesto attribuito da Ollama.
- Infine abbiamo “ornith-1.5:9b” che occupa pochissimo e riesce a stare sempre in VRAM, probabilmente anche su una scheda da 16 GB (la mia ha 20 GB, ma è una misura sfigata, l’ideale credo sarebbe 24 GB, molto più standard e che mi consentirebbe di arrivare tranquillamente a 64K anche con i modelli più grandi).
Ho provato (solo a livello di inferenza, non variando il contesto) in passato molti altri modelli, ma – quantomeno a livello “agentico” – non mi hanno dato grandi soddisfazioni.
Se usati solo come chatbot, effettivamente ce ne sarebbero diversi altri interessanti, penso a “mistral:7b” o il velocissimo “lfm2:24b”.
Se qualcuno vuole consigliarmi altri modelli da provare o ha suggerimenti o commennti, non esiti a scrivermi!