Ollama: Prova empirica con Finestre di Contesto (ContextWindow) diverse

Ho a disposizione una workstation HP Z2, con processore Inter(R) Core(TM) i9-14900K, 64 GB di RAM, Scheda video NVIDIA RTX A4500 20 GB.

Su questa macchina ci ho installato Ollama e alcuni modelli.

Tramite il setup di ollama, ho provato a fare inferenza modificando la “ContextWindow” (Finestra di Contesto), uno dei parametri fondamentali affinché i modelli riescano fattivamente a realizzare un ragionamento compiuto e prolungato (non la semplice domanda, ma proprio una discussione, un lavoro, ecc.).

Più è grande la finestra di contesto, più il modello riuscirà ad immagazzinare informazioni ed elaborarle, ragionandoci sopra (se previsto il ragionamento).

Ma è chiaro che, all’aumentare di questa finestra, Ollama deve allocare sempre più risorse (in realtà, come si vedrà poi dalla tabella di comparazione, non sempre) hardware: prima andrà ad occupare la VRAM (la memoria della scheda video), quindi farà uno “split” e userà la RAM di sistema; nel mio caso specifico sono esattamente 20 GB (VRAM) e 64 GB (RAM).

Tuttavia, ho constatato alcuni aspetti fondamentali:

  1. Finché il modello gira totalmente in VRAM, le prestazioni sono ottime, al pari di un servizio online a pagamento (ChatGPT, Claude, Gemini, ecc.).
  2. Appena il contesto non riesce più ad essere allocato in VRAM, Ollama “spezza” e qui le prestazioni crollano, ma non solo perché …
  3. … ho constatato che anche i crash del modello si fanno MOLTO più probabili.

Quindi: scegliere la finestra di contesto in base al modello e al proprio hardware, diventa estremamente dirimente, fa la differenza tra “tirare fuori un lavoro anziché un fallimento”.

Da qui nasce la mia idea di fare una tabella comparativa dove, semplicemente, ho provato a fare inferenza su tre modelli che sto usando (siamo a Settembre 2026) con soddisfazione, ma variando la Finestra di Contesto dal minimo di 4K fino al massimo di 256K (4K, 8K, 16K, 32K, 64K, 128K, 256K).

Ecco il risultato:

NameIDSizeProcessorContext
orcarouter/Qwen3.8-27B-Uncensored:iq4_xs84e6355d676434 GB48%/52% CPU/GPU262144
orcarouter/Qwen3.8-27B-Uncensored:iq4_xs84e6355d676425 GB28%/72% CPU/GPU131072
orcarouter/Qwen3.8-27B-Uncensored:iq4_xs84e6355d676420 GB10%/90% CPU/GPU65536
orcarouter/Qwen3.8-27B-Uncensored:iq4_xs84e6355d676417 GB100% GPU32768
orcarouter/Qwen3.8-27B-Uncensored:iq4_xs84e6355d676416 GB100% GPU16384
orcarouter/Qwen3.8-27B-Uncensored:iq4_xs84e6355d676415 GB100% GPU8192
orcarouter/Qwen3.8-27B-Uncensored:iq4_xs84e6355d676415 GB100% GPU4096
gemma4:26b5571076f3d7018 GB32%/68% CPU/GPU262144
gemma4:26b5571076f3d7018 GB17%/83% CPU/GPU131072
gemma4:26b5571076f3d7018 GB10%/90% CPU/GPU65536
gemma4:26b5571076f3d7017 GB100% GPU32768
gemma4:26b5571076f3d7017 GB100% GPU16384
gemma4:26b5571076f3d7017 GB100% GPU8192
gemma4:26b5571076f3d7017 GB100% GPU4096
gpt-oss:20b17052f91a42e12 GB100% GPU131072
gpt-oss:20b17052f91a42e12 GB100% GPU65536
gpt-oss:20b17052f91a42e12 GB100% GPU32768
gpt-oss:20b17052f91a42e12 GB100% GPU16384
gpt-oss:20b17052f91a42e12 GB100% GPU8192
gpt-oss:20b17052f91a42e12 GB100% GPU4096
ornith-1.5:9be5df7dcdd8a214 GB100% GPU262144
ornith-1.5:9be5df7dcdd8a29.9 GB100% GPU131072
ornith-1.5:9be5df7dcdd8a27.8 GB100% GPU65536
ornith-1.5:9be5df7dcdd8a26.7 GB100% GPU32768
ornith-1.5:9be5df7dcdd8a26.1 GB100% GPU16384
ornith-1.5:9be5df7dcdd8a25.8 GB100% GPU8192
ornith-1.5:9be5df7dcdd8a25.6 GB100% GPU4096

Analizzando la tabella, si possono fare alcune considerazioni:

  • Non è il numero di parametri a fare la differenza. Le diverse strutture interne degli LLM fanno una certa differenza, tant’è che “Qwen3.8:27b” è molto più esoso di risorse (da 64K in poi, prima sono analoghi) di un “Gemini4:26b” che ha “solo” 1b di differenza.
  • Esiste un caso emblematico fornito da “gpt-oss:20b”, il quale, ha comunque una finestra massima di 128K, ma consuma comunque la stessa RAM, indipendentemente dal contesto attribuito da Ollama.
  • Infine abbiamo “ornith-1.5:9b” che occupa pochissimo e riesce a stare sempre in VRAM, probabilmente anche su una scheda da 16 GB (la mia ha 20 GB, ma è una misura sfigata, l’ideale credo sarebbe 24 GB, molto più standard e che mi consentirebbe di arrivare tranquillamente a 64K anche con i modelli più grandi).

Ho provato (solo a livello di inferenza, non variando il contesto) in passato molti altri modelli, ma – quantomeno a livello “agentico” – non mi hanno dato grandi soddisfazioni.

Se usati solo come chatbot, effettivamente ce ne sarebbero diversi altri interessanti, penso a “mistral:7b” o il velocissimo “lfm2:24b”.

Se qualcuno vuole consigliarmi altri modelli da provare o ha suggerimenti o commennti, non esiti a scrivermi!

Debian Linux e LSI MegaRAID SAS

Monitorare il sistema RAID di un Server IBM x3400 M3 il cui controller RAID risulta “LSI Logic / Symbios Logic MegaRAID SAS 2108 [Liberator] (rev 05)”.

Devendo monitorare il sistema RAID di un Server IBM x3400 M3 il cui controller RAID risulta “LSI Logic / Symbios Logic MegaRAID SAS 2108 [Liberator] (rev 05)”, ho seguito le istruzioni di questo articolo (modificandole un po’ affinché funzionino).

Leggi tutto “Debian Linux e LSI MegaRAID SAS”

Foxit Reader: Stampa Fronte Retro

Utilizzo il reader in oggetto (disponibile qui gratuitamente) perché lo trovo leggero e con funzionalità interessanti.

Tuttavia non riuscivo a stampare fronte-retro su una stampante Brother MFC-L2710W perché l’opzione relativa (“Stampa su entrambi i lati del foglio“), nel dialogo di stampa, era disattivata e non attivabile.

Cercando sul forum relativo all’applicazione (disponibile qui ) ho trovato una soluzione (per Windows 10).

Leggi tutto “Foxit Reader: Stampa Fronte Retro”

VFAT Check: Tool testuale multipiattaforma per il controllo di Chiavette USB difettose

Partiamo dal perché ho realizzato questo programma: mi ritrovo con una chiavetta USB che mi rovina i files che ci copio sopra; i files sono di tipo multimediale, quindi non particolarmente importanti e ne posso tollerare “la perdita“. Tuttavia voglio capire se è possibile localizzare una zona difettosa ed, eventualmente, isolarla al fine di continuare ad utilizzare la parte buona del dispositivo.

Leggi tutto “VFAT Check: Tool testuale multipiattaforma per il controllo di Chiavette USB difettose”

Mouse Wireless LICORICE KRAUN KR.QS

Sto tribolando molto. Lo avevo comprato per il Mac; dopo circa un mese di utilizzo, la rotellina funziona male, fa “le bizze” (sembra che abbia una sorta di “tremore”, è come se la ruotassi velocemente avanti e indietro).

Mi dico: pazienza, l’attacco al vecchio portatile sul quale ho Linux.

Non viene assolutamente visto !

Cercando su Internet e mi accorgo che non c’è assolutamente nulla !!

Tra l’altro, non me l’hanno neanche fatto pagare poco (tipo 16€ ed è anche piccolo). È chiaro che ho preso una fregatura. Se mai dovessi riuscire a farlo partire, scriverò qui come ho fatto, magari è di aiuto ad altri, ma per il momento …