{"id":1472,"date":"2026-09-07T09:01:26","date_gmt":"2026-09-07T09:01:26","guid":{"rendered":"https:\/\/www.budus.it\/Blog\/?p=1472"},"modified":"2026-09-07T09:01:27","modified_gmt":"2026-09-07T09:01:27","slug":"ollama-prova-empirica-con-finestre-di-contesto-contextwindow-diverse","status":"publish","type":"post","link":"https:\/\/www.budus.it\/Blog\/ollama-prova-empirica-con-finestre-di-contesto-contextwindow-diverse\/","title":{"rendered":"Ollama: Prova empirica con Finestre di Contesto (ContextWindow) diverse"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Ho a disposizione una workstation HP Z2, con processore Inter(R) Core(TM) i9-14900K, 64 GB di RAM, Scheda video NVIDIA RTX A4500 20 GB.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Su questa macchina ci ho installato Ollama e alcuni modelli.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Tramite il setup di ollama, ho provato a fare inferenza modificando la &#8220;ContextWindow&#8221; (Finestra di Contesto), uno dei parametri fondamentali affinch\u00e9 i modelli riescano fattivamente a realizzare un ragionamento compiuto e prolungato (non la semplice domanda, ma proprio una discussione, un lavoro, ecc.).<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Pi\u00f9 \u00e8 grande la finestra di contesto, pi\u00f9 il modello riuscir\u00e0 ad immagazzinare informazioni ed elaborarle, ragionandoci sopra (se previsto il ragionamento).<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ma \u00e8 chiaro che, all&#8217;aumentare di questa finestra, Ollama deve allocare sempre pi\u00f9 risorse (in realt\u00e0, come si vedr\u00e0 poi dalla tabella di comparazione, non sempre) hardware: prima andr\u00e0 ad occupare la VRAM (la memoria della scheda video), quindi far\u00e0 uno &#8220;split&#8221; e user\u00e0 la RAM di sistema; nel mio caso specifico sono esattamente 20 GB (VRAM) e 64 GB (RAM).<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Tuttavia, ho constatato alcuni aspetti fondamentali:<\/p>\n\n\n\n<ol class=\"wp-block-list\">\n<li>Finch\u00e9 il modello gira totalmente in VRAM, le prestazioni sono ottime, al pari di un servizio online a pagamento (ChatGPT, Claude, Gemini, ecc.).<\/li>\n\n\n\n<li>Appena il contesto non riesce pi\u00f9 ad essere allocato in VRAM, Ollama &#8220;spezza&#8221; e qui le prestazioni crollano, ma non solo perch\u00e9 &#8230;<\/li>\n\n\n\n<li>&#8230; ho constatato che anche i crash del modello si fanno MOLTO pi\u00f9 probabili.<\/li>\n<\/ol>\n\n\n\n<p class=\"wp-block-paragraph\">Quindi: scegliere la finestra di contesto in base al modello e al proprio hardware, diventa estremamente dirimente, fa la differenza tra &#8220;tirare fuori un lavoro anzich\u00e9 un fallimento&#8221;.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Da qui nasce la mia idea di fare una tabella comparativa dove, semplicemente, ho provato a fare inferenza su tre modelli che sto usando (siamo a Settembre 2026) con soddisfazione, ma variando la Finestra di Contesto dal minimo di 4K fino al massimo di 256K (4K, 8K, 16K, 32K, 64K, 128K, 256K).<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ecco il risultato:<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table class=\"has-fixed-layout\"><thead><tr><th class=\"has-text-align-center\" data-align=\"center\">Name<\/th><th class=\"has-text-align-center\" data-align=\"center\">ID<\/th><th class=\"has-text-align-center\" data-align=\"center\">Size<\/th><th class=\"has-text-align-center\" data-align=\"center\">Processor<\/th><th class=\"has-text-align-center\" data-align=\"center\">Context<\/th><\/tr><\/thead><tbody><tr><td class=\"has-text-align-center\" data-align=\"center\">orcarouter\/Qwen3.8-27B-Uncensored:iq4_xs<\/td><td class=\"has-text-align-center\" data-align=\"center\">84e6355d6764<\/td><td class=\"has-text-align-center\" data-align=\"center\">34 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">48%\/52% CPU\/GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">262144<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">orcarouter\/Qwen3.8-27B-Uncensored:iq4_xs<\/td><td class=\"has-text-align-center\" data-align=\"center\">84e6355d6764<\/td><td class=\"has-text-align-center\" data-align=\"center\">25 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">28%\/72% CPU\/GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">131072<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">orcarouter\/Qwen3.8-27B-Uncensored:iq4_xs<\/td><td class=\"has-text-align-center\" data-align=\"center\">84e6355d6764<\/td><td class=\"has-text-align-center\" data-align=\"center\">20 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">10%\/90% CPU\/GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">65536<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">orcarouter\/Qwen3.8-27B-Uncensored:iq4_xs<\/td><td class=\"has-text-align-center\" data-align=\"center\">84e6355d6764<\/td><td class=\"has-text-align-center\" data-align=\"center\">17 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">32768<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">orcarouter\/Qwen3.8-27B-Uncensored:iq4_xs<\/td><td class=\"has-text-align-center\" data-align=\"center\">84e6355d6764<\/td><td class=\"has-text-align-center\" data-align=\"center\">16 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">16384<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">orcarouter\/Qwen3.8-27B-Uncensored:iq4_xs<\/td><td class=\"has-text-align-center\" data-align=\"center\">84e6355d6764<\/td><td class=\"has-text-align-center\" data-align=\"center\">15 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">8192<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">orcarouter\/Qwen3.8-27B-Uncensored:iq4_xs<\/td><td class=\"has-text-align-center\" data-align=\"center\">84e6355d6764<\/td><td class=\"has-text-align-center\" data-align=\"center\">15 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">4096<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">gemma4:26b<\/td><td class=\"has-text-align-center\" data-align=\"center\">5571076f3d70<\/td><td class=\"has-text-align-center\" data-align=\"center\">18 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">32%\/68% CPU\/GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">262144<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">gemma4:26b<\/td><td class=\"has-text-align-center\" data-align=\"center\">5571076f3d70<\/td><td class=\"has-text-align-center\" data-align=\"center\">18 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">17%\/83% CPU\/GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">131072<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">gemma4:26b<\/td><td class=\"has-text-align-center\" data-align=\"center\">5571076f3d70<\/td><td class=\"has-text-align-center\" data-align=\"center\">18 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">10%\/90% CPU\/GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">65536<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">gemma4:26b<\/td><td class=\"has-text-align-center\" data-align=\"center\">5571076f3d70<\/td><td class=\"has-text-align-center\" data-align=\"center\">17 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">32768<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">gemma4:26b<\/td><td class=\"has-text-align-center\" data-align=\"center\">5571076f3d70<\/td><td class=\"has-text-align-center\" data-align=\"center\">17 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">16384<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">gemma4:26b<\/td><td class=\"has-text-align-center\" data-align=\"center\">5571076f3d70<\/td><td class=\"has-text-align-center\" data-align=\"center\">17 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">8192<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">gemma4:26b<\/td><td class=\"has-text-align-center\" data-align=\"center\">5571076f3d70<\/td><td class=\"has-text-align-center\" data-align=\"center\">17 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">4096<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">gpt-oss:20b<\/td><td class=\"has-text-align-center\" data-align=\"center\">17052f91a42e<\/td><td class=\"has-text-align-center\" data-align=\"center\">12 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">131072<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">gpt-oss:20b<\/td><td class=\"has-text-align-center\" data-align=\"center\">17052f91a42e<\/td><td class=\"has-text-align-center\" data-align=\"center\">12 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">65536<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">gpt-oss:20b<\/td><td class=\"has-text-align-center\" data-align=\"center\">17052f91a42e<\/td><td class=\"has-text-align-center\" data-align=\"center\">12 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">32768<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">gpt-oss:20b<\/td><td class=\"has-text-align-center\" data-align=\"center\">17052f91a42e<\/td><td class=\"has-text-align-center\" data-align=\"center\">12 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">16384<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">gpt-oss:20b<\/td><td class=\"has-text-align-center\" data-align=\"center\">17052f91a42e<\/td><td class=\"has-text-align-center\" data-align=\"center\">12 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">8192<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">gpt-oss:20b<\/td><td class=\"has-text-align-center\" data-align=\"center\">17052f91a42e<\/td><td class=\"has-text-align-center\" data-align=\"center\">12 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">4096<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">ornith-1.5:9b<\/td><td class=\"has-text-align-center\" data-align=\"center\">e5df7dcdd8a2<\/td><td class=\"has-text-align-center\" data-align=\"center\">14 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">262144<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">ornith-1.5:9b<\/td><td class=\"has-text-align-center\" data-align=\"center\">e5df7dcdd8a2<\/td><td class=\"has-text-align-center\" data-align=\"center\">9.9 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">131072<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">ornith-1.5:9b<\/td><td class=\"has-text-align-center\" data-align=\"center\">e5df7dcdd8a2<\/td><td class=\"has-text-align-center\" data-align=\"center\">7.8 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">65536<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">ornith-1.5:9b<\/td><td class=\"has-text-align-center\" data-align=\"center\">e5df7dcdd8a2<\/td><td class=\"has-text-align-center\" data-align=\"center\">6.7 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">32768<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">ornith-1.5:9b<\/td><td class=\"has-text-align-center\" data-align=\"center\">e5df7dcdd8a2<\/td><td class=\"has-text-align-center\" data-align=\"center\">6.1 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">16384<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">ornith-1.5:9b<\/td><td class=\"has-text-align-center\" data-align=\"center\">e5df7dcdd8a2<\/td><td class=\"has-text-align-center\" data-align=\"center\">5.8 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">8192<\/td><\/tr><tr><td class=\"has-text-align-center\" data-align=\"center\">ornith-1.5:9b<\/td><td class=\"has-text-align-center\" data-align=\"center\">e5df7dcdd8a2<\/td><td class=\"has-text-align-center\" data-align=\"center\">5.6 GB<\/td><td class=\"has-text-align-center\" data-align=\"center\">100% GPU<\/td><td class=\"has-text-align-center\" data-align=\"center\">4096<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Analizzando la tabella, si possono fare alcune considerazioni:<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Non \u00e8 il numero di parametri a fare la differenza. Le diverse strutture interne degli LLM fanno una certa differenza, tant&#8217;\u00e8 che &#8220;Qwen3.8:27b&#8221; \u00e8 molto pi\u00f9 esoso di risorse (da 64K in poi, prima sono analoghi) di un &#8220;Gemini4:26b&#8221; che ha &#8220;solo&#8221; 1b di differenza.<\/li>\n\n\n\n<li>Esiste un caso emblematico fornito da &#8220;gpt-oss:20b&#8221;, il quale, ha comunque una finestra massima di 128K, ma consuma comunque la stessa RAM, indipendentemente dal contesto attribuito da Ollama.<\/li>\n\n\n\n<li>Infine abbiamo &#8220;ornith-1.5:9b&#8221; che occupa pochissimo e riesce a stare sempre in VRAM, probabilmente anche su una scheda da 16 GB (la mia ha 20 GB, ma \u00e8 una misura <em>sfigata<\/em>, l&#8217;ideale credo sarebbe 24 GB, molto pi\u00f9 standard e che mi consentirebbe di arrivare tranquillamente a 64K anche con i modelli pi\u00f9 grandi).<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Ho provato (solo a livello di inferenza, non variando il contesto) in passato molti altri modelli, ma &#8211; quantomeno a livello &#8220;agentico&#8221; &#8211; non mi hanno dato grandi soddisfazioni.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Se usati solo come chatbot, effettivamente ce ne sarebbero diversi altri interessanti, penso a &#8220;mistral:7b&#8221; o il velocissimo &#8220;lfm2:24b&#8221;.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Se qualcuno vuole consigliarmi altri modelli da provare o ha suggerimenti o commennti, non esiti a scrivermi!<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Ho a disposizione una workstation HP Z2, con processore Inter(R) Core(TM) i9-14900K, 64 GB di RAM, Scheda video NVIDIA RTX A4500 20 GB. Su questa macchina ci ho installato Ollama e alcuni modelli. Tramite il setup di ollama, ho provato a fare inferenza modificando la &#8220;ContextWindow&#8221; (Finestra di Contesto), uno dei parametri fondamentali affinch\u00e9 i &hellip; <a href=\"https:\/\/www.budus.it\/Blog\/ollama-prova-empirica-con-finestre-di-contesto-contextwindow-diverse\/\" class=\"more-link\">Leggi tutto<span class=\"screen-reader-text\"> &#8220;Ollama: Prova empirica con Finestre di Contesto (ContextWindow) diverse&#8221;<\/span><\/a><\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[286,164],"tags":[288,287],"class_list":["post-1472","post","type-post","status-publish","format-standard","hentry","category-ai","category-hardware","tag-llm","tag-ollama"],"_links":{"self":[{"href":"https:\/\/www.budus.it\/Blog\/wp-json\/wp\/v2\/posts\/1472","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.budus.it\/Blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.budus.it\/Blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.budus.it\/Blog\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/www.budus.it\/Blog\/wp-json\/wp\/v2\/comments?post=1472"}],"version-history":[{"count":1,"href":"https:\/\/www.budus.it\/Blog\/wp-json\/wp\/v2\/posts\/1472\/revisions"}],"predecessor-version":[{"id":1473,"href":"https:\/\/www.budus.it\/Blog\/wp-json\/wp\/v2\/posts\/1472\/revisions\/1473"}],"wp:attachment":[{"href":"https:\/\/www.budus.it\/Blog\/wp-json\/wp\/v2\/media?parent=1472"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.budus.it\/Blog\/wp-json\/wp\/v2\/categories?post=1472"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.budus.it\/Blog\/wp-json\/wp\/v2\/tags?post=1472"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}