A quasi quattro anni dall’arrivo di ChatGPT 3.5 il dibattito su AI ruota ancora attorno al concetto di modello e al numero dei suoi parametri. Ma se i primi modelli erano densi e bastava dire che GPT 3.5 fosse un modello da 175B per caratterizzare molti dei suoi comportamenti e il costo per la sua esecuzione, oggi è necessario possedere una ragionevole comprensione del funzionamento interno di questi modelli per poter capire le opzioni per poterli eseguire localmente, specialmente con l’arrivo di modelli con prestazioni paragonabili a quelli di frontiera chiusi ma i cui pesi sono disponibili e scaricabili, come ad esempio Kimi K3 e i suoi 2.8T parametri (2.800 miliardi di parametri).
la guida
Eseguire grandi LLM in locale: le soluzioni per superare il limite della VRAM
FreeToken, KTransformers e AirLLM puntano a eseguire grandi LLM su workstation con poca VRAM, spostando pesi ed esperti tra RAM, GPU e disco. Le architetture Mixture of Experts riducono i parametri attivi, ma velocità e casi d’uso restano molto diversi
Università di Pisa

Continua a leggere questo articolo
Canali
InnovAttori
-

La vera sfida dell’AI in azienda non è cercare, ma ricordare bene
18 Ago 2026 -

Quali competenze per portare la physical AI nello spazio: il caso Sitael
22 Lug 2026 -

AI in azienda, perché gestire il cambiamento è anche una questione di sicurezza
10 Lug 2026 -

Data center, quanto cresce l’Italia: ma attenzione al thermal management
06 Lug 2026 -

Ecosistemi travel-tech: startup, AI e nuovi modelli per il turismo
15 Giu 2026







