la guida

Eseguire grandi LLM in locale: le soluzioni per superare il limite della VRAM


Indirizzo copiato

FreeToken, KTransformers e AirLLM puntano a eseguire grandi LLM su workstation con poca VRAM, spostando pesi ed esperti tra RAM, GPU e disco. Le architetture Mixture of Experts riducono i parametri attivi, ma velocità e casi d’uso restano molto diversi

Pubblicato il 3 set 2026

Antonio Cisternino

Università di Pisa



Ai,Assistant,Brain,Processor,With,Llm,Technology,,Big,Data,,Machine




A quasi quattro anni dall’arrivo di ChatGPT 3.5 il dibattito su AI ruota ancora attorno al concetto di modello e al numero dei suoi parametri. Ma se i primi modelli erano densi e bastava dire che GPT 3.5 fosse un modello da 175B per caratterizzare molti dei suoi comportamenti e il costo per la sua esecuzione, oggi è necessario possedere una ragionevole comprensione del funzionamento interno di questi modelli per poter capire le opzioni per poterli eseguire localmente, specialmente con l’arrivo di modelli con prestazioni paragonabili a quelli di frontiera chiusi ma i cui pesi sono disponibili e scaricabili, come ad esempio Kimi K3 e i suoi 2.8T parametri (2.800 miliardi di parametri).

Continua a leggere questo articolo

Articoli correlati

0
Lascia un commento, la tua opinione conta.x