Deep Tech · 6 aprile 2026

Google TurboQuant

Google lancia l'algoritmo che sfida la memoria degli LLM

Google TurboQuant

Google lancia l'algoritmo che sfida la memoria degli LLM

Quando chattiamo con un modello LLM, lui non legge solo il nostro ultimo messaggio.

Tiene traccia dell'intera conversazione in una sorta di memoria di lavoro. Più la conversazione si allunga, più questa memoria cresce. E la memoria costa, in termini di hardware, energia, e denaro.

Google Research ha pubblicato TurboQuant: un algoritmo di compressione che riduce questa memoria di circa 6 volte, senza perdita di accuratezza. Nessun riaddestramente del modello necessario.

Tradotto: lo stesso modello, su hardware molto più leggero, molto più economico da far girare.

Non parliamo ancora di un prodotto, ma di una ricerca (presentata all'ICLR 2026). La community degli sviluppatori si è già messa al lavoro autonomamente, partendo dalle formule matematiche del paper.

Maggiore efficienza sulla stessa scala.