Vai al contenuto
Italiano
Contenuto FikirPilot

PrismML spera che il suo piccolo LLM cambi il modo in cui tutti usiamo l’AI

Aggiornato: 20/09/2026 · 3 min di lettura · 481 parole

Pubblicato: · Notizia ricevuta: · Tempo di elaborazione: 33 h 5 min

PrismML spera che il suo piccolo LLM cambi il modo in cui tutti usiamo l’AI
Computer portatile e smartphone

PrismML sostiene che i grandi modelli linguistici ad alte prestazioni e capaci di ragionamento non debbano necessariamente essere di grandi dimensioni. L’azienda, fondata da ricercatori del Caltech, punta a renderli abbastanza compatti da poter essere utilizzati su PC e smartphone. Il CEO dell’azienda è il professore del Caltech Babak Hassibi; Ion Stoica, tra i cofondatori di Databricks e direttore del Berkeley Sky Computing Lab, ricopre inoltre il ruolo di consulente. PrismML è sostenuta da Khosla Ventures, Cerberus Capital e Caltech. Finora, la società ha raccolto 22.25 milioni di dollari in finanziamenti seed.

PrismML ha pubblicato il modello Bonsai 2 27B il 17 settembre 2026. Il modello comprime il modello open source Qwen3.8 27B di Alibaba fino a 5,9 GB. Ciò equivale a una riduzione della memoria da 9x a 10x rispetto al modello originale e consente al modello di entrare in un PC e, probabilmente, in uno smartphone di fascia alta. Hassibi non ha commentato le indiscrezioni secondo cui l’azienda potrebbe essere in trattative con Apple.

Bonsai 2 raggiunge il 98% dei punteggi complessivi di Qwen nei benchmark. Nel primo modello Bonsai, pubblicato a marzo, questa percentuale era del 95%. Secondo l’azienda, il primo modello è stato scaricato più di 11 milioni di volte, mentre i modelli più piccoli di PrismML sono stati scaricati 2,6 milioni di volte. Hassibi osserva che la compressione potrebbe non preservare completamente le prestazioni, ma sottolinea che la perdita del 2% potrebbe non essere determinante nell’uso reale.

PrismML riduce le “pesi” che contengono le informazioni apprese dai modelli durante l’addestramento. Normalmente ogni peso richiede 16 bit, mentre l’approccio “ternary” dell’azienda li riduce a tre valori:

  • +1
  • −1
  • 0

L’azienda prevede di applicare lo stesso metodo, nei prossimi mesi, a modelli più grandi nell’intervallo da diverse centinaia di miliardi di parametri. Hassibi ha affermato che, nei modelli di grandi dimensioni, potrebbe essere più facile comprimere preservando l’intelligenza. Secondo Stoica, la tecnologia potrebbe consentire ai modelli avanzati di funzionare sui dispositivi degli utenti, rendendoli anche più privati perché gratuiti e non inviando i dati al cloud.

Perché è importante

Questo approccio solleva la possibilità che il funzionamento dei modelli linguistici avanzati non richieda una connessione costante al cloud e una potente infrastruttura di data center. Il funzionamento dei modelli sui dispositivi degli utenti potrebbe creare una modalità d’uso diversa sul piano della privacy, poiché i dati non verrebbero inviati al cloud; tuttavia, non è chiaro su quali dispositivi ciò sarebbe possibile, né a quale velocità e con quale consumo energetico. La perdita limitata nei risultati dei benchmark non elimina la necessità di valutare fino a che punto i modelli compressi resteranno adeguati nell’uso pratico. L’applicazione del metodo ternary a modelli più grandi mostrerà se la tecnologia resterà limitata a un solo modello o meno. Per questo, la domanda principale è come il risparmio di memoria verrà bilanciato con le prestazioni e la facilità d’uso nell’esperienza reale sui dispositivi.

Fonte: TechCrunch AI