Aller au contenu
Français
Contenu FikirPilot

PrismML espère que son petit LLM changera la façon dont nous utilisons tous l’AI

Mis à jour: 20/09/2026 · 3 min de lecture · 530 mots

Publié: · Dépêche reçue: · Durée de traitement: 33 h 5 min

PrismML espère que son petit LLM changera la façon dont nous utilisons tous l’AI
Ordinateur portable et smartphone

PrismML soutient que les grands modèles de langage performants et capables de raisonner ne doivent pas nécessairement être volumineux. Fondée par des chercheurs de Caltech, l’entreprise vise à réduire ces modèles jusqu’à une taille leur permettant de tenir sur des PC et des smartphones. Le CEO de l’entreprise est le professeur de Caltech Babak Hassibi ; Ion Stoica, l’un des cofondateurs de Databricks et directeur du Berkeley Sky Computing Lab, exerce également comme conseiller. PrismML est soutenue par Khosla Ventures, Cerberus Capital et Caltech. Les investissements d’amorçage reçus par l’entreprise à ce jour s’élèvent à 22,25 millions de dollars.

PrismML a publié le modèle Bonsai 2 27B le 17 septembre 2026. Le modèle compresse le modèle open source Qwen3.8 27B d’Alibaba à une taille de 5,9 GB. Cela représente une réduction de 9x à 10x de la mémoire par rapport au modèle original et permet au modèle de tenir sur un PC, voire probablement sur un smartphone haut de gamme. Hassibi n’a pas commenté les affirmations selon lesquelles l’entreprise pourrait être en discussion avec Apple.

Bonsai 2 atteint 98 % du score total de Qwen aux benchmarks. Cette proportion était de 95 % pour le premier modèle Bonsai, publié en mars. Selon l’entreprise, le premier modèle a été téléchargé plus de 11 millions de fois, tandis que les modèles plus petits de PrismML l’ont été 2,6 millions de fois. Hassibi indique que la compression pourrait ne pas préserver entièrement les performances, mais que la perte de 2 % pourrait ne pas être déterminante dans une utilisation réelle.

PrismML réduit la taille des « poids », qui contiennent les informations apprises par les modèles pendant leur entraînement. Normalement, chaque poids nécessite 16 bits, mais l’approche « ternary » de l’entreprise les réduit à trois valeurs :

  • +1
  • −1
  • 0

L’entreprise prévoit d’appliquer la même méthode à des modèles plus grands, de l’ordre de plusieurs centaines de milliards de paramètres, au cours des prochains mois. Hassibi a déclaré qu’il pourrait être plus facile de préserver l’intelligence tout en compressant les grands modèles. Selon Stoica, cette technologie pourrait permettre aux modèles avancés de fonctionner sur les appareils des utilisateurs, ce qui les rendrait gratuits et plus respectueux de la vie privée puisque les données ne seraient pas envoyées vers le cloud.

Pourquoi c’est important

Cette approche soulève la possibilité que les modèles de langage avancés n’aient pas besoin d’une connexion permanente au cloud ni d’une infrastructure puissante de centre de données pour fonctionner. Le fonctionnement des modèles sur les appareils des utilisateurs pourrait créer une forme d’utilisation différente en matière de confidentialité, puisque les données ne seraient pas envoyées vers le cloud ; toutefois, on ignore encore sur quels appareils cela serait possible, à quelle vitesse et avec quelle consommation d’énergie. La perte limitée observée dans les résultats des benchmarks ne dispense pas d’évaluer dans quelle mesure les modèles compressés resteront suffisamment performants en pratique. L’application de la méthode « ternary » à des modèles plus grands montrera si cette technologie restera limitée à un seul modèle. La véritable question est donc de savoir comment les économies de mémoire s’équilibreront avec les performances et la facilité d’utilisation dans l’expérience réelle sur les appareils.

Source: TechCrunch AI