Перейти к содержанию
Русский
Материал FikirPilot

PrismML надеется, что небольшая LLM изменит то, как все мы используем AI

Обновлено: 20.09.2026 · 2 мин чтения · 396 слов

Опубликовано: · Новость поступила: · Время обработки: 33 ч 5 мин

PrismML надеется, что небольшая LLM изменит то, как все мы используем AI
Ноутбук и смартфон

PrismML утверждает, что высокопроизводительные большие языковые модели, способные рассуждать, не обязательно должны быть большими. Основанная исследователями Caltech компания стремится уменьшить эти модели настолько, чтобы они помещались на PC и смартфоны. CEO компании является профессор Caltech Babak Hassibi; соучредитель Databricks и директор Berkeley Sky Computing Lab Ion Stoica также выступает в качестве консультанта. PrismML поддерживают Khosla Ventures, Cerberus Capital и Caltech. Объём посевных инвестиций компании на данный момент составляет $22.25 миллиона.

17 сентября 2026 года PrismML выпустила модель Bonsai 2 27B. Модель сжимает открытую модель Alibaba Qwen3.8 27B до размера 5,9 GB. Это означает снижение потребления памяти в 9x–10x по сравнению с исходной моделью и позволяет модели помещаться на PC, а вероятно, и на смартфоне высокого класса. Hassibi не прокомментировал утверждения о том, что компания может вести переговоры с Apple.

Bonsai 2 достигает 98% от совокупных результатов Qwen в бенчмарках. В первой модели Bonsai, выпущенной в марте, этот показатель составлял 95%. По данным компании, первая модель была скачана более 11 миллионов раз, а более компактные модели PrismML — 2,6 миллиона раз. Hassibi отмечает, что сжатие может не полностью сохранять производительность, однако потеря в 2% может не иметь решающего значения при реальном использовании.

PrismML уменьшает «веса», которые содержат информацию, усвоенную моделями во время обучения. Обычно каждый вес требует 16 битов, тогда как «тернарный» подход компании сокращает их до трёх значений:

  • +1
  • −1
  • 0

Компания планирует в течение ближайших нескольких месяцев применить тот же метод к более крупным моделям с несколькими сотнями миллиардов параметров. Hassibi заявил, что в крупных моделях может быть проще сохранять интеллект при сжатии. По словам Stoica, технология может сделать возможной работу продвинутых моделей на пользовательских устройствах, а значит, их использование будет бесплатным и более конфиденциальным, поскольку данные не будут отправляться в облако.

Почему это важно

Этот подход поднимает вопрос о том, действительно ли для работы продвинутых языковых моделей постоянно необходимы облачное подключение и мощная инфраструктура центров обработки данных. Работа моделей на пользовательских устройствах может обеспечить иной формат использования с точки зрения конфиденциальности, поскольку данные не отправляются в облако; однако пока неясно, на каких устройствах, с какой скоростью и при каком энергопотреблении это будет возможно. Ограниченная потеря в результатах бенчмарков не отменяет необходимости оценить, насколько сжатые модели сохранят пригодность для практического использования. Применение тернарного метода к более крупным моделям покажет, ограничится ли технология одной моделью или нет. Поэтому главный вопрос заключается в том, как экономия памяти будет сочетаться с производительностью и удобством использования на реальных устройствах.

Источник: TechCrunch AI