Команда PrismML представила Ternary Bonsai 2 27B — компактную версию модели Qwen3.8 27B, которую удалось ужать до 5,9 ГБ. При этом разработчики заявляют о сохранении 98,2% производительности оригинальной модели в среднем по набору тестов.
Главная особенность Bonsai 2 27B — крайне низкая разрядность весов. Вместо привычных значений используются всего три варианта: −1, 0 и +1. В сочетании с масштабированием FP16 это дает эффективные 1,76 бита на параметр. В результате модель более чем в девять раз меньше полноразмерной версии.
Читают прямо сейчас:
Локальные нейросети для ПК: топ-10 для установки оффлайн — как работает квантизация и почему сжатие в 9 раз не убивает 98% производительности модели
Как за 10 минут запустить нейронки локально на компьютере Apple — как запустить модель через MLX на Apple Silicon — та же платформа, что использует Bonsai 2 27B
Чем занят нейропроцессор в телефоне — как чипы Apple M5 Max и NVIDIA GPU справляются с вычислениями нейросетей и почему 1,76 бит на параметр меняет правила игры
262 000 токенов и работа с изображениями
Несмотря на небольшой размер, модель поддерживает контекст до 262 000 токенов и умеет работать не только с текстом, но и с изображениями.
Разработчики позиционируют ее как вариант для локальных ИИ-инструментов: программирования, анализа документов, работы с изображениями и задач, где модель должна самостоятельно выполнять несколько действий подряд.
В тестах Bonsai 2 27B набрала 83,9 балла в среднем против 85,4 у полноразмерной Qwen3.8 27B. Лучше всего модель сохранила возможности в математике, следовании инструкциям и программировании.
Результаты в работе с изображениями и инструментами оказались несколько ниже оригинала.

До 143 токенов в секунду
Низкая разрядность помогает не только уменьшить размер модели, но и ускорить ее работу. На видеокарте NVIDIA GeForce RTX 5090 Bonsai 2 27B выдает до 143 токенов в секунду. На компьютере с Apple M5 Max показатель достигает 46,8 токена в секунду.
Разработчики также заявляют о снижении энергопотребления. На RTX 4090 модель расходует около 0,714 мВт·ч на токен, что, по их данным, на 40% меньше, чем у 8B-модели с полноточными весами.
Модель можно запускать локально
Bonsai 2 27B работает на видеокартах NVIDIA через CUDA, а на устройствах Apple — через MLX. Вес модели уже опубликован под лицензией Apache 2.0.
Создатели проекта считают, что такие методы сжатия могут сделать более мощные ИИ-модели доступными на обычных компьютерах. Вместо отправки каждого запроса в облако часть задач можно будет выполнять непосредственно на устройстве — с меньшими требованиями к памяти и энергопотреблению.
Большая скидка — 16% на все курсы Практикума
Если вы читаете эту статью, тогда вы точно разбираетесь в технологиях. Стать лучше и зарабатывать больше можно после курсов Практикума — по программированию, анализу данных и искусственному интеллекту.
До 30 сентября на все курсы действует скидка 16%, она применится автоматически при оплате. Потом цены станут выше, поэтому не откладывайте!
