Qwen3.8 27B сжали до 5,9 ГБ — модель с контекстом 262K запускается на обычном ПК

Отличный вариант для несложных запросов

Qwen3.8 27B сжали до 5,9 ГБ — модель с контекстом 262K запускается на обычном ПК

Команда PrismML представила Ternary Bonsai 2 27B — компактную версию модели Qwen3.8 27B, которую удалось ужать до 5,9 ГБ. При этом разработчики заявляют о сохранении 98,2% производительности оригинальной модели в среднем по набору тестов.

Главная особенность Bonsai 2 27B — крайне низкая разрядность весов. Вместо привычных значений используются всего три варианта: −1, 0 и +1. В сочетании с масштабированием FP16 это дает эффективные 1,76 бита на параметр. В результате модель более чем в девять раз меньше полноразмерной версии.

Читают прямо сейчас:

Локальные нейросети для ПК: топ-10 для установки оффлайн — как работает квантизация и почему сжатие в 9 раз не убивает 98% производительности модели

Как за 10 минут запустить нейронки локально на компьютере Apple — как запустить модель через MLX на Apple Silicon — та же платформа, что использует Bonsai 2 27B

Чем занят нейропроцессор в телефоне — как чипы Apple M5 Max и NVIDIA GPU справляются с вычислениями нейросетей и почему 1,76 бит на параметр меняет правила игры

262 000 токенов и работа с изображениями

Несмотря на небольшой размер, модель поддерживает контекст до 262 000 токенов и умеет работать не только с текстом, но и с изображениями. 

Разработчики позиционируют ее как вариант для локальных ИИ-инструментов: программирования, анализа документов, работы с изображениями и задач, где модель должна самостоятельно выполнять несколько действий подряд.

В тестах Bonsai 2 27B набрала 83,9 балла в среднем против 85,4 у полноразмерной Qwen3.8 27B. Лучше всего модель сохранила возможности в математике, следовании инструкциям и программировании. 

Результаты в работе с изображениями и инструментами оказались несколько ниже оригинала.

До 143 токенов в секунду

Низкая разрядность помогает не только уменьшить размер модели, но и ускорить ее работу. На видеокарте NVIDIA GeForce RTX 5090 Bonsai 2 27B выдает до 143 токенов в секунду. На компьютере с Apple M5 Max показатель достигает 46,8 токена в секунду.

Разработчики также заявляют о снижении энергопотребления. На RTX 4090 модель расходует около 0,714 мВт·ч на токен, что, по их данным, на 40% меньше, чем у 8B-модели с полноточными весами.

Модель можно запускать локально

Bonsai 2 27B работает на видеокартах NVIDIA через CUDA, а на устройствах Apple — через MLX. Вес модели уже опубликован под лицензией Apache 2.0.

Создатели проекта считают, что такие методы сжатия могут сделать более мощные ИИ-модели доступными на обычных компьютерах. Вместо отправки каждого запроса в облако часть задач можно будет выполнять непосредственно на устройстве — с меньшими требованиями к памяти и энергопотреблению.

Большая скидка — 16% на все курсы Практикума

Если вы читаете эту статью, тогда вы точно разбираетесь в технологиях. Стать лучше и зарабатывать больше можно после курсов Практикума — по программированию, анализу данных и искусственному интеллекту.

До 30 сентября на все курсы действует скидка 16%, она применится автоматически при оплате. Потом цены станут выше, поэтому не откладывайте!

Соцсети: Юлия Зубарева
Через год — лучше работа, выше зарплата
В «Яндекс Практикуме» становятся разработчиками с нуля. Выберите язык — веб, Python, Java, C++ — и учитесь. Джуны зарабатывают от 80 000 ₽, мидлы — от 150 000 ₽. Дальше — программы трудоустройства и компенсация, если пойдёте в Яндекс.
Вам может быть интересно
easy
[anycomment]
Exit mobile version