На прошлой неделе Alibaba выпустила Qwen 3.8 27B — открытую языковую модель с поддержкой работы с изображениями.
Она распространяется по лицензии Apache 2 и занимает около 17 ГБ, поэтому рассчитана в том числе на запуск локально на производительных ноутбуках и прочем «домашнем» оборудовании.
По данным Alibaba, новая модель заметно превосходит предыдущую Qwen 3.6 27B и закрытую Qwen 3.7-Plus в ряде тестов. Однако первые пользователи обратили внимание не только на производительность, но и на необычную настройку модели: по умолчанию она использует максимальный уровень рассуждений xhigh.
Читают прямо сейчас:
Локальные нейросети для ПК: топ-10 для установки оффлайн — как настроить и запустить модель вроде Qwen 3.8 27B на домашнем железе и что влияет на скорость генерации
11 топовых китайских нейросетей: дешевле ChatGPT и Claude в 20 раз — контекст про линейку Qwen и почему Alibaba продолжает выпускать открытые модели для локального запуска
Как за 10 минут запустить нейронки локально на компьютере Apple — как настроить скорость и уровень рассуждений при локальном запуске модели, чтобы не ждать 21 минуту за SVG с пеликаном
Даже простой круг заставляет модель рассуждать
Из-за этого Qwen 3.8 27B может тратить огромное количество ресурсов на задачи, которые не требуют сложного анализа. Так, модель решили проверить на просьбе нарисовать SVG с обычным кругом.
Вместо быстрого создания фигуры модель начала долго рассуждать о дизайне, эстетике Баухауса, цветовой палитре и даже возможной анимации. В итоге простая задача превратилась в полноценную разработку сложной геометрической композиции.
Другой эксперимент оказался еще показательнее. На создание SVG с пеликаном, едущим на велосипеде, модель потратила 21 минуту и 22 276 токенов на рассуждения.
При отключении reasoning или снижении его уровня до low тот же запрос выполнялся примерно за две минуты. Правда, и качество результата заметно падало.
Qwen 3.8 27B хорошо справляется с кодом и изображениями
При правильной настройке модель демонстрирует гораздо более приятные возможности. В некоторых тестах она успешно выполняла задачи компьютерного зрения, в том числе точно определяла координаты объектов на фотографиях.
Модель также способна работать в качестве локального агента-разработчика. На обычном ноутбуке без подключения к облачным сервисам Qwen 3.8 27B смогла работать с большими контекстами, использовать инструменты внутри локальных репозиториев и создавать рабочие Python-скрипты и HTML-интерфейсы с первой попытки.
Оптимизации помогают ускорить локальную работу
При этом 27-миллиардная модель остается довольно требовательной к пропускной способности памяти. В стандартных реализациях вроде LM Studio скорость генерации на обычном потребительском железе составляет примерно 15–30 токенов в секунду.
Модель поддерживает Multi-Token Prediction (MTP) — механизм, который позволяет заранее предсказывать несколько следующих токенов, после чего основной модели остается проверить эти варианты. Уже появились реализации, использующие MTP на локальных серверах, и они показывают прирост скорости генерации до 72%.
