Локальный Qwen 3.8 27B раскритиковали — мощный ИИ «слишком много думает»

Горе от ума?

Локальный Qwen 3.8 27B раскритиковали — мощный ИИ «слишком много думает»

На прошлой неделе Alibaba выпустила Qwen 3.8 27B — открытую языковую модель с поддержкой работы с изображениями. 

Она распространяется по лицензии Apache 2 и занимает около 17 ГБ, поэтому рассчитана в том числе на запуск локально на производительных ноутбуках и прочем «домашнем» оборудовании.

По данным Alibaba, новая модель заметно превосходит предыдущую Qwen 3.6 27B и закрытую Qwen 3.7-Plus в ряде тестов. Однако первые пользователи обратили внимание не только на производительность, но и на необычную настройку модели: по умолчанию она использует максимальный уровень рассуждений xhigh.

Читают прямо сейчас:

Локальные нейросети для ПК: топ-10 для установки оффлайн — как настроить и запустить модель вроде Qwen 3.8 27B на домашнем железе и что влияет на скорость генерации

11 топовых китайских нейросетей: дешевле ChatGPT и Claude в 20 раз — контекст про линейку Qwen и почему Alibaba продолжает выпускать открытые модели для локального запуска

Как за 10 минут запустить нейронки локально на компьютере Apple — как настроить скорость и уровень рассуждений при локальном запуске модели, чтобы не ждать 21 минуту за SVG с пеликаном

Даже простой круг заставляет модель рассуждать

Из-за этого Qwen 3.8 27B может тратить огромное количество ресурсов на задачи, которые не требуют сложного анализа. Так, модель решили проверить на просьбе нарисовать SVG с обычным кругом.

Вместо быстрого создания фигуры модель начала долго рассуждать о дизайне, эстетике Баухауса, цветовой палитре и даже возможной анимации. В итоге простая задача превратилась в полноценную разработку сложной геометрической композиции.

Другой эксперимент оказался еще показательнее. На создание SVG с пеликаном, едущим на велосипеде, модель потратила 21 минуту и 22 276 токенов на рассуждения

При отключении reasoning или снижении его уровня до low тот же запрос выполнялся примерно за две минуты. Правда, и качество результата заметно падало.

Qwen 3.8 27B хорошо справляется с кодом и изображениями

При правильной настройке модель демонстрирует гораздо более приятные возможности. В некоторых тестах она успешно выполняла задачи компьютерного зрения, в том числе точно определяла координаты объектов на фотографиях.

Модель также способна работать в качестве локального агента-разработчика. На обычном ноутбуке без подключения к облачным сервисам Qwen 3.8 27B смогла работать с большими контекстами, использовать инструменты внутри локальных репозиториев и создавать рабочие Python-скрипты и HTML-интерфейсы с первой попытки.

Оптимизации помогают ускорить локальную работу

При этом 27-миллиардная модель остается довольно требовательной к пропускной способности памяти. В стандартных реализациях вроде LM Studio скорость генерации на обычном потребительском железе составляет примерно 15–30 токенов в секунду.

Модель поддерживает Multi-Token Prediction (MTP) — механизм, который позволяет заранее предсказывать несколько следующих токенов, после чего основной модели остается проверить эти варианты. Уже появились реализации, использующие MTP на локальных серверах, и они показывают прирост скорости генерации до 72%.

Соцсети: Юлия Зубарева
Вам может быть интересно
easy