На GitHub появился интересный проект Strata, который позволяет запускать большую ИИ-модель Qwen3.8-Flash-Next с 125 млрд параметров на обычном игровом ПК.
Для этого достаточно видеокарты с 12 ГБ VRAM и 32 ГБ RAM. Проект бесплатный и распространяется с открытым исходным кодом.
Читают прямо сейчас:
Claude Code, Cursor и Codex: какой AI-агент выбрать — когда Haiku 4.5 за $0,08 за миллион токенов выгоднее Sonnet 5.5 для конкретных задач разработки
Почему короткий промпт может стоить дороже длинного — как кэш-скидка 90% на Haiku 4.5 делает его особенно выгодным для агентов с длинным контекстом
ИИкономика: токены, GPU и бигтех — кто реально контролирует ИИ — почему Anthropic выстраивает трёхуровневую линейку Haiku/Sonnet/Opus и как это соответствует рыночной логике
Модель работает даже на RTX 5070
Разработчики протестировали Strata на двух игровых компьютерах. С RTX 5070 на 12 ГБ и 64 ГБ оперативной памяти модель генерировала до 94 токенов в секунду в зависимости от используемой версии. На AMD Radeon RX 9070 XT с 16 ГБ результат достигал 60 токенов в секунду.
Это довольно высокая скорость для модели такого размера. 60 токенов в секунду уже быстрее обычной скорости чтения. А на видеокарте с 24 ГБ памяти, например RTX 3090, авторы ожидают около 100–140 токенов в секунду.
Qwen3.8-Flash-Next умеет общаться с пользователем, писать код, анализировать изображения и работать с внешними приложениями и ИИ-агентами. При этом запросы и ответы остаются на компьютере и не отправляются на удаленный сервер.
Как огромная модель помещается в домашний компьютер
Секрет Strata — в распределении нагрузки между всеми компонентами ПК. Модель использует 24 576 экспертов, но для обработки каждого слова ей нужны только 10 из них.
На видеокарте находятся наиболее востребованные части модели, остальные хранятся в оперативной памяти. Процессор тоже участвует в расчетах, а SSD используется для хранения большой таблицы, которая помогает системе быстрее находить нужные данные.
Strata дополнительно применяет небольшую вспомогательную модель. Она заранее угадывает несколько следующих токенов, а основная модель затем проверяет их. По данным разработчиков, это ускоряет генерацию примерно в 1,6–1,8 раза.
Что понадобится для запуска
Strata работает на Windows 10 и 11, а также Linux. Поддерживаются видеокарты NVIDIA RTX 20–50-й серий и ряд моделей AMD Radeon. Минимальный объем видеопамяти составляет 12 ГБ.
Оперативной памяти потребуется от 32 ГБ, а 64 ГБ хватит для запуска всех основных вариантов модели. Чем больше памяти, тем меньше придется сжимать модель.
Установка максимально простая: программа сама определяет железо и предлагает подходящую версию модели. После запуска пользователь получает локальный веб-интерфейс с чатом и мониторингом нагрузки.
Strata также поддерживает совместимый с OpenAI API, поэтому ее можно подключать к различным приложениям и инструментам для программирования.
Скидка на все курсы Практикума
Раз вы дочитали эту новость до конца, с технологиями у вас всё в порядке. А если давно присматривались к разработке, аналитике, нейросетям, тестированию или кибербезопасности, сейчас туда можно зайти дешевле.
Промокод KOD (можно просто нажать) даст скидку на любой платный курс! А если пока не готовы покупать курс, у Практикума есть бесплатные вводные части.
