LLM для кода выбирают по цене за миллион токенов, а счёт в конце месяца приходит совсем другой. В мае 2026 года Artificial Analysis прогнала кодовые агенты через свой Coding Agent Index и посчитала для каждого стоимость одной задачи: Cursor с моделью Composer 2.5 набрал 62 балла при цене $0,07 за задачу, а GPT‑5.5 в режиме xhigh внутри Codex — 65 баллов при цене $4,82. Три балла разницы в качестве обошлись в шестьдесят с лишним раз дороже, потому что сильная модель тратит на ту же работу больше токенов, дольше рассуждает и чаще ходит на второй круг. Дальше разберёмся, из чего складывается счёт за нейросеть для написания кода, что стоит за процентами в бенчмарках, как посчитать стоимость одной задачи для своей команды и в какой момент имеет смысл поднять модель на своём железе.
ВАМ ПРИШЛО ПРИГЛАШЕНИЕ 💌
Приходите к нам в соцсети поделиться своим мнением и почитать, что пишут другие. А ещё там выходит дополнительный контент, которого нет на сайте — шпаргалки, опросы и разная дурка. В общем, вот тележка, вот ВК — велком!
Из чего складывается стоимость LLM для кода
Провайдеры показывают две цифры: цену за миллион входных токенов и цену за миллион выходных. На этих двух цифрах строят сравнения, но в реальном счёте за месяц строк больше. Вот всё, за что вы платите, когда LLM для кода работает в связке с редактором или агентом:
- Входные токены — всё, что модель прочитала: ваш промпт, файлы проекта, вывод тестов, история диалога. Цена стоимости API начинается от $0,14 за 1M у DeepSeek V4‑Flash и доходит до $10 у Claude Fable 5.
- Выходные токены — то, что модель написала: код, объяснения, диффы. Здесь разброс шире, от $0,28 до $50 за 1M.
- Reasoning-токены — внутренние рассуждения модели. Вы их не видите в ответе, но платите по выходной цене.
- Повторные прогоны — каждая итерация агента заново отправляет контекст, и вход умножается на число попыток.
- Премия за длинный контекст — часть провайдеров поднимает цену, когда запрос переваливает за порог. У GPT‑5.6 Terra и Gemini 3.1 Pro базовый прайс $2/$12, а на длинном контексте $4/$18.
- Кэш промптов и батчи — единственные две строки со знаком минус, они срезают счёт. Про них ниже отдельно.
Посчитаем на живом сценарии. Вы просите агента отрефакторить модуль на 800 строк на Python: разбить god-object на три класса и не сломать тесты.
Модуль на 800 строк — это примерно 10 000 токенов. Агент тянет в контекст ещё соседние файлы, тесты и вывод прогона, в сумме выходит около 45 000 входных токенов за одну итерацию. Патч и объяснения занимают 4000 выходных токенов, ещё 6000 модель тратит на рассуждения. С первого раза тесты не проходят, поэтому итераций получается три.
На Claude Opus 5 ($5/$25 за 1M) без кэша:
- вход: 45 000 × 3 = 135 000 токенов → $0,68
- выход и reasoning: (4000 + 6000) × 3 = 30 000 токенов → $0,75
- итого за одну задачу: $1,43
Включаем кэш промптов, и вторая с третьей итерацией читают тот же контекст по цене 0,1 от базовой. Вход падает до $0,27, общий счёт — до $1,02. Экономия почти треть, а изменение в коде ровно одно: добавить в запрос пометку о кэшировании.
Та же задача на DeepSeek V4‑Flash ($0,14/$0,28) стоит $0,027, в пятьдесят раз дешевле. Дешёвая модель выигрывает по счёту, пока её патч проходит тесты. Проблема появляется, когда он их ломает, и разработчик тратит сорок минут на разбор. Час работы мидла в Москве стоит больше, чем месяц запросов к DeepSeek, и это соображение перевешивает любую экономию на токенах.

Входные и выходные токены
Вход и выход считаются по разным ставкам, и выход всегда дороже. Причина в том, как модель работает: входной текст она обрабатывает разом, целым блоком, а ответ генерирует по одному токену, и на каждый токен уходит полный проход по всем весам модели. Один выходной токен обходится провайдеру в разы дороже одного входного, и эта разница перекладывается в прайс.
Насколько дороже — зависит от модели. Расхожее правило «выход в пять раз дороже входа» работает не везде: у DeepSeek V4 и Grok разрыв двукратный, у Flash-линеек Google доходит до восьмикратного. Вот прайсы популярных моделей для кода на август 2026 года:
| Модель | Вход, USD/1M | Выход, USD/1M | Множитель |
| Claude Fable 5 | 10,00 | 50,00 | 5 |
| GPT‑5.6 Sol | 5,00 | 30,00 | 6 |
| Claude Opus 5 | 5,00 | 25,00 | 5 |
| Kimi K3 | 3,00 | 15,00 | 5 |
| Grok 4.5 | 2,00 | 6,00 | 3 |
| GPT‑5.6 Luna | 0,20 | 1,20 | 6 |
| DeepSeek V4‑Flash | 0,14 | 0,28 | 2 |
Множитель важен, когда вы выбираете модель под конкретный сценарий. Если агент читает половину репозитория и выдаёт короткий дифф, вас интересует цена входа. Если модель пишет сотни строк тестов, вся стоимость уедет в выход, и Grok 4.5 с его трёхкратным множителем окажется выгоднее моделей с более низкой ценой входа.
Reasoning-токены и агентские циклы
Модели с рассуждением перед ответом прогоняют внутренний черновик: перебирают варианты, проверяют себя, отбрасывают тупиковые ветки. В ответе этого нет, а в счёте есть. Тарифицируются рассуждения по выходной ставке, и на сложной задаче их бывает больше, чем самого ответа.
Второй множитель — агентский цикл. Когда Cursor или Claude Code чинят баг, они не делают один запрос. Они читают файлы, пишут патч, запускают тесты, читают вывод, правят патч, снова запускают тесты. Каждый круг заново отправляет весь накопленный контекст, и вход растёт с каждой итерацией.

Отсюда следует практический вывод: экономить нужно не на цене модели, а на числе кругов. Точная формулировка задачи, готовый тест и указание конкретного файла срезают счёт сильнее, чем переход на модель вдвое дешевле.
Кэш контекста и батчи
Кэширование промптов — самая недооценённая строка в прайсе. Идея простая: если начало запроса от раза к разу не меняется, провайдер сохраняет обработанный контекст и берёт за его повторное чтение символическую сумму.
У Anthropic чтение из кэша стоит примерно 0,1 от базовой цены входа, а запись в кэш — 1,25 базовой ставки при жизни кэша пять минут и двойную при жизни в час. У Kimi K3 кэшированный вход стоит $0,30 вместо $3. У DeepSeek попадание в кэш обходится в сотые доли цента за миллион токенов. Для агента, который двадцать раз за сессию перечитывает одни и те же файлы, это разница между $40 и $6 в день.
Кэш не срабатывает в четырёх случаях, и все они встречаются в реальной работе:
- Изменился хотя бы один токен в начале запроса. Кэш работает по префиксу, поэтому подставленная в начало системного промпта текущая дата обнуляет всю экономию.
- Истёк срок жизни. Пять минут между запросами, — и следующий запрос платит полную цену, плюс ещё раз за запись.
- Запрос ушёл на другую модель или с другими параметрами.
- Префикс короче минимального порога, у разных провайдеров это от 1024 до 4096 токенов.
Батчи работают иначе: вы отдаёте пачку запросов и соглашаетесь ждать ответ до суток, получая скидку около 50%. Для интерактивной работы в редакторе это бесполезно, а для ночной прогонки линтеров, генерации докстрингов по всему репозиторию или массового ревью пул-реквестов скидка достаётся даром.
Большая скидка — 16% на все курсы Практикума
Если вы читаете эту статью, тогда вы точно разбираетесь в технологиях. Стать лучше и зарабатывать больше можно после курсов Практикума — по программированию, анализу данных и искусственному интеллекту.
До 17 сентября на все курсы действует скидка 16%, она применится автоматически при оплате. Потом цены станут выше, поэтому не откладывайте!
Только начали и хотите освоиться с ИИ в редакторе — берите «Вайбкодинг»; работаете с моделями через API и считаете контекст — «Нейросети для разработки»; собираете маршрутизацию между дешёвой и сильной моделью — «ИИ-агентов и автоматизацию»; разворачиваете открытые модели на своём железе — «ИИ-инженера».
Размер контекстного окна
Окно в миллион токенов летом 2026 года есть у Claude Fable 5, Claude Opus 5, GPT‑5.6, Kimi K3, DeepSeek V4 и GLM‑5.2. Соблазн понятный: залить в контекст весь репозиторий и не думать, какие файлы нужны.
Считаем, во что это обходится. Средний бэкенд-проект на 60 000 строк — примерно 750 000 токенов. На Claude Opus 5 одно такое обращение стоит $3,75 только за вход. Десять запросов в день от одного разработчика превращаются в $37,5, а за месяц на пятерых — в $3900. Ровно за те же деньги можно год держать в штате хорошего джуна на полставки, и джун хотя бы запоминает контекст между задачами.
Кэш срезает эту сумму примерно в семь раз, если репозиторий между запросами не меняется. На практике он меняется постоянно, а любая правка в начале контекста обнуляет кэш целиком.
Посчитать свой проект можно за минуту:
# устанавливаем библиотеку от OpenAI для подсчёта токенов
pip install tiktoken
# подключаем библиотеку для подсчёта токенов
import tiktoken
# берём кодировку, которую используют современные модели GPT
enc = tiktoken.get_encoding("o200k_base")
# открываем файл, который хотим измерить
with open("auth.py", "r", encoding="utf-8") as f:
# читаем всё содержимое в переменную
code = f.read()
# превращаем текст в список токенов и считаем их количество
tokens = len(enc.encode(code))
# выводим результат и сразу цену входа на трёх моделях
print(f"Токенов в файле: {tokens}")
print(f"Вход на DeepSeek V4-Flash: ${tokens / 1_000_000 * 0.14:.4f}")
print(f"Вход на Claude Opus 5: ${tokens / 1_000_000 * 5.00:.4f}")
print(f"Вход на Kimi K3: ${tokens / 1_000_000 * 3.00:.4f}")
Чем измеряют качество кодовых моделей
Когда провайдер пишет в анонсе «96,2% на SWE-bench Verified», за этой цифрой стоит конкретная процедура. Модели дают настоящую задачу из GitHub: описание бага из issue и репозиторий на том коммите, где баг ещё воспроизводится. Модель правит код, после чего прогоняются тесты из мерджа, который когда-то закрыл эту issue. Прошли тесты — задача засчитана. Никакого экспертного мнения, только зелёный или красный прогон.
Бенчмарки LLM устроены так, что сравнивать по ним модели можно, но осторожно, и разница между двумя LLM для кода в пару процентных пунктов почти ничего не значит. Разберём три группы замеров, которые встречаются в анонсах чаще всего.
SWE-bench Verified и SWE-bench Pro
SWE-bench Verified — это, по формулировке авторов, «выверенное человеком подмножество» исходного SWE-bench: 500 задач из популярных Python-репозиториев вроде Django, Flask и scikit-learn. Из полного набора выкинули задачи с недостаточным описанием и сломанными тестами, поэтому цифры на Verified честнее, чем на исходном бенчмарке.
Проблема Verified в том, что он состарился. Репозитории публичные, задачи лежат в открытом доступе с 2024 года, и решения с высокой вероятностью попали в обучающие выборки новых моделей. В феврале 2026 года OpenAI публично отказалась опираться на Verified как на основную метрику именно из-за загрязнения выборки. Топ бенчмарка сейчас забит моделями в диапазоне 93–97%, различить их между собой невозможно.
SWE-bench Pro от Scale AI сделан как ответ на эту проблему: 1865 задач из 41 репозитория, часть из них закрытая, все репозитории активно поддерживаются. Разница в цифрах на одной и той же модели впечатляет: Claude Opus 4.8 берёт 88,6% на Verified и 69,2% на Pro.
Смотреть стоит на Pro, но с оговоркой. На Pro есть три разных «первых места», и все три настоящие. На стандартизованном публичном стенде Scale лидирует Muse Spark 1.1 с 61,5%, следом GPT‑5.4 с 59,1%. В агрегате по замерам самих вендоров впереди Claude Fable 5 с 80,0%. Разница между 61,5% и 80,0% — это не разница между моделями, а разница между обвязками, в которых их гоняли. Сравнивать между собой можно только цифры из одной колонки.

HumanEval, Frontend Arena и профильные замеры
HumanEval — старейший кодовый бенчмарк: 164 задачи, где модель по докстрингу пишет тело функции. Он показывает, умеет ли модель писать корректный Python в масштабе одной функции. Все актуальные модели берут там больше 95%, поэтому для выбора между Opus 5 и Kimi K3 HumanEval бесполезен. Если провайдер выносит его в анонс на первое место, это повод посмотреть, что у него с более сложными замерами.
Профильные арены интереснее, потому что они меряют то, что в SWE-bench не попадает. Kimi K3 держит первое место в Arena.ai Frontend Code Arena и обходит там Claude Fable 5, хотя в общем зачёте Fable 5 выше. На Terminal-Bench 2.1 впереди GPT‑5.6 Sol с 88,8%, и для команды, которая гоняет агентов в шелле, эта цифра важнее общего рейтинга.
Отсюда правило: ищите замер, который ближе всего к вашей работе. Верстальщику интерфейсов Frontend Arena скажет больше, чем сводный лидерборд, а команде на legacy-Java не поможет ни один из них.
Почему бенчмарк не равен вашему проекту
Даже честно измеренные проценты плохо переносятся на конкретную кодовую базу, и тому есть четыре причины.
Первая — контаминация, о которой шла речь выше. Модель могла видеть решение в обучающих данных, и тогда бенчмарк меряет память, а не способность разбираться.
Вторая — состав задач. SWE-bench собран из популярных open-source проектов на Python: чистая архитектура, тесты, документация, читаемый код. Ваш проект скорее выглядит иначе: PHP 7.4, фреймворк, который не обновляли с 2019 года, тесты на четверть модулей и бизнес-логика в хранимых процедурах. На таком коде модели проседают, и предсказать насколько по лидерборду нельзя.
Третья — разброс между прогонами. У GPT‑5.4 на SWE-bench Pro доверительный интервал ±3,56 процентного пункта. Значит, разница в два-три пункта между двумя моделями в таблице статистически неотличима от шума, хотя маркетинг подаёт её как превосходство.
Четвёртая — обвязка. Один и тот же вес модели в SWE-agent, в Claude Code и в самописном раннере даёт разные результаты, потому что от обвязки зависит, как модель ходит по файлам и сколько попыток получает.
Практический вывод простой: соберите десять типичных задач из своего трекера, прогоните на двух-трёх моделях и посмотрите, сколько патчей прошло ревью. Полдня работы дадут вам цифру, которая точнее любого лидерборда, потому что померена на вашем коде.
Цена за решённую задачу вместо цены за токен
Это ядро всей темы. Сравнивать модели по прайсу за токен — то же самое, что выбирать машину по цене литра бензина, не спрашивая про расход. Считать нужно стоимость решённой задачи, и формула для неё помещается в одну строку:
Стоимость задачи = (Токены на попытку × Цена токена) × Среднее число попыток
Число попыток берётся из доли успеха: если модель закрывает задачу с первого раза в половине случаев, среднее число попыток равно двум. Разберём на паре моделей одну и ту же задачу — многофайловый рефакторинг с изменением сигнатур.
Claude Opus 5, $5/$25. За попытку модель читает 60 000 токенов и выдаёт 12 000. Это $0,30 за вход и $0,30 за выход, итого $0,60 за попытку. На задачах такого класса Opus закрывает вопрос в среднем с 1,3 попытки, значит, задача стоит $0,78.
Gemini 3 Flash, $0,50/$3. Те же 60 000 входных и 12 000 выходных токенов дают $0,03 и $0,036, итого $0,066 за попытку. Но на многофайловом рефакторинге модель попадает в цель примерно с пятой попытки, поэтому задача обходится в $0,33.
По счёту от провайдера дешёвая модель всё ещё впереди, разница в $0,45. Теперь добавим то, что в счёт не попадает: четыре неудачные попытки означают четыре прогона CI и четыре подхода разработчика к результату. Двадцать минут его времени при ставке $30 в час стоят $10 — в двадцать раз больше, чем вся экономия на токенах.
Вот как соотносятся цена за токен и цена за задачу у восьми моделей* в независимом замере лета 2026 года:
| Модель | Input, USD / 1M | Output, USD / 1M | Цена решённой задачи |
| DeepSeek V3.2 | 0,28 | 0,42 | 0,028 USD |
| Qwen3-Coder 480B | 0,22 | 1,00 | 0,033 USD |
| GLM-4.6 | 0,39 | 1,74 | 0,059 USD |
| Kimi K2.6 | 0,60 | 2,50 | 0,075 USD |
| Gemini 3 Flash | 0,50 | 3,00 | 0,078 USD |
| Claude Haiku 4.5 | 1,00 | 5,00 | 0,150 USD |
| GPT-5.1 | 1,25 | 10,00 | 0,239 USD |
| Claude Opus 4.5 | 5,00 | 25,00 | 0,680 USD |
*Замер от 7 июня 2026 года, поэтому, в таблице модели предыдущего поколения: независимые прогоны cost-per-task выходят с задержкой в один-два релиза относительно анонсов.
Обратите внимание на пару Qwen3-Coder и GLM-4.6. Вход у Qwen дешевле, а выход почти вдвое дешевле у него же, и по цене решённой задачи разрыв сохраняется. А пара Kimi K2.6 и Gemini 3 Flash показывает обратный случай: вход у Gemini дешевле ($0,50 против $0,60), выход дороже ($3 против $2,50), и по цене задачи Kimi выигрывает совсем чуть-чуть, $0,075 против $0,078. Выбирать между такими соседями по одной строке прайса бессмысленно, разница внутри погрешности замера.
Померить это на своих задачах несложно: возьмите двадцать закрытых тикетов, прогоните на двух моделях, посчитайте, сколько патчей прошло ревью без правок, и разделите потраченные деньги на число принятых патчей. Полученная цифра и есть ваша цена решённой задачи, и она будет отличаться от любой таблицы в интернете.
Сравнение LLM для кода на лето 2026
Лучшая LLM для программирования — это та, которая закрывает ваш класс задач с приемлемой долей ошибок по цене, которую вы готовы платить. Рейтинг нейросетей для кода поэтому имеет смысл читать по сегментам, а не сплошным списком.
Дальше — три сегмента, в каждом баллы на SWE-bench Verified, прайс и строка о том, кому модель подходит.
Флагманы
| Модель | SWE-bench Verified | Вход, USD / 1M | Выход, USD / 1M | Кому подходит |
| Claude Opus 5 | 96,0% | 5,00 | 25,00 | Ежедневная работа там, где важен баланс цены и качества |
| GPT‑5.6 Sol | 96,2% | 5,00 | 30,00 | Агенты в терминале, длинные автономные прогоны |
| Claude Fable 5 | 95,0% | 10,00 | 50,00 | Самые сложные многодневные задачи, где ошибка дороже счёта |
| Kimi K3 | 93,4% | 3,00 | 15,00 | Фронтенд и UI, лучшая цена в сегменте |
| Claude Opus 4.8 | 88,6% | 5,00 | 25,00 | Предыдущее поколение, годится как запасной вариант |
Между четырьмя актуальными флагманами разброс по качеству укладывается в три пункта, а по цене выхода доходит до трёх с лишним раз. Claude Opus 4.8 в таблице стоит особняком: это предыдущее поколение, и от лидера его отделяют почти восемь пунктов. Kimi K3 при этом обходит Fable 5 на фронтенде и стоит втрое дешевле, поэтому, платить за флагман Anthropic имеет смысл только там, где нужны долгие автономные прогоны с сохранением контекста.
Средний сегмент
| Модель | Вход, USD / 1M | Выход, USD / 1M | Кому подходит |
| Claude Sonnet 5 | 3,00 | 15,00 | Рабочая лошадка на большом объёме задач |
| GPT‑5.6 Terra | 2,00 | 12,00 | Смешанные задачи, где нужен большой контекст |
| Gemini 3.1 Pro | 2,00 | 12,00 | Работа с длинными документами и спеками |
| Grok 4.5 | 2,00 | 6,00 | Генерация тестов и объёмного кода: множитель выхода всего 3× |
| Claude Haiku 4.5 | 1,00 | 5,00 | Лучшая цена за решённый балл бенчмарка, около 0,13 USD |
Здесь живёт большинство команд, и не зря. Разрыв в качестве с флагманами на рутине почти не ощущается, а счёт отличается в разы. Claude Haiku 4.5 при цене $1/$5 даёт лучшее соотношение балла к доллару во всём обзоре, и для команды, которая гоняет сотни мелких задач в месяц, это разумная точка старта.
Бюджетный сегмент
| Модель | Показатель | Вход, USD / 1M | Выход, USD / 1M | Лицензия |
| DeepSeek V4‑Flash | — | 0,14 | 0,28 | MIT |
| DeepSeek V4‑Pro | 80,6% Verified | 0,435 | 0,87 | MIT |
| Qwen3-Coder 480B | — | 0,22 | 1,00 | Apache 2.0 |
| GLM‑5.2 | 62,1% на Pro | 0,84 | 3,14 | MIT |
| Qwen3.8‑27B* | 61,7% на Pro | 0,50 | 3,00 | Apache 2.0 |
*У Qwen3.8‑27B собственного прайса нет, модель раздают семь сторонних провайдеров, и медианная цена у них примерно втрое ниже указанной.
DeepSeek V4 берёт 80,6% на Verified по замеру вендора, отставая от флагманов примерно на 15 пунктов, при цене выхода в тридцать раз ниже. Если ваши задачи — это CRUD, миграции, тесты и типовые правки, эти 15 пунктов вы не заметите. На архитектурных решениях и отладке гонок заметите сразу. Китайские нейросети действительно дешевле в разы, и главный вопрос не в цене, а в том, какая доля ваших задач попадает в их зону уверенной работы.

Кому что
Три профиля, три разных ответа.
Пет-проект и учёба. Берите бесплатные лимиты и бюджетный сегмент. Gemini даёт бесплатную квоту, GigaChat — миллион токенов, у OpenRouter есть дневные лимиты на открытые модели. Платить имеет смысл, когда упрётесь в очередь в пиковые часы.
Продуктовая команда 3–15 человек. Средний сегмент как основа плюс флагман для сложного. Claude Haiku 4.5 или Grok 4.5 закрывают рутину, Opus 5 подключается на архитектурные задачи. Бюджет предсказуемый, качество ровное.
Энтерпрайз с ревью каждой строки. Здесь цена токена почти не имеет значения, потому что основная статья расхода — время ревьюеров. Флагман снижает число итераций и экономит человеко-часы, поэтому Opus 5 или Fable 5 окупаются даже при десятикратной разнице в прайсе. Отдельная строка — требования к данным, о них ниже.
Больше вариантов под конкретные задачи мы собрали в обзоре топовых ИИ для программистов.
Открытые модели и запуск на своём железе
Открытые LLM для кода привлекают двумя вещами: код не уходит наружу и за токены никто не берёт денег. Второе обещание при ближайшем рассмотрении разваливается, и вот почему.
Веса надо где-то держать. Правило для прикидки: при 4-битной квантизации на каждый миллиард параметров нужно примерно 0,6 ГБ видеопамяти, плюс запас под KV-кэш, который растёт с длиной контекста. Отсюда требования:
| Модель | Параметры | Минимум VRAM (4 бита) | На чём реально запускается |
| Qwen3.8‑27B | 27,8 млрд | ~20 ГБ | Одна RTX 4090 |
| DeepSeek V4‑Flash | — | ~90–100 ГБ | 4× RTX 4090 или 2× H200 |
| Qwen3-Coder 480B | 480 млрд | ~290 ГБ | 4× H100 |
| GLM‑5.2 | 753 млрд | ~470 ГБ | 8× H100 |
| DeepSeek V4‑Pro | 1,6 трлн | ~900 ГБ | 8× H200, датацентр |
| Kimi K3 | 2,8 трлн | датацентр | Кластер, не вариант для команды |
Требования по VRAM — с учётом KV-кэша, август 2026 года. Данные по открытым весам на Hugging Face и в развёрточных гайдах.
Теперь аренда. Час RTX 4090 стоит около $0,69, час A100 80 ГБ — от $1,39 до $2,20, час H100 — от $2,89. Узел из восьми H100 в AWS обойдётся примерно в $55 в час по on-demand и около $33 по годовому резерву.
Считаем точку безубыточности. Один H100 в режиме 24/7 стоит примерно $2100 в месяц. При смешанной цене DeepSeek V4‑Flash около $0,21 за миллион токенов эти деньги покупают у провайдера 10 миллиардов токенов. Одна карта столько не отдаст физически: реальная пропускная способность на модели такого класса даёт в лучшем случае сотни миллионов токенов в месяц при полной загрузке. Разрыв не в проценты, а в порядок.
Для маленьких моделей арифметика ближе к разумной. Qwen3.8‑27B в четырёхбитной квантизации занимает 17,9 ГБ и помещается на одну карту с 24 ГБ памяти. Аренда 4090 обойдётся примерно в $500 в месяц, а через API эта же модель стоит порядка $1 за миллион токенов в смешанном режиме. Своя карта отбивается на объёме около полумиллиарда токенов в месяц. Столько она физически способна отдать, но только при загрузке, близкой к круглосуточной, а в команде из пяти человек карта две трети времени простаивает.
К счёту за железо добавляются три расхода, которые не попадают в пресс-релизы:
- DevOps-время. Развернуть vLLM, настроить квантизацию, поднять мониторинг, разобраться с OOM на длинном контексте — это недели работы инженера. При ставке $50 в час первый месяц эксплуатации съедает годовую экономию.
- Простой карты. Провайдер батчит на одну карту тысячи запросов от разных клиентов, а ваша карта ночью и в выходные греет воздух. Реальная утилизация в команде из пяти человек редко превышает 15%.
- Обновление весов. Вышла новая версия — надо скачать сотни гигабайт, переразвернуть, перепрогнать регрессы. Провайдер делает это за вас и бесплатно.
Свой сервер выигрывает не по цене, а по требованиям: код физически не покидает контур, нет квот и лимитов, задержка предсказуемая. Если этих причин нет, API дешевле почти всегда. Мы разбирали, что реально можно запустить на домашней машине, и картина там похожая.

Российские модели и требования 152‑ФЗ
Иногда выбор по бенчмаркам отменяется одним пунктом договора. Если в коде или в данных, которые уходят в модель, есть персональные данные российских граждан, действует 152‑ФЗ: их обработка и хранение должны происходить на территории России. Отправка такого фрагмента в зарубежный API — нарушение, независимо от того, насколько хороша модель.
Важно понимать границу. Закон говорит о персональных данных, а не об исходном коде вообще. Сам по себе код под 152‑ФЗ не попадает. Попадают тестовые фикстуры с настоящими ФИО, дампы боевой базы, конфиги с адресами клиентов и логи с телефонами. Отдельная история — коммерческая тайна и NDA с заказчиком, и там ограничения бывают жёстче закона.
Российские LLM решают вопрос размещением данных внутри страны. Прайсы на август 2026 года:
| Модель | Цена | В пересчёте на 1M токенов |
| GigaChat‑2 Lite | 0,065 ₽ за 1000 токенов | ~65 ₽ |
| GigaChat‑2 Pro | 0,5 ₽ за 1000 токенов | ~500 ₽ |
| GigaChat‑2 Max | ~0,65 ₽ за 1000 токенов | ~650 ₽ |
| YandexGPT 5 Lite | ~0,2 ₽ за 1000 токенов | ~200 ₽ |
| YandexGPT 5 Pro | ~0,8 ₽ за 1000 токенов | ~800 ₽ |
По деньгам это сопоставимо со средним зарубежным сегментом. По кодовым задачам отставание есть, и оно заметное: ни GigaChat, ни YandexGPT не участвуют в SWE-bench и профильных кодовых аренах, а заявленные метрики измерены на русскоязычных задачах общего назначения. На генерации SQL, простых скриптов и документации они работают приемлемо, на многофайловом рефакторинге проигрывают среднему сегменту.
Есть четыре легальных сценария, которые дают доступ к сильным моделям без нарушения требований:
- Гибридная схема. Всё, что содержит персональные данные, обрабатывается российской моделью, остальной код уходит во внешний API. Требует дисциплины и автоматической проверки на выходе.
- Обезличивание перед отправкой. Прогон через препроцессор, который заменяет ФИО, телефоны, адреса и номера договоров на синтетические значения. Для кодовых задач работает хорошо: модели всё равно, зовут пользователя Иванов или User_042.
- Открытая модель в закрытом контуре. DeepSeek V4 и GLM‑5.2 лежат под MIT, Qwen — под Apache 2.0, поэтому их можно развернуть на своих серверах внутри периметра. Требования по железу выше.
- Российское облако с зарубежной моделью на своих серверах. Часть провайдеров предлагает инференс открытых моделей на площадках внутри страны, и юридически данные не покидают юрисдикцию.
Маршрутизация задач между моделями
Роутинг между несколькими LLM для кода экономит больше, чем любая смена провайдера, и работает на простой мысли: задачи неодинаковые. Переименовать переменную во всём проекте и спроектировать схему шардирования — это работа разного класса, а платят за них по одному тарифу, если в редакторе выставлена одна модель на всё.
Рабочая пропорция — 80 на 20. Восемьдесят процентов обращений — это рутина, которую закрывает бюджетная модель: автотесты по готовому коду, докстринги, переименования, шаблонный CRUD, перевод конфигов между форматами, разбор стектрейса. Двадцать процентов — то, где ошибка стоит дорого: архитектура, отладка гонок, миграции схемы, работа с легаси без тестов.
При переходе с одной флагманской модели на такую схему счёт падает в три-пять раз, а качество результата держится, потому что сложные задачи по-прежнему идут к сильной модели.
Решение о маршруте принимается по трём признакам:
- Тип задачи. Механическая правка по понятному образцу или проектное решение с последствиями.
- Длина контекста. Если для задачи нужно держать в голове пять файлов и историю миграций, дешёвая модель начнёт терять нить.
- Цена ошибки. Плохой докстринг заметят на ревью. Плохую миграцию заметят в проде в ночь релиза.
| Тип задачи | Модель | Почему так |
| Докстринги, комментарии, README | Бюджетная (DeepSeek V4‑Flash) | Шаблонный текст, ошибка ловится глазами за секунду |
| Автотесты по готовому коду | Средняя с низким множителем выхода (Grok 4.5) | Много выходных токенов, логика простая |
| Шаблонный CRUD, эндпоинты | Бюджетная или средняя | Код по образцу, покрыт тестами |
| Разбор стектрейса, поиск опечатки | Бюджетная | Задача локальная, контекст маленький |
| Рефакторинг модуля с тестами | Средняя (Haiku 4.5, Sonnet 5) | Нужна аккуратность, но есть страховка тестами |
| Многофайловый рефакторинг | Флагман (Opus 5) | Много связей, цена ошибки высокая |
| Отладка гонок и утечек | Флагман | Требует длинной цепочки рассуждений |
| Миграции схемы БД | Флагман плюс обязательное ревью | Ошибка необратима |
| Разбор легаси без тестов | Флагман | Нет страховки, некому поймать ошибку |
Настраивается это либо на уровне редактора, где Cursor и Claude Code позволяют выбрать модель для конкретного режима, либо через прокси вроде OpenRouter с правилами, либо руками — просто держите два профиля и переключайтесь. Ручной вариант работает не хуже автоматики, если в команде есть договорённость. Для типовых операций пригодятся готовые промпты для код-ревью, их удобно закрепить за дешёвой моделью.

Подписка на ассистента или прямой доступ к API
Доступ к LLM для кода продают двумя способами: подписка на AI-ассистента с фиксированной ценой и оплата по факту через API. Подписка даёт предсказуемый счёт и удобный интерфейс, API — точный контроль расхода и возможность гонять любую модель.
Порог считается просто. Базовая подписка стоит около $20 в месяц. При цене решённой задачи $0,15 на модели среднего сегмента эти деньги покрывают примерно 130 задач, то есть шесть задач в рабочий день. Если вы обращаетесь к модели реже, API обойдётся дешевле подписки. Если чаще — подписка уже окупилась, и дальше она работает в плюс.
Для тяжёлых сценариев картина другая. По данным Anthropic, разработчик на Claude Code тратит около $13 в активный день, а типичный месячный расход укладывается в $150–250. Команды, которые гоняют агентов в автономном режиме, доходят до $500–2000 на человека в месяц, и там уже никакая подписка не спасает: тарифы уровня Max стоят $100–200, но упираются в лимиты.
| Параметр | Подписка | Прямой API |
| Стоимость входа | 20–200 USD в месяц | По факту, от нуля |
| Предсказуемость счёта | Полная | Считать самому |
| Выбор моделей | Что дал вендор | Любая, включая открытые |
| Лимиты | Квоты, троттлинг в пик | Только rate limit провайдера |
| Порог выгоды | Больше 6 задач в день | Меньше 6 задач в день |
| Маршрутизация | Ограниченная | Полная |
Отдельно про лимиты, о которых редко пишут на лендинге. У подписок есть квоты на премиум-запросы: пятьсот обращений к сильной модели в месяц, дальше переключение на слабую. Есть троттлинг в пиковые часы, когда ответ приходит в три раза медленнее. Есть ограничение на длительность агентских прогонов, из-за которого долгая задача обрывается на середине. И есть недельные лимиты поверх месячных, которые не дают выбрать квоту за три дня. Мы подробно разбирали, чем отличаются Claude Code, Cursor и Codex по этим параметрам.
Командные тарифы устроены выгоднее личных: место в команде обычно стоит на 20–40% дешевле индивидуальной подписки, квоты общие на всю команду, и это выравнивает нагрузку между тем, кто кодит целыми днями, и тем, кто заходит раз в неделю. Плюс единый биллинг, который бухгалтерия примет без вопросов.

Как посчитать бюджет команды на месяц
Бюджет на LLM для кода считается за пять шагов, и ни один из них не требует ничего сложнее калькулятора. Разберём на команде из пяти разработчиков, которая работает по схеме с маршрутизацией: рутина на Claude Haiku 4.5, сложное на Claude Opus 5.
Шаг 1. Считаем задачи. Один разработчик обращается к модели 8–12 раз в день, но полноценных задач среди них 4–6. Берём среднее — 5 задач в день на человека. Пятеро за 21 рабочий день дают 525 задач в месяц.
Шаг 2. Раскладываем по моделям. По схеме 80/20 получаем 420 задач на бюджетную модель и 105 на флагман.
Шаг 3. Умножаем на цену задачи. Haiku 4.5 обходится в $0,15 за задачу, Opus 5 — в $0,78. Считаем: 420 × 0,15 = $63, плюс 105 × 0,78 = $81,9. Итого $144,9.
Шаг 4. Добавляем множитель на переделки. Часть задач уходит на второй круг, потому что постановка была неточной или результат не прошёл ревью. Реалистичный множитель — 1,4. Получается $202,9.
Шаг 5. Закладываем резерв на пики. В неделю релиза расход подскакивает вдвое, в спокойный месяц падает. Резерв 30% сглаживает эти колебания: $263,7 на команду, или около $53 на разработчика.
Формула, которую можно перенести в таблицу одной строкой:
= Разработчики × Задач_в_день × Рабочих_дней
× (Доля_рутины × Цена_дешёвой + Доля_сложного × Цена_флагмана)
× Множитель_переделок × (1 + Резерв)
Для нашего примера: 5 × 5 × 21 × (0,8 × 0,15 + 0,2 × 0,78) × 1,4 × 1,3 = $263,7.
Сравните с подписками: пять мест на базовом тарифе стоят $100 в месяц, пять мест уровня Max — от $500. Схема с API и маршрутизацией попадает ровно между ними, при этом даёт свободу выбора модели. Кстати, во многих компаниях подписку на ИИ-инструменты оплачивает работодатель, и это стоит выяснить до того, как платить из своего кармана.
Через месяц работы сверьте прогноз с фактическим счётом в консоли провайдера. Расхождение больше чем в полтора раза означает, что вы ошиблись в числе задач или в множителе переделок, и обе цифры легко уточнить по логам.
Чек-лист выбора модели
Как выбрать LLM для кода, если сравнивать все модели по всем параметрам некогда. Пройдите по восьми вопросам, и вариантов останется два-три.
- На каком стеке вы пишете? Бенчмарки построены на Python. Если у вас Kotlin, Scala, 1С или древний PHP, прогоните десять своих задач на кандидатах и смотрите на результат, а не на лидерборд.
- Есть ли в данных персональные данные? Фикстуры с настоящими ФИО, дампы, логи с телефонами. Если да, дальше выбираете или из российских моделей, или из открытых в своём контуре.
- Сколько кода нужно держать в контексте? Один файл, модуль или весь репозиторий. От этого зависит, переплатите ли вы за длинный контекст и поможет ли кэш.
- Какая доля ошибок допустима? Для генерации докстрингов допустима высокая, для миграций схемы — нулевая.
- Кто ловит ошибку? Автотесты, ревьюер или клиент в проде. Чем позже, тем дороже, и тем сильнее модель нужна.
- Какой месячный потолок бюджета и что делать при его превышении? Настройте алерт на 70% лимита в консоли провайдера, иначе узнаете о перерасходе из счёта.
- Нужна ли работа без интернета? Закрытый контур, командировки, объекты без связи. Если нужна, вы автоматически в разделе про открытые модели.
- Что вы сделаете, когда модель подорожает или её отключат? Держите обращения к модели за одной абстракцией и используйте OpenAI-совместимый эндпоинт. Тогда смена провайдера займёт час, а не спринт.
Частые вопросы
Какая LLM для кода самая дешёвая
По цене за токен из моделей, которые реально годятся для кода, дешевле всех DeepSeek V4‑Flash ($0,14/$0,28). Формально ниже прайс у Qwen 3.7 Flash ($0,03/$0,13), но это ставка для запросов короче 32 тысяч токенов, дальше она поднимается втрое и ещё раз втрое, а кодовых замеров у модели нет вообще. Для агента, который читает репозиторий, такая экономия не работает. По цене решённой задачи в замере июня 2026 года первое место у DeepSeek V3.2 с $0,028 за задачу. Для реальной работы важнее второй показатель: модель за три цента за миллион токенов, которая не закрывает задачу, обходится дороже любой другой.
Хватит ли бесплатных лимитов для пет-проекта
Обычно да. Бесплатная квота Gemini, миллион токенов у GigaChat и дневные лимиты OpenRouter на открытые модели закрывают несколько задач в день. Ограничения — скорость, очередь в пиковые часы и запрет на коммерческое использование у части провайдеров. Начать проще всего с редактора со встроенным ассистентом, у нас есть пошаговый туториал по Cursor.
Насколько открытые модели отстают от платных
На SWE-bench Verified разрыв между лидером (около 96%) и лучшей открытой моделью DeepSeek V4 (80,6% по замеру вендора) — примерно 15 пунктов. На SWE-bench Pro у GLM‑5.2 62,1% против 69,2% у Claude Opus 4.8, но обе цифры опубликованы самими разработчиками и получены на разных обвязках, так что разрыв тут скорее ориентир. При этом по цене за токен разрыв доходит до двух порядков. На рутинных задачах отставание почти не чувствуется, на многофайловых правках заметно сразу.
Можно ли отдавать коммерческий код внешнему API
С точки зрения закона это вопрос договора с заказчиком и NDA, потому что 152‑ФЗ регулирует персональные данные, а не исходный код. У крупных провайдеров есть режимы, в которых данные не идут в обучение и не хранятся дольше обработки запроса. Если в коде есть ПД — фикстуры с ФИО, дампы, конфиги с адресами — нужен российский контур или обезличивание на входе.
Как часто пересматривать выбор модели
Раз в квартал. Только за лето 2026 года OpenAI срезала цену GPT‑5.6 Luna на 80%, Anthropic перевела Sonnet 5 с вводной цены на обычную, а на вершине SWE-bench Verified сменился лидер. Внеплановый повод пересмотреть выбор — релиз модели, которая на вашем классе задач стоит в разы меньше текущей.
Заключение
Выбор LLM для кода сводится к одному числу, и это не цена за токен. Считайте стоимость решённой задачи: сколько денег ушло на то, чтобы получить патч, который прошёл ревью и не сломал прод. Посчитать её можно за полдня — двадцать задач из своего трекера, две-три модели-кандидата, деление потраченного на число принятых патчей.
Пересматривать результат стоит раз в квартал, потому что прайсы и лидеры меняются быстрее вашего релизного цикла: за одно лето цена одной популярной модели упала на 80%, а первое место в главном кодовом бенчмарке сменилось дважды. Заодно посмотрите, какие ИИ-навыки сейчас ждут от разработчика — умение считать стоимость модели уже входит в этот список.
Советуем дополнительно почитать
Claude Code: 6 инструментов и как снизить расход токенов в 2026 — практика экономии внутри конкретного агента: что настроить, чтобы контекст не раздувался на каждой итерации.
Как ИИ читает промпты — что происходит с запросом внутри модели и почему одни формулировки требуют вдвое меньше вычислений.
Как создать AI-агента: пошаговое руководство — сборка агента с нуля: как устроен цикл «прочитал — сделал — проверил», из которого и складывается счёт за токены.
15 скиллов для AI-агентов: установка и как работает в 2026 — готовые наборы правил, которые сокращают число попыток на типовых задачах.
14 сайтов с готовыми промтами для нейронок — где брать формулировки, чтобы не переизобретать постановку задачи каждый раз.
Бонус для читателей
Если вам интересно погрузиться в мир IT и при этом немного сэкономить, держите наш промокод на курсы Практикума. Он даст вам скидку при оплате, поможет с льготной ипотекой или безлимитом на маркетплейсах. Ладно, окей, это просто скидка, без остального, но хорошая.
