Вышла Claude Sonnet 5.5: проходит игры по скриншотам и почти догнала Opus

Anthropic представила Claude Sonnet 5.5 — новую модель семейства Claude 5.5. Она стала быстрее предыдущей версии более чем на 30%, при этом стоимость выполнения задач может быть до 30% ниже.  В некоторых тестах Sonnet 5.5 уже приблизилась к более мощной Claude Opus 5.5, хотя Anthropic по-прежнему отводит Opus роль модели для самых сложных задач. Новая […]

Вышла Claude Sonnet 5.5: проходит игры по скриншотам и почти догнала Opus

Anthropic представила Claude Sonnet 5.5 — новую модель семейства Claude 5.5.

Она стала быстрее предыдущей версии более чем на 30%, при этом стоимость выполнения задач может быть до 30% ниже. 

В некоторых тестах Sonnet 5.5 уже приблизилась к более мощной Claude Opus 5.5, хотя Anthropic по-прежнему отводит Opus роль модели для самых сложных задач.

Читают прямо сейчас:

Claude Code, Cursor и Codex: какой AI-агент выбрать — как прирост в CursorBench с 34% до 55% меняет выбор модели для ежедневной работы с кодом

Почему короткий промпт может стоить дороже длинного — почему «до 30% дешевле» при той же цене токенов — это реальная экономия за счёт меньшего числа шагов и вызовов инструментов

Чем заменить ChatGPT: 20 лучших аналогов в 2026 году — где Sonnet 5.5 теперь стоит на фоне GPT-6 Sol и других конкурентов в том же ценовом сегменте

Новая модель заметно «прибавила» в кодинге

Самый большой прирост Sonnet 5.5 показала в работе с кодом. В тесте Terminal-Bench 4.0 модель получила 70,6% против 10,3% у Sonnet 5. На CursorBench результат вырос с 34,1% до 55,5%, а в FrontierCode 1.1 новая модель набрала 46,2% на максимальном уровне усилий.

В некоторых тестах Sonnet 5.5 на высоких настройках показывает результаты, близкие к Opus 5.5. 

Например, в CursorBench разница между ними составляет около 2%. При этом Anthropic отмечает, что Opus все еще лучше справляется с открытыми задачами, где требуется долго анализировать ситуацию и принимать сложные решения.

Sonnet 5.5 также стала эффективнее работать с инструментами. По данным компании, модель чаще объединяет несколько вызовов инструментов в один этап, поэтому выполняет задачи за меньшее число шагов и расходует меньше токенов.

Вышла Claude Sonnet 5.5: проходит игры по скриншотам и почти догнала Opus

Claude научилась проходить Pokémon Red по скриншотам

Одной из необычных демонстраций стала игра Pokémon Red. Sonnet 5.5 впервые среди моделей семейства Sonnet смогла пройти игру, ориентируясь только на скриншоты. 

Это показывает улучшение работы с изображениями и способность модели выполнять длинные последовательности действий без постоянного вмешательства пользователя.

Модель также заметно улучшила работу с документами, презентациями и таблицами. Anthropic утверждает, что она лучше следует шаблонам и аккуратнее оформляет интерфейсы. 

В одном внутреннем тесте Sonnet 5.5 получила материалы о квартальных результатах компании и шаблон презентации, после чего подготовила десять слайдов. Два эксперта оценили первый вариант как готовый к отправке без дополнительного редактирования.

В тесте GDPval-AA, который проверяет работу с реальными задачами из 44 профессий, Sonnet 5.5 получила 1844 балла. У Opus 5.5 результат составил 1846 баллов, тогда как Sonnet 5 набрала 1449.

Вышла Claude Sonnet 5.5: проходит игры по скриншотам и почти догнала Opus

Скорость выросла, а цена осталась прежней

Стоимость Sonnet 5.5 для API не изменилась относительно Sonnet 5: $2 за миллион входных токенов и $10 за миллион выходных. Чтение кэша стоит $0,20 за миллион токенов. При этом новая модель обычно использует меньше токенов для выполнения той же задачи, поэтому фактическая стоимость работы, по данным Anthropic, может быть до 30% ниже.

Скорость генерации выросла более чем на 30%, что делает Sonnet 5.5 самой быстрой моделью серии Sonnet на данный момент. В Claude и Claude Code по умолчанию используется средний уровень усилий, а разработчики могут выбирать более высокие или низкие настройки в зависимости от того, что важнее — скорость, цена или качество результата.

Sonnet 5.5 уже доступна в Claude и на платформах AWS, Google Cloud и Microsoft Azure. Для разработчиков модель доступна через Claude Platform под идентификатором claude-sonnet-5-5.

Большая скидка — 16% на все курсы Практикума

Если вы читаете эту статью, тогда вы точно разбираетесь в технологиях. Стать лучше и зарабатывать больше можно после курсов Практикума — по программированию, анализу данных и искусственному интеллекту.

До 30 сентября на все курсы действует скидка 16%, она применится автоматически при оплате. Потом цены станут выше, поэтому не откладывайте!

Соцсети: Юлия Зубарева
Через год — лучше работа, выше зарплата
В «Яндекс Практикуме» становятся разработчиками с нуля. Выберите язык — веб, Python, Java, C++ — и учитесь. Джуны зарабатывают от 80 000 ₽, мидлы — от 150 000 ₽. Дальше — программы трудоустройства и компенсация, если пойдёте в Яндекс.
Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата
Вам может быть интересно