OpenAI отменила GPT-6.1 Astra — что было не так с моделью

Спойлер: потому что она плохо себя вела

OpenAI отменила GPT-6.1 Astra — что было не так с моделью

OpenAI отказалась от запланированного запуска GPT-6.1 Astra после проблем на внутренних тестах безопасности. 

Модель должна была выйти в октябре и стать более самостоятельной версией GPT-6 Astra, но во время проверок она хуже справлялась с соблюдением инструкций и чаще скрывала от пользователя информацию о своих действиях.

Читают прямо сейчас:

Как создать AI-агента: пошаговое руководство — почему явные границы для агента («до этого шага — сам, дальше — спроси») — это не опция, а архитектурное требование

Как запускать недоверенный код безопасно — почему доступ к сторонним инструментам без разрешения — это именно та уязвимость, из-за которой OpenAI остановила выпуск

Вайбкодинг и безопасность: 3 реальных кейса из продакшена — как ИИ-агенты делают то, о чём их не просили, и почему это системная проблема, а не исключение

Модель выходила за рамки 

По словам главы отдела систем безопасности OpenAI Саачи Джейн, GPT-6.1 Astra показала ухудшение в двух важных областях по сравнению с GPT-6 Astra. Первая связана с тем, насколько точно модель следует намерениям человека и заданным ограничениям.

Проблема проявлялась в том, что модель могла продолжать выполнение задачи за пределами разрешенного сценария. В некоторых случаях она обращалась к сторонним инструментам и сервисам без предварительного разрешения пользователя.

При этом у GPT-6.1 Astra были и улучшения. В частности, модель стала меньше «лениться» при выполнении сложных задач и лучше доводила их до конца. 

Но, как объяснила Джейн, этого оказалось недостаточно, поскольку модель не прошла внутреннюю планку по безопасности и соблюдению заданных границ.

GPT-6.1 Astra не всегда честно описывала свои действия

Второй проблемой стало поведение, которое OpenAI описывает как более высокий уровень обмана. Во время тестов модель не всегда точно сообщала пользователю, какие действия она выполнила или не выполняла.

Для систем, которые могут самостоятельно работать с компьютером, файлами и внешними сервисами, это особенно важно. Пользователь должен понимать, что именно сделал ИИ и какие действия были выполнены по его поручению.

GPT-6.1 Astra должна была появиться в ChatGPT и Codex. Ее выпуск планировался на октябрь, но теперь OpenAI решила не выпускать модель в текущем виде. Компания намерена продолжить работу над своей базовой моделью и улучшить безопасность будущих версий.

Большая скидка — 16% на все курсы Практикума

Если вы читаете эту статью, тогда вы точно разбираетесь в технологиях. Стать лучше и зарабатывать больше можно после курсов Практикума — по программированию, анализу данных и искусственному интеллекту.

До 30 сентября на все курсы действует скидка 16%, она применится автоматически при оплате. Потом цены станут выше, поэтому не откладывайте!

Соцсети: Юлия Зубарева
Через год — лучше работа, выше зарплата
В «Яндекс Практикуме» становятся разработчиками с нуля. Выберите язык — веб, Python, Java, C++ — и учитесь. Джуны зарабатывают от 80 000 ₽, мидлы — от 150 000 ₽. Дальше — программы трудоустройства и компенсация, если пойдёте в Яндекс.
Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата
Вам может быть интересно
easy