OpenAI опубликовала результаты работы своей передовой ИИ-модели. Речь идет о внутренней разработке, которая еще не была публично представлена.
Модель смогла решить около 90 важных математических задач из 500. Что самое интересное — компания выложила полученные результаты и дополнительные материалы в открытый репозиторий на GitHub.
Читают прямо сейчас:
LLM для кода: как выбрать между ценой и качеством — почему бенчмарк не равен реальной задаче: модель могла видеть тест в обучающих данных, и тогда он меряет память, а не интеллект
Как выбрать свою LLM-модель — как устроены тесты на логику и рассуждения, которые Fable 5.1 прошла лучше среднего человека
Галлюцинации ИИ: почему LLM врут и как с этим бороться — почему высокий IQ-балл ещё не означает надёжности: модель с лучшими показателями рассуждений всё равно может уверенно ошибаться в фактах
Решения можно проверить
В репозитории OpenAI публикует не только сами результаты, но и материалы, которые помогают оценить работу модели. Для части доказательств доступны формализации на Lean — языке, который позволяет проверять математические доказательства с помощью компьютера.
Компания также собирается постепенно добавлять новые формализации по мере их подготовки. Для опубликованных работ предусмотрены отдельные правила обновления и цитирования, чтобы исследователи могли отслеживать изменения.
OpenAI отдельно отмечает, что при подготовке публикации консультировалась с независимой экспертной группой по математике и искусственному интеллекту при Институте перспективных исследований. Ее рекомендации использовали при выборе формата раскрытия результатов.
На одну задачу уходило около трех часов
Вместе с решениями OpenAI раскрыла больше информации о том, как они были получены. В репозитории появились десять кратких описаний рассуждений модели, статистика по количеству попыток и оценка затраченных вычислительных ресурсов.
В среднем на один результат приходился объем вычислений, примерно сопоставимый с тремя часами режима Thinking в ChatGPT Pro. При этом речь идет о среднем показателе: сложность и количество попыток для разных задач заметно отличались.
OpenAI хочет ускорить научные исследования
Компания рассматривает такие результаты не просто как демонстрацию возможностей ИИ. OpenAI планирует использовать их для дальнейшей работы с научным сообществом и собирается финансировать семинары, конференции и специальные программы, посвященные изучению результатов, полученных ИИ.
При этом модель, которая занималась математикой, пока не выпущена публично. OpenAI заявляет, что работает над ее ответственным раскрытием и продолжит тестировать внутренние модели не только в математике, но и в других научных областях.
Компания также обещает улучшать формат будущих публикаций. В том числе качество математического изложения, ссылок и представления результатов. Это должно упростить независимую проверку работ и их дальнейшее использование исследователями.
Скидка на все курсы Практикума
Раз вы дочитали эту новость до конца, с технологиями у вас всё в порядке. А если давно присматривались к разработке, аналитике, нейросетям, тестированию или кибербезопасности, сейчас туда можно зайти дешевле.
Промокод KOD (можно просто нажать) даст скидку на любой платный курс! А если пока не готовы покупать курс, у Практикума есть бесплатные вводные части.
