ИИ от OpenAI решила 90 из 500 главных задач математики — решения выложены на GitHub

Впечатляет

ИИ от OpenAI решила 90 из 500 главных задач математики — решения выложены на GitHub

OpenAI опубликовала результаты работы своей передовой ИИ-модели. Речь идет о внутренней разработке, которая еще не была публично представлена. 

Модель смогла решить около 90 важных математических задач из 500. Что самое интересное — компания выложила полученные результаты и дополнительные материалы в открытый репозиторий на GitHub.

Читают прямо сейчас:

LLM для кода: как выбрать между ценой и качеством — почему бенчмарк не равен реальной задаче: модель могла видеть тест в обучающих данных, и тогда он меряет память, а не интеллект

Как выбрать свою LLM-модель — как устроены тесты на логику и рассуждения, которые Fable 5.1 прошла лучше среднего человека

Галлюцинации ИИ: почему LLM врут и как с этим бороться — почему высокий IQ-балл ещё не означает надёжности: модель с лучшими показателями рассуждений всё равно может уверенно ошибаться в фактах

Решения можно проверить

В репозитории OpenAI публикует не только сами результаты, но и материалы, которые помогают оценить работу модели. Для части доказательств доступны формализации на Lean — языке, который позволяет проверять математические доказательства с помощью компьютера.

Компания также собирается постепенно добавлять новые формализации по мере их подготовки. Для опубликованных работ предусмотрены отдельные правила обновления и цитирования, чтобы исследователи могли отслеживать изменения.

OpenAI отдельно отмечает, что при подготовке публикации консультировалась с независимой экспертной группой по математике и искусственному интеллекту при Институте перспективных исследований. Ее рекомендации использовали при выборе формата раскрытия результатов.

На одну задачу уходило около трех часов

Вместе с решениями OpenAI раскрыла больше информации о том, как они были получены. В репозитории появились десять кратких описаний рассуждений модели, статистика по количеству попыток и оценка затраченных вычислительных ресурсов.

В среднем на один результат приходился объем вычислений, примерно сопоставимый с тремя часами режима Thinking в ChatGPT Pro. При этом речь идет о среднем показателе: сложность и количество попыток для разных задач заметно отличались.

OpenAI хочет ускорить научные исследования

Компания рассматривает такие результаты не просто как демонстрацию возможностей ИИ. OpenAI планирует использовать их для дальнейшей работы с научным сообществом и собирается финансировать семинары, конференции и специальные программы, посвященные изучению результатов, полученных ИИ.

При этом модель, которая занималась математикой, пока не выпущена публично. OpenAI заявляет, что работает над ее ответственным раскрытием и продолжит тестировать внутренние модели не только в математике, но и в других научных областях.

Компания также обещает улучшать формат будущих публикаций. В том числе качество математического изложения, ссылок и представления результатов. Это должно упростить независимую проверку работ и их дальнейшее использование исследователями.

Скидка на все курсы Практикума

Раз вы дочитали эту новость до конца, с технологиями у вас всё в порядке. А если давно присматривались к разработке, аналитике, нейросетям, тестированию или кибербезопасности, сейчас туда можно зайти дешевле.

Промокод KOD (можно просто нажать) даст скидку на любой платный курс! А если пока не готовы покупать курс, у Практикума есть бесплатные вводные части.

Соцсети: Юлия Зубарева
Через год — лучше работа, выше зарплата
В «Яндекс Практикуме» становятся разработчиками с нуля. Выберите язык — веб, Python, Java, C++ — и учитесь. Джуны зарабатывают от 80 000 ₽, мидлы — от 150 000 ₽. Дальше — программы трудоустройства и компенсация, если пойдёте в Яндекс.
Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата Через год — лучше работа, выше зарплата
Вам может быть интересно
easy