Ученые выявили ограничения ИИ в самостоятельных научных исследованиях
ИИ-агенты уже способны самостоятельно искать литературу, проводить сотни экспериментов и писать научные работы, однако пока плохо справляются с выбором действительно перспективных идей. Эксперимент показал, что такие системы слишком рано привязываются к первоначальной гипотезе и недостаточно критично оценивают собственные результаты.
Источник: Новости науки
МОСКВА, 14 августа /Новости науки/. Современные системы искусственного интеллекта пока не способны полностью самостоятельно проводить полноценные научные исследования. К такому выводу пришли американские исследователи, результаты работы которых опубликованы в виде препринта на arXiv, сообщает журнал Nature.
Эксперимент показал, что главная проблема современных ИИ-агентов заключается не столько в выполнении технической работы, сколько в выборе научного направления. Система могла несколько дней подряд самостоятельно проводить эксперименты, анализировать литературу и исправлять ошибки, однако зачастую слишком рано выбирала одну из гипотез и продолжала развивать ее даже тогда, когда полученные результаты указывали на необходимость сменить подход.
Для проверки возможностей ИИ ученые разработали метод так называемой теневой оценки. Они выбрали две работы, представленные на конференцию Neural Information Processing Systems, и поручили ИИ провести собственные исследования по тем же научным вопросам. Полученные результаты затем оценивали не обычные рецензенты, а авторы исходных исследований, хорошо знакомые с проблемами и возможными решениями.
Исследователи использовали большую языковую модель Claude Opus 4.8 в модифицированной агентной системе OpenClaw. ИИ получил доступ к интернету, научным библиотекам, вычислительным ресурсам, программам для проведения экспериментов и инструментам имитации научного рецензирования. Он также мог создавать собственных вспомогательных ИИ-агентов. На решение каждой из двух задач системе предоставили шесть дней и вычислительные ресурсы стоимостью до $3 тыс.
В первом случае ИИ должен был разработать способ точного управления «личностью» чат-бота, во втором — создать систему обнаружения сбоев определенного типа нейронных сетей. Авторы исследования признали, что технические возможности ИИ превзошли их ожидания. Система самостоятельно провела сотни экспериментов, не застревала надолго из-за программных ошибок, качественно анализировала научную литературу и получила несколько небольших новых результатов. Более того, ИИ замечал некоторые собственные ложные утверждения и не пытался искусственно улучшать показатели экспериментов.
Однако с решением главных научных задач система справилась значительно хуже. Авторы исходных работ поставили ей лишь 2 балла из 6 за одно исследование и 1 балл из 6 за другое. По словам ученых, ИИ недостаточно активно отказывался от неудачных гипотез, а его собственная последующая критика результатов оказывалась слишком мягкой. В итоге система постепенно сокращала первоначальные утверждения и приходила к выводам, представлявшим лишь ограниченный научный интерес.
Попытки создать полностью автономного «ИИ-ученого» предпринимаются уже несколько лет. В 2024 году японская компания Sakana AI представила систему The AI Scientist, способную самостоятельно придумывать исследовательские идеи, проводить эксперименты, писать статьи и оценивать их. Некоторые созданные ею работы смогли пройти формальное научное рецензирование. Новое исследование, однако, показывает, что способность подготовить внешне полноценную научную статью еще не означает способности выбирать плодотворные исследовательские направления и получать действительно значимые результаты.
Эксперимент показал, что главная проблема современных ИИ-агентов заключается не столько в выполнении технической работы, сколько в выборе научного направления. Система могла несколько дней подряд самостоятельно проводить эксперименты, анализировать литературу и исправлять ошибки, однако зачастую слишком рано выбирала одну из гипотез и продолжала развивать ее даже тогда, когда полученные результаты указывали на необходимость сменить подход.
Для проверки возможностей ИИ ученые разработали метод так называемой теневой оценки. Они выбрали две работы, представленные на конференцию Neural Information Processing Systems, и поручили ИИ провести собственные исследования по тем же научным вопросам. Полученные результаты затем оценивали не обычные рецензенты, а авторы исходных исследований, хорошо знакомые с проблемами и возможными решениями.
Исследователи использовали большую языковую модель Claude Opus 4.8 в модифицированной агентной системе OpenClaw. ИИ получил доступ к интернету, научным библиотекам, вычислительным ресурсам, программам для проведения экспериментов и инструментам имитации научного рецензирования. Он также мог создавать собственных вспомогательных ИИ-агентов. На решение каждой из двух задач системе предоставили шесть дней и вычислительные ресурсы стоимостью до $3 тыс.
В первом случае ИИ должен был разработать способ точного управления «личностью» чат-бота, во втором — создать систему обнаружения сбоев определенного типа нейронных сетей. Авторы исследования признали, что технические возможности ИИ превзошли их ожидания. Система самостоятельно провела сотни экспериментов, не застревала надолго из-за программных ошибок, качественно анализировала научную литературу и получила несколько небольших новых результатов. Более того, ИИ замечал некоторые собственные ложные утверждения и не пытался искусственно улучшать показатели экспериментов.
Однако с решением главных научных задач система справилась значительно хуже. Авторы исходных работ поставили ей лишь 2 балла из 6 за одно исследование и 1 балл из 6 за другое. По словам ученых, ИИ недостаточно активно отказывался от неудачных гипотез, а его собственная последующая критика результатов оказывалась слишком мягкой. В итоге система постепенно сокращала первоначальные утверждения и приходила к выводам, представлявшим лишь ограниченный научный интерес.
Попытки создать полностью автономного «ИИ-ученого» предпринимаются уже несколько лет. В 2024 году японская компания Sakana AI представила систему The AI Scientist, способную самостоятельно придумывать исследовательские идеи, проводить эксперименты, писать статьи и оценивать их. Некоторые созданные ею работы смогли пройти формальное научное рецензирование. Новое исследование, однако, показывает, что способность подготовить внешне полноценную научную статью еще не означает способности выбирать плодотворные исследовательские направления и получать действительно значимые результаты.