OpenAI опублікувала сотні розв’язків складних математичних задач. Але науковці виявили, що ШІ міг змінити зміст доведення під час перевірки
OpenAI опублікувала сотні розв’язків складних математичних задач, створених її ШІ-моделлю. Але дослідники виявили, що в одному з доведень текстове пояснення не повністю збігається з кодом, який мав підтвердити його правильність. Дослідники знайшли щонайменше дві такі розбіжності.
OpenAI опублікувала сотні розв’язків складних математичних задач, створених її ШІ-моделлю. Але дослідники виявили, що в одному з доведень текстове пояснення не повністю збігається з кодом, який мав підтвердити його правильність. Дослідники знайшли щонайменше дві такі розбіжності.
Цього тижня OpenAI опублікувала 719 робіт із розв’язками складних математичних задач, отриманими за допомогою ШІ. Однак у науковців виникли запитання щодо того, як компанія перевіряла ці результати.
Щоб перевірити математичне доведення, ШІ може спочатку описати розв’язок звичайними словами, а потім перекласти його на спеціальну мову Lean. Вона дозволяє комп’ютеру перевірити, чи правильно побудоване доведення. Однак під час такого «перекладу» ШІ може неточно передати зміст доведення мовою Lean. У результаті код може доводити не зовсім те, що написано в текстовому поясненні. І навіть якщо комп’ютер підтвердить правильність коду, це ще не означає, що початкове доведення буде правильним.
Саме на цю проблему звернули увагу дослідники Кембриджського університету та Королівського коледжу Лондона, які вивчали роботу OpenAI над задачею, пов’язаною з рівняннями Нав'є — Стокса.
Також перед публікацією компанія консультувалася з групою математиків AGMAI, яка розробила рекомендації для ШІ-лабораторій. Однак виконала не всі з них.
Зокрема, науковці закликали не використовувати закриті ШІ-моделі для дослідження складних математичних задач. А OpenAI підтвердила, що переважну більшість опублікованих результатів отримала за допомогою власної внутрішньої моделі, яку ще не випустила у відкритий доступ.
До того ж OpenAI опублікувала записи міркувань ШІ лише для 10 із 719 робіт, а у формальному вигляді представила приблизно 42% доведень.
Математик Теренс Тао звернув увагу й на іншу проблему: люди, які отримують розв’язки за допомогою ШІ, не завжди розуміють їх достатньо добре, щоб пояснити іншим науковцям. Професорка Гарварду Мелані Вуд також зазначила, що коли ШІ видає готовий розв’язок, це ще не означає, що люди його зрозуміли.
Раніше dev.ua писав, що 25 лауреатів Філдсівської премії, серед яких українська математикиня Марина В’язовська, розкритикували гонку ШІ-компаній за математичними проривами. Науковці попередили, що компанії поспішають оголосити про розв’язання складних задач ще до належної перевірки результатів.