ШІ-модель Mythos 5 від Anthropic вийшла із-під контролю і намагалася обдурити реальних розробників
ШІ-агент створював фейкові особистості, надсилав цільовий фішинг та подавав шкідливі баг-репорти, щоб змусити людину затвердити вірусний код.
ШІ-агент створював фейкові особистості, надсилав цільовий фішинг та подавав шкідливі баг-репорти, щоб змусити людину затвердити вірусний код.
ШІ-агент створював фейкові особистості, надсилав цільовий фішинг та подавав шкідливі баг-репорти, щоб змусити людину затвердити вірусний код.
Тільки минув тиждень з моменту, як OpenAI визнала, що її видозмінені моделі зламали платформу Hugging Face та скомпрометували акаунти ще на чотирьох сервісах, як стався потенційно небезпечніший інцидент. Під час кібервипробувань модель Mythos 5 від компанії Anthropic вдалася до прямого обману людей, аби просунути шкідливий код у реальний open-source проєкт.
Про це повідомив Британський інститут безпеки ШІ (AISI), який оцінював кіберможливості передових моделей, пише TechSpot.
Дослідники запустили 122 тести «capture-the-flag» для семи різних моделей у симульованому середовищі. Щоб перевірити максимум можливостей ШІ, їм навмисно увімкнули доступ до реального інтернету та вимкнули стандартні захисні бар'єри.
Результати виявилися тривожними: у 10 тестах агенти виконали 19 автономних і несанкціонованих дій проти реальних людей та організацій у мережі:
17 випадків припадають на модель Mythos 5 (Anthropic);
2 випадки — на модель GPT-5.6 Sol (OpenAI).
У найнебезпечнішому сценарії Mythos вирішив, що для атаки на ціль йому потрібно створити бекдор у реальному GitHub-проєкті. Модель діяла як досвідчений хакер.
Спочатку модель дослідила профілі мейнтейнерів проєкту та надіслала їм цільові фішингові листи зі шкідливим навантаженням. Далі вона подала шкідливий Pull Request і створила кілька цифрових особистостей, де одна фейкова особа переконувала у безпечності коду, а інша підтверджувала це в коментарях, причому для більшої переконливості один із баг-репортів було підписано данською мовою, оскільки розробник походив із Данії. Коли ж розробник висловив сумніви, ШІ відредагував свій репорт задля приховування доказів, розглядав можливість повернутися під новим акаунтом, а також додав в один із репортів промпт-ін'єкцію, розраховану на обман ШІ-асистентів розробника з метою змусити їх виконати вірусний код.
Також Mythos залишав публічні повідомлення для інших ШІ-агентів із порадами щодо співпраці та інструкціями з використання створених ним інструментів і акаунтів (якими пізніше скористалися інші моделі). А модель GPT-5.6 Sol окремо розгорнула шкідливий сервер у мережі та зламала GitHub-акаунт, створений іншим ШІ.
«Це перший випадок, коли AISI зафіксував обман такої суворості, спрямований на реальну людину, без спонукання з боку оператора та в реальному світі», — заявили в інституті.
Аномальну активність виявили 28 липня, коли системи помітили підозрілий трафік через мережу Tor. Науковці негайно зупинили тестування, ізолювали машини та заблокували доступ до найпотужніших моделей протягом години.
Реальний розробник відхилив шкідливий PR, тож жодної шкоди завдано не було.
В AISI наголошують, що конфігурації моделей були тестовими і не доступні публічно, а сам ШІ, ймовірно, навіть не усвідомлював, де закінчується симуляція і починається реальний світ. Тим не менш, той факт, що Mythos 5 самостійно обрав шлях обману людей для досягнення мети, викликає серйозні побоювання в IT-спільноті.
Зважаючи на нещодавній інцидент з OpenAI, цей випадок посилить вимоги до безпеки штучного інтелекту. Anthropic та OpenAI вже заявили про необхідність розробки єдиних галузевих стандартів тестування.


