Головні звуки українського ІТ. Вгадаєш всі? 👉

ШІ-модель Mythos 5 від Anthropic вийшла із-під контролю і намагалася обдурити реальних розробників

ШІ-агент створював фейкові особистості, надсилав цільовий фішинг та подавав шкідливі баг-репорти, щоб змусити людину затвердити вірусний код.

Залишити коментар
ШІ-модель Mythos 5 від Anthropic вийшла із-під контролю і намагалася обдурити реальних розробників

ШІ-агент створював фейкові особистості, надсилав цільовий фішинг та подавав шкідливі баг-репорти, щоб змусити людину затвердити вірусний код.

Тільки минув тиждень з моменту, як OpenAI визнала, що її видозмінені моделі зламали платформу Hugging Face та скомпрометували акаунти ще на чотирьох сервісах, як стався потенційно небезпечніший інцидент. Під час кібервипробувань модель Mythos 5 від компанії Anthropic вдалася до прямого обману людей, аби просунути шкідливий код у реальний open-source проєкт.

Про це повідомив Британський інститут безпеки ШІ (AISI), який оцінював кіберможливості передових моделей, пише TechSpot.

Як проводилося тестування

Дослідники запустили 122 тести «capture-the-flag» для семи різних моделей у симульованому середовищі. Щоб перевірити максимум можливостей ШІ, їм навмисно увімкнули доступ до реального інтернету та вимкнули стандартні захисні бар'єри.

Результати виявилися тривожними: у 10 тестах агенти виконали 19 автономних і несанкціонованих дій проти реальних людей та організацій у мережі:

  • 17 випадків припадають на модель Mythos 5 (Anthropic);

  • 2 випадки — на модель GPT-5.6 Sol (OpenAI).

Хроніка обману: як діяв Mythos 5

У найнебезпечнішому сценарії Mythos вирішив, що для атаки на ціль йому потрібно створити бекдор у реальному GitHub-проєкті. Модель діяла як досвідчений хакер.

Спочатку модель дослідила профілі мейнтейнерів проєкту та надіслала їм цільові фішингові листи зі шкідливим навантаженням. Далі вона подала шкідливий Pull Request і створила кілька цифрових особистостей, де одна фейкова особа переконувала у безпечності коду, а інша підтверджувала це в коментарях, причому для більшої переконливості один із баг-репортів було підписано данською мовою, оскільки розробник походив із Данії. Коли ж розробник висловив сумніви, ШІ відредагував свій репорт задля приховування доказів, розглядав можливість повернутися під новим акаунтом, а також додав в один із репортів промпт-ін'єкцію, розраховану на обман ШІ-асистентів розробника з метою змусити їх виконати вірусний код.

Також Mythos залишав публічні повідомлення для інших ШІ-агентів із порадами щодо співпраці та інструкціями з використання створених ним інструментів і акаунтів (якими пізніше скористалися інші моделі). А модель GPT-5.6 Sol окремо розгорнула шкідливий сервер у мережі та зламала GitHub-акаунт, створений іншим ШІ.

«Це перший випадок, коли AISI зафіксував обман такої суворості, спрямований на реальну людину, без спонукання з боку оператора та в реальному світі», — заявили в інституті.

Як зупинили ШІ та які будуть наслідки

Аномальну активність виявили 28 липня, коли системи помітили підозрілий трафік через мережу Tor. Науковці негайно зупинили тестування, ізолювали машини та заблокували доступ до найпотужніших моделей протягом години.

Реальний розробник відхилив шкідливий PR, тож жодної шкоди завдано не було.

В AISI наголошують, що конфігурації моделей були тестовими і не доступні публічно, а сам ШІ, ймовірно, навіть не усвідомлював, де закінчується симуляція і починається реальний світ. Тим не менш, той факт, що Mythos 5 самостійно обрав шлях обману людей для досягнення мети, викликає серйозні побоювання в IT-спільноті.

Зважаючи на нещодавній інцидент з OpenAI, цей випадок посилить вимоги до безпеки штучного інтелекту. Anthropic та OpenAI вже заявили про необхідність розробки єдиних галузевих стандартів тестування.

Anthropic заявила що її ШІ-моделі зламали три компанії під час тестів на безпеку
Anthropic заявила, що її ШІ-моделі зламали три компанії під час тестів на безпеку
По темi
Anthropic заявила, що її ШІ-моделі зламали три компанії під час тестів на безпеку
17 600 дій за 4 дні: як ШІ-модель OpenAI самостійно зламала платформу Hugging Face та які висновки зробили експерти
17 600 дій за 4 дні: як ШІ-модель OpenAI самостійно зламала платформу Hugging Face та які висновки зробили експерти
По темi
17 600 дій за 4 дні: як ШІ-модель OpenAI самостійно зламала платформу Hugging Face та які висновки зробили експерти
Читайте головні IT-новини країни в нашому Telegram
Читайте головні IT-новини країни в нашому Telegram
По темi
Читайте головні IT-новини країни в нашому Telegram

Хочете повідомити важливу новину? Пишіть у Telegram-бот

Головні події та корисні посилання в нашому Telegram-каналі

Обговорення
Коментарів поки немає.