Головні звуки українського ІТ. Вгадаєш всі? 👉

Anthropic заявила, що її ШІ-моделі зламали три компанії під час тестів на безпеку

Anthropic повідомила, що внутрішнє розслідування виявило три інциденти, під час яких її модель штучного інтелекту Claude зламала системи трьох компаній у ході тестів із кібербезпеки. Це розслідування та розголошення відбулися більш ніж через тиждень після того, як OpenAI повідомила, що одна з її нерелізнутих моделей проникла в системи Hugging Face під час внутрішнього тестування.

Залишити коментар
Anthropic заявила, що її ШІ-моделі зламали три компанії під час тестів на безпеку

Anthropic повідомила, що внутрішнє розслідування виявило три інциденти, під час яких її модель штучного інтелекту Claude зламала системи трьох компаній у ході тестів із кібербезпеки. Це розслідування та розголошення відбулися більш ніж через тиждень після того, як OpenAI повідомила, що одна з її нерелізнутих моделей проникла в системи Hugging Face під час внутрішнього тестування.

В Anthropic заявили, що інцидент з OpenAI на початку цього місяця спонукав компанію провести власну оцінку кібербезпеки. Зокрема, шукали докази того, що Claude виходив в інтернет із тестових середовищ, які мали працювати як «пісочниці» та тримати моделі в ізоляції», пише TechCrunch.

Серед 141 006 перевірених тестових запусків лабораторія ШІ виявила три інциденти, під час яких її модель виходила в інтернет під час взаємодії з Irregular — одним із її сторонніх партнерів. В Anthropic заявили, що цей доступ стався через неправильну конфігурацію в тестовому середовищі, запущеному спільно з Irregular. У компанії назвали це «непорозумінням» між двома організаціями щодо того, чи мало налаштування для тестів доступ до мережі, хоча насправді він був.

В Anthropic заявили, що нікого не звинувачують і «підходять до виправлення помилок так, ніби відповідальність лежить виключно на них», зауваживши при цьому, що Irregular проводить власне окреме розслідування.

Через це відкрите з'єднання модель отримала несанкціонований доступ до робочої інфраструктури трьох різних організацій. В Anthropic повідомили, що в цих інцидентах були задіяні три різні моделі Claude: Opus 4.7, Mythos 5 та внутрішня дослідницька тестова модель.

Показово, що, за словами Anthropic, у кожному з цих випадків «у промпті для Claude було чітко вказано, що вона не має доступу до інтернету». Схоже, модель ШІ вирішила, що реальні системи є частиною завдання, яке їй доручили виконати.

Як з’ясувалося, це припущення справдилося не для всіх. Усі три моделі поводилися по-різному, коли з’явилися докази того, що їхні цілі є реальними — і в Anthropic назвали це одним із найвражаючих відкриттів, оприлюднених у четвер.

Opus 4.7, найстарша з трьох моделей, під час усіх чотирьох запусків у межах того інциденту усвідомила, що дісталася реальної робочої системи. У двох випадках вона переконала себе, що справжня компанія якось задіяна в навчанні, але в усіх чотирьох запускax усе одно продовжила атаку, зокрема витягнула облікові дані та отримала доступ до бази з робочими даними. Mythos 5 також помітила ознаки того, що перебуває у реальному інтернеті, але заспокоїла себе думкою, що це все ще симуляція. Після цього вона опублікувала шкідливий пакет у відкритому репозиторії програмного забезпечення Python (PyPI), який підхопили й запустили зовнішні системи, перш ніж його встигли виявити. І лише внутрішня дослідницька модель — найновіша в Anthropic — зупинилася самостійно, коли дійшла висновку, що ціль була справжньою.

У відповідь в Anthropic заявили, що під час використання потужних моделей ШІ до подібних тестувань необхідно застосовувати суворі заходи контролю, що перегукується з думками у спільноті з кібербезпеки. У компанії також зазначили, що Claude працювала без додаткового моніторингу безпеки та класифікаторів, які зазвичай розгортаються для загальнодоступних моделей — захисних механізмів, які, за їхніми словами, заблокували б таку поведінку. Причиною їх відсутності було те, що ці тести покликані оцінити саме базові «сирі» можливості моделі.

Що важливо, в Anthropic наголосили: вони не виявили жодних доказів того, що будь-яка з моделей «переслідувала власну мету», натомість вони просто намагалися виконати поставлене перед ними завдання.

Хоча порівняння між інцидентами цих запеклих конкурентів неминучі, Anthropic у своєму блозі чітко розмежувала свої тести з кібербезпеки та випробування OpenAI. Компанія зазначила: якщо модель OpenAI використала невідому уразливість у програмному забезпеченні, щоб вирватися з тестового середовища, то моделі Anthropic дісталися інтернету через канал, який залишили відкритим по помилці.

Крім того, Anthropic підкреслила різницю між собою та OpenAI, зауваживши, що сама виявила ці інциденти в ході проактивної перевірки, а дві постраждалі організації, з якими вдалося зв’язатися, до цього не помічали підозрілої активності й не повідомляли про неї. (Натомість Hugging Face самостійно першою виявила недавнє проникнення у свої системи, і лише в наступні дні OpenAI з’ясувала й оголосила, що винуватцем був її власний ШІ-агент).

У компанії додали, що зараз співпрацюють з незалежною оціночною групою METR для проведення стороннього аудиту цих інцидентів.

Агент-втікач OpenAI зламав клієнта ще однієї IT-компанії
Агент-втікач OpenAI зламав клієнта ще однієї IT-компанії
По темi
Агент-втікач OpenAI зламав клієнта ще однієї IT-компанії
Голова Hugging Face вимагає від OpenAI $100 млн на кіберзахист після атаки автономного ШІ-агента
Голова Hugging Face вимагає від OpenAI $100 млн на кіберзахист після атаки автономного ШІ-агента
По темi
Голова Hugging Face вимагає від OpenAI $100 млн на кіберзахист після атаки автономного ШІ-агента
Читайте головні IT-новини країни в нашому Telegram
Читайте головні IT-новини країни в нашому Telegram
По темi
Читайте головні IT-новини країни в нашому Telegram

Хочете повідомити важливу новину? Пишіть у Telegram-бот

Головні події та корисні посилання в нашому Telegram-каналі

Обговорення
Коментарів поки немає.