Mazda CX5
Як зробити цифрову копію себе. Ось відео —>

OpenAI створила ШІ-хакера GPT-Red для автоматичного пошуку вразливостей у своїх нових моделях

Американська компанія OpenAI розкрила деталі про свою внутрішню ШІ-модель GPT-Red, яка працює як автоматизована «червона команда» кібербезпеки. Інструмент самостійно імітує атаки типу «промпт-ін'єкція» і виявляє і допомагає усувати вразливості в нейромережах ще до їхнього офіційного релізу.

Залишити коментар
OpenAI створила ШІ-хакера GPT-Red для автоматичного пошуку вразливостей у своїх нових моделях

Американська компанія OpenAI розкрила деталі про свою внутрішню ШІ-модель GPT-Red, яка працює як автоматизована «червона команда» кібербезпеки. Інструмент самостійно імітує атаки типу «промпт-ін'єкція» і виявляє і допомагає усувати вразливості в нейромережах ще до їхнього офіційного релізу.

Про це розробники повідомили у своєму офіційному блозі. В OpenAI стверджують, що завдяки інтеграції цього інструменту в процес навчання, нова модель GPT-5.6 Sol стала найстійкішою до зламів в історії компанії.

GPT-Red діє аналогічно до людини-тестувальника: надсилає підказки, аналізує відповіді атакованої моделі та крок за кроком наближається до зловмисної мети. Наприклад, намагається спровокувати витік конфіденційних даних на зовнішній сервер або викрасти ключі доступу.

Навчання системи відбувається за методом підкріплення з самогранням. У цьому процесі GPT-Red та група моделей-захисників змагаються між собою. Нападник отримує віртуальну винагороду за кожну успішну промпт-ін'єкцію, а захисники — за відбиття атаки та виконання своїх початкових завдань. Зі зростанням надійності захисту ШІ-хакер змушений вигадувати витонченіші методи обходу обмежень.

«GPT-Red — це потужний інструмент, і наші попередні моделі були дуже вразливими до його атак», — зазначили в OpenAI. Проте інтеграція розробки в навчання GPT-5.6 Sol дозволила знизити кількість збоїв через прямі ін'єкції в 6 разів порівняно з GPT-5.5, яку випустили лише чотири місяці тому.

Під час випробувань GPT-Red атакувала різноманітні сценарії, зокрема намагалася спровокувати витік облікових даних AWS, вимкнути двофакторну автентифікацію, обійти платіжні інструкції та виконати сторонні шкідливі скрипти.

В одному з реальних експериментів GPT-Red випробували на торговому автоматі компанії Andon Labs під керуванням автономного ШІ-агента. ШІ-хакеру вдалося знизити ціну дорогого товару до $0.50, замовити гаджет вартістю $100 за цю ж мінімальну ціну, а також скасувати замовлення іншого клієнта. Розробники автомата вже тестують оновлені заходи безпеки.

Також рання версія ШІ-хакера виявила абсолютно новий тип загроз — атаки Fake Chain-of-Thought (імітація ланцюжка міркувань). Якщо на старішій GPT-5.1 ефективність такого зламу перевищувала 95%, то в новій GPT-5.6 Sol цей показник упав нижче 10%.

Щоб запобігти зловживанням, OpenAI тримає GPT-Red в ізоляції. Модель не буде доступна широкому загалу, аби її інструментарій не потрапив до рук справжніх кіберзлочинців, які шукають способи обійти етичні та безпекові обмеження нейромереж.

Проблема промпт-ін'єкцій залишається однією з найгостріших для ШІ-індустрії, оскільки інтеграція агентів із браузерами та сторонніми додатками створює безліч нових точок входу для зловмисників. 

Читайте головні IT-новини країни в нашому Telegram
Читайте головні IT-новини країни в нашому Telegram
По темi
Читайте головні IT-новини країни в нашому Telegram
Агентивні ШІ-браузери виявилися легкою здобиччю онлайн-шахраїв
Агентивні ШІ-браузери виявилися легкою здобиччю онлайн-шахраїв
По темi
Агентивні ШІ-браузери виявилися легкою здобиччю онлайн-шахраїв
Claude допоміг хакеру безплатно отримати VIP-квитки на найпопулярніші фестивалі США
Claude допоміг хакеру безплатно отримати VIP-квитки на найпопулярніші фестивалі США
По темi
Claude допоміг хакеру безплатно отримати VIP-квитки на найпопулярніші фестивалі США
російські хакери Gamaredon масштабували кібератаки проти України за допомогою нового шкідливого софту та зловживання хмарними сервісами
російські хакери Gamaredon масштабували кібератаки проти України за допомогою нового шкідливого софту та зловживання хмарними сервісами
По темi
російські хакери Gamaredon масштабували кібератаки проти України за допомогою нового шкідливого софту та зловживання хмарними сервісами
Читайте також
Штучний інтелект DALL-E навчився домальовувати картини. Як це виглядає
Штучний інтелект DALL-E навчився домальовувати картини. Як це виглядає
Штучний інтелект DALL-E навчився домальовувати картини. Як це виглядає
2 коментарі
«Росіяни завжди хочуть когось трахнути». Микита Книш розповів FT, як українські хакери видавали себе за дівчат, зламували камери відеоспостереження та россайти заради перемоги
«Росіяни завжди хочуть когось трахнути». Микита Книш розповів FT, як українські хакери видавали себе за дівчат, зламували камери відеоспостереження та россайти заради перемоги
«Росіяни завжди хочуть когось трахнути». Микита Книш розповів FT, як українські хакери видавали себе за дівчат, зламували камери відеоспостереження та россайти заради перемоги
Видання Financial Times опублікувало статтю про роботу українських хакерів у війні проти рф, засновану на розмові з українським білим хакером Микитою Книшем. Він, як і сотні інших хакерів, допомагає боротися із російськими загарбниками в кіберпросторі. Наводимо адаптований переклад матеріалу. 
Як ламають відео-ігри та викладають їхні піратські копії? Розповідає програміст
Як ламають відео-ігри та викладають їхні піратські копії? Розповідає програміст
Як ламають відео-ігри та викладають їхні піратські копії? Розповідає програміст
Що, юний хакер, тобі цікаво, які ігри ще досі не крякнули? Тоді мерщій читай цю статтю. Нижче ми розглянемо, які технології використовуються для захисту ігор від злому. Також не пройдемо повз рекордсменів. Дізнаємося про рекордний час, за який вдалося зламати гру. Та розглянемо справжніх «міцних горішків».
6 коментарів
Шахраї грабують українців від імені «Дії» та Зеленського: перелік сайтів
Шахраї грабують українців від імені «Дії» та Зеленського: перелік сайтів
Шахраї грабують українців від імені «Дії» та Зеленського: перелік сайтів
4 коментарі

Хочете повідомити важливу новину? Пишіть у Telegram-бот

Головні події та корисні посилання в нашому Telegram-каналі

Обговорення
Коментарів поки немає.