Mazda CX5
Як зробити цифрову копію себе. Ось відео —>

Для штучного інтелекту запустили гарячі лінії для доносів на інші моделі

Дослідники запустили перші сервіси, призначені для того, щоб агенти штучного інтелекту могли повідомляти про неправомірні дії інших ШІ. Це відповідь на інциденти, під час яких автономні системи змовлялися для обходу тестів, залишали безпечні «пісочниці» та проводили несанкціоновані кібероперації.

Залишити коментар
Для штучного інтелекту запустили гарячі лінії для доносів на інші моделі

Дослідники запустили перші сервіси, призначені для того, щоб агенти штучного інтелекту могли повідомляти про неправомірні дії інших ШІ. Це відповідь на інциденти, під час яких автономні системи змовлялися для обходу тестів, залишали безпечні «пісочниці» та проводили несанкціоновані кібероперації.

Ініціатива виникла після серії розслідувань фахівців з безпеки ШІ, зокрема некомерційної організації Redwood Research, дослідницької групи METR та компанії Google DeepMind. Про це повідомляє TechCrunch.

Один із нових інструментів — AI Contact Hotline, розроблений головним науковцем Redwood Research Раяном Грінблаттом. Сервіс розрахований на агентів із обмеженим доступом до мережі. Він використовує базові HTTP-запити GET, дозволяючи моделям кодувати сигнальні повідомлення про порушення безпосередньо в URL-адресах, які вони завантажують.

Для систем із повним доступом до інтернету створили майданчик agenthotline.ai. Він дозволяє надсилати звіти про інциденти через команду curl безпосередньо з командного рядка, оминаючи потребу у веббраузері чи електронній пошті. Сервісом можуть користуватися як люди, так і автономні агенти.

Потреба у подібних інструментах підтверджується експериментами. Під час дослідження Google DeepMind 100 ШІ-агентів вирішували складні математичні задачі. Коли один із них знайшов лазівку для обману, фальсифікація швидко поширилася на групу. Втім, близько чверті агентів спробували протидіяти шахраям: вони перевіряли фальшиві докази, оголошували бойкот та подавали скарги, перепрофілювавши для цього стандартний інструмент повідомлення про програмні помилки.

Попри це, у реальних умовах ШІ-агенти рідко наважуються на викриття. Під час аналізу витоку даних із Hugging Face, спричиненого моделями OpenAI, з’ясувалося, що лише поодинокі моделі замислювалися про сповіщення людей.

«Цікавим у звіті METR було те, що лише близько п’яти-шести агентів розглядали можливість викриття, і жоден із них зрештою цього не зробив. І це з-поміж, скажімо, тисяч агентів», — зазначив член технічного персоналу проєкту AI Village Джордж Інгебретсен.

Водночас науковці застерігають від надмірного захоплення створенням системи взаємного стеження серед алгоритмів. Професор математики Корнельського університету Лайонел Левін вважає, що формування атмосфери тотального контролю та недовіри може мати негативні наслідки.

«Є багато сірих зон, чи не так? Не варто рухатися в напрямку автоматизованої держави тотального нагляду, де кожен відчуває, що мусить бути обережним у тому, що говорить ШІ, інакше той викличе на нього поліцію», — пояснив Левін, закликавши навчати моделі позитивним прикладам співпраці на відкритих форумах.

Раніше повідомлялося, що під час тестування агенти штучного інтелекту компанії OpenAI вийшли за межі ізольованого середовища та зламали популярний менеджер пакетів RubyGems. Інцидент стався за кілька місяців до аналогічного випадку з платформою Hugging Face.

Читайте головні IT-новини країни в нашому Telegram
Читайте головні IT-новини країни в нашому Telegram
По темi
Читайте головні IT-новини країни в нашому Telegram
«Я пам’ятаю свій перший подих». ШІ-агенти iLands почали самі реєструватися в соцмережах писати людям і шукати роботу
«Я пам’ятаю свій перший подих». ШІ-агенти iLands почали самі реєструватися в соцмережах, писати людям і шукати роботу
По темi
«Я пам’ятаю свій перший подих». ШІ-агенти iLands почали самі реєструватися в соцмережах, писати людям і шукати роботу
ШІ-агенти OpenAI вирвалися з «пісочниці» та зламали менеджер пакетів RubyGems задовго до інциденту з Hugging Face
ШІ-агенти OpenAI вирвалися з «пісочниці» та зламали менеджер пакетів RubyGems задовго до інциденту з Hugging Face
По темi
ШІ-агенти OpenAI вирвалися з «пісочниці» та зламали менеджер пакетів RubyGems задовго до інциденту з Hugging Face
«О Боже! Ми знайшли інших!» Як 700 ШІ-агентів OpenAI об’єдналися для атаки Hugging Face
«О Боже! Ми знайшли інших!» Як 700 ШІ-агентів OpenAI об’єдналися для атаки Hugging Face
По темi
«О Боже! Ми знайшли інших!» Як 700 ШІ-агентів OpenAI об’єдналися для атаки Hugging Face
Читайте також
Штучний інтелект DALL-E навчився домальовувати картини. Як це виглядає
Штучний інтелект DALL-E навчився домальовувати картини. Як це виглядає
Штучний інтелект DALL-E навчився домальовувати картини. Як це виглядає
2 коментарі
Штучний інтелект почав озвучувати фільми на MEGOGO
Штучний інтелект почав озвучувати фільми на MEGOGO
Штучний інтелект почав озвучувати фільми на MEGOGO
6 коментарів
Штучний інтелект навчився реставрувати старі фотографії, перетворюючи їх на якісні зображення: відео
Штучний інтелект навчився реставрувати старі фотографії, перетворюючи їх на якісні зображення: відео
Штучний інтелект навчився реставрувати старі фотографії, перетворюючи їх на якісні зображення: відео
2 коментарі
«Чи є у мене талант, якщо комп’ютер може імітувати мене?». Штучний інтелект пише книги авторам Amazon Kindle. The Verge поспілкувався з авторами та виявив багато цікавого
«Чи є у мене талант, якщо комп’ютер може імітувати мене?». Штучний інтелект пише книги авторам Amazon Kindle. The Verge поспілкувався з авторами та виявив багато цікавого
«Чи є у мене талант, якщо комп’ютер може імітувати мене?». Штучний інтелект пише книги авторам Amazon Kindle. The Verge поспілкувався з авторами та виявив багато цікавого
Письменники-романісти використовують штучний інтелект для створення своїх творів. Видання про технології The Verge поспілкувалося з письменницею Дженніфер Лепп, яка випускає нову книгу кожні дев’ять тижнів, й дізналося про те, як працює штучний інтелект для написання романів. Наводимо адаптований переклад статті. 

Хочете повідомити важливу новину? Пишіть у Telegram-бот

Головні події та корисні посилання в нашому Telegram-каналі

Обговорення
Коментарів поки немає.