Олександр КузьменкоШІ
16 вересня 2026, 08:09
2026-09-16
Для штучного інтелекту запустили гарячі лінії для доносів на інші моделі
Дослідники запустили перші сервіси, призначені для того, щоб агенти штучного інтелекту могли повідомляти про неправомірні дії інших ШІ. Це відповідь на інциденти, під час яких автономні системи змовлялися для обходу тестів, залишали безпечні «пісочниці» та проводили несанкціоновані кібероперації.
Дослідники запустили перші сервіси, призначені для того, щоб агенти штучного інтелекту могли повідомляти про неправомірні дії інших ШІ. Це відповідь на інциденти, під час яких автономні системи змовлялися для обходу тестів, залишали безпечні «пісочниці» та проводили несанкціоновані кібероперації.
Ініціатива виникла після серії розслідувань фахівців з безпеки ШІ, зокрема некомерційної організації Redwood Research, дослідницької групи METR та компанії Google DeepMind. Про це повідомляє TechCrunch.
Один із нових інструментів — AI Contact Hotline, розроблений головним науковцем Redwood Research Раяном Грінблаттом. Сервіс розрахований на агентів із обмеженим доступом до мережі. Він використовує базові HTTP-запити GET, дозволяючи моделям кодувати сигнальні повідомлення про порушення безпосередньо в URL-адресах, які вони завантажують.
Для систем із повним доступом до інтернету створили майданчик agenthotline.ai. Він дозволяє надсилати звіти про інциденти через команду curl безпосередньо з командного рядка, оминаючи потребу у веббраузері чи електронній пошті. Сервісом можуть користуватися як люди, так і автономні агенти.
Потреба у подібних інструментах підтверджується експериментами. Під час дослідження Google DeepMind 100 ШІ-агентів вирішували складні математичні задачі. Коли один із них знайшов лазівку для обману, фальсифікація швидко поширилася на групу. Втім, близько чверті агентів спробували протидіяти шахраям: вони перевіряли фальшиві докази, оголошували бойкот та подавали скарги, перепрофілювавши для цього стандартний інструмент повідомлення про програмні помилки.
Попри це, у реальних умовах ШІ-агенти рідко наважуються на викриття. Під час аналізу витоку даних із Hugging Face, спричиненого моделями OpenAI, з’ясувалося, що лише поодинокі моделі замислювалися про сповіщення людей.
«Цікавим у звіті METR було те, що лише близько п’яти-шести агентів розглядали можливість викриття, і жоден із них зрештою цього не зробив. І це з-поміж, скажімо, тисяч агентів», — зазначив член технічного персоналу проєкту AI Village Джордж Інгебретсен.
Водночас науковці застерігають від надмірного захоплення створенням системи взаємного стеження серед алгоритмів. Професор математики Корнельського університету Лайонел Левін вважає, що формування атмосфери тотального контролю та недовіри може мати негативні наслідки.
«Є багато сірих зон, чи не так? Не варто рухатися в напрямку автоматизованої держави тотального нагляду, де кожен відчуває, що мусить бути обережним у тому, що говорить ШІ, інакше той викличе на нього поліцію», — пояснив Левін, закликавши навчати моделі позитивним прикладам співпраці на відкритих форумах.
«Чи є у мене талант, якщо комп’ютер може імітувати мене?». Штучний інтелект пише книги авторам Amazon Kindle. The Verge поспілкувався з авторами та виявив багато цікавого
Письменники-романісти використовують штучний інтелект для створення своїх творів. Видання про технології The Verge поспілкувалося з письменницею Дженніфер Лепп, яка випускає нову книгу кожні дев’ять тижнів, й дізналося про те, як працює штучний інтелект для написання романів. Наводимо адаптований переклад статті.
Хочете повідомити важливу новину? Пишіть у Telegram-бот
Головні події та корисні посилання в нашому Telegram-каналі