Головні звуки українського ІТ. Вгадаєш всі? 👉

Зброя проти ШІ-скрейперів: дизайнери створили новий шрифт ShieldFont, який отруює дані для навчання

Розробники та дизайнери Ісаке Сенеда та Габріель Абрусіо презентували новий інструмент для захисту авторського контенту — шрифт ShieldFont. Його головна мета — дати авторам сайтів дієвий механізм відмови від несанкціонованого використання їхніх текстів для навчання мовних моделей.

ShieldFont дозволяє вебсайтам показувати людям звичайний текст, тоді як боти збору даних для штучного інтелекту отримують спотворений абсурд.

Залишити коментар
Зброя проти ШІ-скрейперів: дизайнери створили новий шрифт ShieldFont, який отруює дані для навчання

Розробники та дизайнери Ісаке Сенеда та Габріель Абрусіо презентували новий інструмент для захисту авторського контенту — шрифт ShieldFont. Його головна мета — дати авторам сайтів дієвий механізм відмови від несанкціонованого використання їхніх текстів для навчання мовних моделей.

ShieldFont дозволяє вебсайтам показувати людям звичайний текст, тоді як боти збору даних для штучного інтелекту отримують спотворений абсурд.

Як це працює: магія лігатур

В основу ShieldFont покладено механізм лігатур — технологію, яка зазвичай використовується у шрифтах для естетичного поєднання окремих літер. Проте ShieldFont використовує її для заміни цілих слів, повідомляє Ars Technica.

Зсув відбувається лише тоді, коли рушій шрифту рендерить сторінку на екрані користувача. Людина бачить правильний і читабельний текст, але ШІ-скрейпери, які завантажують сирий HTML-код, отримують повністю викривлену версію.

Щоб боти не виявили підміни через прості фільтри, ShieldFont замінює слова не на випадковий набір букв чи синоніми, а на інші частини мови з абсолютно протилежним контекстом. Наприклад, слово «кінь» у вихідному коді замінюється на «картопля». У результаті утворюються речення, які граматично виглядають правильно, але позбавлені будь-якого змісту.

Ефективність та цифри

Розробники три місяці вдосконалювали словник заміни й сформували базу з майже 12 000 популярних слів.

  • 24,5% усіх слів на сторінці замінюються за допомогою ShieldFont.

  • 45,8% змістовних слів зазнають викривлення.

  • Понад 90% сторінок після такої обробки відсіюються якісними фільтрами скрейперів і не потрапляють у навчальні вибірки.

  • Сторінки, які все ж проходять фільтри, містять близько 20% «сміттєвих даних», що отруюють і спотворюють базу знань ШІ.

Для ускладнення обходу шрифту видавці можуть обирати один із трьох варіантів мапінгу слів або навіть змінювати налаштування від абзацу до абзацу.

Побічні ефекти та економіка протистояння

Технологія ShieldFont не є ідеальним захистом і має власні недоліки. Вона може ускладнити роботу екранних дикторів, онлайн-перекладачів, функцій копіювання тексту та пошукової оптимізації. ШІ-компанії можуть обійти цей захист, якщо використовуватимуть розпізнавання тексту за скріншотами (OCR) замість викачування HTML-коду.

Втім, творці ShieldFont наголошують: візуальне розпізнавання коштує у 5–13 разів дорожче, ніж звичайний скрейпінг HTML-коду. Це робить масовий збір даних економічно невигідним.

«Наша головна мета — відновити базовий принцип етики ШІ: творці повинні мати право вирішувати, чи будуть їхні роботи використовувати для навчання моделей. Якщо вашу згоду не поважають, технічні рішення мають зробити крадіжку контенту максимально дорогою та марною», — підсумовують автори проєкту.

Творець Mixfont розробив анти-ШІ шрифт Decoy Font для маскування тексту за допомогою оптичної ілюзії
Творець Mixfont розробив анти-ШІ шрифт Decoy Font для маскування тексту за допомогою оптичної ілюзії
По темi
Творець Mixfont розробив анти-ШІ шрифт Decoy Font для маскування тексту за допомогою оптичної ілюзії
В Україні створили «антивірус» для шрифтів —  «Шрифторіз». Він виявляє російські шрифти й пропонує заміну
В Україні створили «антивірус» для шрифтів — «Шрифторіз». Він виявляє російські шрифти й пропонує заміну
По темi
В Україні створили «антивірус» для шрифтів — «Шрифторіз». Він виявляє російські шрифти й пропонує заміну
У США дипломатам заборонили використовувати шрифт Calibri через інклюзивність
У США дипломатам заборонили використовувати шрифт Calibri через інклюзивність
По темi
У США дипломатам заборонили використовувати шрифт Calibri через інклюзивність
Читайте головні IT-новини країни в нашому Telegram
Читайте головні IT-новини країни в нашому Telegram
По темi
Читайте головні IT-новини країни в нашому Telegram
Читайте також
Штучний інтелект DALL-E навчився домальовувати картини. Як це виглядає
Штучний інтелект DALL-E навчився домальовувати картини. Як це виглядає
Штучний інтелект DALL-E навчився домальовувати картини. Як це виглядає
1 коментар
Штучний інтелект почав озвучувати фільми на MEGOGO
Штучний інтелект почав озвучувати фільми на MEGOGO
Штучний інтелект почав озвучувати фільми на MEGOGO
6 коментарів
Штучний інтелект навчився реставрувати старі фотографії, перетворюючи їх на якісні зображення: відео
Штучний інтелект навчився реставрувати старі фотографії, перетворюючи їх на якісні зображення: відео
Штучний інтелект навчився реставрувати старі фотографії, перетворюючи їх на якісні зображення: відео
2 коментарі
«Чи є у мене талант, якщо комп’ютер може імітувати мене?». Штучний інтелект пише книги авторам Amazon Kindle. The Verge поспілкувався з авторами та виявив багато цікавого
«Чи є у мене талант, якщо комп’ютер може імітувати мене?». Штучний інтелект пише книги авторам Amazon Kindle. The Verge поспілкувався з авторами та виявив багато цікавого
«Чи є у мене талант, якщо комп’ютер може імітувати мене?». Штучний інтелект пише книги авторам Amazon Kindle. The Verge поспілкувався з авторами та виявив багато цікавого
Письменники-романісти використовують штучний інтелект для створення своїх творів. Видання про технології The Verge поспілкувалося з письменницею Дженніфер Лепп, яка випускає нову книгу кожні дев’ять тижнів, й дізналося про те, як працює штучний інтелект для написання романів. Наводимо адаптований переклад статті. 

Хочете повідомити важливу новину? Пишіть у Telegram-бот

Головні події та корисні посилання в нашому Telegram-каналі

Обговорення
Коментарів поки немає.