UA RU EN

Вчені MIT з'ясували чому плагіат у ШІ неможливо довести

Дослідники з Массачусетського технологічного інституту виявили причини, чому ідентифікація плагіату в системах штучного інтелекту стає складним завданням. Фото: НВ — Техно

Дослідження генеративного штучного інтелекту

Дослідники з лабораторії MIT CSAIL з'ясували, що зі збільшенням обсягу даних для навчання генеративного штучного інтелекту практично неможливо визначити, які саме зображення вплинули на конкретний результат. Керівник дослідження Чжен Дай зазначив, що коли модель генерує зображення, виникає бажання вказати на конкретну частину навчальних даних, яка відповідальна за результат. Однак, в результаті проведеного дослідження це стало складніше.

У рамках дослідження вчені створили близько двох десятків власних дифузійних моделей, які навчали на наборах даних від кількох сотень до сотень тисяч зображень. Моделі тестувалися на фотографіях облич та роботах різних художників. У всіх випадках виявилося, що більший обсяг навчальних даних ускладнює визначення внеску конкретної роботи. Це явище дослідники назвали втратою атрибуції (attribution decay).

Метод дослідження та його наслідки

Метод дослідження полягав у порівнянні стандартного результату моделі з альтернативним, отриманим після видалення певних зображень із навчальних даних. Результати показали, що в умовах великих наборів даних зв'язок між конкретною роботою та результатом стає слабшим. Висновок дослідження свідчить про те, що для великих дифузійних моделей неможливо надійно встановити, яка конкретна робота спричинила появу певного елемента згенерованого зображення.

Ця проблема ускладнює митцям доведення того, що їхня конкретна робота безпосередньо спричинила появу зображення, створеного штучним інтелектом. Оскільки комерційні моделі значно масштабніші, встановити походження окремих елементів у них ще складніше. Автори дослідження наголошують на необхідності розуміння механізмів роботи таких моделей для подальшого дослідження технології та розробки правил її використання.

Ці findings мають значні наслідки для сфери мистецтва та захисту авторських прав, оскільки ускладнюють визначення, як і в якій мірі роботи художників впливають на результати генеративних моделей. Зростаюча популярність штучного інтелекту в креативних індустріях підкреслює важливість розробки нових стандартів і регуляцій, щоб забезпечити справедливість у використанні творчого контенту. Невизначеність, що виникає з втратою атрибуції, може призвести до юридичних та етичних викликів, які потребують глибшого розгляду.

У той час як дослідники MIT виявили складнощі у визначенні атрибуції в генеративному ШІ, інші компанії також шукають рішення для уникнення плагіату. Наприклад, Anthropic почала використовувати невидимий код для маркування текстів, що може стати важливим кроком у розв'язанні подібних проблем у сфері штучного інтелекту.