Почему доказать плагиат у нейросетей почти невозможно: выводы учёных из MIT
Что показало исследование генеративных моделей
Как сообщает НВ — Техно: Специалисты лаборатории MIT CSAIL установили: чем больше изображений используется при обучении генеративного ИИ, тем сложнее понять, какие именно образцы повлияли на итоговую картинку. Руководитель работы Чжен Дай отметил, что после создания изображения хочется связать результат с конкретным фрагментом обучающей выборки, однако проведённый эксперимент показал, что сделать это всё труднее. Для русскоязычных читателей эта тема особенно важна на фоне активных споров о правовом статусе контента, создаваемого нейросетями.
Учёные обучили около двадцати собственных диффузионных моделей. Объём данных варьировался от нескольких сотен до сотен тысяч изображений. Модели тестировали на фотографиях лиц и работах разных художников. Во всех случаях увеличение датасета ослабляло связь между конкретным произведением и полученным результатом. Этот эффект исследователи назвали утратой атрибуции, или attribution decay.
Методика и практическое значение
Чтобы выявить закономерность, специалисты сравнивали стандартный результат модели с вариантом, полученным после удаления из выборки определённых изображений. Оказалось, что при больших объёмах данных вклад отдельной работы становится почти неразличимым. Итог таков: для крупных диффузионных моделей невозможно достоверно установить, какое именно произведение привело к появлению конкретного элемента сгенерированной картинки.
Из-за этого художникам становится сложнее доказать, что их работа напрямую использовалась при создании изображения искусственным интеллектом. В коммерческих моделях, которые значительно масштабнее экспериментальных, отследить происхождение отдельных деталей ещё труднее. Авторы исследования подчёркивают, что необходимо лучше понимать внутренние процессы таких систем - это поможет и в дальнейшем изучении технологии, и в разработке правил её применения.
Полученные результаты затрагивают сферу искусства и защиты авторских прав, поскольку размывают границу между чужими работами и результатом работы генеративного ИИ. Популярность нейросетей в творческих индустриях делает вопрос о новых стандартах и нормативных правилах особенно острым. Неопределённость, вызванная утратой атрибуции, способна приводить к юридическим и этическим спорам, которые потребуют отдельного обсуждения.
В то время как исследование MIT поднимает важные вопросы о сложности определения авторства в контенте, созданном нейросетями, аналогичные проблемы возникают и в других областях. Например, новая разработка компании Anthropic предполагает внедрение скрытых маркеров для автоматического выявления ИИ-контента, что может стать шагом к улучшению прозрачности в этой сфере. Это подчеркивает необходимость более глубокого анализа и понимания процессов, происходящих в генеративных моделях.
Читайте также

