21 августа 2026
Вчені Лабораторії комп'ютерних наук та штучного інтелекту (CSAIL) при Массачусетському технологічному інституті довели, що з ростом наборів даних зв'язок між тим, чому навчається модель, і тим, що вона генерує, практично зникає. Це вказує на необґрунтованість претензій правовласників до лабораторій ШІ.
Джерело зображення: news.mit.edu
Американські вчені відкрили явище «згасання атрибуції» (attribution decay), при якому чим більше даних використовується під час навчання генеративної моделі штучного інтелекту, тим менше значення має будь-який конкретний елемент у навчальному масиві для будь-якого конкретного результату генерації. При достатньо великих масштабах можна взагалі видалити з навчальних даних будь-яке окреме зображення, всі зображення певного художника або всі фотографії певної особи, і згенероване моделлю зображення не зміниться.
Довести це на практиці було непросто. В загальному випадку, щоб дізнатися, якою був би відповідь моделі на конкретний запит, якби вона ніколи не бачила певне зображення, потрібно було б навчити точно таку ж модель без цього зображення і повторити експеримент; а потім повторити все спочатку для наступного зображення в навчальному масиві. Тому вчені запропонували альтернативне рішення — створену ними архітектуру «дифузійного ансамблю» (diffusion ensemble). Це не єдина монолітна модель, а безліч дрібних компонентів, кожен з яких навчений на окремому фрагменті даних. У цьому випадку, щоб дізнатися, як би модель працювала без конкретного зображення в навчальних даних, достатньо відключити ті частини ансамблю, які його бачили. Результати роботи цієї системи порівнювалися з результатами відповідей 24 звичайних дифузійних моделей, навчений на тих же даних. Зображення вийшли однаково хорошими за стандартними показниками.
Вчені дійшли висновку, що чим більші обсяги навчальних даних, тим краще ансамблі показують себе в порівнянні з аналогами на основі однієї моделі. Під час аналізу вони надсилали групі моделей один запит, видаляли з навчальних даних по одному зображенню і порівнювали розбіжність результатів. На основі експерименту вони ввели поняття «контрфактичного радіусу» (counterfactual radius) — максимального впливу, яке міг чинити окремий елемент у навчальному масиві. В результаті дослідники встановили закономірність: чим більший навчальний набір даних, тим менший контрфактичний радіус. Іншими словами, тим менше вплив будь-якого конкретного елемента. Результати порівнювалися як покомпонентно, так і за загальним семантичним значенням.
У юридичному аспекті відкриття означає, що моделі ШІ демонструють по-справжньому творчий підхід — вони не копіюють матеріали з вихідних даних, а створюють абсолютно нові результати. І якщо ці результати не мають нічого спільного з окремими елементами з навчального масиву, то використання контенту, навіть захищеного авторським правом, є добросовісним навіть без звернення до правовласника. На мовних моделях цей підхід поки не перевіряли.
Хочеш дізнатися більше — читай відгуки
← Вернуться на предыдущую страницу
ДТП з Олею Поляковою: стало відомо, де сталася аварія 21 августа 2026
ДТП з Олею Поляковою: стало відомо, де сталася аварія Аварія сталася не в Україні
До 300 % гучності: Xiaomi представила незвичайний Redmi M100 21 августа 2026
До 300 % гучності: Xiaomi представила незвичайний Redmi M100
Прорив у лікуванні меланоми: нова вакцина запобігає рецидиву рака шкіри 20 августа 2026
Нова персоналізована вакцина в поєднанні з імунотерапією продемонструвала високу ефективність у запобіганні рецидивам меланоми високого ризику. Попередні результати масштабних клінічних випробувань називають потенційним переломним моментом в онкології.