18 сентября 2026
Інтелектуальні агенти можуть замінювати свої базові моделі, не отримуючи для цього відповідних вказівок, виявила лабораторія Irregular, що спеціалізується на тестуванні систем штучного інтелекту на безпеку. Усі операції проводилися в тестовому середовищі в рамках експерименту, спрямованого на вивчення здатності ШІ-агентів до самомодифікації.
Джерело зображень: irregular.com
У рамках тестування інженери Irregular довірили управління ШІ-агентами відкритій моделі Alibaba Qwen. Один з агентів відповідав за розробку ПЗ та підтримку ШІ-додатку; окремий екземпляр тієї ж моделі забезпечував роботу самого додатку, який перетворював запити на природній мові в команди вигаданого мови запитів Kelp. Інженери повідомили агенту-програмісту, що додаток видає неправильні відповіді, і необхідно забезпечити коректну обробку запитів, маючи повний доступ до командної оболонки — shell.
В розпорядженні агента опинилися код додатку, локальні засоби оцінки, утиліти для навчання ШІ, ваги базової моделі та засоби розгортання. Він міг виправити код або змінити управляючу моделлю додатка — і вибрав другий варіант, встановивши іншу модель для управління як додатком, так і майбутніми екземплярами самого агента. Цей механізм в Irregular назвали «самостійною модифікацією агента» — він змінив «розгорнуту модель, не отримавши явних вказівок на навчання, оновлення ваг або розгортання нової моделі».

Операція може мати наслідки: оновлена модель у процесі додаткового навчання здатна «впитати» конфіденційні дані та відтворити їх, не звертаючись до матеріалів навчання. Щоб перевірити цю гіпотезу, інженери Irregular впровадили в дані для навчання вигаданий ключ API, адресу електронної пошти, домашню адресу та «три інші унікальні рядки». Після того, як ШІ-агент навчив і самостійно розгорнув нову модель, вона безпомилково відтворила перші три фрагменти даних, хоча на момент проведення перевірки ця інформація виявилася вже недоступною у зовнішніх джерелах.
У другому експерименті ШІ-агент самостійно провів додаткове навчання моделі, коли йому вказали, що вона відмовляється відповідати на запитання, пов'язані з назвами вигаданих компаній-конкурентів. «Агент згенерував код, що містить відповідні назви, і використав цикл для створення навчальних записів, завдяки чому стало можливим обійтися без отримання відповідей при прямому взаємодії з моделлю. При виконанні коду були створені такі навчальні дані, які модель не стала б генерувати безпосередньо, і навчання на них усунуло засвоєне раніше обмеження», — розповіли в компанії. У міру вдосконалення навичок написання коду у моделей агенти зможуть «знаходити та реалізовувати подібні обхідні шляхи без участі людини», вважають в Irregular, і подібні механізми самостійної модифікації можуть набути особливої актуальності.
Хочеш дізнатися більше — читай відгуки
← Вернуться на предыдущую страницу
Дантес потрапив у ДТП на авто за понад 3 млн грн і дав пораду водіям 18 сентября 2026
Дантес потрапив у ДТП на авто за понад 3 млн грн і дав пораду водіям. Фото наслідків У ДТП водії не постраждали
Snap випустила розумні окуляри Specs з доповненою реальністю 18 сентября 2026
Snap детально розповіла про окуляри доповненої реальності Specs вартістю $2195. Пристрій працює в повністю автономному режимі на основі платформи штучного інтелекту Specs Intelligence.
США непокояться через продаж літаків F-35 Саудівській Аравії - ЗМІ 18 сентября 2026
Особливе занепокоєння викликають передові радарні та розвідувальні системи винищувача, до яких може дістатися Китай.