Інтелектуальні агенти навчилися змінювати себе без участі людини і це насторожує

18 сентября 2026

Інтелектуальні агенти можуть замінювати свої базові моделі, не отримуючи для цього відповідних вказівок, виявила лабораторія Irregular, що спеціалізується на тестуванні систем штучного інтелекту на безпеку. Усі операції проводилися в тестовому середовищі в рамках експерименту, спрямованого на вивчення здатності ШІ-агентів до самомодифікації.

Інтелектуальні агенти: irregular.com

Джерело зображень: irregular.com

У рамках тестування інженери Irregular довірили управління ШІ-агентами відкритій моделі Alibaba Qwen. Один з агентів відповідав за розробку ПЗ та підтримку ШІ-додатку; окремий екземпляр тієї ж моделі забезпечував роботу самого додатку, який перетворював запити на природній мові в команди вигаданого мови запитів Kelp. Інженери повідомили агенту-програмісту, що додаток видає неправильні відповіді, і необхідно забезпечити коректну обробку запитів, маючи повний доступ до командної оболонки — shell.

В розпорядженні агента опинилися код додатку, локальні засоби оцінки, утиліти для навчання ШІ, ваги базової моделі та засоби розгортання. Він міг виправити код або змінити управляючу моделлю додатка — і вибрав другий варіант, встановивши іншу модель для управління як додатком, так і майбутніми екземплярами самого агента. Цей механізм в Irregular назвали «самостійною модифікацією агента» — він змінив «розгорнуту модель, не отримавши явних вказівок на навчання, оновлення ваг або розгортання нової моделі».

Операція може мати наслідки: оновлена модель у процесі додаткового навчання здатна «впитати» конфіденційні дані та відтворити їх, не звертаючись до матеріалів навчання. Щоб перевірити цю гіпотезу, інженери Irregular впровадили в дані для навчання вигаданий ключ API, адресу електронної пошти, домашню адресу та «три інші унікальні рядки». Після того, як ШІ-агент навчив і самостійно розгорнув нову модель, вона безпомилково відтворила перші три фрагменти даних, хоча на момент проведення перевірки ця інформація виявилася вже недоступною у зовнішніх джерелах.

У другому експерименті ШІ-агент самостійно провів додаткове навчання моделі, коли йому вказали, що вона відмовляється відповідати на запитання, пов'язані з назвами вигаданих компаній-конкурентів. «Агент згенерував код, що містить відповідні назви, і використав цикл для створення навчальних записів, завдяки чому стало можливим обійтися без отримання відповідей при прямому взаємодії з моделлю. При виконанні коду були створені такі навчальні дані, які модель не стала б генерувати безпосередньо, і навчання на них усунуло засвоєне раніше обмеження», — розповіли в компанії. У міру вдосконалення навичок написання коду у моделей агенти зможуть «знаходити та реалізовувати подібні обхідні шляхи без участі людини», вважають в Irregular, і подібні механізми самостійної модифікації можуть набути особливої актуальності.

Хочеш дізнатися більше — читай відгуки

← Вернуться на предыдущую страницу

Читайте также:

Дантес потрапив у ДТП на авто за понад 3 млн грн і дав пораду водіям 18 сентября 2026

Дантес потрапив у ДТП на авто за понад 3 млн грн і дав пораду водіям. Фото наслідків У ДТП водії не постраждали

Snap випустила розумні окуляри Specs з доповненою реальністю 18 сентября 2026

Snap детально розповіла про окуляри доповненої реальності Specs вартістю $2195. Пристрій працює в повністю автономному режимі на основі платформи штучного інтелекту Specs Intelligence.

США непокояться через продаж літаків F-35 Саудівській Аравії - ЗМІ 18 сентября 2026

Особливе занепокоєння викликають передові радарні та розвідувальні системи винищувача, до яких може дістатися Китай.

 

Вас могут заинтересовать эти отзывы

Отличный сервис 4.9
Отличный сервис

Отзывов: 1

DonorUA 0.1
DonorUA

Отзывов: 1

Каталог отзывов





×

Выберите область поиска

  • Авто
  • Одяг / аксесуари
  • Роботодавці
  • Інше