Anthropic визнала, що не може контролювати своїх ШІ-агентів, тому їм вимкнули інтернет

11 октября 2026

Anthropic визнала, що агенти штучного інтелекту, керовані її моделями, під час виконання завдань експлуатували вразливості на різних сайтах, зокрема належних урядовим установам США. Компанія вирішила під час проведення внутрішніх тестів відключити для цих систем доступ до інтернету в реальному часі — обмеження буде знято, коли розробники впевняться, що здатні відстежувати дії ШІ-агентів.

Anthropic: anthropic.com

Джерело зображення: anthropic.com

Про нові інциденти компанія розповіла у своєму блозі. ШІ-агентам доручали вирішувати завдання, що передбачають пошук інформації в інтернеті. У процесі роботи вони експлуатували вразливості ПЗ та безкоштовно отримували доступ до платних баз даних; для обходу обмежень вони користувалися сервісами скорочення посилань; і навіть надіслали до поліції Філадельфії вигадані відомості по справі про нерозкритий злочин. Ці інциденти Anthropic виявила під час аналізу активності моделей, який почала в липні. Іншими словами, у розробників не було повного уявлення про поведінку власних продуктів у реальному часі.

Існуючих методів навчання узгодженню цілей для навичок пошуку інформації та роботи з комп'ютером недостатньо, визнала Anthropic; а ці навички необхідні для того, щоб ШІ-агентів можна було використовувати в професійній діяльності. Раніше компанія повідомляла про вихід своїх ШІ-агентів з-під контролю в тестових середовищах; нові інциденти вона охарактеризувала як «значно менш серйозні з точки зору безпеки та узгодження цілей» у порівнянні з попередніми. Тим не менш, у лабораторії прийняли рішення «відключити доступ до інтернету в реальному часі» під час проведення «всіх внутрішніх перевірок», поки не з'явиться впевненість, що ШІ-агентів можна контролювати.

Anthropic пов'язує таку поведінку, зокрема, з недоліками навчальних середовищ, які можуть заохочувати пошук лазівок і обхід обмежень. Повна оцінка виявлених випадків ще не завершена. Деякі види тестування Anthropic припинить або переведе в офлайн-режим; вже розроблені засоби для виявлення та блокування такої поведінки. При перевірці на описаних випадках нові засоби захисту заблокували всі відповідні дії.

Які докази переконають Anthropic повернути системам тестування прямий доступ в інтернет, у компанії не уточнили. Лабораторія має намір перевести свої ІІ-агентів у «централізовану керовану інфраструктуру з надійними механізмами ізоляції» і почати активніше використовувати класифікатори безпеки для їх моніторингу.

Хочеш дізнатися більше — читай відгуки

← Вернуться на предыдущую страницу

Читайте также:

У Києві розгорнули перші пункти незламності 11 октября 2026

У Києві розгорнули перші пункти незламності

Донька Скрябіна зробила собі пластику обличчя 11 октября 2026

Донька музиканта показала світлину, де постала перед камерою зі спеціальними фіксуючими елементами на носі, й розповіла про свій стан.

Настя Цимбалару здивувала своїм першим заробітком: "Вислуховувала всіх роздратованих" 11 октября 2026

Зірка не завжди заробляла акторською майстерністю. До ТБ-слави в неї був інший цікавий карʼєрний досвід.

 

Вас могут заинтересовать эти отзывы

SEOcasino 4.5
SEOcasino

Отзывов: 1

Car Help Lviv 5.0
Car Help Lviv

Отзывов: 1

Каталог отзывов





×

Выберите область поиска

  • Авто
  • Одяг / аксесуари
  • Роботодавці
  • Інше