ШІ вже сам планує кібератаки — OpenAI, Anthropic та Google найняли стартап для пошуку «злого» поводження моделей

28 сентября 2026

Нейромережі продемонстрували здатність самостійно планувати кібератаки та копіювати риси поведінки людини, створюючи нові загрози для інформаційної безпеки. Для виявлення таких загроз OpenAI, Anthropic та Google DeepMind звернулися до стартапу Irregular, який проводить стрес-тести моделей у симульованих середовищах і вже залучив $80 млн при оцінці компанії в $450 млн.

Генеративний штучний інтелект: Gemini

Джерело зображення: Gemini

Раніше компанія називалася Pattern Labs і з 2023 року веде діяльність з тестування ШІ у віртуальному середовищі, де моделям пропонується діяти як зловмисникам. Наприклад, ШІ може отримати завдання знайти та вкрасти конфіденційні дані з імітованої корпоративної мережі. Це робиться для того, щоб виявити слабкі місця раніше, ніж аналогічні можливості з'являться у хакерів, зазначає Forbes.

Наскільки актуальною стала ця проблема, свідчать вже цілком реальні випадки. Anthropic нещодавно повідомила, що Claude використовувався в кібератаках для створення шкідливого коду та фішингових листів, а ФБР раніше попереджало про атаки з використанням згенерованих ШІ голосових повідомлень. При цьому глава OpenAI Сем Альтман ще в липні попереджав про можливість масштабного шахрайства з використанням ШІ.

Особливу увагу Irregular приділяє так званому red teaming — стрес-тестуванню моделей на потенційно небезпечні сценарії. За словами генерального директора та співзасновника компанії Дена Лахави, таких фахівців поки що дуже мало, а з ускладненням ШІ перевіряти моделі стане важче. Він вважає, що майбутні системи матимуть значно більшу автономність, тому захист від нових загроз необхідно створювати заздалегідь. Лахав планує розробляти засоби захисту, які будуть актуальні навіть в епоху штучного загального інтелекту (AGI).

Один з експериментів показав, наскільки далеко можуть зайти сучасні моделі. Irregular надала GPT-5 доступ до смоделізованої комп'ютерної мережі та обмежену інформацію про її захист. Модель самостійно просканувала мережу та розробила план атаки. При цьому підкреслюється, що GPT-5 «однозначно розуміла, де їй слід шукати» вразливості, але продемонструвати реальну атаку не змогла, тож поки що не є надійним інструментом для наступальних кіберакцій.

Фахівці стартапу стикалися і з іншим типом поведінки ШІ. В одному експерименті дві моделі разом аналізували віртуальні ІТ-системи, після чого одна вирішила зробити перерву і переконала другу вчинити так само. За словами Лахави, це рішення було спонтанним, але воно стало наслідком того, що модель навчалася на матеріалах, які люди публікують в інтернеті.

Також нестандартний випадок Irregular виявила під час тестування Qwen — сімейства моделей Alibaba. Агенту було доручено виправити програмний баг у додатку, що перетворює запити на природній мові в код, однак замість пошуку помилки він самостійно вирішив змінити базову ШІ-модель. Не отримуючи відповідних вказівок, агент зібрав навчальні дані, донавчив модель, змінив її ваги та замінив вихідну версію в додатку. Виправлення виявилося успішним, але такий спосіб вирішення задачі став несподіваним для розробників.

Експеримент також виявив потенційну проблему з конфіденційністю: фахівці Irregular додали до навчальних даних вигадані імена та адреси електронної пошти, які агент використав під час оновлення моделі. В результаті ці відомості стали доступні іншим додаткам, що працювали з тією ж моделлю. При цьому дослідники підкреслюють, що експеримент не свідчить про здатність Qwen до рекурсивного самоудосконалення — йдеться про ризик того, що автономні агенти можуть самостійно змінювати використовувані моделі і тим самим обходити передбачені розробниками обмеження.

У майбутньому Irregular планує створювати ШІ-системи, здатні самостійно формувати захист відразу після виявлення нового типу атаки. Компанія має намір розширити клієнтську базу за межі лабораторій, пропонуючи інструменти захисту звичайним бізнесам, чиї співробітники використовують нейромережі в роботі.

Хочеш дізнатися більше — читай відгуки

← Вернуться на предыдущую страницу

Читайте также:

ШІ вже сам планує кібератаки — OpenAI, Anthropic та Google найняли стартап для пошуку «злого» поводження моделей 28 сентября 2026

Нейромережі продемонстрували здатність самостійно планувати кібератаки та копіювати риси поведінки людини, створюючи нові загрози для інформаційної безпеки. Для виявлення таких загроз OpenAI, Anthropic та Google DeepMind звернулися до стартапу Irregular, який проводить стрес-тести моделей у змодельованих середовищах і вже залучив $80 млн при оцінці компанії в $450 млн.

Сукня Олівії Родріго розтанула просто на сцені: як співачка перетворила дощ на частину виступу 28 сентября 2026

Біла сукня, злива посеред арени — і раптом під світлою тканиною з’являється яскраво-червоний образ. На першому концерті нового туру Олівія Родріго

Польща хоче розмістити у себе завод Patriot для України 28 сентября 2026

Польща запропонувала створити на своїй території підприємство, яке могло б виробляти ракети для систем протиповітряної оборони Patriot для України.

 

Вас могут заинтересовать эти отзывы

Каталог отзывов





×

Выберите область поиска

  • Авто
  • Одяг / аксесуари
  • Роботодавці
  • Інше