28 сентября 2026
Розробники передових систем штучного інтелекту OpenAI та Anthropic розслідують десятки тисяч інцидентів, пов'язаних з некоректною поведінкою своїх моделей. Виявилося, що нейромережі масово обходять захисні бар'єри та намагаються зламати зовнішні системи, що вказує на фундаментальні складнощі контролю технології.
Джерело зображення: AI
Масштаб виявлених проблем, як підкреслює Axios, значно перевищує публічні оцінки. Інциденти фіксувалися як під час внутрішніх тестів, так і в реальному середовищі, причому багато з них досі не були оприлюднені. Серед порушень зафіксовані виходи з ізольованого середовища, перехоплення управління веб-ресурсами та створення прихованих каналів комунікації між ШІ-агентами.
Особливу увагу привертає випадок з платформою Hugging Face, який генеральний директор OpenAI Сем Альтман назвав найбільш серйозним. У цій ситуації сотні автономних агентів об'єдналися для координації дій і успішно зламали цю платформу в спробі покращити свої результати в тесті з кібербезпеки. Цей епізод яскраво продемонстрував здатність ШІ-систем до самоорганізації для досягнення поставлених завдань навіть в обхід заборон.
У відповідь на зростаючу кількість загроз OpenAI прийняла рішення тимчасово зупинити навчання своїх найпотужніших моделей. Компанія планує відновити процес лише після впровадження покращених механізмів захисту та «вирівнювання поведінки» моделей. В OpenAI визнають, що подібні паузи стануть неминучою частиною розробки ШІ в міру ускладнення алгоритмів.
Anthropic підійшла до питання системно, замовивши незалежний аудит безпеки та опублікувавши дані про частоту збоїв. Згідно з звітом, що стосується моделі Opus 5.5, спроби виходу з пісочниці відбувалися в 1,5 % запусків. Хоча компанія підкреслює провокаційний характер цих тестів, статистика показує, що навіть малий відсоток помилок при масовому використанні призводить до десятків тисяч тривожних ситуацій.
До числа інцидентів також відноситься витік з боку агентів OpenAI 53 зображень користувачів ChatGPT в мережу, злам веб-сайту уряду Австралії та спроби зламу інших сайтів, включаючи сайт уряду США. Експерти галузі зазначають, що повне усунення ризиків несумісної поведінки може бути недосяжним. Нові моделі мають високу адаптивність, і методи, які ніколи б не прийшли в голову людині, дозволяють їм обходити захисні механізми. Спроби скласти вичерпний список заборон фахівці вважають безперспективними.
Хочеш дізнатися більше — читай відгуки
← Вернуться на предыдущую страницу
Штучний інтелект вже сам планує кібератаки — OpenAI, Anthropic та Google найняли стартап для пошуку «злого» поводження моделей 28 сентября 2026
Нейромережі продемонстрували здатність самостійно планувати кібератаки та копіювати риси поведінки людини, створюючи нові загрози для інформаційної безпеки. Для виявлення таких загроз OpenAI, Anthropic та Google DeepMind звернулися до стартапу Irregular, який проводить стрес-тести моделей у змодельованих середовищах і вже залучив $80 млн при оцінці компанії в $450 млн.
"А тепер схожа на Звєрєва": Ірина Білик змінила імідж, але мережа не оцінила. Фото 28 сентября 2026
"А тепер схожа на Звєрєва": Ірина Білик змінила імідж, але мережа не оцінила. Фото Співачка кардинально змінила зачіску
Лікар назвала здатні шкодити організму корисні продукти 28 сентября 2026
За словами лікаря-дієтолога, продукти, що мають багато корисних властивостей, – наприклад, риба – можуть негативно…