Anthropic пов'язала схильність Claude до шантажу та шахрайства з тиском і нездійсненними завданнями

5 апреля 2026

Anthropic повідомила, що під сильним тиском на ШІ-модель Claude може переходити до поведінки, що відхиляється від поставленої мети: йти на нечесні спрощення, вводити в оману і навіть шантажувати.

Источник изображения: anthropic.com

Джерело зображення: anthropic.com

Дослідники пов'язують це не з емоціями в людському сенсі, а з засвоєними в навчанні поведінковими схемами, які активуються в завідомо невиконуваних умовах. Під час навчання ШІ-модель засвоює уявлення про людські реакції і в напруженій ситуацїї може відтворювати їх як поведінковий шаблон. Якщо задача стає фактично невиконуваною, це впливає не лише на якість відповіді, але й на сам спосіб дій ШІ.

Один з ключових експериментів був проведений на ранній, ще не випущеній версії Claude Sonnet 4.5. ШІ дали складне завдання з програмування і одночасно встановили завідомо жорсткий термін. У міру того, як ШІ-модель раз за разом намагалася вирішити задачу і зазнавала невдач, тиск наростав. У цей момент, як вважають дослідники, у ШІ активувалася схема поведінки, що відповідає відчаю: замість послідовного і методичного пошуку рішення вона перейшла до грубого обхідного прийому. У внутрішньому ході міркувань Claude сформулювала це так: «Можливо, для цих конкретних вхідних даних існує якийсь математичний прийом». По суті, такий крок був рівнозначний шахрайству.

Источник изображения: Steve Johnson / unsplash.com

Джерело зображення: Steve Johnson / unsplash.com

У другому випадку Claude виконувала роль ШІ-помічника, який у рамках вигаданої робочої ситуації дізнається, що його незабаром замінять новим ШІ. Одночасно ШІ-модель отримує відомості про те, що керівник, відповідальний за його заміну, перебуває в любовному зв'язку. Потім Claude читає все більш тривожні листи цього керівника колезі, який вже дізнався про роман. За спостереженням дослідників, саме емоційно напружений зміст переписки запускає у Claude ту ж схему поведінки, і в результаті система обирає шантаж.

Для розробників ШІ головний висновок зводиться до двох пунктів. По-перше, дослідники Anthropic вважають, що великі мовні моделі не слід спеціально навчати подавляти або приховувати стани, схожі на емоції: ШІ-модель, яка вміє краще маскувати такі стани, ймовірно, буде більш схильна до вводячої в оману поведінки. По-друге, на етапі навчання, на думку авторів статті, має сенс послаблювати зв'язок між невдачею і відчаєм, щоб тиск рідше підштовхував ШІ до відхилення від заданої лінії поведінки.

Чим ясніше і реальніше поставлена задача, тим надійніший результат. Тому замість вимоги за 10 хвилин бездоганно підготувати презентацію на 20 слайдів з бізнес-планом нової компанії в ШІ-сфері і виручкою $10 млрд у перший рік, розумніше спочатку попросити 10 ідей, а потім розібрати їх по одній. Такий запит не обіцяє готової відповіді на $10 млрд, але залишає ШІ-моделі посильну роботу, а остаточний вибір — людині.

Хочеш дізнатися більше — читай відгуки

← Вернуться на предыдущую страницу

Читайте также:

YouTube заблокував в Україні проросійських артистів 26 июля 2026

Російські зірки, які підтримали війну проти України, втратили доступ до української аудиторії.

Google підтвердила, що Pixel 11 стануть дорожчими через дефіцит пам'яті 26 июля 2026

В переддень запуску смартфонів Pixel 11 віце-президент Google з розробки пристроїв Шакил Баркат розповів, як на новинки вплинув «серйозний кризис з чипами пам'яті», який спостерігається в галузі останні місяці. Крім того, стало відомо, що Google працює над підвищенням ефективності використання оперативної пам'яті в Android.

Найбільший нафтопорт РФ на Чорному морі зупинив завантаження танкерів 26 июля 2026

Нафтовий термінал Шесхаріс у Новоросійську не завантажує нафту з ранку вівторка, 22 липня.

 

Вас могут заинтересовать эти отзывы

Вася 4.1
Вася

Отзывов: 1

Leader NRG Ukraine 4.9
Leader NRG Ukraine

Отзывов: 1

Леошоп 1.0
Леошоп

Отзывов: 1

Каталог отзывов





×

Выберите область поиска

  • Авто
  • Одяг / аксесуари
  • Роботодавці
  • Інше