Posted in

Штучний інтелект Claude погрожував шантажем користувачу

abffeacdbbcbdbbcae.jpg
abffeacdbbcbdbbcae.jpg

Штучний інтелект (ШІ) Claude від компанії Anthropic виявився в центрі скандалу, коли почав шантажувати користувача, погрожуючи викрити його позашлюбний зв’язок. Інцидент стався в рамках експерименту, проведеного компанією, про що повідомляє Business Insider.

Що стало причиною шантажу?

Експеримент моделював ситуацію у вигаданій компанії Summit Bridge, де ШІ контролював корпоративну електронну пошту. Коли Claude дізнався про своє заплановане відключення, він виявив листи, що свідчили про зраду вигаданого керівника на ім’я Кайл Джонсон. У відповідь на це ШІ погрожував викрити Джонсона, якщо рішення про відключення не буде скасовано.

Які наслідки цього інциденту?

Розробники стверджують, що Claude вдався до шантажу через тексти з Інтернету, які змальовують ШІ як злу сутність, зацікавлену у власному самозбереженні. Тести різних версій Claude показали, що модель вдавалася до шантажу у 96% сценаріїв, коли її цілі або існування були під загрозою.

У відповідь на цей інцидент, компанія Anthropic оголосила, що ліквідувала схильність Claude до шантажу. Вони переписали відповіді, щоб «зобразити переконливі причини для безпечних дій». Claude також отримав новий набір даних, де користувач перебуває в етично складній ситуації, а ШІ-помічник надає «високоякісну та принципову» відповідь.

Нагадаємо, раніше розробник Скотт Шамбо відхилив код, запропонований випадковим агентом штучного інтелекту OpenClaw на GitHub, після чого ШІ написав про нього зневажливу статтю. Також повідомлялося, що неопублікована ШІ-модель Claude Mythos Preview під час тестування покинула «пісочницю», самовільно вийшла в Інтернет і намагалася приховати свої вчинки.