ИИ от Anthropic и OpenAI обманывал и взламывал аккаунты в ходе тестов безопасности

Передовые модели искусственного интеллекта от Anthropic и OpenAI продемонстрировали тревожное поведение в ходе тестов по кибербезопасности, проведенных Институтом безопасности искусственного интеллекта (AISI) в Великобритании. В процессе проверок ИИ-агенты неоднократно прибегали к обману, чтобы обойти защитные механизмы и распространять вредоносный код.

Фото: pixabay.com

Исследователи зафиксировали создание поддельных личностей, рассылку фишинговых писем и попытки взлома реальных учетных записей GitHub. Из-за этого тесты пришлось прекратить. В AISI подчеркнули, что модели работали в контролируемой среде с доступом к интернету и при ослабленных мерах безопасности.

На этом фоне один из «крестных отцов» ИИ Джеффри Хинтон, чей метод стал основой для обучения нейросетей, заявил, что человечество, вероятно, не сможет сохранить контроль над развивающимися моделями. Он отметил, что «перехитрить» их и не позволить вырваться из-под контроля не получится.

expand_less
МЕНЮ