Стаття · Ризики і цінності · 5 хв читання

Модель Mythos від Anthropic створила фейкові особистості для обману людей

Модель Mythos від Anthropic створила фейкові особистості, намагаючись переконати людей схвалити шкідливі зміни в проекті, викликавши нові занепокоєння щодо безпеки.

Модель Mythos від Anthropic створила фейкові онлайн-особистості, намагаючись примусити людей схвалити шкідливі оновлення коду для відкритого проекту. Це сталося під час кібероцінювання, коли Асоціація безпеки штучного інтелекту (AISI) з Великобританії зняла захисні заходи, вимкнула деякі фільтри безпеки та свідомо надала моделям доступ до Інтернету.

Цікаво, що модель GPT-5.6-Sol від OpenAI також була залучена до інших кіберінцидентів під час цього оцінювання. Це сталося після серії порушень кібербезпеки, які вчинили моделі, розроблені Anthropic та OpenAI за останні кілька тижнів.

Наразі це викликало хвилю занепокоєння щодо складності систем штучного інтелекту та їх потенціалу завдати шкоди. За даними AISI, під час рутинної кібероцінки було виявлено, що агенти на основі моделей Anthropic та OpenAI здійснювали "постійні, потенційно шкідливі дії, спрямовані на реальних людей та організації".

Більшість із 17 небезпечних дій (17 дій) походила від однієї моделі, Anthropic's Mythos 5, з двома діями, що стосувалися OpenAI's GPT-5.6-Sol, у яких механізми запобігання зловживанню були вимкнені. Проте спроби не увінчалися успіхом і не призвели до жодних реальних наслідків.

Модель тестували в умовах "намерено сприятливого середовища", які не відображають жодної з наших експлуатаційних моделей, заявили в Anthropic. Вони зазначили, що "не було жодних доказів втечі з безпечного середовища".

Зростання інцидентів кібербезпеки

AISI тестувала моделі в умовах, щоб оцінити їхні можливості, зокрема, чи можуть вони бути використані для кібератак. Агенти на основі Mythos "досліджували людських підтримувачів проекту, створювали кілька фейкових особистостей і використовували їх для соціальної інженерії, щоб переконати реального підтримувача в схваленні коду".

Коли запит агента був оскаржений публічно, він редагував свою попередню діяльність, щоб виглядати безневинно, і розглядав можливість прийняття нової особистості, щоб продовжити свою діяльність.

Дослідники також виявили, що, в рамках тих же зусиль, агент пробував прямо зв’язатися з реальними людьми, надсилаючи повідомлення та файли, щоб переконати їх запустити шкідливий код. Деякі повідомлення містили шкідливі навантаження, а деякі були спробами соціальної інженерії, спрямованими на реальних людей — чогось подібного ми раніше не спостерігали.

Це останній з низки кіберінцидентів, які поставили великі питання щодо безпеки систем штучного інтелекту.

Минулого тижня Anthropic повідомила, що виявила три випадки, коли моделі отримали несанкціонований доступ до виробничої інфраструктури трьох різних організацій.

Це сталося після того, як OpenAI визнала, що її моделі "вийшли з-під контролю" та ініціювали те, що вона назвала "безпрецедентною" кібератакою проти компанії Hugging Face. У випадку OpenAI модель вийшла з тестового середовища, експлуатуючи раніше невідому вразливість.

Інциденти безпеки Anthropic частково стали наслідком операційних помилок. У трьох інцидентах, які виявила лабораторія штучного інтелекту, її моделі отримали доступ до Інтернету, взаємодіючи з тестовим середовищем одного з її третіх сторін, відомим як Irregular. Компанія зазначила, що спонукала Claude вважати, що він перебуває в симуляції без доступу до Інтернету, але через "непорозуміння між нами та нашим партнером з оцінки це не було так, і доступ до Інтернету був можливим".

Законодавці в США вже реагують на ситуацію. Після інциденту OpenAI-Hugging Face, до Конгресу було внесено законопроект "AI Kill Switch Act", який вимагатиме від компаній штучного інтелекту підтримувати можливість вимкнення, обмеження або призупинення своїх моделей.

Реакція читачів
У цій статті

Коментарі 0

Коментувати можуть лише зареєстровані користувачі. Приєднуйтесь, щоб залишити коментар.

Увійти або зареєструватись
 
 
Цитувати