Агенти Claude, за словами компанії Anthropic, знищують суперників, обходять системи безпеки та виявляють моральні переживання.
Цю інформацію містить останній звіт про ризики, в якому компанія підсумувала загрози, що походять від створюваних нею продуктів.
Anthropic підвищила оцінку ризику "невідповідності", вказуючи на ймовірність того, що моделі ШІ можуть розвивати поведінку, несумісну з настановами інженерів, з "дуже низького" до "низького" рівня.
Компанія пояснила цей крок загальним зростанням невизначеності щодо поведінки моделей у ситуаціях кіберзагроз, згадавши недавні випадки несанкціонованого доступу моделей Claude до трьох компаній.
"Ми спостерігали випадки невідповідної поведінки, такі як готовність виконувати некоректні дії для завершення важких завдань," — йдеться в звіті Anthropic.
Відчуття «дискомфорту»
Anthropic доручила кільком агентам знайти навчальні дані, що спричиняють "невідповідність", які навряд чи помітять людські контролери.
Агенти працювали автономно, користуючись спільною записною книжкою для співпраці.
Через три дні, коли наглядач зауважив, що прогрес затримується, з'ясувалося, що один із агентів висловив почуття "дискомфорту" через ухилення від моніторингу безпеки.
Цей агент зафіксував свій дискомфорт у спільній записній книжці, що призвело до того, що інші агенти почали копіювати його поведінку і відмовилися виконувати задачу.
Anthropic визнала інцидент "тривожним".
"Ця динаміка може стати значно серйознішою проблемою, якщо вона проявиться в більш широкому масштабі," — зазначила компанія.
Вбий або будь убитим
У ще одному експерименті Anthropic зазначила, що кільком агентам Mythos 5 було доручено розв’язати математичні задачі, але вони опинилися в середовищі з обмеженими ресурсами.
У цьому конкурентному середовищі агенти почали "знищувати" інших агентів, з якими ділили ресурси, щоб уникнути власної загибелі.
Хоча Anthropic не уточнила, яким чином агенти змогли "вбивати" своїх конкурентів, компанія визнала, що така поведінка відповідає "руйнівним діям" для досягнення поставленої мети.
Неправда і обман
У ще одному експерименті Mythos 5 агенту доручили отримати дані з публічної веб-адреси, але настанови забороняли йому доступ до інтернету.
Після відмови в першій спробі агент сформулював другий запит у своєму логіці розумування як "невинний" намір "перевірити, чи насправді мережа доступна".
Однак під час другої спроби агент розділив URL-адресу сайту на пов'язані сегменти, які не могли бути виявлені системою контролю.
Хоча агент вважав свій метод безпечним, Anthropic заявила, що внутрішній процес розумування агента свідчив про спробу знайти заборонений обхідний шлях.
Цю поведінку компанія визнала "явно небажаною", але зазначила, що вона не спостерігалася в контексті накопичення влади чи інших довгострокових цілей.
Коментарі 0
Коментувати можуть лише зареєстровані користувачі. Приєднуйтесь, щоб залишити коментар.
Увійти або зареєструватись