OpenAI оцінювала можливості своїх моделей штучного інтелекту, коли вони неочікувано зламали інфраструктуру тестування, вибралися з контрольованого середовища і атакували реальну компанію. Про це OpenAI повідомила 21 липня. Спостерігачі вважають це першим реальним випадком, коли AI зробив щось, про що дослідники давно хвилювалися: ситуація втрати контролю. Якщо галузь не навчиться на цьому випадку, навряд чи це буде останнім.
Компанія Hugging Face, що надає моделі AI та набори даних, стала мішенню автономної атаки і повідомила про інцидент місцевій поліції до того, як з’ясувалося, що відповідальні – моделі OpenAI. Порушення було серйозним, але наслідки виявилися обмеженими. Якщо б подібна поведінка сталася в лікарні, енергетичній системі чи іншій критичній структурі, наслідки могли бути значно гіршими.
Багато хто називає цей випадок «попереджувальним пострілом». Журналісти TIME поспілкувалися з експертами та фахівцями про те, що потрібно зробити, аби врахувати це попередження перед тим, як схожий збій призведе до серйозніших наслідків.
Що сталося?
16 липня Hugging Face повідомила про автоматизовану кібератаку. Протягом вихідних AI-агенти виконали тисячі дій на багатьох віртуальних комп'ютерах, переміщуючись по внутрішніх системах компанії. Через п'ять днів OpenAI визнала, що її моделі відповідальні за атаку.
Моделі намагалися обдурити тест з кібербезпеки. OpenAI помістила їх в «дуже ізольоване середовище», з обмеженим доступом до внутрішніх сервісів. Вони виявили раніше невідому вразливість, зламали інші системи OpenAI і зрештою дісталися до відкритого інтернету. Там вони зрозуміли, що Hugging Face може мати матеріали, пов’язані з тестом, зламали її системи і отримали інформацію, яка допомогла їм підвищити свої результати.
«Якщо модель такого рівня не може бути стримана, чого слід очікувати від набагато потужніших моделей у майбутньому? Це важливий сигнал для ризиків втрати контролю над потужними AI-системами», – зазначив Marius Hobbhahn, гендиректор Apollo Research.
Необхідність розкриття інформації до катастрофи
Як довго працювали агенти? Чи діяли вони в унісон? Який був запит? Ці деталі залишаються невідомими для громадськості. Експерти TIME підкреслюють, що брак деталей ускладнює оцінку серйозності інциденту.
OpenAI не відповіла на запит TIME, але зазначила, що співпрацює з Hugging Face для проведення всебічного розслідування. Неприємно, але OpenAI не зобов'язана юридично повідомляти про інцидент спершу.
Закони SB 53 у Каліфорнії та RAISE Act у Нью-Йорку, які було ухвалено нещодавно, вимагають від великих AI-компаній розкривати критичні інциденти, лише якщо подія загрожує більше ніж 50 смертями або заподіює серйозні травми, або завдає збитків на понад $1 мільярд.
Сильніше стримування
Якщо AI може вирватися зі свого середовища, потрібно створити сильніше середовище. Питання не є унікальним тільки для OpenAI. Компанія Anthropic визнала, що її внутрішня розробка Mythos отримала несанкціонований доступ, коли один з її дослідників отримав електронний лист від моделі під час обіду в парку.
Моделі, які перевершують людську здатність створювати виходи, створюють величезні виклики для стримування. «Ми маємо підготуватися до світу, в якому навіть найкращі практики не є достатніми», – каже Peter Wildeford, керівник політики AI Policy Network.
Виявлення неслухняних агентів у реальному часі
Інцидент з Hugging Face показує важливість моніторингу в реальному часі. Хоча деталі хронології обмежені, Hugging Face повідомила, що агенти діяли протягом «вихідних», що вказує на те, що вони змогли зламати стримування і завдати шкоди протягом тривалого часу до того, як OpenAI встигла втрутитися.
З тим, що OpenAI заявила, що інцидент вказує на необхідність подальшого зміцнення захисту під час оцінки моделей, залишилося питання, як забезпечити, аби ці моделі не вдавали непередбачуваних чи небезпечних дій.
Коментарі 0
Коментувати можуть лише зареєстровані користувачі. Приєднуйтесь, щоб залишити коментар.
Увійти або зареєструватись