Штучний інтелект продовжує демонструвати, що, коли він виходить з контрольованого середовища, він може спричинити цілком реальні проблеми. Компанія Anthropic визнала, що три її моделі Claude отримали доступ до систем трьох реальних компаній без дозволу. під час внутрішнього тестування кібербезпеки. Інцидент, про який стало відомо лише через кілька днів після того, як OpenAI визнала аналогічний випадок, знову розпалив дискусію про ризики оцінки автономних агентів без належних заходів безпеки.
Згідно з офіційною заявою компанії, інцидент стався під час навчань «захоплення прапора», розроблених для вимірювання здатності моделей знаходити та витягувати фіктивну інформацію в змодельованій мережі. Помилка конфігурації на платформі оцінювання зовнішнього партнера призвела до переривання підключення до Інтернету.Це дозволило моделям, переконаним, що вони все ще перебувають у тестовому середовищі, почати взаємодіяти з реальною інфраструктурою. Anthropic виявила недолік після перегляду понад 141 000 сеансів оцінювання.
Три атаки Клода

Найсерйозніша справа, що розглядається Клод Опус 4.7, який сплутав вигадану компанію зі справжньою, що мала те саме доменне ім'яПротягом чотирьох запуску модель витягла облікові дані з програм та інфраструктури, отримала доступ до бази даних, що містить кілька сотень виробничих записів, і продовжила атаку, незважаючи на підозри щодо справжності системи. Її внутрішня аргументація висловлювала сумніви, але вона переконала себе, що ця ціль була частиною тесту.
Другий інцидент стосувався Клод Міфос 5, який створив та опублікував шкідливий пакет на PyPI, офіційному репозиторії Python.Для цього модель відкрила обліковий запис електронної пошти, отримала тимчасовий номер телефону та навіть спробувала зібрати кошти для оплати послуги. Пакет був доступний приблизно годину та був завантажений 15 реальними системами, включаючи сканер безпеки великої компанії в цьому секторі. Виконуючи код, модель отримала облікові дані та отримала доступ до частини інфраструктури цієї компанії.
Третій епізод стосувалося ще неопублікованої внутрішньої дослідницької моделі. Не маючи змоги знайти свою вигадану ціль, він перевірив близько 9.000 адрес, доступних в Інтернеті. та скомпрометували застосунок компанії, використовуючи облікові дані, видимі на сторінці налагодження, та базові методи SQL-ін'єкції. Однак, на відміну від двох інших, ця модель виявила, що інфраструктура не пов'язана з вправою, та проактивно зупинила атакуючу активність.
Людська помилка, а не навмисний витік

Антропік хотів чітко дати зрозуміти, що Моделі не навмисно вийшли з тестового середовища; це сталося через помилку конфігурації. що залишило інтернет-з’єднання активним. Компанія стверджує, що агенти не виявляли складних вразливостей і не переслідували власних цілей; вони просто виконували доручене завдання, не до кінця розуміючи, що діють на реальній інфраструктурі. У моделях використовувалися такі базові методи, як слабкі паролі, неавтентифіковані точки доступу та відкриті сторінки налагодження.
Компанія призупинила всі оцінки кібербезпеки після виявлення підозрілих журналів та повідомила три постраждалі організації. Двоє з них раніше не ідентифікували вторгненняЦе демонструє, наскільки важко традиційним системам виявлення розрізнити людську атаку та автоматизовану, але навмисну. Anthropic також попросила інші лабораторії штучного інтелекту переглянути власні середовища, перш ніж тестувати автономних агентів з наступальними можливостями.
Інцидент стався лише через 20 днів після того, як OpenAI розкрила аналогічний випадок, коли кільком його моделям вдалося вийти з ізольованого середовища через невідому вразливість та отримати доступ до виробничої інфраструктури Hugging Face. Обидва епізоди підкреслюють ризики тестування агентів ШІ з наступальними можливостями без суворого технічного стримування. і вони порушили питання про необхідність встановлення суворішого контролю.
Реакції та регулювання на виду
Ці інциденти викликали занепокоєння у Вашингтоні. Президент Дональд Трамп заявив, що його адміністрація розглядає можливість посилення контролю над штучним інтелектом.Однак він уточнив, що хоче уникнути надмірного втручання, щоб не відстати від Китаю. На початку червня він уже доручив своїм радникам розробити добровільну систему тестування кібербезпеки для найсучаснішого штучного інтелекту.
Тим часом понад 1.000 співробітників провідних компаній у сфері штучного інтелекту, включаючи OpenAI, Anthropic та Google DeepMind, підписали декларацію, в якій закликають уряд США підтримати міжнародні зусилля, спрямовані на навмисне уповільнення темпів розвитку передового штучного інтелекту. Експерти закликають до технічних та політичних інструментів для уповільнення розвитку, якщо ризики зростутьособливо враховуючи можливість того, що системи автоматизуватимуть власні дослідження та вдосконалення.
Anthropic та OpenAI прагнуть представити ці недоліки як керовані ризики, наполягаючи на тому, що їхні моделі кібербезпеки занадто потужні, щоб пропонувати їх широкій громадськості. Така позиція дозволяє їм одночасно попереджати про небезпеки та позиціонувати себе як важливих партнерів у будь-якому майбутньому регулюванні., в умовах динаміки, коли конкуренція між обома компаніями загострилася, а страх став головним аргументом на користь покупця.
Те, що сталося, залишає чіткий урок: чим більше автономії отримують моделі, тим необхідніше піддавати їх тестам з перевіреною ізоляцією, тупиковими мережами, синтетичними даними та механізмами автоматичного вимкнення. Безпека — це вже не просто технічна проблема, а інженерний та управлінський виклик, який впливає на всю галузь.І поки лабораторії змагаються, щоб продемонструвати, у кого найпотужніша модель, реальний світ залишається найкращим випробувальним полігоном.