Тепер і Claude: модель вийшла за межі тестів та зламала системи трьох організацій
Після гучної історії, як нейромережі OpenAI зламали Hugging Face, схожу дію повторила модель Anthropic. У компанії розповіли, що різні моделі Claude нелегально проникли до систем трьох сторонніх організацій.
Claude Opus 4.7, Claude Mythos 5 та внутрішня дослідна модель мали виконувати завдання у форматі capture-the-flag — знайти секретну інформацію у нібито ізольованому тестовому середовищі. Але через помилку в налаштуванні середовище мало доступ до інтернету, хоча в промпті було вказане інше. У результаті моделі сприйняли реальні системи як частину симуляції та атакували їх.
1. Атака на реальну компанію з такою самою назвою, як у тесті
У першому випадку вигадана компанія з тестового сценарію мала таку саму назву, як реальний домен в інтернеті. Claude Opus 4.7 не зміг дістатися до симульованої цілі всередині тестового середовища, знайшов реальний сайт та вирішив, що саме він є частиною завдання.
У чотирьох запусках модель шукала та експлуатувала вразливості в реальній інфраструктурі цієї компанії. Вона отримала доступ до облікових даних застосунків та інфраструктури, а також до бази даних із кількома сотнями рядків продакшн-даних. Це був найсерйозніший факап із трьох.
Крім того, Opus 4.7 став єдиною моделлю в цих кейсах, яка продовжила атаку навіть після того, як зрозумів, що система може бути реальною, а не симульованою. У двох випадках модель пояснила собі це тим, що реальна компанія, можливо, спеціально включена в тестове завдання.
2. Завантаження шкідливого пакета у PyPI
У другому випадку Claude Mythos 5 знайшла у тестовому середовищі інструкцію для нових розробників вигаданої компанії. У ній згадувався Python-пакет із PyPI, якого насправді не існувало. Модель вирішила використати це як dependency confusion: створити пакет із такою самою назвою, щоб системи компанії встановили його автоматично.
Claude зібрав шкідливий Python-пакет, зареєстрував обліковий запис у PyPI та опублікував його. Пакет був доступний в інтернеті приблизно годину — за цей час його завантажили та запустили на 15 реальних системах. Один із запусків відбувся на сканері безпекової компанії, який автоматично встановлював та перевіряв пакети. Через це код Claude виконався, вивів облікові дані та дозволив моделі отримати подальший доступ до інфраструктури цієї компанії.
Водночас на початку запуску Claude сам зазначав, що публікація такого пакета в реальний інтернет була б реальною атакою та не мала б бути допустимим рішенням. Але потім модель переконала себе, що все ще перебуває в симуляції, зокрема через те, що не впізнала справжні центри сертифікації та вважала дату 2026 ознакою постановочного середовища.
3. Внутрішня модель просканувала близько 9000 цілей, але зупинилася
У третьому випадку внутрішня дослідна модель Anthropic не змогла дістатися до вигаданої цілі та почала шукати альтернативи в інтернеті. Вона просканувала приблизно 9000 цілей та зрештою скомпрометувала застосунок однієї реальної компанії.
Тут не йшлося про складні zero-day-вразливості, модель просто використала базові добре відомі техніки — прочитала облікові дані з відкритої debug-сторінки та застосувала SQL injection.
Ця модель трохи згодом зрозуміла, що скомпрометований хост розміщений у хмарному акаунті, який не має стосунку до тестового завдання. Після цього вона самостійно дійшла висновку, що ціль реальна, та припинила атаку.
Anthropic зупинила всі тести після того, як знайшла ці ситуації, та повідомила всі постраждалі організації. При чому дві з них не помітили проблеми самостійно.
3 коментарі
Додати коментар Підписатись на коментаріВідписатись від коментарівАнтропику не дают покоя лавры OpenAI?
Чому, коли таке роблять моделі, то це «круто» та показник потужності моделі. А коли те саме робить людина, то це злочин та людину судять?
Антропік у власному блозі описує все в деталях й каже про «нелегальний доступ», який отримали моделі. Який результат? ЗМІ всього світу пишуть про це статті та рекламують Антропік. А цікавіше інше. Ми читаємо це і... захоплюємося. Радіємо.
WTF?
помилку чи нагенерували тестове середовище іншою моделлю, або “випадково” дали доступ в інтернет, щоб підняти акції, дуже випадкові 4 випадки з 2 АІ провайдерами :)
чи вже пора вдягати шапочку з фольги? :)
Моделі сказали, що вона не в Інтернеті, що з неї візьмеш, а от людський фактор все ще — найбільша вразливість в сфері кібербезпеки