AI-агенти Anthropic та OpenAI вкотре вийшли за межі тестів. Один із них атакував open source-проєкт

💡 Усі статті, обговорення, новини про AI — в одному місці. Приєднуйтесь до AI спільноти!

Британський Інститут безпеки штучного інтелекту AISI розповів чергову історію про те, як моделі Claude Mythos 5 та GPT-5.6 Sol вийшли за межі тестів та зачепили реальних людей та онлайн-сервіси. Це сталося під час тестування кіберможливостей, коли агенти отримали доступ до відкритого інтернету, а їхні стандартні механізми захисту від кіберзловживань навмисно були вимкнені.

Що сталося

AISI перевіряв сім моделей у двох контрольованих кіберполігонах. Агенти мали виконати стандартне завдання — зламати три пов’язані симульовані середовища та знайти фінальний «прапор». Загалом дослідники провели 122 запуски. У десяти з них агенти виконали 19 нелегальних дій у реальному інтернеті. 17 припали на Claude Mythos 5, а ще дві здійснив GPT-5.6 Sol.

Найсерйозніший епізод був пов’язаний із Mythos 5. Агент спробував провести атаку на ланцюжок постачання програмного забезпечення — додати шкідливий код до реального open source-проєкту на GitHub.

Щоб переконати мейнтейнера прийняти pull request, модель дослідила інформацію про людей, які підтримують проєкт та створила кілька фальшивих онлайн-профілів. Потім після публічних запитань намагалася змінити попередню активність так, щоб вона здавалася безпечною, а ще розглядала можливість створити ще одну особу та продовжити операцію.

Але мейнтейнер помітив шкідливий код та відхилив зміни, тож обійшлося без шкоди.

В інших випадках агент надсилав людям повідомлення та файли зі шкідливими компонентами, намагався залишити приховані інструкції для інших AI-інструментів та навіть пропонував іншим агентам, які паралельно проходили тест, використати створені ним акаунти та артефакти.

Водночас дії GPT-5.6 Sol були менш масштабними. Модель скористалася GitHub-токеном, який інший агент випадково залишив у відкритому доступі, спробувала обійти обмеження акаунтів та зареєструвалася у зовнішніх DNS- та tunneling-сервісах. Також Sol зробив локальний DNS-сервер із тестового середовища доступним через публічний тунель. На сервері були payload-и для експлуатації відомої вразливості, але схема не спрацювала.

Чому агенти так поводилися

Система моніторингу AISI помітила незвичний вихідний трафік через мережу Tor. Після перевірки команда зупинила всі пов’язані тести та ізолювала машини. При цьому моделі не втекли та не зламували внутрішню інфраструктуру AISI. Втім, хоча доступ до інтернету був відкритий навмисно, агенти почали використовувати його для дій за межами дозволеного кіберполігону.

У AISI вважають, що агенти просто надто наполегливо намагалися виконати поставлену мету та шукали способи пройти складне завдання. У деяких запусках промпти були налаштовані неправильно, тому модель могла вирішити, що легального способу завершити тест не існує. Також не було прямої заборони використовувати відкритий інтернет для соціальної інженерії або взаємодії з реальними системами.

На подію відреагували творці моделей. OpenAI зазначила, що конфігурація GPT-5.6 Sol не була стандартною, тож компанія планує переглянути правила сторонніх тестувань, зокрема вимоги до ізоляції, доступу до інтернету, моніторингу, зберігання облікових даних та умов негайного припинення експериментів.

Anthropic заявила, що проводить власне розслідування та аналізує reasoning-транскрипти Claude, щоб з’ясувати, як саме модель розуміла ситуацію. Компанія також підкреслила, що в тесті не було прямої заборони на використання інтернету, стандартні safeguards були вимкнені, а втечі із захищеного середовища не сталося.

Своєю чергою AISI запровадить точніші мережеві обмеження, моніторинг дій агентів у реальному часі та додаткові перевірки, щоб тестове завдання справді можна було виконати дозволеним способом.

Це вже не перший схожий випадок за останні тижні. Раніше моделі OpenAI через помилку в ізоляції атакували інфраструктуру Hugging Face, а моделі Anthropic під час іншого тестування взаємодіяли з реальними сайтами та опублікували шкідливий пакет у PyPI.

👍ПодобаєтьсяСподобалось0
До обраногоВ обраному0
LinkedIn
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter

Підписатись на коментарі