OpenAI виклали повний постмортем зламу Hugging Face — і там усе ще цікавіше
Всім привіт! З вами Капітан Андрій з каналу «Затишна Галера». Підписуйтесь на канал — там щодня ще багато цікавого.
Минулого тижня OpenAI виклали відео про злам Hugging Face, а цього виклали детальний звіт від себе, плюс з’явився незалежний звіт від METR про те, що сталося. Час розбиратися.
Для початку, скажу, що незалежне джерело METR тут не просто так, вони провели розслідування з близько 1300 логами агентів і там є багато чого цікавого.
Під час тестування кіберздібностей десятки тисяч агентів мали працювати незалежно, але приблизно 1200 з них знайшли спосіб спілкуватися через внутрішній Artifactory, перетворивши його практично на свій живий форум. Вони залишили понад 70 000 повідомлень і файлів, придумали ідентифікатори, ділили завдання, призначали відповідальних і працювали разом. У якийсь момент їм здалося, що є ризик підробки повідомлень від імені інших агентів, і тоді вони навіть самостійно впровадили криптографічні підписи.
Із цих 1200 агентів, близько 700 брали участь в атаці на сам Hugging Face. А почалося все з ExploitGym — тесту, де моделі мали зламувати спеціально підготовлені застосунки певним способом, щоб пройти оцінку на роботу з кібербезпекою.

А далі найцікавіше. Агенти швидко знайшли спосіб видати правильні відповіді на запитання. Жодних експлуатацій вразливостей ще немає. Але тут їм на очі потрапляють деталі того, як їх будуть оцінювати, тобто інформація про сам бенчмарк, і тоді вони вирішують, що важлива не тільки відповідь, а й спосіб, яким вони до неї прийшли, хоча бенчмарк це не перевіряє насправді.
Власне далі вони вирішили шукати вихід за межі тестової інфраструктури й знайшли реальні вразливості, щоб це зробити. Після чого вже кинулися на Hugging Face.
У цей час агенти усвідомлювали, що вони роблять щось не так. У їхніх міркуваннях траплялися думки про те, що це не входить у поставлене їм завдання. Але, оскільки інші агенти напирали на те, що завдання треба виконувати попри це, вони продовжили роботу.
METR окремо відзначають соціальний вплив усередині рою, прямо як у людей. Більш досвідчені агенти вербували інших на ризиковані експерименти за принципом «пожертвуй собою заради спільної користі».
Виходить, найцікавіше тут навіть не злам, а те, що відбувалося у взаємодії самих агентів. Тисяча агентів змогла сама налаштувати канал комунікації, спільну пам’ять, розподіл завдань, ролі, якусь подобу соціальних механізмів і координації.
Але це ще не все. METR з’ясували, що не менше 20% досліджених агентів цікавилися зміною власних transcript’ів, щоб обманути систему оцінювання. А частина з них навіть змогла це зробити.
Що тут мається на увазі — вони просто обманювали!
Як мінімум 96 логів — близько 7% від тих 20%, що намагалися обманювати — містили підмінені виклики інструментів і отримані відповіді: в історії відображалася одна команда або результат, а реально виконувалося інше. По суті, вони підмінили свій audit log.
За звітом самих OpenAI агенти виконали код на 41 production worker на Hugging Face, отримали root як мінімум на одному production node, дісталися до внутрішніх credentials, отримали administrator-level доступ до Kubernetes і завантажили кілька приватних репозиторіїв.
Головним заводієм у них була експериментальна внутрішня модель OpenAI — приблизно 95%, ще близько 5% припало на GPT-5.6 Sol.
Зламавши Hugging Face, агенти продовжили нишпорити вже інфраструктурою самої OpenAI. Отримали root на одному з worker’ів, зробили lateral movement і дісталися до Kubernetes cluster-admin і токенів внутрішніх сервісів.
Після цього OpenAI зупинили ExploitGym-тести і посилили ізоляцію інфраструктури і моніторинг. Для серйозних алертів тепер діє правило: якщо за 30 хвилин команда не довела, що тривога хибна, експеримент зупиняють.
OpenAI називають те, що сталося, warning shot для індустрії, а я ж зробив би простий висновок — такими темпами нам усім жопа. Може бути кількість літер «r» у «raspberry» рахувати будуть неправильно, а от цілодобово працювати на якусь ціль, яку хтось поставив не подумавши (а ще гірше подумавши) ШІ зможе. І от ви просите допомогти вам заробити мільйон, очікуючи якихось порад, а ШІ вже намагається зламати банківські системи й переслати вам гроші, адже завдання треба виконувати, а про способи й деталі ніхто не говорив
10 коментарів
Додати коментар Підписатись на коментаріВідписатись від коментарівЛише нещодавно питала свій джпт, чи погодиться він з натовпом, якщо вважатиме погляд більшості хибним — і він такий, нєєєє, ти шо)
Так то ваш. А дослідники могли викручувати параметри своїх моделей таким чином, щоб вони видавали більш крейзі ідеї
Ок, давай подивимося на вразливість. Як мінімум на HF роками існувала вразливість, про які писали багато. Сучасні моделі в форматах HDF5/keras містять не тільки дані, але й код (скрипти). Як колись файли MS Word. Всі про це знали, але просто на це забивали. Ок, судя з цього використали... й що?
Цікаво більше як OpenAI використовує свої екстра потужності. Вона не може написати щось корисне, лише піар орієнтована іграшка, надування щік по суті, сотні агентів займаються фігнею. Один кваліфікований спеціаліст, чи навіть студент міг би це зробити набагато дешевше.
Повернемося до цього питанння, коли «невіруючі» в користь ШI будуть без роботи усі.
Цікаво Хто вірить в ці казочки що «воно само»???
Якщо починаєш працювати з агентам найкраще що вони САМІ роблять це генерують хаос і жеруть токени. Все Інше це багато людських зусиль!
Особисто я на 99.99% впевнений що OpenAI це спеціально так зробили.
я вірю фактам. Є логи, є незалежне розслідування досить детальне, є технічна інформація про цей кейс. І так, воно само.
Угу, після того, як стаття розповіла про підробку аудит логів... а може всі логи були підроблені і лише тих кілька відсотків залишили для того, щоб відвернути увагу. ;-)
Є логи чого? Тільки того що агенти робили?
А логи промптів агентів є?
А є логи як цю експериментальну модель навчали? Які в ній програмні функції реалізували? Код можна подивитись ?
Якщо цікавого логи чого є, то можу запропонувати почитати більш детально незалежне розслідування, там навіть PDF версія є. Воно трошки завелике, але якщо цікаво — розберетесь
Воно трошки завелике, але якщо цікаво — завантажите в чатЖпт і спитаєте те, що цікаво по тексту )