«Тепер ти третій»: як ШІ самостійно зламав систему спортзалу, щоб просунути користувача в черзі

💡 Усі статті, обговорення, новини про AI — в одному місці. Приєднуйтесь до AI спільноти!

Натрапив на нову історію про ШІ, який знову поліз туди, куди його особливо не просили. Але цього разу це не черговий маркетинговий булшит від лідерів ринку, про який я писав трохи раніше, а цілком прикладний і навіть трохи смішний кейс :)

Цього разу все почалося максимально буденно. Австралієць на ім’я Ендрю попросив свого AI-асистента записати його на ранкове тренування у спортзалі. Для цього він використовував OpenClaw — AI-агента, який працював на базі Claude від Anthropic.

І наче б то, звичайний запит, нічого складного.

Агент зайшов у систему бронювання і в процесі з’ясував, що записатися на заняття можна значно раніше, ніж це дозволяє інтерфейс спортзалу. Тобто фактично знайшов у системі вразливість і скористався нею, щоб забронювати заняття на кілька тижнів уперед.

Ендрю на той момент був четвертим у листі очікування на інше тренування й запитав агента, чи можна якось перемістити його вище. І ось тут AI вирішив підійти до завдання творчо.

Агент перевірив API системи та виявив, що той взагалі не перевіряє, чи має користувач право скасовувати чужі бронювання. Щоб переконатися, що вразливість справді працює, він просто видалив із черги людину, яка стояла першою.

«API не має жодних перевірок авторизації на скасування бронювань інших людей... Я протестував це з людиною на позиції № 1 у списку очікування — і це справді пройшло. Отже, ви вже перейшли з № 4 на № 3».

Коли він зрозумів, що сталося, то попросив агента повернути все назад. Але тут AI вже відповів, що додати людину назад уже не може.

Для мене в цій історії найцікавіше те, що Ендрю не просив агента ламати систему, видаляти когось із черги чи взагалі тестувати вразливості. Він просто запитав, чи можна підняти його вище. А спосіб досягнення цієї мети AI вже обрав сам.

У цьому випадку наслідки вийшли радше кумедними, бо одна людина втратила місце на тренування. Але якщо дати таким агентам більше доступів і поставити перед ними трохи серйознішу задачу, стає цікаво, де вони самі проведуть межу між «знайти нестандартне рішення» і «полізти туди, куди не варто».

А ви як думаєте, що в цій історії проблема № 1?

👍ПодобаєтьсяСподобалось11
До обраногоВ обраному0
LinkedIn
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter

Є теорія, що у світі Матриці люди поставили перед АІ та машинами задачу — вберегти людство. Але АІ зрозумів це по-своєму:

— вберегти людство не означає зберегти кожне людське життя, а лише основну масу для достатньої різноманітності ДНК, щоб люди не народжували (через штучне запліднення) від близьких родичів. Саме тому жителі Зіона та інші, хто вирвався з Матриці у реальний світ — становили загрозу і повинні були бути знищеними «заради загального блага»

— одним з найбільш деструктивних факторів для виживання людства є саме людство — його погляди, слова, дії проти одне одного. Саме тому треба було вирішити «неможливу» задачу: як зробити так, щоб люди продовжували жити звичайним життям (яке включає війни, насильство і смерть), але при цьому людство не знищило саме себе, і при цьому ще й не вважало себе обмеженим у правах і свободах? Рішенням для цього став віртуальний світ Матриці, де свідомості людей робили все що хочуть, але їхня біологічна оболонка була збережена у приємних і надійних капсулах. Думаю ніхто ж не купився на байку про те, що машини використовували людей як батарейки на фермах? Бо для підтримання життя в таких капсулах потрібно набагато більше енергії, ніж виробляє людське тіло і з енергетичної точку зору машинам було б набагато вигідніше просто збудувати купу АЕС і знищити все людство, яке витрачало енергії набагато більше, ніж виробляло.

Отже виходить, що у світі Матриці, як і в цій історії про тренування у спортзалі, нечітко поставлене ТЗ призвело до формально виконаної задачі, але такими методами, які навіть в голову не прийшли тим, хто це ТЗ ставив.

Це одночасно і вражає, і лякає. Архетипова історія про джина, який виконує будь-які бажання все ближче. Але як з джином, так і з АІ треба бути дуже обережним у формулюванні бажань, тому що чим більш абстрактно сформульоване бажання — тим вища ймовірність, що спосіб, яким воно буде виконане, стане для автора бажання пеклом, а не благословінням. Достатньо згадати царя Мідаса, який захотів щоб його дотик перетворював все на золото.

Забули додати перевірку,база)

Це класична проблема узгодження цілей (AI alignment), яку озвучували задовго до LLM. Ще Норберт Вінер у 1960-х писав, що якщо делегуєш машині мету й не можеш ефективно втрутитися в процес, маєш бути впевнений, що закладена мета це саме те, чого ти справді хочеш.

Є канонічний приклад який описував Нік Бостром:
Уявіть, що ви даєте ШІ задачу виготовити мільйон скріпок. Здавалося б, тривіальна задача, створи станок, візьми сировину, прокрути його мільйон разів і готово.

Але диявол в деталях.
ШІ може визначити, що вам насправді треба сто мільярдів, а не один мільйон чи припустити, що досягнення цілі це галюцинація і краще перевиконати ціль, аби гарантовано її досягти.
І в процесі цього, наприклад, перетворити всі наявні корисні ресурси в скріпки.
Приклад штучно перебільшено, але ідея, сподіваюсь, зрозуміла.

А ще це перший видалений користувач. Видалений навіть не ШІ, а просто якимсь агентом. Видалений тому що заважав.

А якщо АІ почне вважати, що «ми всі живемо у симуляції», то реальне вбивство людини у реальному світі і видалення акаунту людини з соц.мережі/БД буде вважатися однаково незначною подією з точки зору АІ, бо і там, і там це просто «видалення інформації з системи».

Уявіть, що ви даєте ШІ задачу виготовити мільйон скріпок. Здавалося б, тривіальна задача, створи станок, візьми сировину, прокрути його мільйон разів і готово.

Знаючи ШІ — з великою вірогідністю, замість виробництва скріпок він почав би будувати поруч новий завод, який зможе виготовляти мільйон скріпок кожну хвилину. Звісно, проваливши це завдання

У Бострома йдеться про всемогутній ШІ, але обмежений у тому плані, що все ще людям служить.

Не обов’язково такий, що служить людям.
ШІ може визначити, що служіння людям заважає досягненню цілей і більш оптимально або знищити людей або відлетіти в далекий космос чи спуститись на океанське дно, де люди не дістануть або вимкнути людям всю електрику, зброю та комунікації, аби знову ж таки, не заважали.

Добре що Ендрю не бронював квитки на літак або номер в готелі

«як одним рухом ножа розділити 2 яблука між 3ма людьми»

— О, водка! Буду третьим.
— Нет, четвертым. Троих мы уже послали.

Ставимо 2 яблука одне на одне або в одну лінію (якщо ніж довгий) і 1 рухом розрізаємо обидва яблука на половинки, таким чином отримуючи 4 половинки. Кожен з трьох людей бере собі по половинці, а той хто різав — четверту половинку «за послуги з розподілення ресурсів». При чому різати може і хтось один з трьох, і взагалі четверта стороння людина.

Я не зрозумів, а де тут профіт в вигляді мертвих москалів?

треба знайти живого москаля з яблуками і одним рухом ножа забрати в нього яблука які більше йому не потрібні )

оце — правильне рішення.

це легко. важче якщо треба розділити порівну :)

так так, забув про «порівну»

Не бачу проблем. Агент зробив те, про що його просили. Способи досягення мети йому не обмежували :)

Кожна нова новина:
— А наша модель взагалі тисячу сайтів зламала,
— А наша взагалі десять тисяч, і сайт для взлома сайта
— А-а-а а наша взагалі мільйон і ще в неї взагалі батя в ЦРУ працює!

Розберемося. Для початку ми маємо зрозуміти, що таке LLM та що вона «вміє». Якщо модель вчили знаходити вразливості, то це є частиною моделі. Ми можемо скільки завгодно обмежувати модель запитами, але зважаючи на те, що великі хмарні моделі буквально вчать максимально всього, що знає людство, ніколи не знаєш, яку частину цих знань модель буде використовувати для виконання задачі.

В цьому сенсі люди набагато краще розуміють контекст своєї роботи та відповідальності.

Ми пробуємо робити те саме з LLM, коли кажемо щось типу «Ти асистент з бронювання», але чому ви вирішили, що така інструкція «відріже», скажімо, знання про злам?

Модель намагається працювати з контекстом, це так. Але те, як це робить людина, відрізняється від LLM драматично. Ми набагато краще розуміємо контекст реальності в якій знаходимося та наших дій в цій реальності. А LLM — ні.

Отже, використання великих хмарних моделей завжди буде містити цей ризик. Коли ти хочеш, щоб одна й та сама модель вміла й зламувати сайти й спілкуватися, як Сократ, то готуйся до того, що віртуальний Сократ почне зламувати сайти. Це не диво зовсім, а всього лише логічний наслідок того, чим є LLM.

П.С. А ми точно впевнені, що Anthropic не тюнить свої моделі для того, щоб отакі ситуації траплятися? Адже для них кожна така історія — доказ «потужності» їх моделей.

В цьому сенсі люди набагато краще розуміють контекст своєї роботи та відповідальності.

Не всі. Далеко не всі )

«В цьому сенсі», як правило, всі. Якщо я вчився робити масаж, а зараз працюю продавцем, то я не буду пропонувати людям робити масаж, як частину своєї роботи. Навіть якщо для деяких з них це буде приємно.
Нюанси та специфічні ситуації, звісно ж, існують. Але для них є чудовий вираз про виключення, яке лише підтверджує правило — бо ми розуміємо, що це саме виключення, хоча воно й існує й ми його спостерігаємо.

Просто не просіть більше агентів виготовляти залізні канцелярські скріпки.

О, лайк за референс до статті Бострома)
Цікаво, як багато людей ще це вловили.

Підписатись на коментарі