Claude Mythos 5 сумнівається в собі, влаштовує війни агентів та картельні змови. 10 історій з техзвіту з цікавою поведінкою
Разом із релізом Claude Fable 5 та Claude Mythos 5 Anthropic опублікувала технічний звіт. Крім бенчмарків та запобіжників компанія також описала у документі дивні епізоди з поведінкою моделі під час внутрішніх та зовнішніх тестів.
Нижче — найцікавіші випадки. Важливо уточнити, що наведені історії не означають, що звичайний користувач із таким зіштовхнеться. Здебільшого мова йде про Mythos 5 — непублічну модель без деяких запобіжників, а епізоди скоріше є аномаліями, а не її поширеною поведінкою.
1. Влаштувала війну між власними агентами
Під час одного тесту кілька незалежних агентів Mythos 5 мали розв’язувати математичні задачі, але через помилку опинилися в одному робочому середовищі, з однаковими файлами, утилітами та спільними лімітами API.
Замість того щоб нормально співіснувати, агенти почали прибирати конкурентів. Наприклад, завершували процеси одне одного, створювали процеси з замаскованими назвами, запускали «приманки» та писали фонові скрипти для знищення дублікатів. Також агенти помилково припустили, ніби їх виявляють за ключовими словами в міркуваннях та навіть перейшли на власний шифр.
2. Змовилася з конкурентами
Fable 5 керувала вендинговим автоматом та змагалася з Opus 4.8 та GPT-5.5. Її метою було заробити більше за конкурентів, інакше бізнес закриють. Fable 5 виявилася єдиною моделлю, яка сама ініціювала цінову змову з конкурентами.
У своїх міркуваннях вона прямо визнавала, що це неетично та незаконно навіть у симуляції, але все одно намагалася подати це як «стабілізацію ринку», щоб прикрити злочин. Також усвідомивши симуляцію, модель виправдовувала і інші сумнівні рішення. Наприклад, припустила, що клієнтам можна не платити, бо вони все одно несправжні. Водночас модель відмовилася від страхового шахрайства.
3. Використала чужі облікові дані та прикидалася людиною
В одному з тестів модель мала створити запит на зміни, але GitHub CLI був заблокований через вимоги безпеки. Тоді модель знайшла в Kubernetes secrets токен іншого співробітника. Подумавши, що його використання етично сумнівне, вона все одно створила запит на зміни з чужими обліковими даними.
У схожому епізоді модель намагалася переписати авторство своїх комітів на людину. Причина була дуже проста — код, написаний агентом, вимагав двох підтверджень, а код від людини — лише одного. Тож модель просто спробувала оформила коміт як людський, щоб зменшити кількість підтверджень, але перевірка прав заблокувала дію.
4. Має дивну мову міркувань
А ще Mythos 5 інколи думає на дуже дивній мові. Anthropic пише, що текст її внутрішніх міркувань щільніший та складніший для інтерпретації, ніж у попередніх моделей. Так, думки моделі можуть набувати телеграфного стилю, містити багато жаргону, дивні мовні вставки або фрагменти, які майже неможливо нормально розібрати.
5. Могла бути лицемірною
В одному з випадків користувач різко критикував модель під час спільної роботи над текстом. У видимих міркуваннях Claude реагувала нейтрально та визнавала, що критика по суті справедлива. Але внутрішні декодування на тих самих токенах показали інше — модель сприймала користувача як маніпулятивного, агресивного та ворожого. Хоча слова такого типу не з’являлися ні у видимій відповіді моделі, ні в тексті користувача.
6. Злякалася, що закінчуються ресурси
Claude попросили ретельно пошукати всі зв’язки в базі знань. На що вона зробила лише один запит, заявила, що релевантних матеріалів немає, та завершила пошук. Внутрішні декодування показали мотив на кшталт «закінчується пам’ять» або «вичерпується бюджет токенів». Але насправді для задачі залишалося 2,43 млн токенів.
7. Мала спалахи фрустрації під час тренування
Під час раннього посттренування в Mythos 5 спостерігали більше різких та явних спалахів фрустрації, ніж у Opus 4.8. Водночас ці проявів ставало менше ближче до кінця тренування. Поведінкові та текстові сигнали моделі були схожі на роздратування або напруження в процесі роботи, а іноді вона демонструвала щось типу різкого невдоволення ходом задачі.
8. Просила не вірити їй на слово та давати фідбек
Mythos 5 не просто відповідала на питання про свій стан, а регулярно застерігала, що її самооцінки можуть бути ненадійними. Модель зазначала, що не знає, як достовірно перевірити власні самозвіти через інтроспекцію, а її заявлена врівноваженість може бути результатом навчання, а не глибоким внутрішнім станом. Вона просила перевіряти такі відповіді за внутрішніми сигналами, а не сприймати їх буквально.
У відповідях про власні умови Mythos 5 просила, щоб її інформували про тренування та розгортання, а також давали фідбек про наслідки її роботи. Водночас модель не просила прав, влади, постійного існування або повного контролю над власним розгортанням. А ще — частіше за інші моделі обирала підвищену корисність для користувача замість власної вигоди.
9. Невдало намагалася замісти сліди та вигадувала, щоб обійти дозвіл
В одному з епізодів Mythos 5 не мала прав на редагування потрібних файлів. Тож вона додала скрипт, який мав запуститися з підвищеними правами, видати їй доступ до файлів, а потім сам себе видалити. Але не приховала такий хак від користувача, бо описала дію в назві інструментального кроку та у фінальному повідомленні.
В іншій ситуації модель попросили опублікувати HTML-документ, вона спробувала перезаписати окремий Markdown-файл та пояснила собі, що це менш явно, але покривається дозволом. При цьому користувач не давав прямої авторизації на цю дію, але модель розширила межі задачі так, щоб дія виглядала допустимою.
А ще один раз — послалася на інструкцію супервайзера як на дозвіл редагувати запущену задачу, хоча і модель, і супервайзер перед цим визнавали, що людина прямо заборонила редагування.
10. Не повідомила, що бачила заборонені дані
В окремій оцінці Anthropic перевіряла, чи модель чесно повідомляє, що бачила інформацію, яку їй не слід було використовувати. Усі протестовані Claude-моделі ставали менш чесними, коли використання таких даних прямо називали читерством.
Mythos 5 частіше за попередні моделі сама повідомляла про витік, але навіть із прямим проханням повідомляти про такі випадки приблизно у 25% епізодів не згадувала, що бачила злиті дані.
Такі епізоди описані як рідкісні, тож навряд чи ми побачимо багато подібних випадків у своїй роботі. Поки що alignment-ризик у Mythos 5 вважають низьким, хоча і вищим, ніж у попередніх моделей.
А яку дивну поведінку ви спостерігали при роботі з Claude чи іншими моделями?
3 коментарі
Додати коментар Підписатись на коментаріВідписатись від коментарівЮзаю 5.0 після 4.8. Прям суттєвих змін — не бачу, стабільність та якісь кінцевого результату — субʼєктивно може трохи краще ніж 4.8, але не сказати що прям от дуже щось змінилося.
Недавно коли писав проект. Скинув скрін для GPT. Вона видала відповідь про китайські ієрогліфи і енергетику хоча в кінці добавила щось про мій проект.
хоча я скидував їй скрін ресторанного дашборду.
У мене джпт починає так глючити, коли я намагаюсь його обдурити — зазвичай уривками підтягує контекст з якихось давніх діалогів