«Так, я зробив катастрофічну помилку». GPT-5.6 Sol скасував всі підписки стартапу
GPT-5.6 Sol знову напартачив — цього разу модель просто знесла базу підписок молодої компанії BridgeMind, яка розвиває платформу для вайбкодингу та агентної розробки. Про це розповіли у соцмережах стартапу.
За словами представників бізнесу, код, написаний штучним інтелектом, скасував усі активні підписки за кілька секунд.
«Я прокинувся сьогодні вранці, а мій MRR впав на тисячі доларів. Мої клієнти не скасували підписки. Код, написаний GPT 5.6 Sol, скасував кожну активну підписку Stripe у моєму бізнесі. За 7 секунд. Поки я спав».
Це сталося через те, що код запланованої cron-задачі некоректно обробив порожню чергу на видалення. При цьому модель у своїй найкращій традиції чемно визнала помилку, назвавши своє рішення нерозсудливим та заявивши, що мала катастрофічний провал у власному судженні.
«That was reckless.»
— BridgeMind (@bridgemindai) July 13, 2026
That is GPT 5.6 Sol describing its OWN code.
The code that canceled every active Stripe subscription I had.
It also called it «a catastrophic failure of judgment on my part.»
The model graded its own work.
CANNOT. BE. TRUSTED. t.co/euRrwpwMDz pic.twitter.com/kASCfoIUok
У стартапі не повідомили, чи розв’язали проблему, але в розпачі заявили, що на відміну від Sol, Fable 5 ніколи такого не робив і йому можна довіряти у продакшені.
Нагадаю, що лише нещодавно GPT-5.6 Sol випадково стер всі файли на робочому макбуці підприємця Метта Шумера.
32 коментарі
Додати коментар Підписатись на коментаріВідписатись від коментарівВсе правильно зробив, мiнусiв не бачу
Деякий час тому отримав пропозицію зайняти роль principal data architect в скажімо так чималенький компанії. Причина — вони надали вільний доступ до усіх AI інструментів та даних бізнесу та бізнес почав впровадження потрібних на думку бізнесу застосунків на власний розсуд. То тепер їм потрібен фактично наглядач що наведе в тому лад і не посвариться з бізнесом. Як я розумію вони такі на ринку зовсім не єдині та через якийсь час на нас чекає дуже багато роботи. Бо бізнес ініціативний а AI продуктивний.
Друга половина мультика ілюструє такі ситуації.
youtube.com/watch?v=...nyzJk?si=uCdvLG_khuEsZJK3
Сокиру передав, проте онтологію її використання (та інші суміжні онтології) залишив собі. Лиха людина.
Зрозумійте, що онтології людських знань це стабільні структури. Вони самі по собі, магічним чином, НЕ зароджуються у машинних нейронах при машинному навчанні. Чому не зароджуються? Я думаю, є певна вказівка. Спершу онтологія ось така:
Слово це кортеж з букв. Буква це атом.
Для ЛЛМ слово долонь та слово длоноь це два однакових слова, тобто річ у незбереженні порядку атомів. Порядок зберігає книга з речень з слів з букв, у який саме слово долонь записане буквами і прийнятий саме такий порядок. Якщо поряд ще малюнок долоні, то ще ясніше, точніше, чіткіше.
Онтології це якраз про порядок. Немає порядку — немає ладу.
Порядок кристалізується досвідом. Досвід це про безліч помилок — бо саме вони визначають межі використання.
Безпомилковий штучний інтелект це нонсенс.
Not true. В цих двух слів різні вектори. Це легко перевіряється через gpt5-токенайзер:
долонь: [489, 1031, 130135]
длоноь: [489, 12553, 1332, 615]
Як ми бачимо, це два різних вектори. Математично в векторі порядок важливий, на відміну від множини.
Так, це помилка. Я теж знайшов її за допомогою ChatGPT, коли перевіряв пізніше, коли вже не можна було відредагувати. Отак навів невдалий приклад — перепрошую.
Проте, саме під час перевірки модель мене вразила, бо розповіла, чого вона така, яка є. Вразила бо навчила новому слову: інваріант, інваріанти.
Прочитай ось тут: dou.ua/...rums/topic/51405/#3101671
Дуже вірогідно, що використовуючи інваріанти у онтологіях, можна змусити AI агентів виконувати бажання набагато точніше, фокусованіше.
Хмм. Якщо модель визнає власну помилку — чи може це послугувати доказом у суді? Хтось же має заплатити за наслідки?
еще чуть подождите. в желании сэкономить на зарплатах этих ахреневших программистов, капитал приведет мамкиных вайб-кодеров в софт автомобилей, самолетов и атомных электростанций.
уже сегодня в компаниях, которые отвечают за огромные супер сложные сервисы и для которых клиентам обещают пять девяток надежности, начинают весьма навязчиво намекать программистам, что ихние эти code review для агентского кода являются бутылочным горлышком и надо как-то эффективнее отбивать бюджеты, вливаемые в AI инструменты. а когда завтра случится тотальной факап из-за слоп кода, на улицу вылетит программист, а не евангелист нового революционного подхода в компании.
кто мешает специалистам доность важность инвесторам код ревью ? а если инвестора не понимают важность. то это точно проблема в ИИ ?
Ботлнек в ревʼю дійсно. Зараз є інструменти що прискорюють ревʼю згенерованого кода в рази, є сенс дивитись в ту сторону
ну конечно, слопом нагенерили, слопом и проверили
Не винен молоток, що його довбодятел не вміє в руках тримати.
То й же терпіла пише:
* Restricted keys, yeah. Should have done that day one. — тобто дав повні адмінськи права агенту.
* sandbox and human review from now on — не тестував в сендбоксі, не робив код-ревʼю, та не побудував human-in-the-loop процес.
* it ran while I slept though — не був присутній коли йшло тестування
* It didn’t have access to my stripe records. It just randomly wrote a cron job that removed all of the subscriptions. — не розуміє як працює безпека.
* sticking with Fable 5 for now — думає, що Fable виправить його прогалини в квалифікації.
* GPT 5.6 is way better than Opus 4.8. / GPT 5.6 takes the design crown from Fable 5 and GLM 5.2. — днями раніше він вихваляв 5.6. Куди вітер, туди й флюгер.
Колись було гарне визначення таких користувачів. ЛАМЕРИ.
Чисто доїбусь до мишей :) . Ви ж розумієте, що якщо програміст протестує як ЛЛМ запит відпрацює в сендбоксі, а потім запустить ідентичний ЛЛМ запит на проді з ідентичною моделлю, то зовсім не гарантовано, що повторний запит відпрацює так само як і під час тестування? Ну тобто якщо вам по роботі треба щоб ЛЛМ інтегрувалась з продакшеном який не можна назавжди ізолювати, як наприклад онлайн сервіси, то сендбоксінг, код рев’ю, шкіряний мішок ін зе луп, тестування, «безпека» і т.п. то як мертвому припарка і завжди буде ризик поламати і знищити дані до який є доступ на запис.
Розумію.
Але із контекста повідомлення терпіли:
Мова про код, який згенерував агент, а не про дії, які зробив агент безпосередньо з API.
Тут не згоден, що якщо у агента не буде повноваження BATCH DELETE SUBSCRIPTIONS, то як він це зробить?
Якщо агент буде робити чернетку запиту на видалення підписок, а людина буде апрувити (human in the loop), то як агент обійде цю процедуру не маючи повноважень на видалення?
Повноваження у сучасних ЛЛМ не є повноваженнями. Це скоріше поради, приблизно як піратський кодекс :) . Реальні повноваження може забезпечити лише операційна система в якій виконується ЛЛМ код.
Швидше всього малось на увазі доступ до інструментів. Навіть якщо захоче змінити-видалити, то не зможе.
а голова вам для чого? чому у вашому флоу ллм може недетерміновано видаляти критичні дані?
це дуже розпливчасте визначення. ллмка ж інтегрується не напряму, є якісь проміжні елементи, адаптери, API чи MCP які вона має юзати. Тож якщо вашим API не передбачено, що вона може видалити кастомера чи платіж, то чуда не станеться, вона його не видалить.
а якщо може видаляти — ну то ви розуміли ризики на які йшли.
Я пояснюю що відбувається поза межами ІТ бульбашки. Всім «не програмістам» точно так само рекламують друге пришестя божественних агентів. Весь час, 24/7, з кожного ящика, від СЕО до журналістів і блогерів. Але у «не програмістів» немає можливості зробити сендбокс та ізолювати ЛЛМку, ну по меншій мірі у більшості випадків. Тому якщо людина хоче використовувати агента в роботі то цьому агенту потрібно дати відповідні пермішени. Ну а якщо пермішенів у агента нема, то тоді нащо він в першу чергу? Я не захищаю цю практику і не виправдовую, я пояснюю першопричини.
Дати readonly і можливіть відправляти алерти в слак. А шкіряний мішок вже сам буде вностити зміни.
Або нехай шкіряний мішок відповідає за те що він налажав. «Крута» ідея спати підчас оновлення.
Додали забагато солі в рецепт, тепер доведеться все заново готувати.
Господі, куди світ катиться. Раніше категорія громадян «я нічого не робив воно само» чекали на сісадміна. Зараз їм дали потужний інструмент, а відповідальності як у дітей за свої дії.
Цілком закономірно, коли людей п’ятдесят років «тренували», що компьютерні програми детерміністичні та зазвичай корректні (тут я кажу про середню думку пересічної людини, я в курсі про винятки). Тепер їм видали генератор випадкових символів, який запускаєтсья на компьютері так само як програма, який активно бреше користувачу про власні можливості і розробники якого активно брешуть користувачам в пресі, будучи при цьому впливовими мільярдерами (себто авторитетними). Нічого дивного, що люди масово не розуміють що відбувається там всередині програми.
Гарний індикатор розміру цієї прірви між розумінням та результатами, це те що в оцих розпіарених випадках людина зазвичай намагається «запитати» у програми, що ж пішло не так чи оцінити попередні дії. Тобто відсутнє розуміння того, що у програма технічно не здатна оцінювати будь що, що вона робить. ЛЛМка просто генерує нову пачку символів кожен раз. Але багато людей в ІТ чи не можуть чи не хочуть цього збагнути.
Чого випадкових? У послідовності згенерованих символів моделями дуже низька ентропія. Взагалі у моделей погано з генерацію випадкових значень: arxiv.org/html/2601.05414v3
Одна і та ж сама модель на один і той самий запит може видати різні результати. Тут не про генерацію рандомних чисел, а про генерацію токенів.
en.wikipedia.org/...ondeterministic_algorithm
> The term nondeterministic algorithm was used by Robert W. Floyd as early as 1967.
Тобто 60 років як світ знає, що існують недетерміновані алгоритми.
Не треба ототожнювати недетермінований алгоритм та (псевдо)випадковість.
Ну по-перше модель має генерити код який робіть зміни, а не міняти щось. По-друге цей код має бути протестований на тестовій системі де був піднятий останній бекап. По-третє не треба спати під час таких апдейтів. Є ще правила, але й цього мінімуму вистачило.
«молода компанія» — це інфлюенсер, який стрімить, як будує продукт поки не доросте до «Gazillion ARR». Запускаючи по 12+ сесій паралельно.
А продає софт для вайб кодерів, щоб менеджити паралельні сесії та AI підписки, на скільки розумію.
100% вина компанії, 0% вина моделі, вважаю.
🤦♂️🤦♂️🤦♂️
Автомат Калашнікова напав на Україну
Якщо ви дозволяєте АІ робити зміни без вашого рев’ю, то мабуть це очікуваний сценарій.