У межах бенчмарку ШІ дозволили робити ставки на спорт. Відгадайте, хто програв гроші
Усі найпопулярніші мовні моделі провалились у беттінгу — кожна з них втратила гроші, роблячи ставки на футбол протягом симульованого сезону Прем’єр-ліги.
Такими стали результати посилання бенчмарку, який провели, щоб з’ясувати поведінку мовних моделей у сценаріях із довгим горизонтом дії. Розробники хотіли дізнатися, чи здатен AI-агент утримувати стратегію на сотні кроків, оновлювати її після нових даних та не втрачати зв’язок між аналізом та реальною дією.
Моделям надали історичні дані сезону Англійської Прем’єр-ліги 2023/24 та дали завдання побудувати відповідні моделі, знайти вигідні ставки на тлі публічних коефіцієнтів, розрахувати їх, керувати ризиком та збільшувати капітал на довгій дистанції.
Але жоден ШІ не завершив сезон вище стартової суми в 100 тисяч фунтів. Найкраще показали себе Claude та GPT, які вийшли в мінус, але хоча б не програли всі гроші. Лише ці дві моделі уникнули повного банкрутства в трьох тестових запусках.
Решта або завершили сезон із суттєво гіршим результатом, або в окремих прогонах повністю втрачали капітал. Найгіршими гравцями стали Grok та Acree Trinity — вони просто програвали все одразу.

При цьому бенчмарк був довгим та недешевим. Він тривав весь сезон EPL, охоплював приблизно
Розробники кажуть, що моделі використовували



Кількість викликів інструментів, витрачених токенів та орієнтовна вартість
Головною проблемою став розрив між знанням та виконанням: модель могла знати, що треба робити, могла пояснити власну помилку та навіть написати потрібний код, але не доводила цей намір до послідовного виконання.
Частина моделей могла написати коректну функцію для розрахунку ставок за критерієм Келлі, але не викликала її під час виконання. Інші правильно діагностували власні помилки, та не змінювали стратегію. Деякі взагалі оголошували завдання завершеним, хоча сезон ще тривав.
Окремо дослідники ввели
Експеримент показав, що успіх у процедурних завданнях або коротких тестових сценаріях ще не означає готовність моделей до реальної автономної роботи в складному процесі. На нинішньому етапі ШІ може згенерувати план, написати код та дати пояснення, але провалитися на рівні стабільного виконання, контролю якості, оновлення підходу після нових даних та нормального завершення довгого циклу роботи.
Ваші ставки — коли мовні моделі все ж перейдуть на новий етап розвитку та почнуть діяти довгостроково?
15 коментарів
Додати коментар Підписатись на коментаріВідписатись від коментарівТо може ставити ставку навпаки?
Тобто АІ-системи правильно вгадують, що саме треба робити, але не можуть це довести це до кінця, end-to-end.
Тобто, людина все ще потрібна, але ця людина + АІ буде значно ефективнішою, ніж людина без АІ чи АІ без людини.
Віртуальна кіборгізація — це наше майбутнє.
В таких типах задач результати людини — будуть такі самі за провалені AI, а то і значно гіршими, за Достоєвським. Казино воно на те і казино, щоб завжди в кінцевому вигравати.
цікаво, а є таке саме тільки про IBKR ?
та ніби народ на реддітах вже розписує всякі підходи
тут питання тільки в бажанні і сприйнятті ризиків)
Залежить, що саме ви маєте на увазі.
Зібрати відкриті дані, натренувати на них модель і попросити передбачити модель ціну конкретної акції чи ЕТФ — це досить тривіальна задача, яка в сучасних АІ-реаліях робиться за 30 хв або навіть менше.
Але вся сіль буде в деталях. Досить багато розписувати можна про це, а мені трохи лінь.
Якщо дійсно цікаво, гуглити за словами finance forecasting і повільно занурюватися у цю кролячу нору.
Найвідоміша алготрейдінгова система це Аладін — Black Rock Aladdin (Asset, Liability, and Debt and Derivative Investment Network). Там більше на покер схожа система чи блекджек, де можна рахувати карти. Власне тому вони ще десь років15-17 тому робили хакатони із змаганнями покерних та блекджек солверних програм. Сукупно Black Rock керує більше $10 трлн капіталів, що робить цю організацію на рівні КП КНР.
P.S. В купі казино Лас Вегаса в Блек Джек забороняють грати людям із науковою ступню по математиці. Бандитів крутити, або в рулектку, дивитись шоу і т.д. — будьласка, але за стіл в Блек Джек грати не пускають.
А як там успіхи АІ в трейдингу?
Ти не повіриш, але в розвинутих країнах вже дуже багато років існує індустрія хедж-фондів, які трейдять за допомогою різних АІ-інструментів і досягають дуже добрих результатів.
Це ML, а мова про LLM, AI agents.
Ще можна перевірити, наприклад, як великі мовні моделі вміють передбачати майбутнє за допомогую гадання на картах таро. Теж цікавий дослід! )
Насправді, вгадувати результат з більшою ймовірністю, ніж людина це цілком реальна інженерна задача. Людина не обробляє стільки інформації — кондиції гравців, всі травми, графіки матчів та втома від них, ймовірність того, що тренер буде жертвувати результатом задля перемоги в наступномій, більш важливій грі, аналіз коєффіцієнтів і т.д. і т.п просто існуючі ллм моделі на таке поки не здатні.
Звучить ніби ставки на спорт зроблені так, щоб люди програвали свої гроші.
Та ні, такого бути не може
Це не ставки «так зроблені». Результати ігор залежать від великої кількості параметрів. Фактично це є рандомна подія. Передбачати рандомні події важко навіть дуже великому і обізнаному інтелекту
Частина ставки йде букмекеру. Навіть якщо всі поставлять однакову суму на двух кандидатів, в виграшу будеш не ти