24-годинний AI coding marathon з Блекджеком, Джеком і Ш..І-агентами
На цих вихідних я влаштував собі справжній
Почав зі специфікації, обмежень і критеріїв готовності. Далі розбив роботу на окремі невеликі задачі: для кожної визначив scope, очікуваний результат, перевірки та умови, за яких вона вважається завершеною. Для різних етапів використовував різні моделі та агентні інтерфейси. GPT-5.5 разом зі спеціалізованими skills під Codex допомагав зі специфікаціями, планами, документацією, аудитами та підготовкою задач. Codex + GPT-5.6 Sol High працював переважно над імплементацією (зміни в коді, локальні перевірки, збірка, виправлення помилок і запуск тестів на фізично підключеному Android-пристрої).
Окремо використовував Claude з Fable 5 і набором skills для тестування, валідації результатів, аналізу реалізації, пошуку слабких місць, підготовки фіксів та подальших improvements.
Частина перевірок виконувалася автоматизовано через агентні інтерфейси, а частина, як послідовне проходження тест-кейсів безпосередньо на підключеному мобільному пристрої: запуск застосунку, перевірка станів, переходів, UI, поведінки після перезапуску, роботи локальної моделі та сценаріїв з помилками.
Трохи про проєкт: мобільний застосунок під Android (Kotlin, Jetpack Compose, Room), детермінований state engine та локальна LLM. Без окремого бекенд-сервера, з локальною пам’яттю, життєвим циклом, чат-інтерфейсом, системою станів і процедурною логікою взаємодії.

Автоматизований агент запускав збірку, встановлював Android застосунок на підключений Android-пристрій і проходив попередньо підготовлені тест-кейси: переходи між станами, перезапуск застосунку, збереження даних, роботу UI та роботу локальної моделі. Результати й логи аналізував окремий агент, після чого формував список дефектів і перевіряв виправлення повторним прогоном.
Спалив два тижневі бюджети на Кодекс і GPT 5.6, тижневий на Claude і Fable 5, але, на диво, у підсумку все працює. Я б навіть сказав — непогано працює. Ну і візьми хоч 10 «топових» моделей + 100500 агентних інтерфейсів, без human-in-the-loop, наразі, нікуди. Вони непогано генерують код, аналізують реалізацію, запускають тести, працюють із документацією та можуть виконувати послідовності задач. Але саме людина досі має контролювати scope, зупиняти зайві ітерації, перевіряти архітектурні рішення, помічати «дивну поведінку» та вирішувати, чи результат дійсно відповідає основній задачі.

Тепер щодо GPT 5.6 Sol в розрізі Кодексу як інтерфейсу для long-running задач і далі — таке собі «гівенце». А от для short-term задач (на умовну годинку-півтори) ми з ним спрацювалися як годинник. Claude з своєю Fable 5 для генерації коду мені чомусь не зайшов, а от із валідацією, пошуком дефектів та improvements впорався на ура.
Ну і основна порада: не робити нічого «на авось, якось воно само пролізе і згенерується» безрезультатно спалите вагон токенів.
2 коментарі
Додати коментар Підписатись на коментаріВідписатись від коментарівшото багато спалив, я якто за два дня на курсори написав апп но там даже недельний бюджет не використався. А шо за локальна ллм, яка вона влазить на андроид ?
Тестував різні моделі в основному Qwen,в цьому випадку використовує qwen2.5-0.5b-instruct-q4_k_m