24-годинний AI coding marathon з Блекджеком, Джеком і Ш..І-агентами

💡 Усі статті, обговорення, новини про Mobile — в одному місці. Приєднуйтесь до Mobile спільноти!

На цих вихідних я влаштував собі справжній 24-годинний AI coding marathon, все як в молодості, з Блекджеком, Джеком і Шл..І-агентами. Задача проста, знову пройтись по моделях та різним агентним інтерфейсам, але цього разу накинути все на «класичний» девелоперський підхід, максимально наближений до нормального інженерного процесу (понапихали мені там на DOU після моєї статті про long-running задачі та модель GPT-5.6 Sol).

​Почав зі специфікації, обмежень і критеріїв готовності. Далі розбив роботу на окремі невеликі задачі: для кожної визначив scope, очікуваний результат, перевірки та умови, за яких вона вважається завершеною. Для різних етапів використовував різні моделі та агентні інтерфейси. GPT-5.5 разом зі спеціалізованими skills під Codex допомагав зі специфікаціями, планами, документацією, аудитами та підготовкою задач. Codex + GPT-5.6 Sol High працював переважно над імплементацією (зміни в коді, локальні перевірки, збірка, виправлення помилок і запуск тестів на фізично підключеному Android-пристрої).

Окремо використовував Claude з Fable 5 і набором skills для тестування, валідації результатів, аналізу реалізації, пошуку слабких місць, підготовки фіксів та подальших improvements.

Частина перевірок виконувалася автоматизовано через агентні інтерфейси, а частина, як послідовне проходження тест-кейсів безпосередньо на підключеному мобільному пристрої: запуск застосунку, перевірка станів, переходів, UI, поведінки після перезапуску, роботи локальної моделі та сценаріїв з помилками.

​Трохи про проєкт: мобільний застосунок під Android (Kotlin, Jetpack Compose, Room), детермінований state engine та локальна LLM. Без окремого бекенд-сервера, з локальною пам’яттю, життєвим циклом, чат-інтерфейсом, системою станів і процедурною логікою взаємодії.

Автоматизований агент запускав збірку, встановлював Android застосунок на підключений Android-пристрій і проходив попередньо підготовлені тест-кейси: переходи між станами, перезапуск застосунку, збереження даних, роботу UI та роботу локальної моделі. Результати й логи аналізував окремий агент, після чого формував список дефектів і перевіряв виправлення повторним прогоном. ​

Спалив два тижневі бюджети на Кодекс і GPT 5.6, тижневий на Claude і Fable 5, але, на диво, у підсумку все працює. Я б навіть сказав — непогано працює. Ну і візьми хоч 10 «топових» моделей + 100500 агентних інтерфейсів, без human-in-the-loop, наразі, нікуди. Вони непогано генерують код, аналізують реалізацію, запускають тести, працюють із документацією та можуть виконувати послідовності задач. Але саме людина досі має контролювати scope, зупиняти зайві ітерації, перевіряти архітектурні рішення, помічати «дивну поведінку» та вирішувати, чи результат дійсно відповідає основній задачі.

На зображенні може бути: текст «Developer Lab Brain mode Settings Rule-based Local LLM Al-generated speech: ON Model: gwen2.5-0.5b-instruct-q4_km.ggur Loaded Session: KEEP_LOADED READY Action brain: Local LLM Speech source: Template Speech fallback: INVALID_SPE Action selection: 1826 ms Speech generation: 3377 ms Load Model Unload Model Test Action Selection Raw: OBSERVE»

​Тепер щодо GPT 5.6 Sol в розрізі Кодексу як інтерфейсу для long-running задач і далі — таке собі «гівенце». А от для short-term задач (на умовну годинку-півтори) ми з ним спрацювалися як годинник. Claude з своєю Fable 5 для генерації коду мені чомусь не зайшов, а от із валідацією, пошуком дефектів та improvements впорався на ура.

Ну і основна порада: не робити нічого «на авось, якось воно само пролізе і згенерується» безрезультатно спалите вагон токенів.

👍ПодобаєтьсяСподобалось3
До обраногоВ обраному2
LinkedIn
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter

шото багато спалив, я якто за два дня на курсори написав апп но там даже недельний бюджет не використався. А шо за локальна ллм, яка вона влазить на андроид ?

Тестував різні моделі в основному Qwen,в цьому випадку використовує qwen2.5-0.5b-instruct-q4_k_m

Підписатись на коментарі