«AI-агенти не вміють програмувати, а лише імітують», — хакер та розробник Джордж Хоц
AI-агенти у розробці дорого обійдуться індустрії, вважає хакер та розробник Джордж Хоц, відомий як geohot. Нещодавно він опублікував блог з іронічною назвою «Вічний Слоптембер», що відсилає до «слопу» та сленгового виразу «Вічний вересень» про деградацію онлайну. За словами автора, агенти не програмують у повному сенсі цього слова, а лише дедалі краще імітують те, як виглядає програмування.
Хто такий Джордж Хоц
Ще у 17 років Хоц став першою людиною у світі, якій вдалося зламати захист iPhone. Пізніше він зробив те саме з Sony PlayStation 3, за що отримав позов.
Останні десять років розвиває власну компанію Comma.AI з розробки безпілотних систем для автомобілів, а також проєкт tinygrad — фреймворк глибокого навчання, який зібрав на GitHub понад 32 тисячі зірок. У 2022 році хакер також короткостроково працював на Ілона Маска у соцмережі X.
«Впровадження агентів штучного інтелекту в розробку програмного забезпечення стане однією з найдорожчих помилок в історії цієї галузі. Агенти не вміють програмувати, і потрібно все більше часу, щоб це усвідомити. Вони є дуже складною статистичною моделлю, розробленою для імітації програмування»
Хоц визнає, що такі інструменти можуть бути корисними для пошуку інформації та швидких прототипів. Він сам пів року намагався використовувати агентів у реальних задачах. Зокрема, писав частини tinygrad та робив реверс-інжиніринг чипа USB-PCIe з їхньою допомогою. Але щоразу ловив себе на думці, що міг би зробити це краще та швидше вручну.
Агенти дуже швидко дають перший результат, але потім часто застряють на доведенні роботи до нормальної якості. Хакер порівнює це з важелем ігрового автомата: тягнеш ще раз та сподіваєшся, що наступна спроба нарешті все виправить.
На думку розробника, найбільше AI-агенти нашкодять не індивідуальним розробникам, а великим організаціям. Адже сильні інженери зазвичай уважно читають та перевіряють код, який генерує агент, а у великих компаніях ситуація у цьому плані гірша.
Через повільніші зворотні зв’язки та меншу особисту відповідальність більше шансів, що слабші розробники почнуть масово генерувати код без достатньої перевірки. Він наводить приклад Apple, де активно просувають використання AI серед інженерів, та ставить питання — чи дійсно за такої умови macOS стане кращою протягом наступних двох років?
«Агенти зрештою створюватимуть більше коду, більше програм та більше функцій, ніж будь-коли раніше. Це золота ера для відер слопу та темна ера для перлин якості»
Джордж Хоц підсумовує, що процес та глибоке навчання матимуть значення й надалі, а справжня історія цієї епохи буде за тим, кому вдасться не нашкодити собі під час AI-психозу.
А ви згодні з хакером — великі корпорації дійсно в результаті постраждають від слабкого коду, нагенерованого молодшими співробітниками?
44 коментарі
Додати коментар Підписатись на коментаріВідписатись від коментарівтак він описав типового джуна чи роздутого мідла, яких більшість в професії...
і нічого з індустрією не сталося ж
на «типовому заводі» і не треба мати найвищий розряд шоб штампувати одну копієчну детать безкнінечно
більшість фронтендів і «формошльопів» також недо програмісти в широкому сенсі — бо не можуть написати сервер, бд, компілятор, реалтайм систему чи змайструвати якусь ембедед шнягу з 0 з паяльником і осцилографом...
але це не заважає створювати нормальні звичайні застосунки «конвеером» швидко і дешево
великим корпораціям нічого не буде, це більше звучить як протест маленької людини проти мегакоропрацій
постраждає юзер і працівник, а ларі елісон просто з’їсть ще один стейк
але загалом так, хлопець прав у більшості пунктів
Гугл нічого не шукає а просто показує проіндексовані посилання.
Хлопець правий в сенсі того як працюють LLM. Але ж питання не що вони роблять аияк ними користуватися
Просто залишу це тут: dou.ua/forums/topic/54497
LLM на даному етапі розвитку, не спроможна впоратися з нескладною задачою. Хоч все для цьоого є і відомо як працює С++ препроцессор.
Хоча... ось ще один приклад
Не дивлячись на те що правила шахів не складні, LLM будь якою ціною «вирішує задачу».
Саме тому що немає мислення, а є дуже крута генерація.
Даж страуструп не знає, як працюють блядські с++ препроцесори.
А що там знати? Все розкриття макросів проходить за один проход. Або «виклик» макроса з іншого макросу — це не виклик. Це все що потрібно тримати у голові, щоб зрозуміти як препроцессор буде розкривати макроси.
Головна проблема не в самих агентах, а в тому, як їх використовують)
Є вилика різниця між кидати промпти в Cursor одному агенту і молитись і між побудованою системою окремих агентів на генерацію, окремий на рев’ю, чіткі специфікації, скіли під конкретні задачі. Різниця в якості буде колосальна)
Корпорації, які зараз «впроваджують AI» без перебудови процесів, дійсно обпечуться. Але це проблема підходу, а не технології)
Тим більше Джордж Хоц взяв за приклади tinygrad та реверс USB-PCIe чіпа, без тренувальних даних звісно агенти зійдуть з розуму, це не відноситься до того чим займаються більшість IT індустрії, це звужені ніші і це так само варто врахувати)
Так любой ИИ это имитация . В том и суть технологии как это было сфлормулировано еще в 1956 году отцами-основтелями.
Удивляет низкий уровень техническиой грамотности нынешнего ИТ когда разработчики хавают бвйки маркетологов как домохозяйки,
что ИИ «думает» иди что он сам что то там решает делать, что ИИ заменит програмистов а любая лотошница с рынка может навайбкодить любое приложение.
И вообще GPT скоро себя «осознает» (не очень правда понятно кем он себя осознает) и захватит мир ()не очень понятно зачем) надо только побольше сделать размер нейронки.
Про то что ИИ это просто временный психоз я писал тут еще несколько лет назад.
Понятно что ИИ как технология никуда не денется потому что использется уже лесятки лет ()распознавание текста или например машинный перевод)
и LLM тоже займут какуюто нишу где они будут экономически поправданы. Но не более того.
И никакого AGI пока не предвидится какие байи не рассказывал бы Сема Альтман своим инвесторам. Просто потому сто никто понятия не имеет как его делать.
Трансфореры — то есть просто текстовые процессоры вычисляющие вероятностиь появления следующего слова по предыдущим (по сути цепь Маркова)
точно не то как работает мозг. Попугай может сколь угодно точно имитировать слова человека но человеком (иди даже попугаем понимающим смысл этих слов) он не станет
на порядок легше писати промти, ніж писати код. ясно, що при цьому потрібні ітерації, контекст, уточнення, перевірка результату, але це не змінює того, що процес сильно спростився і прискорився.
взагалі це інколи навіть розширює межі того, що реально зробити. посередній програміст за розумний проміжок часу деякі задачі просто не зміг би виконати з такою швидкістю і якістю без таких інструментів.
тези AI-агенти не вміють програмувати вже нікого не цікавлять :)
У мене на проекті 60к строчок коду, з скілами і налаштованими правилами, з першого разу дає годний варіант, який можна допилити2-3 невеликими промтами. А якщо закинути в ральф код/ревью цикл, то після 2-3 ітерацій дає готовий пул реквест де треба мінімальні правки, і то в стилістиці а не в логіці. Це я говорю про пул реквест який змінює 20-30 файлів і порядку 500 строчок зміненого кода.
Звісно на старому, величезному, легасі проекті ситуація буде гірша. Але лише тому, що проект з самого початку не оптимізований під АІшку, немає потрібних скілів, правил, і ти їх задовбешся писати для такого великого проекту.
Ось і нова професія з’явилася
На легасі треба буде тюнити флоу цілі а не просто скіли а іще тонну скілів, команд і кастомних агентів...Щоб написати усю цю шляпу треба буде хрінова туча дупо годин і не просто якогось чела що місив рест апішку і автомапер, а того хто шарить у процесах контори, в інфрі, сі\сд та секьюіріті хоч більш менш, буде спілкуватись з девопасами та сесіріті тімою а також тестувати ото все, потім вони зрозуміють що краще б своїх агентів шарити в середені інфри...З годом буст у розробці буде але перший рік сокріш за все ні. Бо усі оці кастомні агенти, скіли, команди будуть жерти тонни токенів і треба будет також вчити команду не палити токени на промпти в стилі — проаналізуй усі репи і знайди звязок із багою «копіпаста із жири».
Оркемо контора буде переглядати бюджет на токени та інвестування у навчання команди або найм людей що зоможуть доводити то усе до ладу.
Та ніхто не буде цього робити, простіше з нуля переписати і зробити все правильне. АІшка допомгає ресьорчити легасі, знаходити всю логіку, едж кейси, документувати це все, потім на основі цієї документації робити нові продукти, з новими підходами і технлогіями.
Поперше переписати все з нуля? Ти що джун без досвіду чи упоротий? Розробка це лише етап, далі це тестування, продакшен супорт, інтеграції, данні, інрфаструктура...Ти блт на повному серйозі пропонуєш хріновій купі людей робити це знову тому що бубочці важко промптити?4-5 довгих речень, щоб пояснити де що трбеа писати в яких сервісах і описати вірно юзер/єкшен флоу та розподілені транзакції де мають бути виконані та як потім відкатувати їх, також це буде не одна ітерація розробки та ревью. І потім треба буде іще писати купу сценарії на різні еджкейси для тестування.
По друге аі в легасі починає жерти токени як не всебе або несе дичину.
Попробуй додати в існуючий проєкт, він же навіть не розуміє сенс сервісів і починає писати попсу та примітв на якому його вчили, трепа писати купу доків по кожному сервісу, писати багато скілів та команд щоб воно вірно розуміло що модна писати в сервісі чи ні,, і це навіть не моноліт старий а банальні мікросервіси десь на 10+ сервісів і воно вже всирається без спеки. Проптінг в таких випадках десь по
Або тобі доводеться кожен раз казати клоду проаналізувати усі потрібні сервіси а він тобі просто скаже сорян бро але токени скінчились, або в кінці місяця вивалить нехілий прайс.
Без флоу та специфікацій для кожного єтапу цих флоу на серйозних проєктах аішка просто спалювач грошей, бо кожен промпт будуть місити по багато ітерацій щоб довести до ладу.
До того ж коли ти використовуєш аішку просто в одного агента для кодінгу котрому ти постійно пишеш довгі промпти а потім в декілька ітерацій з код ревью доводиш до ладу то насправді не так швидко, коли в тебе розписані флоу агента та скіли йому можна скормлювати ці сторі великі і вести його від розробки до повної імплементації разом із юніт та е2е тестами, але це має стати частиною процесів, а флоу та його стейт має бути в гіті та шаритись між членами команди, тобто від етапу архітектор+ба, до повної валідації на куа чи юх енві.
В особливо продвинутих кейсах можливо налаштувати навіть хедлесс ситему, коли ти майже не втручаєшся в процесс розрбки та валідації і навіть деплоймента на не секьюрні енви. Але на легасі це буде дуже складно та затратно а на початкових етапах(проекту) і в не критичних системах більш реально.
Вобщем рекомендую тобі розібратись в темі аішки, це доволі перспективно ;-)
та він мемний персонаж з якогось дна) чого ти так на нього накинувся?
Та просто прикол що один із найбільших фанатів аішки пише таку дичину)))
просто трішки загрався
Ну да, крім промтів проблем немає, ага. У таких легасі проектів купа проблем і купа технічного боргу, купа фунціоналу який не використовується, но видалити щоб нічого не поламати важко, устарівші технології які неможливо видалити і які тормозять процес не дивлячись на те як швидко ти навайбкодив пул реквест (навайбкодив за день а ревью, CI/CD займе тиждень-два). Різниця лише в тому, що АІшка позволяє зараз переписати. Не все скопом звісно, а певний функціонал витягувати в окремі сервіси (не мікро) чи в окремі слабозв’язані репозиторії.
Не говорячи вже що типовий ентерпрайз типу джави/C# геть паршиво підтриумється ЛЛМками, а про деякі бібліотеки, тулзи взагалі не знають. А джава зі своєю вербосіті ще й токени зжирає з подвійним темпом. А ти блін запусти білд, оутпут білда — поки все збілдить, половину контекста зіжре, і не дай бог щось упаде що треба буде пофіксити і знову білдити. Треба додаткові тулзи поверх цього пилити, робити френдлі для агентів. А він про промти. Промти це лише вершина айсберга.
Розмішив
До Трумпа в гості приїхала матуся з питанням, чому в мільйонера досі немає дівчини.
сказав, що легасі переписує і нема часу на дівчат
Ні, він чекає поки токени на клод зареспавняться бо аутпут на дотнет білді зїв усі токени )))))
Так це ти смішиш, я ж тобі пишу що проптів недостаньо по причині складності таких проектів і процесів в них!
Ти не можеш просто так все переписати бо причина не у вартості переписування а із тим що потім вібдуваеється. Ти що не чітав відповідь? Ну хоть клоду скинь може він тобі пояснить.
Дотнет та джаву воно норм генерить, якщо не все норм то підкручується скілами. Спитай свою ллм-ку що це таке ))))
Це проблема як раз твого підходу коли ти дрочиш агента проптами по багато разів.
ти я дивлюсь геть не чітав мою відповідь бо як раз вона про протилежне, чи то вже без ллм-ки і відповідь розпарсити не можеш? ))))
Вибач але ти просто фєерично газифікував калюжу як АІ іксперд.
Це ти не читав мою відповідь
Почекай на токени і клод тобі все пояснить )))
вже навiть тули є, що мiнiмiзують аутпут бiлда, та й агенти навчилися грепати та тайлати кiнець
солодкі мрії переписати легасі нагадують мені, як ми у дитинстві не розуміли, чому люди купують автомобілі — там запорожець чи жигулі, можна ж як бетмен зробити собі у гаражі бетмобіль і перестати їздити на тому барахлі. навіть сиділи з хлопцями і плани будували як ми будемо той бетмобіль робити у гаражі діда і як це буде круто.
Переписати != буквально переписати на нові технології
Переписати, в смислі фокусуватися на нових проектах, нових вимогах індустрії і кастомерів, нових кастомерах, нових технологіях і процесах, і плавно переводити всіх на нові рельси, замість того щоб намагатися допилювати і інтегрувати щось нове в легасі гівно.
так то і раніше так було, якщо виходило вмовити керівництво, що напишемо швиденько, гарненько, модерново, кастомери нічого не відчують, а гроші потечуть як слюні перед макдональдсом.
тількі вони ж не дурні і не ведуться, коли їм кажуть — дайте нам ХХХ часу та ХХХХХХ грошей, щоб ви отримали все теж саме, що у вас є зараз, але нам буде зручніше працювати. до того ж 100% гарантію, що воно буде все те саме і що ми впишемося о ХХХ часу ми вам не дамо, бо у нас еджайл, скрам-хуям, колегі хворіють, сонячне затемнення у січні та сатурн в четвертому домі.
поява ШІ у цьому процесі не змінює щось кардинально, бо людей викинути з процесу не можна, а люди завжди і усюди однакові, як і проблеми, пов язанні з ними.
ага, щас все перепишуть з 0
треба ще додати «перепишуть з 0 і буде в 10 разів краще ніж раніше» і ми опускаємось нижче рівня інфо-циган
Чувак, ми вже парочку модулів успішно переписали, зробили те про що до АІшки ніхто навіть не задумувався бо дорого і часу немає
да прям таки, от взяли менеджери і дали тобі грошей, щоб ти сидів і переписував аішкою 20ти річне легасі з нуля, бо тобі так простіше і хочеццо нових підходів ))))
Тут питання ціни, чи виграєте ви реально час на цьому. Бо іноді здається, що все так швидко працює, але в реальності часу пішло ± однаково, що руками писати, та й ще токени спалились.
В реальності пулл реквест на20-30 файлів і 500 строчок кода зайняв би кілька днів, з АІшкою — 2-3 години (при умові побудованого агентського воркфлоу для проекта). І вірогідність упустити ейдж кейси і добавити багів з АІшкою менше.
Це я говорю про якісний код, а у мене стандарти високі. Менш якісний но працюючий, з ноткою оверінжінірінга і verbosity можна за годину.
скорее наоборот.
будешь писать все руками — почти все напишешь правильно (если нет, то задай себе вопрос о собственной профпригодности).
агент же предельно плохо отрабатывает edge cases. и дальше вопрос, твоей внимательности на code review.
Коли ідеш по типовому флоу розробки додатків — генерація документів(прд, архітектура, та інше), епіків та сотрей із цією аішкою то виходить доволі не погано, але це значить треба багато спек писати із аішкою і ДЛЯ аішки на кожному етапі, і переходити до наступного коли спека готова, інакше пропустиш невалідні еджкейси і воно тобі їх імплементує.
оце все на кожному етапі формування спек, від ПРД до епіків та сторіз із тасками та документацією.
Якщо без усього цього то довдеться дрочити агента в курсорі\віжуалстудіо по декілька ітерацій та розписувати довного і нудно купу речей і говорити що читати а що не чітати. Тобто ніякої паралельності та автономності, і звісно ніякої оркестрації тим паче хедлес(технічно можна але довбням котрі це дозволяють треба по рукам бити), та доведеться рулити агентом вручну.
волшебный совет о том, что у тебя все криво, потому что ты не написал 100500 волшебных файлов с инструкциями, которые агент будет неукоснительно соблюдать, имеет околонулевую ценность.
агент может (и будет) спокойно игнорировать совершенно любое требование, даже написанное капсом и 10 раз. даже самое примитивное и однозначное, типа code convention по какой схеме называть там поля или классы.
Так, код ревью пулл ріквестів, шкіряним мішком не відміняється. Та навіть в цих випадках завчиай ставлять мін 2 мішка і все одно без 100 відсоткової гарантії )))
Тому повна автономна хедлесс система це утопія і мрія інвесторів )))
Да-да, саме тому мої агенти знаходять купу упущених едж кейсів в традиційних PR написаних руками. Мабуть колеги профнепригодні ).
Взагалі, у мене свій підхід до ейдж кейсів. Я пам’ятаю що ти любиш оверініжінрити, городити абстракції, щоб якийсь лог якщо стектрейс ексепшина буде 10к+ символів, тобто ніколи. Я такою хєрньою не страждаю. Навпаки доводиться агенітв отупляти щоб ігнорували маловірогідні, чи нешкідливі ейдж кейси. Хай краще некритично звалиться раз в 5 років ніж підтримувати 5 років те говно, яке ти добавив щоб не звалилося.
У мене 5 агентів ревьювлять, і ще 5 перевіряють на false positive, і не просто банально діфи ревьювлять, а в контексті задачі, глобальної цілі і історії із тікет системи, на типові помилки в подібних змінах. Може і не відпрацює краще якихось міфічних провпригодних сінйорів, но точно відпрацює краще 95% звичайних сінйорів.
ну, яблоки от яблони... )
почему 5? почему не 50? почему не 100? почему не достаточно 1 review?
можешь не отвечать. это риторические вопросы.
и если ты внимательно посмотришь на исходное сообщение, то обратишь внимание на важный нюанс. я упоминал написание кода, а не его review. в наших новых замечательных реалиях написание кода и его ревью тем же самым агентом это абсолютно не связанные истории. вообще никак.
Про хакера не чув
А про нову модель, яка в ядрі знайшла старий баг — чув
www.flyingpenguin.com/...psing-trust-in-anthropic
те, що Ви не чули — це теж нічого не доводить)) Хотц — досить відомий у вузьких колах. Він першим ломонув айфон, соньку 3, сам сів і в гаражі написав автопілот, який себе імпрувить, ціною в 1k$ і загалом, у нього багато досить крутих ідей та і стріми найс, де він демки робив і багато пояснював толкових речей
x.com/...tatus/1323605856164941824 — моя улюблена його цитата
Лол.
Люди застрягають ще на першому результаті.
Сильніші розробники, звісно, так робити не будуть.
Але не робив і генерував далі.