AI News Digest #9: Поразка Ілона Маска, реліз Claude Opus 4.8 та мільйон рядків коду від ШІ за 10 днів

💡 Усі статті, обговорення, новини про AI — в одному місці. Приєднуйтесь до AI спільноти!

Всім привіт! На звʼязку Сергій Лелеко, Senior Machine Learning & Artificial Intelligence Engineer в SPD Technology, і це наш AI-дайджест за травень 2026 року.

Травень продемонстрував, що розробка ПЗ за допомогою ШІ вийшла на рівень повноцінної автономної інженерії архітектурного масштабу. Поки команди закривали звичайні спринти, ШІ-агенти за кілька днів повністю переписували великі фреймворки на нові мови програмування. Водночас на юридичному та фінансовому фронтах завершилися ключові судові битви року, а інфраструктурні бюджети лідерів індустрії перевалили за мільярдні позначки на місяць.

Юридичні війни та фінал протистояння року

Судовий вердикт у справі Musk v. Altman

a composite image of two men in suits

Фото: Ілон Маск та Сем Альтман. Ресурс: The Guardian

Суд присяжних ухвалив фінальне рішення у справі генерального директора Tesla проти керівництва OpenAI. Позов Ілона Маска відхилено, оскільки присяжні визнали його поданим занадто пізно для притягнення Сема Альтмана чи Грега Брокмана до відповідальності.

Корпорацію Microsoft також повністю визнано невинною в отриманні неправомірної вигоди. Головним фактором стало те, що Маск залишив раду директорів ще у 2018 році і був детально поінформований про всі етапи комерціалізації компанії.

Під час судових допитів розкрилися критичні інсайдерські деталі: Ілон Маск офіційно визнав, що його компанія xAI займалася прямою дистиляцією моделей OpenAI для прискорення навчання Grok.

Ілля Суцкевер підтвердив, що під час скандального звільнення Сема Альтмана рада директорів OpenAI офіційно пропонувала Даріо Амодеї об’єднати компанії, але отримала відмову. Суцкевер під тиском доказів підтвердив, що особисто обговорював з Маском відмову від концепції повністю відкритого коду для майбутніх моделей ще до 2018 року.

Автономна інженерія, кодинг та нові бенчмарки

Інструмент тривалої розробки Anthropic Dynamic Workflows

Скріншот зі статті Claude.

Успіх із переписуванням кодової бази Bun став можливим завдяки релізу нової фічі від Anthropic під назвою Dynamic Workflows. Замість лінійного виконання промпту, Claude створює динамічний граф підзадач і розподіляє роботу між сотнями паралельних агентів. Одні агенти пишуть код, інші (у ролі рев’юерів) шукають помилки в результатах, а треті проганяють збірку та тести. Процес автоматично ітерується до моменту, поки етап рев’ю не поверне нульову кількість зауважень. Це робить Spec-Driven Development головним інструментом літа 2026 року.

Новий стандарт оцінки кодинг-агентів ProgramBench

Тестовий набір від Meta Superintelligence Labs, Stanford та Harvard став новим викликом для індустрії. Агент має відтворити програму з нуля, маючи лише скомпільований бінарник та користувацьку документацію. На максимальних налаштуваннях міркувань (xhigh) GPT-5.5 зміг повністю вирішити перші завдання та покрити тестами 95% функціональності у 13.5% складних репозиторіїв. Натомість Claude Opus 4.7 xhigh набрав лише 4.5%.

Оцінка довгострокових завдань на бенчмарку DeepSWE

Бенчмарк для перевірки агентів в умовах тривалого горизонту планування (в середньому потрібно додати 668 рядків коду) показав впевнене лідерство OpenAI.

Модель GPT-5.5 показує рекордні 70% успішності.

Скріншот зі статті deepswe.datacurve.ai/blog.

Аналіз траєкторій показав цікаву закономірність: сильні моделі OpenAI автономно пишуть smoke tests для самоперевірки у 80% задач, тоді як Claude часто ігнорує багатокрокові інструкції у промптах та схильний забувати про другорядні вимоги.

Флагманські оновлення LLM

Реліз OpenAI GPT-5.5 Instant

OpenAI запустила нову базову модель за замовчуванням для всіх користувачів ChatGPT. Вона повністю замінює попередню версію 5.3. Модель зберігає low-latency, але демонструє кардинальне зниження галюцинацій: у складних медичних, юридичних та фінансових запитах кількість помилкових тверджень знизилася на 52.5%. Оновлення принесло помітний приріст у тестах математичного мислення AIME 2025 (з 65.4% до 81.2%) та експертного мультимодального аналізу MMMU-Pro (до 76.0%). Модель значно краще аналізує фото, графіки та STEM-завдання, самостійно вирішуючи, коли варто підключити веб-пошук.

Оновлення Claude Opus 4.8

Anthropic випустила оновлення своєї флагманської моделі. Головні зміни торкнулися інтерфейсу міркувань та оптимізації вартості: запроваджено гранульоване налаштування глибини мислення, а швидкий режим (Fast mode) прискорює генерацію в 2.5 рази і став утричі дешевшим у перерахунку на токени. Також заявлено суттєве зниження рівня галюцинацій та підвищення показника загальної чесності моделі при роботі з суперечливими фактами.

Google I/O 2026: Gemini Flash 3.5 та платформа Antigravity

Google презентувала нове покоління своїх швидких моделей. Gemini Flash 3.5 за багатьма метриками обходить попередню Pro-версію, працюючи на нових чіпах TPU v8i зі швидкістю від 800 до 1500 токенів за секунду. Наскрізна швидкість обробки контексту в системі Antigravity зросла в 12 разів порівняно з початком року, що дозволяє паралельним субагентам розгортати масштабні робочі процеси за мінімальну вартість.

Cursor Composer 2.5 та технологія self-distillation

Команда популярної IDE випустила власну модель Composer 2.5. Вона базується на кодовій базі Kimi 2.5, але навчена з використанням технології self-distillation (коли одна й та сама модель виступає і в ролі вчителя, і в ролі учня, точково фіксуючи та виправляючи помилки у викликаних інструментах чи тестах). Модель оптимізована під CursorBench v3.1 і коштує всього $0.5 за мільйон вхідних токенів, що вдесятеро дешевше за комерційний інференс GPT-5.5, роблячи підписку Cursor вкрай привабливою для корпоративного сектору.

Кібербезпека та фундаментальна наука

Проміжні результати Project Glasswing від Anthropic

Спеціалізована хакерська модель Mythos пройшла місячний тест у реальних інфраструктурах партнерів. Результати вражають: Cloudflare за допомогою моделі виявила 2000 реальних вразливостей у своїх критичних системах (400 з яких критичного рівня), причому відсоток хибних спрацювань виявився нижчим, ніж у штатних пентестерів. При скануванні 1000 найбільших open-source репозиторіїв інтернету модель знайшла понад 6000 критичних дірок, включно з експлойтом для підробки сертифікатів у бібліотеці wolfSSL, який повністю обходить стандартні попередження браузерів.

Рейтинг стійкості систем у бенчмарку FrontierMath

В рамках Tier 4 надскладних математичних завдань дослідницького рівня Google DeepMind зайняла перше місце зі своєю новою агентською системою Co-Mathematician, вирішивши 48% завдань та обійшовши GPT-5.5 Pro (40%). Водночас автори бенчмарку з Epoch.

AI виявили, що близько третини всіх завдань у системі перевірки містили помилкові відповіді через баги попередніх автоматичних оцінювачів, тому зараз готується повна ревізія лідерборду.

Автономне вирішення відкритої проблеми в комбінаторній геометрії

Внутрішня reasoning-модель OpenAI автономно вирішила відому відкриту задачу в комбінаторній геометрії, над якою вчені билися майже 80 років (визначення кількості пар точок на відстані одиниці на площині). Модель спростувала класичну гіпотезу «квадратної сітки», знайшовши нескінченне сімейство оптимальних конструкцій за допомогою алгебраїчної теорії чисел.

Лауреат Філдсівської премії Тімоті Гауерс назвав цей результат історичною віхою для ШІ в науці.

Математичне моделювання феномену Grokking від FAIR

Директор з досліджень FAIR Юаньдун Тянь опублікував модель динаміки навчання, яка пояснює межу між меморизацією (запам’ятовуванням) та генералізацією (узагальненням). Дослідження описує три фази: lazy learning, feature learning та interactive feature learning. Науковці виявили два типи затримок: pre-grokking (до узагальнення) та anti-grokking (коли при занадто довгому навчанні модель знову втрачає здатність узагальнювати і скачується в меморизацію). Практичний висновок для інженерів: правильний підбір градієнтного шуму та weight decay потрібен для фізичного утримання моделі в оптимумі генералізації, а не для простої регуляризації.

Геополітичні обмеження на виїзд AI-фахівців у Китаї

Уряд Китаю офіційно розширив режим виїзних погоджень та контролю переміщень на провідних приватних спеціалістів у сфері комп’ютерного зору, робототехніки та глибокого навчання з таких компаній, як Alibaba та DeepSeek. Списки відтепер формуються не за формальними посадами, а за індивідуальною оцінкою критичності коду та архітектур, які розробляє конкретний інженер, що фактично прирівнює топ-дослідників ШІ до фахівців оборонного та ядерного секторів.

***

На сьогодні це все. Дякую усім за увагу до дайджесту. Буду вдячний за зворотний зв’язок, і якщо в матеріалі ще не висвітлено щось, про що ви хотіли б почитати — дайте знати в коментарях.

Дізнатися більше про культуру і роботу в SPD Technology ви можете, підписуючись на наші акаунти в соцмережах: LinkedIn, Instagram, Facebook. А якщо ви в пошуках нових карʼєрних можливостей, запрошую переглянути наші відкриті ролі.

👍ПодобаєтьсяСподобалось9
До обраногоВ обраному0
LinkedIn
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter

Підписатись на коментарі