Вийшла Claude Opus 4.8 — модель чесніша та рідше пропускає помилки у своєму коді

💡 Усі статті, обговорення, новини про AI — в одному місці. Приєднуйтесь до AI спільноти!

Anthropic випустила Claude Opus 4.8 — оновлення флагманської моделі, яке компанія називає скромним, але відчутним. Модель має краще справлятися з кодингом, агентними задачами, міркуванням та сценаріями, де треба довго тримати контекст. Opus 4.8 уже доступна за тією самою ціною, що й попередня версія: $5 за мільйон вхідних токенів та $25 за мільйон вихідних.

Разом із оновленням Anthropic запустила кілька нових функцій: effort control у Claude.ai та Cowork, dynamic workflows у Claude Code для великих багатокрокових задач та дешевший fast mode.

Що нового

Головна відмінність від попередньої версії у зменшенні кількості помилок. Opus 4.8 набагато чесніша з користувачем: наприклад, буде частіше позначати власну невпевненість та рідше робити необґрунтовані висновки. Модель приблизно в 4 рази рідше пропускає без коментаря помилки у коді, який написала сама.

Також має кращі оцінки в бенчмарках. На SWE-Bench Pro вона набирає 69,2% проти 64,3% у Opus 4.7, на OSWorld-Verified — 83,4%, а на GDPval-AA — 1890 балів проти 1769 у GPT-5.5. Водночас на Terminal-Bench Opus 4.8 поступається GPT-5.5: 74,6% проти 78,2%. Тобто хоча модель не беззаперечний переможець всюди, але явно сильніший інструмент для кодування та агентних робочих процесів.

Anthropic також каже, що Opus 4.8 рідше, ніж Opus 4.7, демонструє проблемну поведінку — наприклад, обманює або підтримує небезпечні сценарії. За цим параметром модель уже близька до Claude Mythos Preview, тобто стає більш передбачуваною та надійною у довгих агентних задачах.

Що за нові функції

У Claude.ai з’явився effort control — користувач може обрати, скільки зусиль Claude має витрачати на задачу: відповідати швидше або думати довше та глибше. В свою чергу у Claude Code з’явилися dynamic workflows для великих задач. Тепер модель може планувати роботу, запускати багато паралельних субагентів та перевіряти результат перед відповіддю.

Також оновили fast mode для Opus 4.8. За словами компанії, у цьому режимі модель може працювати у 2,5 раза швидше, а сам режим став утричі дешевшим, ніж у попередніх моделей.

Чекали апгрейда чесності моделі чи сподівались на більш вражаюче оновлення? 😅
👍ПодобаєтьсяСподобалось7
До обраногоВ обраному0
LinkedIn
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter

Активно юзаю і кодекс, і клод, і інші. Новий клод (як і попередній, в принципі), має вайби 23-річного синіора. Проактивний (аж занадто), завжди купу ідей (часто відірваних від реальності), якщо вчепиться за якусь ідею-фікс — буде йти до мети, навіть якщо просиш цього не робити. До кодекса хожу, як до не балакучого ліда, який може аргументувати клоду, чому той не правий

Яке прикольне порівняння) Клод досі не пробувала, але у порівнянні з джеміні, мені джпт здається більш балакучим та ініціативним

Цікава, не накручена статистика від компанії, яка вайбкодить на своїй же моделі. Нехай частіше додаюсь у репу .env :) Підсажують людей на голку ШІ задля отримання величезних грошей, працюючи собі у мінус.

Trustmebro benchmark statistics

нет веры, только Codex

Підписатись на коментарі