Вийшла Claude Opus 4.8 — модель чесніша та рідше пропускає помилки у своєму коді
Anthropic випустила Claude Opus 4.8 — оновлення флагманської моделі, яке компанія називає скромним, але відчутним. Модель має краще справлятися з кодингом, агентними задачами, міркуванням та сценаріями, де треба довго тримати контекст. Opus 4.8 уже доступна за тією самою ціною, що й попередня версія: $5 за мільйон вхідних токенів та $25 за мільйон вихідних.
Разом із оновленням Anthropic запустила кілька нових функцій: effort control у Claude.ai та Cowork, dynamic workflows у Claude Code для великих багатокрокових задач та дешевший fast mode.
Що нового
Головна відмінність від попередньої версії у зменшенні кількості помилок. Opus 4.8 набагато чесніша з користувачем: наприклад, буде частіше позначати власну невпевненість та рідше робити необґрунтовані висновки. Модель приблизно в 4 рази рідше пропускає без коментаря помилки у коді, який написала сама.
Також має кращі оцінки в бенчмарках. На SWE-Bench Pro вона набирає 69,2% проти 64,3% у Opus 4.7, на OSWorld-Verified — 83,4%, а на GDPval-AA — 1890 балів проти 1769 у GPT-5.5. Водночас на Terminal-Bench Opus 4.8 поступається GPT-5.5: 74,6% проти 78,2%. Тобто хоча модель не беззаперечний переможець всюди, але явно сильніший інструмент для кодування та агентних робочих процесів.

Anthropic також каже, що Opus 4.8 рідше, ніж Opus 4.7, демонструє проблемну поведінку — наприклад, обманює або підтримує небезпечні сценарії. За цим параметром модель уже близька до Claude Mythos Preview, тобто стає більш передбачуваною та надійною у довгих агентних задачах.
Що за нові функції
У Claude.ai з’явився effort control — користувач може обрати, скільки зусиль Claude має витрачати на задачу: відповідати швидше або думати довше та глибше. В свою чергу у Claude Code з’явилися dynamic workflows для великих задач. Тепер модель може планувати роботу, запускати багато паралельних субагентів та перевіряти результат перед відповіддю.
Також оновили fast mode для Opus 4.8. За словами компанії, у цьому режимі модель може працювати у 2,5 раза швидше, а сам режим став утричі дешевшим, ніж у попередніх моделей.
Чекали апгрейда чесності моделі чи сподівались на більш вражаюче оновлення? 😅
6 коментарів
Додати коментар Підписатись на коментаріВідписатись від коментарівАктивно юзаю і кодекс, і клод, і інші. Новий клод (як і попередній, в принципі), має вайби23-річного синіора. Проактивний (аж занадто), завжди купу ідей (часто відірваних від реальності), якщо вчепиться за якусь ідею-фікс — буде йти до мети, навіть якщо просиш цього не робити. До кодекса хожу, як до не балакучого ліда, який може аргументувати клоду, чому той не правий
Яке прикольне порівняння) Клод досі не пробувала, але у порівнянні з джеміні, мені джпт здається більш балакучим та ініціативним
Цікава, не накручена статистика від компанії, яка вайбкодить на своїй же моделі. Нехай частіше додаюсь у репу .env :) Підсажують людей на голку ШІ задля отримання величезних грошей, працюючи собі у мінус.
Trustmebro benchmark statistics
нет веры, только Codex
Амінь)