28 Липня, 2026

Стрибок у логічному мисленні: Claude Opus 5 майже вчетверо покращує попередній рекорд

Нова LLM-модель Claude Opus 5, яку Anthropic представила перед вихідними, показала стрибок на бенчмарку ARC-AGI-3, який вважається одним із найскладніших тестів на абстрактне мислення для штучного інтелекту — на відміну від більшості інших тестів, він побудований так, щоб виключити переваги від запам’ятовування даних під час тренування.

Читайте также: Сотні фігурок та імпортні амфори. Археологи виявили новий похоронний комплекс у єгипетському некрополі Кесна

Стрибок у логічному мисленні: Claude Opus 5 майже вчетверо покращує попередній рекорд

Opus 5 набирає 30,2% на бенчмарку ARC-AGI-3 — це майже вчетверо більше за попередній рекорд у 7,8%, який належав моделі OpenAI GPT-5.6 Sol (Max). Команда розробників тесту пов’язує цей відрив із дійсно сильнішим логічним мисленням моделі, яке дозволяє їй автономніше досліджувати незнайомі середовища, планувати дії та виконувати їх.

Під час тестування Opus 5 продемонстрував поведінку, якої раніше не спостерігали в жодної моделі: він перекладав завдання в алгебраїчні позначення та самостійно виводив рівняння відбиття. Крім того, модель розв’язала п’ять середовищ, які раніше не піддавалися жодній системі, причому чотири з них — на рівні людини або вище. За словами дослідників, результат Opus 5 також суттєво випереджає «Fable-класс» моделей Anthropic, які показують близько 20% на ARC-AGI-3.

На попередній версії бенчмарку, ARC-AGI-2, Opus 5 набрала 90,4%, а на ARC-AGI-1 — 97,5%; обидва результати відповідають попереднім лідерам рейтингу, хоча й за дещо вищою вартістю запиту. Наразі розв’язано шість із 25 публічних демо-середовищ ARC-AGI-3.

Варто зауважити: офіційний рейтинг враховує лише самостійну роботу мовної моделі — деякі системи вже долали поріг бенчмарку за допомогою додаткового програмного «обв’язування» (harness), але такі результати не потрапляють у офіційний залік. Дослідники ARC Prize окремо відзначили, що результат Opus 5, ймовірно, був би ще вищим, якби модель тестувалась у складі Claude Code.

Офіційна порівняльна таблиця Claude Opus 5 (Anthropic)

Категорія / БенчмаркClaude Opus 5Claude Fable 5Claude Opus 4.8GPT-5.6 Sol
Агентне термінальне кодування — Frontier-Bench v0.143,3%33,7%21,1%34,4%
Робота зі знаннями — GDPval-AA v2 (Elo)1861174715931736
Розв’язання нових задач — ARC-AGI-330,2%1,5%7,8%
Агентний пошук — BrowseComp90,8%87,4%84,3%90,4%
Мультидисциплінарне мислення — Humanity’s Last Exam (без інструментів)56,3%56,5%49,8%
Мультидисциплінарне мислення — Humanity’s Last Exam (з інструментами)64,7%63,9%57,9%
Комп’ютерне використання — OSWorld 2.070,6%66,1%55,7%62,6%
Агентне кодування — DeepSWE v1.168,8%69,7%59,0%72,7%
Агентне кодування — FrontierCode v1.1 (Main)53,4%53,5%46,5%47,5%
Бізнес-процеси — AutomationBench26,0%17,4%17,0%18,1%
Юридична робота — Legal Agent Benchmark (Held-out)11,7%13,3%10,4%2,5%
Охорона здоров’я — HealthBench Professional59,8%66,0% (Mythos 5)57,4%60,5%
Біологія — BioMysteryBench (складні задачі)49,4%46,5%42,4%
Біологія — BioMysteryBench (розв’язані людьми)90,1%89,0% (Mythos 5)88,5%

Джерело: офіційна таблиця Anthropic з анонсу Claude Opus 5 (24 липня 2026 р.). Прочерк означає відсутність опублікованих даних для цієї моделі на цьому бенчмарку. Для рядків «Юридична робота» та «Біологія» Fable 5 не мала власного результату — Anthropic показала замість неї Mythos 5.

Ключові висновки з таблиці

Opus 5 лідирує у 9 з 13 показаних категорій, зокрема з великим відривом на ARC-AGI-3 (новизна задач) та Frontier-Bench (агентне кодування в терміналі). Водночас таблиця чесно показує три випадки, де модель поступається:

  • DeepSWE v1.1 — GPT-5.6 Sol попереду (72,7% проти 68,8%);
  • Humanity’s Last Exam без інструментів та Legal Agent Benchmark — тут скромно виграє Fable 5;
  • HealthBench Professional — найкращий результат тут не в Opus 5, а в Mythos 5 (66,0%), що логічно, адже це модель вищого класу.

Хочете, щоб я вбудував цю уточнену таблицю в текст рерайту замість попередньої версії?

Незалежні тести показують скромніший прогрес

Не всі результати такі однозначні. Тести на приватному бенчмарку Witness дослідника Гуанхана Нінга, орієнтованому на інтерактивні пазли, показали набагато скромніший прогрес: Opus 5 набрала 43,4 бала, статистично зрівнявшись із Kimi K3 та Fable 5, і покращення відносно Opus 4.8 виявилось значно меншим, ніж на ARC-AGI-3.

Читайте также: Сильніший за колайдер. Науковці знайшли найпотужніший прискорювач частинок у галактиці

На пазлі зі знайомою механікою Opus 5 сформулювала приховані правила ще до першого ходу, але коли гра поєднувала правила в менш звичний спосіб, модель показала гірший результат, ніж Opus 4.8. Дослідник припускає, що це узгоджується з гіпотезою про цільове тренування на даних, специфічних для жанру головоломок, хоча точно визначити, які саме дані використовувала Anthropic, неможливо.

Втім, один із авторів ARC-AGI-3 Грег Камрадт зауважив, що результати не виключають ширшого покращення мислення — знайомий пазл міг просто не перевіряти новизну, а слабший результат в іншій незвичній грі міг бути ізольованою регресією. Пізніше сам Нінг уточнив, що Opus 5 таки показала загальніший прогрес на Witness, хоча й значно менший, ніж на ARC-AGI-3, порівнявши цю динаміку з тим, як раніше розвивалися бенчмарки для програмування — від насиченого HumanEval до сучасних агентних систем.

Практичне застосування: ціна, ефективність, обмеження

Головна інтрига релізу Opus 5 — не лише в бенчмарках, а в ціновій політиці. Anthropic утримала ціну на рівні попередньої моделі Opus 4.8, фактично вдвічі знизивши вартість за одиницю продуктивності на ключових агентних завданнях. Модель коштує $5 за мільйон вхідних токенів і $25 за мільйон вихідних — тобто вдвічі дешевше за Fable 5.

Практичні переваги проявляються насамперед в агентних сценаріях:

  • на OSWorld 2.0 (тест на керування комп’ютером) Opus 5 досягла 70,57% проти 55,7% в Opus 4.8;
  • на Zapier AutomationBench результат зріс до 26,0% проти 17,0% в Opus 4.8 та 17,4% в Fable 5;
  • на OSWorld модель перевершує найкращий результат Fable 5, витрачаючи трохи більше третини її вартості.

Anthropic також відкрито визнає слабкі місця. Компанія підтверджує, що Opus 5 усе ще поступається Mythos 5 у задачах з кібербезпеки та біологічних досліджень, а одна з моделей сімейства OpenAI досі лідирує на одному з агентних бенчмарків програмування. Крім того, компанія опублікувала й «незручні» дані — зокрема, дещо вищий рівень фактологічних галюцинацій порівняно з Opus 4.8.

Технічно модель отримала режим Fast, що працює приблизно у 2,5 раза швидше за стандартний за подвійною базовою ціною, автоматичну маршрутизацію запитів (fallback routing) в API, а також можливість змінювати набір інструментів посеред розмови без втрати кешу підказки. Як і попередні моделі Opus, Opus 5 не вимагає обов’язкового збереження даних для звичайного доступу — цей момент компанія окремо підкреслила для клієнтів із жорсткими вимогами до нульового зберігання даних (zero data retention).

Рекорд на ARC-AGI-3 — найяскравіший, але не єдиний показник релізу Opus 5. Він переконливо демонструє прогрес у здатності моделі розв’язувати справді нові завдання без опори на завчені шаблони, хоча незалежні тести на інших пазлах натякають, що масштаб цього прогресу поки не варто перебільшувати за межами конкретного бенчмарку. У практичному ж вимірі головна новина — не сам скачок в інтелекті, а те, що Anthropic впровадила його без підвищення ціни, зробивши раніше нерентабельні автоматизовані сценарії економічно доцільними.

Нагадаємо, кілька днів тому Claude Fable 5 спростувала гіпотезу Якобі, яка не піддавалася математикам 87 років.

Читайте также: Тепло не зупиняють, а обводять. Інженери зробили перший тривимірний плащ проти тепловізорів

Підписуйтесь на нас у соцмережах: Telegram | Facebook | LinkedIn

Автор admin

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *