Рейтинг AI-агентів

Який штучний інтелект найкраще працює як агент — виконує реальні задачі з інструментами, терміналом і кодом? Щоденний рейтинг 49 агентних моделей, побудований на мільйонах реальних робочих сесій, а не на синтетичних тестах.

49 моделей 1 793 983 сесій 16 постачальників 16 відкритих моделей Оновлено: 18.08.2026
🥇
Claude Opus 5 (High)
Anthropic · Пропрієтарна
12,19% ±1,45
19 739 сесій · $5 / $25 $/M
🥈
Claude Fable 5 (High)
Anthropic · Пропрієтарна
12,01% ±2,57
24 417 сесій · $10 / $50 $/M
🥉
Claude Opus 5 (Max)
Anthropic · Пропрієтарна
11,95% ±1,71
15 515 сесій · $5 / $25 $/M

Повна таблиця: 49 моделей

Клікніть на заголовок колонки, щоб відсортувати
# Δ Модель Приріст Успіх Схвалення Керованість Відновлення Галюцинації ↓ Сесії Ціна $/M
1 1–6 Claude Opus 5 (High) Anthropic · Пропрієтарна
12,19% ±1,45
15,35% ±3,03 19,26% ±5,29 11,34% ±2,79 13,89% ±0,79 1,13% ±0,19 19 739 $5 / $25
2 1–8 Claude Fable 5 (High) Anthropic · Пропрієтарна
12,01% ±2,57
10,66% ±4,90 25,14% ±9,01 8,84% ±5,23 14,19% ±3,71 1,22% ±0,19 24 417 $10 / $50
3 1–6 Claude Opus 5 (Max) Anthropic · Пропрієтарна
11,95% ±1,71
17,96% ±3,18 19,30% ±6,26 6,95% ±3,43 14,38% ±0,88 1,18% ±0,19 15 515 $5 / $25
4 1–11 GPT 5.6 Sol (xHigh) OpenAI · Пропрієтарна
10,86% ±1,80
10,12% ±3,69 23,03% ±6,72 9,23% ±3,74 10,71% ±1,27 1,22% ±0,19 18 091 $5 / $30
5 1–8 Kimi K3 (Max) Moonshot · Ліцензія Kimi K3
10,60% ±1,04
15,55% ±2,06 20,31% ±3,78 7,80% ±1,91 8,12% ±0,83 1,22% ±0,19 28 369 $3 / $15
6 1–13 Claude Opus 4.8 (High) Anthropic · Пропрієтарна
9,78% ±1,78
9,45% ±3,10 22,52% ±5,71 8,44% ±3,33 9,29% ±2,89 0,80% ±2,47 35 151 $5 / $25
7 3–13 GPT 5.5 (xHigh) OpenAI · Пропрієтарна
8,90% ±1,03
4,97% ±2,18 14,61% ±3,62 9,17% ±1,92 14,53% ±1,25 1,21% ±0,19 47 586 $2.5 / $15
8 3–16 Claude Opus 4.7 (High) Anthropic · Пропрієтарна
8,17% ±1,43
6,61% ±2,95 12,32% ±4,81 7,72% ±2,91 13,09% ±2,08 1,12% ±0,21 36 116 $5 / $25
9 6–16 GPT 5.5 (High) OpenAI · Пропрієтарна
7,73% ±0,97
4,03% ±2,04 11,62% ±3,39 8,59% ±1,79 13,21% ±0,97 1,22% ±0,19 72 849 $2.5 / $15
10 5–16 Claude Opus 4.7 Anthropic · Пропрієтарна
7,66% ±1,45
5,45% ±3,08 11,57% ±4,71 9,95% ±2,87 10,15% ±2,31 1,17% ±0,19 36 677 $5 / $25
11 5–17 НОВА Qwen3.8 Max Alibaba · Пропрієтарна
7,61% ±1,60
12,54% ±3,32 11,64% ±5,58 5,34% ±3,09 8,40% ±1,21 0,11% ±0,41 9 314 $2 / $6
12 5–20 Claude Sonnet 5 (High) Anthropic · Пропрієтарна
7,14% ±2,29
3,13% ±4,73 15,08% ±7,93 5,22% ±4,88 11,21% ±1,80 1,07% ±0,20 25 733 $1 / $5
13 6–18 Claude Opus 4.6 Anthropic · Пропрієтарна
6,89% ±1,39
5,28% ±2,98 8,21% ±4,53 8,30% ±2,73 11,46% ±1,80 1,22% ±0,19 35 853 $5 / $25
14 8–18 GLM 5.2 (Max) Z.ai · MIT
6,74% ±0,90
8,39% ±1,91 11,60% ±3,18 6,14% ±1,58 6,33% ±1,07 1,22% ±0,19 53 469 $1.4 / $4.4
15 8–18 GPT 5.5 OpenAI · Пропрієтарна
6,35% ±0,91
3,63% ±1,98 7,71% ±3,12 7,36% ±1,72 11,86% ±1,00 1,22% ±0,19 73 997 $2.5 / $15
16 8–19 Grok 4.5 SpaceXAI · Пропрієтарна
6,19% ±1,20
6,42% ±2,68 5,04% ±4,27 7,04% ±2,29 11,22% ±1,20 1,22% ±0,19 29 943 $2 / $6
17 12–23 GPT 5.4 (High) OpenAI · Пропрієтарна
4,99% ±0,95
4,33% ±2,06 3,82% ±3,18 6,05% ±1,81 9,55% ±1,32 1,22% ±0,19 73 220 $2.5 / $15
18 11–24 GPT 5.6 Luna (xHigh) OpenAI · Пропрієтарна
4,28% ±1,88
1,09% ±4,27 8,16% ±6,50 1,48% ±3,85 11,65% ±1,45 1,22% ±0,19 8 692 $1 / $6
19 16–24 Deepseek V4 Flash (High) (20260731) DeepSeek · MIT
4,04% ±0,81
8,70% ±1,93 2,46% ±2,71 3,34% ±1,57 4,48% ±0,69 1,21% ±0,19 36 264
20 15–24 GPT 5.6 Terra (xHigh) OpenAI · Пропрієтарна
3,78% ±1,25
1,80% ±3,04 3,56% ±4,22 6,22% ±2,43 9,70% ±1,15 1,22% ±0,19 14 022 $2.5 / $15
21 17–24 Gemini 3.7 Flash (High) Google · Пропрієтарна
3,61% ±1,22
9,85% ±2,83 1,84% ±4,04 2,83% ±2,51 2,33% ±1,39 1,18% ±0,19 13 000 $0.75 / $3.57
22 17–26 Claude Sonnet 4.6 Anthropic · Пропрієтарна
3,12% ±1,40
0,06% ±3,15 1,07% ±4,17 2,21% ±2,70 11,15% ±2,72 1,09% ±0,24 36 710 $1.5 / $7.5
23 17–32 Claude Opus 4.8 Anthropic · Пропрієтарна
2,12% ±2,72
8,76% ±3,17 13,67% ±5,40 8,34% ±3,22 10,86% ±2,23 31,01% ±10,90 33 192 $5 / $25
24 22–29 Muse Spark 1.1 Meta · Пропрієтарна
1,17% ±0,61
7,28% ±1,40 4,95% ±1,82 3,25% ±1,15 5,59% ±1,20 1,19% ±0,19 72 668 $1.25 / $4.25
25 18–34 Kimi K2.7 Code Moonshot · Модифікований MIT
1,08% ±2,15
4,43% ±4,55 2,74% ±7,27 1,76% ±4,86 1,22% ±2,58 1,22% ±0,19 11 029 $0.47 / $2
26 23–32 GLM 5.1 Z.ai · MIT
0,58% ±0,82
1,75% ±1,82 0,84% ±2,56 1,73% ±1,48 0,91% ±1,47 0,53% ±0,37 71 334 $1.4 / $4.4
27 23–33 Qwen3.7 Max Alibaba · Пропрієтарна
0,20% ±0,87
0,34% ±2,13 4,24% ±2,67 0,03% ±1,52 5,02% ±1,47 0,60% ±0,27 30 743
28 23–33 DeepSeek V4 Pro DeepSeek · MIT
0,14% ±0,88
2,16% ±2,21 2,50% ±2,82 0,59% ±1,63 4,41% ±0,98 0,35% ±0,29 30 083 $1.32 / $3.96
29 24–33 Gemini 3.5 Flash (High) Google · Пропрієтарна
0,29% ±0,64
0,63% ±1,50 0,28% ±1,99 0,47% ±1,17 1,66% ±1,00 0,32% ±0,22 93 770 $0.75 / $4.5
30 24–35 Gemini 3.1 Pro Preview Google · Пропрієтарна
0,44% ±0,75
1,49% ±1,69 3,65% ±2,32 3,21% ±1,32 11,48% ±1,43 0,93% ±0,31 81 349 $1 / $6
31 22–38 Kimi K2.6 Moonshot · Модифікований MIT
0,56% ±2,31
0,56% ±4,67 2,05% ±7,32 1,15% ±4,96 5,46% ±4,40 1,22% ±0,19 11 177 $0.95 / $4
32 24–38 Hy3 Tencent · Apache 2.0
1,31% ±1,27
2,47% ±2,84 1,80% ±4,39 8,63% ±2,38 4,01% ±1,56 1,27% ±0,71 18 388 $0.13 / $0.53
33 29–38 Mimo V2.5 Pro Xiaomi · MIT
1,97% ±0,91
2,81% ±2,21 6,62% ±2,77 1,98% ±1,63 1,57% ±1,59 0,01% ±0,34 31 435 $0.43 / $0.87
34 26–38 Qwen3.7 Plus Alibaba · Пропрієтарна
1,98% ±1,34
1,10% ±3,43 9,74% ±4,03 5,57% ±2,78 6,35% ±1,81 0,17% ±0,40 16 766 $0.32 / $1.28
35 31–38 DeepSeek V4 Flash DeepSeek · MIT
2,20% ±0,90
2,02% ±2,43 9,24% ±2,73 1,00% ±1,69 2,61% ±1,02 1,33% ±0,42 23 570 $0.44 / $1.32
36 30–38 Gemini 3.6 Flash (High) Google · Пропрієтарна
2,36% ±1,22
0,87% ±2,99 4,12% ±3,90 4,42% ±2,38 3,57% ±1,69 1,18% ±0,20 12 411 $0.38 / $1.88
37 31–38 Minimax M3 MiniMax · Ліцензія MiniMax
2,53% ±0,84
5,81% ±2,22 8,24% ±2,60 5,14% ±1,58 5,87% ±0,83 0,69% ±0,33 31 143 $0.6 / $2.4
38 31–38 Gemini 3.5 Flash (Medium) Google · Пропрієтарна
3,48% ±1,43
8,34% ±3,61 5,74% ±4,26 3,50% ±2,82 0,34% ±2,26 0,51% ±0,67 12 965 $0.75 / $4.5
39 39–40 Inkling Thinky · Apache 2.0
6,57% ±0,91
11,70% ±2,59 16,70% ±2,61 11,78% ±1,86 6,79% ±1,08 0,56% ±0,27 35 781 $0.5 / $2.02
40 39–44 Mistral Medium 3.5 Mistral · Модифікований MIT
7,03% ±2,00
9,72% ±4,62 9,83% ±5,70 11,01% ±4,03 1,69% ±3,56 2,87% ±2,12 5 730 $1.5 / $7.5
41 40–45 Grok 4.3 (High) SpaceXAI · Пропрієтарна
8,47% ±0,89
9,71% ±1,86 13,27% ±2,02 7,20% ±1,37 13,25% ±2,98 1,09% ±0,19 62 174 $1.25 / $2.5
42 40–45 Gemini 3 Flash Google · Пропрієтарна
8,50% ±0,87
7,16% ±1,70 10,22% ±1,95 3,43% ±1,29 21,02% ±2,39 0,65% ±1,86 82 748 $0.5 / $3
43 40–45 Grok Build 0.1 SpaceXAI · Пропрієтарна
9,10% ±0,95
5,37% ±1,92 11,02% ±2,32 8,61% ±1,68 21,44% ±2,91 0,96% ±0,19 73 718
44 40–47 Solar Pro 4 Upstage · Пропрієтарна
10,10% ±2,23
8,44% ±5,67 15,67% ±6,83 13,32% ±4,02 13,56% ±4,52 0,51% ±0,53 4 851 $0.03 / $0.12
45 41–46 Gemini 3.5 Flash Lite Google · Пропрієтарна
10,38% ±1,19
12,73% ±2,91 13,51% ±3,03 10,28% ±2,25 15,08% ±2,74 0,28% ±0,50 20 237 $0.15 / $1.25
46 44–47 Minimax M2.7 MiniMax · Модифікований MIT
11,17% ±1,08
10,88% ±2,51 15,51% ±2,87 13,67% ±1,96 16,82% ±2,89 1,03% ±0,23 31 290 $0.3 / $1.2
47 45–49 Nemotron 3 Ultra Nvidia · OpenMDW-1.1
14,63% ±2,54
15,38% ±5,41 14,33% ±6,73 19,91% ±4,74 24,09% ±7,19 0,54% ±0,35 11 997
48 47–48 Grok 4.3 SpaceXAI · Пропрієтарна
14,67% ±1,27
10,83% ±1,76 16,23% ±1,84 5,65% ±1,30 41,77% ±5,52 1,14% ±0,19 82 146 $1.25 / $2.5
49 48–49 Gemma 4 31B Google · Apache 2.0
18,88% ±2,85
0,26% ±2,07 2,58% ±3,00 9,36% ±2,05 51,50% ±11,13 31,21% ±7,86 56 561 $0.14 / $0.4

Рейтинг оновлюється автоматично щодня. У колонці Δ — зміна позиції відносно попереднього оновлення.

Лідери за метриками

Серед топ-20 рейтингу
Приріст якості
Claude Opus 5 (High)#1 · Anthropic 12,19%
Підтверджений успіх
Claude Opus 5 (Max)#3 · Anthropic 17,96%
Схвалення користувачів
Claude Fable 5 (High)#2 · Anthropic 25,14%
Керованість
Claude Opus 5 (High)#1 · Anthropic 11,34%
Відновлення в терміналі
GPT 5.5 (xHigh)#7 · OpenAI 14,53%
Галюцинації інструментів менше = краще
Qwen3.8 Max#11 · Alibaba 0,11%

Топ-15 за приростом якості

Наскільки модель-агент покращує результат задачі порівняно з базовим рівнем (Net Improvement). Колір — постачальник.

Динаміка топ-моделей

Як змінюється приріст якості лідерів з кожним оновленням даних.

Моделі за постачальниками

Ціна vs якість

Вісь X — ціна за 1M вихідних токенів ($), вісь Y — приріст якості. Шукайте точки лівіше і вище.

Як читати цей рейтинг

Приріст якості

Головна метрика. Показує, наскільки модель-агент реально покращує результат задачі порівняно з базовим рівнем — з урахуванням і успіхів, і зіпсованих спроб. 12% у лідера — це великий відрив: більшість моделей нижче 5%.

Підтверджений успіх

Частка сесій, де успішне виконання задачі підтверджено (тестами, перевіркою результату), а не просто «модель сказала, що зробила».

Схвалення користувачів

Баланс похвал і скарг живих користувачів після сесій. Висока цифра означає, що людям справді подобається працювати з цим агентом.

Керованість

Керованість: чи слухається модель інструкцій, чи тримається плану, чи легко її скоригувати посеред задачі.

Відновлення в терміналі

Робота з терміналом: як часто агент сам виправляється після помилки команди замість того, щоб зациклитись або здатися.

Галюцинації інструментів ↓

Єдина метрика, де менше = краще: як часто модель викликає неіснуючі інструменти або вигадує їхні параметри. У найкращих — близько 1%.

На відміну від класичних бенчмарків, цей рейтинг будується на реальних агентних сесіях: мільйони запусків, де ШІ керує інструментами, пише й виконує код, працює з файлами і терміналом. Це найближча до практики відповідь на питання «який ШІ найкращий для реальної роботи, а не для тестів».

Для кожної метрики вказано довірчий інтервал (±). Якщо інтервали двох моделей перетинаються — різниця між ними статистично незначуща, тому поруч із рангом ми показуємо і діапазон можливих позицій (наприклад, «1–6»). Колонка Δ показує зміну позиції відносно попереднього зрізу даних — так видно, хто росте, а хто здає.

Ціни вказано у доларах за мільйон токенів (вхідні / вихідні) — це дає змогу оцінити не лише якість, а й вартість практичного використання: подивіться на графік «Ціна vs якість», щоб знайти оптимальні за співвідношенням моделі.

Часті питання

Який AI-агент зараз найкращий?

Зараз рейтинг очолює Claude Opus 5 (High) від Anthropic з Net Improvement 12,19%. Але зважайте на довірчі інтервали: верхівка рейтингу часто статистично нерозрізненна.

Як часто оновлюється цей рейтинг?

Дані перевіряються щодня. Якщо рейтинг змінився — сторінка оновлюється автоматично, а в колонці Δ з'являються стрілки змін позицій.

Чим цей рейтинг відрізняється від звичайних бенчмарків?

Класичні бенчмарки — це фіксовані набори задач, під які моделі можуть «підучуватися». Тут моделі оцінюються на мільйонах реальних агентних сесій із реальними інструментами, тому такий рейтинг складніше «обдурити» і він ближчий до практики.

Що таке AI-агент і чим він відрізняється від чат-бота?

Чат-бот відповідає текстом. Агент — діє: викликає інструменти, виконує команди в терміналі, редагує файли, перевіряє результат і виправляє власні помилки. Саме агентні можливості вимірює цей рейтинг.

Чи є у рейтингу безкоштовні або відкриті моделі?

Так, зараз у таблиці 16 моделей з відкритими вагами (Apache 2.0, MIT та інші ліцензії) — їх можна запускати на власному обладнанні. Шукайте ліцензію під назвою моделі.

 
 
Цитувати