Рейтинг AI-агентів
Який штучний інтелект найкраще працює як агент — виконує реальні задачі з інструментами, терміналом і кодом? Щоденний рейтинг 49 агентних моделей, побудований на мільйонах реальних робочих сесій, а не на синтетичних тестах.
Повна таблиця: 49 моделей
Клікніть на заголовок колонки, щоб відсортувати| # | Δ | Модель | Приріст ⓘ | Успіх ⓘ | Схвалення ⓘ | Керованість ⓘ | Відновлення ⓘ | Галюцинації ↓ ⓘ | Сесії | Ціна $/M |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 1–6 | — | Claude Opus 5 (High) Anthropic · Пропрієтарна |
12,19%
±1,45
|
15,35% ±3,03 | 19,26% ±5,29 | 11,34% ±2,79 | 13,89% ±0,79 | 1,13% ±0,19 | 19 739 | $5 / $25 |
| 2 1–8 | — | Claude Fable 5 (High) Anthropic · Пропрієтарна |
12,01%
±2,57
|
10,66% ±4,90 | 25,14% ±9,01 | 8,84% ±5,23 | 14,19% ±3,71 | 1,22% ±0,19 | 24 417 | $10 / $50 |
| 3 1–6 | — | Claude Opus 5 (Max) Anthropic · Пропрієтарна |
11,95%
±1,71
|
17,96% ±3,18 | 19,30% ±6,26 | 6,95% ±3,43 | 14,38% ±0,88 | 1,18% ±0,19 | 15 515 | $5 / $25 |
| 4 1–11 | — | GPT 5.6 Sol (xHigh) OpenAI · Пропрієтарна |
10,86%
±1,80
|
10,12% ±3,69 | 23,03% ±6,72 | 9,23% ±3,74 | 10,71% ±1,27 | 1,22% ±0,19 | 18 091 | $5 / $30 |
| 5 1–8 | — | Kimi K3 (Max) Moonshot · Ліцензія Kimi K3 |
10,60%
±1,04
|
15,55% ±2,06 | 20,31% ±3,78 | 7,80% ±1,91 | 8,12% ±0,83 | 1,22% ±0,19 | 28 369 | $3 / $15 |
| 6 1–13 | — | Claude Opus 4.8 (High) Anthropic · Пропрієтарна |
9,78%
±1,78
|
9,45% ±3,10 | 22,52% ±5,71 | 8,44% ±3,33 | 9,29% ±2,89 | 0,80% ±2,47 | 35 151 | $5 / $25 |
| 7 3–13 | — | GPT 5.5 (xHigh) OpenAI · Пропрієтарна |
8,90%
±1,03
|
4,97% ±2,18 | 14,61% ±3,62 | 9,17% ±1,92 | 14,53% ±1,25 | 1,21% ±0,19 | 47 586 | $2.5 / $15 |
| 8 3–16 | — | Claude Opus 4.7 (High) Anthropic · Пропрієтарна |
8,17%
±1,43
|
6,61% ±2,95 | 12,32% ±4,81 | 7,72% ±2,91 | 13,09% ±2,08 | 1,12% ±0,21 | 36 116 | $5 / $25 |
| 9 6–16 | — | GPT 5.5 (High) OpenAI · Пропрієтарна |
7,73%
±0,97
|
4,03% ±2,04 | 11,62% ±3,39 | 8,59% ±1,79 | 13,21% ±0,97 | 1,22% ±0,19 | 72 849 | $2.5 / $15 |
| 10 5–16 | — | Claude Opus 4.7 Anthropic · Пропрієтарна |
7,66%
±1,45
|
5,45% ±3,08 | 11,57% ±4,71 | 9,95% ±2,87 | 10,15% ±2,31 | 1,17% ±0,19 | 36 677 | $5 / $25 |
| 11 5–17 | НОВА | Qwen3.8 Max Alibaba · Пропрієтарна |
7,61%
±1,60
|
12,54% ±3,32 | 11,64% ±5,58 | 5,34% ±3,09 | 8,40% ±1,21 | 0,11% ±0,41 | 9 314 | $2 / $6 |
| 12 5–20 | — | Claude Sonnet 5 (High) Anthropic · Пропрієтарна |
7,14%
±2,29
|
3,13% ±4,73 | 15,08% ±7,93 | 5,22% ±4,88 | 11,21% ±1,80 | 1,07% ±0,20 | 25 733 | $1 / $5 |
| 13 6–18 | — | Claude Opus 4.6 Anthropic · Пропрієтарна |
6,89%
±1,39
|
5,28% ±2,98 | 8,21% ±4,53 | 8,30% ±2,73 | 11,46% ±1,80 | 1,22% ±0,19 | 35 853 | $5 / $25 |
| 14 8–18 | — | GLM 5.2 (Max) Z.ai · MIT |
6,74%
±0,90
|
8,39% ±1,91 | 11,60% ±3,18 | 6,14% ±1,58 | 6,33% ±1,07 | 1,22% ±0,19 | 53 469 | $1.4 / $4.4 |
| 15 8–18 | — | GPT 5.5 OpenAI · Пропрієтарна |
6,35%
±0,91
|
3,63% ±1,98 | 7,71% ±3,12 | 7,36% ±1,72 | 11,86% ±1,00 | 1,22% ±0,19 | 73 997 | $2.5 / $15 |
| 16 8–19 | — | Grok 4.5 SpaceXAI · Пропрієтарна |
6,19%
±1,20
|
6,42% ±2,68 | 5,04% ±4,27 | 7,04% ±2,29 | 11,22% ±1,20 | 1,22% ±0,19 | 29 943 | $2 / $6 |
| 17 12–23 | — | GPT 5.4 (High) OpenAI · Пропрієтарна |
4,99%
±0,95
|
4,33% ±2,06 | 3,82% ±3,18 | 6,05% ±1,81 | 9,55% ±1,32 | 1,22% ±0,19 | 73 220 | $2.5 / $15 |
| 18 11–24 | — | GPT 5.6 Luna (xHigh) OpenAI · Пропрієтарна |
4,28%
±1,88
|
1,09% ±4,27 | 8,16% ±6,50 | 1,48% ±3,85 | 11,65% ±1,45 | 1,22% ±0,19 | 8 692 | $1 / $6 |
| 19 16–24 | — | Deepseek V4 Flash (High) (20260731) DeepSeek · MIT |
4,04%
±0,81
|
8,70% ±1,93 | 2,46% ±2,71 | 3,34% ±1,57 | 4,48% ±0,69 | 1,21% ±0,19 | 36 264 | — |
| 20 15–24 | — | GPT 5.6 Terra (xHigh) OpenAI · Пропрієтарна |
3,78%
±1,25
|
1,80% ±3,04 | 3,56% ±4,22 | 6,22% ±2,43 | 9,70% ±1,15 | 1,22% ±0,19 | 14 022 | $2.5 / $15 |
| 21 17–24 | — | Gemini 3.7 Flash (High) Google · Пропрієтарна |
3,61%
±1,22
|
9,85% ±2,83 | 1,84% ±4,04 | 2,83% ±2,51 | 2,33% ±1,39 | 1,18% ±0,19 | 13 000 | $0.75 / $3.57 |
| 22 17–26 | — | Claude Sonnet 4.6 Anthropic · Пропрієтарна |
3,12%
±1,40
|
0,06% ±3,15 | 1,07% ±4,17 | 2,21% ±2,70 | 11,15% ±2,72 | 1,09% ±0,24 | 36 710 | $1.5 / $7.5 |
| 23 17–32 | — | Claude Opus 4.8 Anthropic · Пропрієтарна |
2,12%
±2,72
|
8,76% ±3,17 | 13,67% ±5,40 | 8,34% ±3,22 | 10,86% ±2,23 | 31,01% ±10,90 | 33 192 | $5 / $25 |
| 24 22–29 | — | Muse Spark 1.1 Meta · Пропрієтарна |
1,17%
±0,61
|
7,28% ±1,40 | 4,95% ±1,82 | 3,25% ±1,15 | 5,59% ±1,20 | 1,19% ±0,19 | 72 668 | $1.25 / $4.25 |
| 25 18–34 | — | Kimi K2.7 Code Moonshot · Модифікований MIT |
1,08%
±2,15
|
4,43% ±4,55 | 2,74% ±7,27 | 1,76% ±4,86 | 1,22% ±2,58 | 1,22% ±0,19 | 11 029 | $0.47 / $2 |
| 26 23–32 | — | GLM 5.1 Z.ai · MIT |
0,58%
±0,82
|
1,75% ±1,82 | 0,84% ±2,56 | 1,73% ±1,48 | 0,91% ±1,47 | 0,53% ±0,37 | 71 334 | $1.4 / $4.4 |
| 27 23–33 | — | Qwen3.7 Max Alibaba · Пропрієтарна |
0,20%
±0,87
|
0,34% ±2,13 | 4,24% ±2,67 | 0,03% ±1,52 | 5,02% ±1,47 | 0,60% ±0,27 | 30 743 | — |
| 28 23–33 | — | DeepSeek V4 Pro DeepSeek · MIT |
0,14%
±0,88
|
2,16% ±2,21 | 2,50% ±2,82 | 0,59% ±1,63 | 4,41% ±0,98 | 0,35% ±0,29 | 30 083 | $1.32 / $3.96 |
| 29 24–33 | — | Gemini 3.5 Flash (High) Google · Пропрієтарна |
0,29%
±0,64
|
0,63% ±1,50 | 0,28% ±1,99 | 0,47% ±1,17 | 1,66% ±1,00 | 0,32% ±0,22 | 93 770 | $0.75 / $4.5 |
| 30 24–35 | — | Gemini 3.1 Pro Preview Google · Пропрієтарна |
0,44%
±0,75
|
1,49% ±1,69 | 3,65% ±2,32 | 3,21% ±1,32 | 11,48% ±1,43 | 0,93% ±0,31 | 81 349 | $1 / $6 |
| 31 22–38 | — | Kimi K2.6 Moonshot · Модифікований MIT |
0,56%
±2,31
|
0,56% ±4,67 | 2,05% ±7,32 | 1,15% ±4,96 | 5,46% ±4,40 | 1,22% ±0,19 | 11 177 | $0.95 / $4 |
| 32 24–38 | — | Hy3 Tencent · Apache 2.0 |
1,31%
±1,27
|
2,47% ±2,84 | 1,80% ±4,39 | 8,63% ±2,38 | 4,01% ±1,56 | 1,27% ±0,71 | 18 388 | $0.13 / $0.53 |
| 33 29–38 | — | Mimo V2.5 Pro Xiaomi · MIT |
1,97%
±0,91
|
2,81% ±2,21 | 6,62% ±2,77 | 1,98% ±1,63 | 1,57% ±1,59 | 0,01% ±0,34 | 31 435 | $0.43 / $0.87 |
| 34 26–38 | — | Qwen3.7 Plus Alibaba · Пропрієтарна |
1,98%
±1,34
|
1,10% ±3,43 | 9,74% ±4,03 | 5,57% ±2,78 | 6,35% ±1,81 | 0,17% ±0,40 | 16 766 | $0.32 / $1.28 |
| 35 31–38 | — | DeepSeek V4 Flash DeepSeek · MIT |
2,20%
±0,90
|
2,02% ±2,43 | 9,24% ±2,73 | 1,00% ±1,69 | 2,61% ±1,02 | 1,33% ±0,42 | 23 570 | $0.44 / $1.32 |
| 36 30–38 | — | Gemini 3.6 Flash (High) Google · Пропрієтарна |
2,36%
±1,22
|
0,87% ±2,99 | 4,12% ±3,90 | 4,42% ±2,38 | 3,57% ±1,69 | 1,18% ±0,20 | 12 411 | $0.38 / $1.88 |
| 37 31–38 | — | Minimax M3 MiniMax · Ліцензія MiniMax |
2,53%
±0,84
|
5,81% ±2,22 | 8,24% ±2,60 | 5,14% ±1,58 | 5,87% ±0,83 | 0,69% ±0,33 | 31 143 | $0.6 / $2.4 |
| 38 31–38 | — | Gemini 3.5 Flash (Medium) Google · Пропрієтарна |
3,48%
±1,43
|
8,34% ±3,61 | 5,74% ±4,26 | 3,50% ±2,82 | 0,34% ±2,26 | 0,51% ±0,67 | 12 965 | $0.75 / $4.5 |
| 39 39–40 | — | Inkling Thinky · Apache 2.0 |
6,57%
±0,91
|
11,70% ±2,59 | 16,70% ±2,61 | 11,78% ±1,86 | 6,79% ±1,08 | 0,56% ±0,27 | 35 781 | $0.5 / $2.02 |
| 40 39–44 | — | Mistral Medium 3.5 Mistral · Модифікований MIT |
7,03%
±2,00
|
9,72% ±4,62 | 9,83% ±5,70 | 11,01% ±4,03 | 1,69% ±3,56 | 2,87% ±2,12 | 5 730 | $1.5 / $7.5 |
| 41 40–45 | — | Grok 4.3 (High) SpaceXAI · Пропрієтарна |
8,47%
±0,89
|
9,71% ±1,86 | 13,27% ±2,02 | 7,20% ±1,37 | 13,25% ±2,98 | 1,09% ±0,19 | 62 174 | $1.25 / $2.5 |
| 42 40–45 | — | Gemini 3 Flash Google · Пропрієтарна |
8,50%
±0,87
|
7,16% ±1,70 | 10,22% ±1,95 | 3,43% ±1,29 | 21,02% ±2,39 | 0,65% ±1,86 | 82 748 | $0.5 / $3 |
| 43 40–45 | — | Grok Build 0.1 SpaceXAI · Пропрієтарна |
9,10%
±0,95
|
5,37% ±1,92 | 11,02% ±2,32 | 8,61% ±1,68 | 21,44% ±2,91 | 0,96% ±0,19 | 73 718 | — |
| 44 40–47 | — | Solar Pro 4 Upstage · Пропрієтарна |
10,10%
±2,23
|
8,44% ±5,67 | 15,67% ±6,83 | 13,32% ±4,02 | 13,56% ±4,52 | 0,51% ±0,53 | 4 851 | $0.03 / $0.12 |
| 45 41–46 | — | Gemini 3.5 Flash Lite Google · Пропрієтарна |
10,38%
±1,19
|
12,73% ±2,91 | 13,51% ±3,03 | 10,28% ±2,25 | 15,08% ±2,74 | 0,28% ±0,50 | 20 237 | $0.15 / $1.25 |
| 46 44–47 | — | Minimax M2.7 MiniMax · Модифікований MIT |
11,17%
±1,08
|
10,88% ±2,51 | 15,51% ±2,87 | 13,67% ±1,96 | 16,82% ±2,89 | 1,03% ±0,23 | 31 290 | $0.3 / $1.2 |
| 47 45–49 | — | Nemotron 3 Ultra Nvidia · OpenMDW-1.1 |
14,63%
±2,54
|
15,38% ±5,41 | 14,33% ±6,73 | 19,91% ±4,74 | 24,09% ±7,19 | 0,54% ±0,35 | 11 997 | — |
| 48 47–48 | — | Grok 4.3 SpaceXAI · Пропрієтарна |
14,67%
±1,27
|
10,83% ±1,76 | 16,23% ±1,84 | 5,65% ±1,30 | 41,77% ±5,52 | 1,14% ±0,19 | 82 146 | $1.25 / $2.5 |
| 49 48–49 | — | Gemma 4 31B Google · Apache 2.0 |
18,88%
±2,85
|
0,26% ±2,07 | 2,58% ±3,00 | 9,36% ±2,05 | 51,50% ±11,13 | 31,21% ±7,86 | 56 561 | $0.14 / $0.4 |
Рейтинг оновлюється автоматично щодня. У колонці Δ — зміна позиції відносно попереднього оновлення.
Лідери за метриками
Серед топ-20 рейтингуТоп-15 за приростом якості
Наскільки модель-агент покращує результат задачі порівняно з базовим рівнем (Net Improvement). Колір — постачальник.
Динаміка топ-моделей
Як змінюється приріст якості лідерів з кожним оновленням даних.
Моделі за постачальниками
Ціна vs якість
Вісь X — ціна за 1M вихідних токенів ($), вісь Y — приріст якості. Шукайте точки лівіше і вище.
Як читати цей рейтинг
Приріст якості
Головна метрика. Показує, наскільки модель-агент реально покращує результат задачі порівняно з базовим рівнем — з урахуванням і успіхів, і зіпсованих спроб. 12% у лідера — це великий відрив: більшість моделей нижче 5%.
Підтверджений успіх
Частка сесій, де успішне виконання задачі підтверджено (тестами, перевіркою результату), а не просто «модель сказала, що зробила».
Схвалення користувачів
Баланс похвал і скарг живих користувачів після сесій. Висока цифра означає, що людям справді подобається працювати з цим агентом.
Керованість
Керованість: чи слухається модель інструкцій, чи тримається плану, чи легко її скоригувати посеред задачі.
Відновлення в терміналі
Робота з терміналом: як часто агент сам виправляється після помилки команди замість того, щоб зациклитись або здатися.
Галюцинації інструментів ↓
Єдина метрика, де менше = краще: як часто модель викликає неіснуючі інструменти або вигадує їхні параметри. У найкращих — близько 1%.
На відміну від класичних бенчмарків, цей рейтинг будується на реальних агентних сесіях: мільйони запусків, де ШІ керує інструментами, пише й виконує код, працює з файлами і терміналом. Це найближча до практики відповідь на питання «який ШІ найкращий для реальної роботи, а не для тестів».
Для кожної метрики вказано довірчий інтервал (±). Якщо інтервали двох моделей перетинаються — різниця між ними статистично незначуща, тому поруч із рангом ми показуємо і діапазон можливих позицій (наприклад, «1–6»). Колонка Δ показує зміну позиції відносно попереднього зрізу даних — так видно, хто росте, а хто здає.
Ціни вказано у доларах за мільйон токенів (вхідні / вихідні) — це дає змогу оцінити не лише якість, а й вартість практичного використання: подивіться на графік «Ціна vs якість», щоб знайти оптимальні за співвідношенням моделі.
Часті питання
Який AI-агент зараз найкращий?
Зараз рейтинг очолює Claude Opus 5 (High) від Anthropic з Net Improvement 12,19%. Але зважайте на довірчі інтервали: верхівка рейтингу часто статистично нерозрізненна.
Як часто оновлюється цей рейтинг?
Дані перевіряються щодня. Якщо рейтинг змінився — сторінка оновлюється автоматично, а в колонці Δ з'являються стрілки змін позицій.
Чим цей рейтинг відрізняється від звичайних бенчмарків?
Класичні бенчмарки — це фіксовані набори задач, під які моделі можуть «підучуватися». Тут моделі оцінюються на мільйонах реальних агентних сесій із реальними інструментами, тому такий рейтинг складніше «обдурити» і він ближчий до практики.
Що таке AI-агент і чим він відрізняється від чат-бота?
Чат-бот відповідає текстом. Агент — діє: викликає інструменти, виконує команди в терміналі, редагує файли, перевіряє результат і виправляє власні помилки. Саме агентні можливості вимірює цей рейтинг.
Чи є у рейтингу безкоштовні або відкриті моделі?
Так, зараз у таблиці 16 моделей з відкритими вагами (Apache 2.0, MIT та інші ліцензії) — їх можна запускати на власному обладнанні. Шукайте ліцензію під назвою моделі.