Китайська компанія Moonshot AI випустила Kimi K3 — LLM-модель на 2,8 трильйона параметрів, яка вже офіційно стала найбільшою відкритою мовною моделлю у світі. І хоча за загальним інтелектом вона все ще поступається флагманам США, у веб-програмуванні вона вийшла в беззаперечні лідери.
Читайте также: Кухар їдальні отримав акцій на $10 млн: розмір компенсацій в OpenAI та Anthropic шокує навіть ІТ-сектор

Перше місце в рейтингу фронтенд-розробки
Kimi K3 дебютувала на вершині рейтингу Frontend Code Arena від Arena.ai з результатом 1679 балів, випередивши Claude Fable 5 (1631 бал) та GPT-5.6 Sol (1618 балів). Це перший випадок, коли відкрита модель очолила саме цей лідерборд — і водночас стрибок одразу на 17 позицій угору порівняно з попередньою флагманською моделлю Kimi K2.6, яка займала лише 18-те місце.

Рейтинг формується не синтетичними тестами, а голосуванням розробників у стилі Ело: реальні користувачі порівнюють код, згенерований різними моделями, і обирають кращий варіант. За даними Arena.ai, показник влучень Kimi K3 у парних порівняннях становить 76% — проти 63% у Fable 5 та 58% у GPT-5.6 Sol.
Модель посіла перше місце у шести з семи оцінюваних напрямів фронтенд-розробки: брендинг і маркетинг, дизайн за референсами, аналітика даних, споживчі продукти, симуляції та інструменти для створення контенту. Єдина категорія, де Kimi K3 не стала лідером, — розробка ігор, де друге місце вона поступилася саме Fable 5.
Але не всюди попереду
Тут важливо зробити застереження: перемога в рейтингу фронтенд-коду не означає загальної переваги над флагманами Anthropic та OpenAI. За даними аналітичної компанії Artificial Analysis, у загальному індексі інтелекту Kimi K3 набирає 57 балів проти 60 у Fable 5 та 59 у GPT-5.6 Sol — це третє місце, хоч і найближче, на яке будь-коли підходила відкрита модель до рівня закритих систем. На приватному тесті довготривалих агентних задач (long-horizon knowledge work) K3 також посіла друге місце, поступившись лише Fable 5.
Читайте также: Розвиток пухлин. Кетогенна дієта може по-різному впливати на ризик раку кишечника
Ось повна таблиця порівняння бенчмарків з офіційного блогу Moonshot AI.
Кодування
| Бенчмарк | Kimi K3 (max) | Claude Fable 5 (max) | GPT 5.6 Sol (max) | Claude Opus 4.8 (max) | GPT 5.5 (xhigh) | GLM-5.2 (max) |
|---|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 67.0 | 46.2 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 70.8 | 63.7 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 83.4 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 64.9 | 67.3 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 14.0 | 13.0 |
| PostTrain Bench | 36.6 | 41.4 | 34.6 | 34.1 | 28.4 | 34.3 |
| MLS Bench | 48.3 | 49.9 | 46.2 | 42.8 | 35.5 | 40.4 |
| Kimi Code Bench 2.0 (внутр.) | 72.9 | 76.9 | 64.8 | 71.7 | 69.0 | 64.2 |
Агентна робота
| Бенчмарк | Kimi K3 (max) | Claude Fable 5 (max) | GPT 5.6 Sol (max) | Claude Opus 4.8 (max) | GPT 5.5 (xhigh) | GLM-5.2 (max) |
|---|---|---|---|---|---|---|
| GDPval-AA v2 (Elo) | 1668.0 | 1760.0 | 1748.0 | 1600.0 | 1494.0 | 1514.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | 84.4 | — |
| DeepSearchQA (F1) | 95.0 | 94.2 | — | 93.1 | — | — |
| Toolathlon-Verified | 73.2 | 77.9 | 74.9 | 76.2 | 73.5 | 59.9 |
| MCP Atlas | 84.2 | 84.7 | 83.6 | 83.6 | 82.8 | 82.6 |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 22.7 | 12.9 |
| Job Bench | 52.9 | 57.4 | 46.5 | 48.4 | 38.3 | 43.4 |
| AA-Briefcase (Elo) | 1548.0 | 1583.0 | 1495.0 | 1354.0 | 1158.0 | 1260.0 |
| APEX-Agents | 37.6 | 43.3 | 39.9 | 39.4 | 38.5 | 35.6 |
| Office QA Pro | 63.3 | 69.9 | 63.2 | 63.9 | 60.9 | 41.4 |
| SpreadsheetBench 2 | 34.8 | 34.7 | 32.4 | 31.6 | 29.1 | 28.1 |
| DECK-Bench (внутр.) | 73.5 | 73.0 | 74.7 | 66.9 | 68.2 | 68.6 |
Міркування та знання
| Бенчмарк | Kimi K3 (max) | Claude Fable 5 (max) | GPT 5.6 Sol (max) | Claude Opus 4.8 (max) | GPT 5.5 (xhigh) | GLM-5.2 (max) |
|---|---|---|---|---|---|---|
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 93.5 | 91.2 |
| HLE-Full | 43.5 | 53.3 | 44.5 | 49.8 | 41.4 | — |
| HLE-Full з інструментами | 56.0 | 63.0 | 58.0 | 57.9 | 52.2 | — |
Візуальне бачення
| Бенчмарк | Kimi K3 (max) | Claude Fable 5 (max) | GPT 5.6 Sol (max) | Claude Opus 4.8 (max) | GPT 5.5 (xhigh) | GLM-5.2 (max) |
|---|---|---|---|---|---|---|
| MMMU-Pro | 81.6 | 81.2 | 83.0 | 78.9 | 81.2 | — |
| MMMU-Pro з python | 83.4 | 86.5 | 84.6 | 82.7 | 83.2 | — |
| CharXiv (RQ) | 84.8 | 88.9 | 84.6 | 80.5 | 84.1 | — |
| CharXiv (RQ) з python | 91.3 | 93.5 | 89.1 | 89.9 | 89.0 | — |
| MathVision | 94.3 | 94.8 | 95.8 | 86.7 | 92.2 | — |
| MathVision з python | 97.8 | 98.6 | 97.8 | 97.1 | 96.8 | — |
| BabyVision з python | 85.7 | 90.5 | 88.9 | 81.2 | 83.6 | — |
| ZeroBench (pass@5) | 23.0 | 23.0 | 17.0 | 17.0 | 22.0 | — |
| ZeroBench з python (pass@5) | 41.0 | 46.0 | 35.0 | 34.0 | 41.0 | — |
| WorldVQA ForceAnswer | 51.0 | 56.7 | 41.8 | 39.1 | 38.5 | — |
| OmniDocBench | 91.1 | 89.8 | 85.8 | 87.9 | 89.4 | — |
| PerceptionBench | 58.5 | 57.2 | 59.7 | 47.2 | 55.8 | — |
Важливо для точності: це офіційна таблиця самої Moonshot AI, і в ній Kimi K3 в цілому поступається Fable 5 у більшості категорій (особливо reasoning/HLE та vision) — сама компанія прямо пише, що загальна продуктивність «все ще відстає від Fable 5 і GPT 5.6 Sol».
Ціна Kimi K3 як додаткова перевага
Kimi K3 коштує $3 за мільйон вхідних токенів (і лише $0,30 при кешованому вводі) та $15 за мільйон вихідних. Для порівняння, Claude Fable 5 обходиться в $10 за вхідні та $50 за вихідні токени — тобто китайська модель утричі дешевша на вводі. Саме ця різниця, на думку аналітиків, здатна прискорити перехід розробників на Kimi K3 для завдань фронтенд-розробки, де вона вже демонструє найкращий результат на ринку.
Повні ваги моделі Moonshot AI планує опублікувати 27 липня.
Нагадаємо, кілька тижнів тому дослідники виявили, що захисні обмеження у відкритих LLM можна зняти за 10 хвилин — навіть без технічних знань.
Читайте также: Розвиток пухлин. Кетогенна дієта може по-різному впливати на ризик раку кишечника
Підписуйтесь на нас у соцмережах: Telegram | Facebook | LinkedIn
