21 Липня, 2026

Kimi K3 виявилась найкращою у веб-програмуванні, обійшовши Claude Fable 5 та GPT-5.6 Sol

Китайська компанія Moonshot AI випустила Kimi K3 — LLM-модель на 2,8 трильйона параметрів, яка вже офіційно стала найбільшою відкритою мовною моделлю у світі. І хоча за загальним інтелектом вона все ще поступається флагманам США, у веб-програмуванні вона вийшла в беззаперечні лідери.

Читайте также: Кухар їдальні отримав акцій на $10 млн: розмір компенсацій в OpenAI та Anthropic шокує навіть ІТ-сектор

Kimi K3 виявилась найкращою у веб-програмуванні, обійшовши Claude Fable 5 та GPT-5.6 Sol

Перше місце в рейтингу фронтенд-розробки

Kimi K3 дебютувала на вершині рейтингу Frontend Code Arena від Arena.ai з результатом 1679 балів, випередивши Claude Fable 5 (1631 бал) та GPT-5.6 Sol (1618 балів). Це перший випадок, коли відкрита модель очолила саме цей лідерборд — і водночас стрибок одразу на 17 позицій угору порівняно з попередньою флагманською моделлю Kimi K2.6, яка займала лише 18-те місце.

Kimi K3 виявилась найкращою у веб-програмуванні, обійшовши Claude Fable 5 та GPT-5.6 Sol

Рейтинг формується не синтетичними тестами, а голосуванням розробників у стилі Ело: реальні користувачі порівнюють код, згенерований різними моделями, і обирають кращий варіант. За даними Arena.ai, показник влучень Kimi K3 у парних порівняннях становить 76% — проти 63% у Fable 5 та 58% у GPT-5.6 Sol.

Модель посіла перше місце у шести з семи оцінюваних напрямів фронтенд-розробки: брендинг і маркетинг, дизайн за референсами, аналітика даних, споживчі продукти, симуляції та інструменти для створення контенту. Єдина категорія, де Kimi K3 не стала лідером, — розробка ігор, де друге місце вона поступилася саме Fable 5.

Але не всюди попереду

Тут важливо зробити застереження: перемога в рейтингу фронтенд-коду не означає загальної переваги над флагманами Anthropic та OpenAI. За даними аналітичної компанії Artificial Analysis, у загальному індексі інтелекту Kimi K3 набирає 57 балів проти 60 у Fable 5 та 59 у GPT-5.6 Sol — це третє місце, хоч і найближче, на яке будь-коли підходила відкрита модель до рівня закритих систем. На приватному тесті довготривалих агентних задач (long-horizon knowledge work) K3 також посіла друге місце, поступившись лише Fable 5.

Читайте также: Розвиток пухлин. Кетогенна дієта може по-різному впливати на ризик раку кишечника

Ось повна таблиця порівняння бенчмарків з офіційного блогу Moonshot AI.

Кодування

БенчмаркKimi K3 (max)Claude Fable 5 (max)GPT 5.6 Sol (max)Claude Opus 4.8 (max)GPT 5.5 (xhigh)GLM-5.2 (max)
DeepSWE67.570.073.059.067.046.2
Program Bench77.876.877.671.970.863.7
Terminal Bench 2.188.384.688.884.683.482.7
FrontierSWE81.286.671.366.764.967.3
SWE Marathon42.035.039.040.014.013.0
PostTrain Bench36.641.434.634.128.434.3
MLS Bench48.349.946.242.835.540.4
Kimi Code Bench 2.0 (внутр.)72.976.964.871.769.064.2

Агентна робота

БенчмаркKimi K3 (max)Claude Fable 5 (max)GPT 5.6 Sol (max)Claude Opus 4.8 (max)GPT 5.5 (xhigh)GLM-5.2 (max)
GDPval-AA v2 (Elo)1668.01760.01748.01600.01494.01514.0
BrowseComp91.288.090.484.384.4
DeepSearchQA (F1)95.094.293.1
Toolathlon-Verified73.277.974.976.273.559.9
MCP Atlas84.284.783.683.682.882.6
Automation Bench30.829.129.727.222.712.9
Job Bench52.957.446.548.438.343.4
AA-Briefcase (Elo)1548.01583.01495.01354.01158.01260.0
APEX-Agents37.643.339.939.438.535.6
Office QA Pro63.369.963.263.960.941.4
SpreadsheetBench 234.834.732.431.629.128.1
DECK-Bench (внутр.)73.573.074.766.968.268.6

Міркування та знання

БенчмаркKimi K3 (max)Claude Fable 5 (max)GPT 5.6 Sol (max)Claude Opus 4.8 (max)GPT 5.5 (xhigh)GLM-5.2 (max)
GPQA-Diamond93.592.694.191.093.591.2
HLE-Full43.553.344.549.841.4
HLE-Full з інструментами56.063.058.057.952.2

Візуальне бачення

БенчмаркKimi K3 (max)Claude Fable 5 (max)GPT 5.6 Sol (max)Claude Opus 4.8 (max)GPT 5.5 (xhigh)GLM-5.2 (max)
MMMU-Pro81.681.283.078.981.2
MMMU-Pro з python83.486.584.682.783.2
CharXiv (RQ)84.888.984.680.584.1
CharXiv (RQ) з python91.393.589.189.989.0
MathVision94.394.895.886.792.2
MathVision з python97.898.697.897.196.8
BabyVision з python85.790.588.981.283.6
ZeroBench (pass@5)23.023.017.017.022.0
ZeroBench з python (pass@5)41.046.035.034.041.0
WorldVQA ForceAnswer51.056.741.839.138.5
OmniDocBench91.189.885.887.989.4
PerceptionBench58.557.259.747.255.8

Важливо для точності: це офіційна таблиця самої Moonshot AI, і в ній Kimi K3 в цілому поступається Fable 5 у більшості категорій (особливо reasoning/HLE та vision) — сама компанія прямо пише, що загальна продуктивність «все ще відстає від Fable 5 і GPT 5.6 Sol».

Ціна Kimi K3 як додаткова перевага

Kimi K3 коштує $3 за мільйон вхідних токенів (і лише $0,30 при кешованому вводі) та $15 за мільйон вихідних. Для порівняння, Claude Fable 5 обходиться в $10 за вхідні та $50 за вихідні токени — тобто китайська модель утричі дешевша на вводі. Саме ця різниця, на думку аналітиків, здатна прискорити перехід розробників на Kimi K3 для завдань фронтенд-розробки, де вона вже демонструє найкращий результат на ринку.

Повні ваги моделі Moonshot AI планує опублікувати 27 липня.

Нагадаємо, кілька тижнів тому дослідники виявили, що захисні обмеження у відкритих LLM можна зняти за 10 хвилин — навіть без технічних знань.

Читайте также: Розвиток пухлин. Кетогенна дієта може по-різному впливати на ризик раку кишечника

Підписуйтесь на нас у соцмережах: Telegram | Facebook | LinkedIn

Автор admin

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *