Аналіз бенчмарків Kimi K3 проти Fable 5 на коді fd
Журналіст видання The New Stack Нік Луккезі провів серію прямих тестів між відкритою мовною моделлю Kimi K3 на 2,8 трлн параметрів від китайської компанії Moonshot AI та Claude Fable 5 від Anthropic. Для експерименту використали термінальні агенти Kimi Code CLI v0.27.0 та Claude Code v2.1.212 у роботі з популярною утилітою пошуку файлів fd, написаною мовою Rust. Обидва ШІ-інструменти розв'язували ідентичні технічні завдання в ізольованих середовищах із нульовим контекстом попередньої історії комітів.
Під час вирішення помилки з прапором --no-ignore-vcs (баг #907 у репозиторії fd) обидві моделі згенерували байт-у-байт однаковий диф, видаливши одну й ту саму стрічку в src/main.rs і успішно пройшовши 70 з 70 юніт-тестів. Однак Fable 5 впоралася за 1 хвилину 4 секунди, тоді як Kimi K3 витратила 3 хвилини 7 секунд. На етапі виділення функції construct_config у новий модуль src/config_builder.rs китайська модель продемонструвала глибший інженерний підхід — зробила знімок бінарного файлу та звірила бінарні відмінності для 40 CLI-сценаріїв. Це гарантувало стабільність 264 тестів, але розтягнуло процес до 14 хвилин 50 секунд проти 3 хвилин 11 секунд у суперника.
Економіка токенів та інженерні компроміси
Витрати на використання API виявилися головною перевагою рішення від Moonshot AI. Повний цикл із трьох завдань (виправлення багу, рефакторинг та створення нового прапора --count) обійшовся у $2,13 для Kimi K3 проти $5,98 у Fable 5. Базова тарифікація Moonshot становить $3 за мільйон вхідних і $15 за мільйон вихідних токенів, що утричі дешевше за прайс Anthropic ($10/$50 відповідно). При цьому Kimi K3 виявилася менш ощадливою до контексту, витративши 3,3 мільйона токенів проти 2,4 мільйона у Claude.
Під час розробки нового функціоналу --count Fable 5 випередила опонентку, оновивши не лише документацію man, а й автодоповнення для zsh. Kimi K3 обмежилася правильним виправленням 6 файлів, але витратила 10 хвилин 21 секунду проти 2 хвилин 34 секунд у Claude Code. Загальний час виконання тестового пакету для Kimi K3 склав 28 хвилин 18 секунд, що перетворює її на поволі діючого інженера, який вимагає терпіння під час інтерактивного вайб-кодингу.
Розробники зазначають, що open-weight модель Kimi K3 залишається найпотужнішою відкритою нейромережею з Китаю, але її низька швидкість генерації поки заважає повноцінно витіснити пропрієтарні інструменти з середовищ типу Cursor чи VS Code.