dubyshk.in EN / UA
2026 — 08 — 23
Вимірювання
6 моделей
2 задачі
1 несподіванка
← усі записи

П'ять моделей із шести відповіли правильно.
Це нічого не сказало.

Я дав шістьом моделям дві задачі, відповіді на які порахував заздалегідь. П'ять повернули бездоганний результат. А вирішила вибір цифра, якої немає в жодному лідерборді.

Бенчмарки відповідали не на те питання

Мій агент працює на дошці задач: читає дані, рахує, пише файл із результатом. Іноді задача падає й перезапускається. Я хотів знати, яка модель падатиме рідше й коштуватиме менше.

BFCL міряє окремий виклик інструмента: чи правильно обрано функцію й заповнено аргументи. Мої збої стаються не всередині одного виклику, а на тридцяти, де кожен крок залежить від попереднього. Це різні здатності.

З оглядами було ще гірше. Дві цифри розсипались при перевірці: розтиражована «точність викликів 97.2%» належить іншій моделі, ніж та, до якої її причепили, а обсяг одного розхваленого протоколу виявився вчетверо меншим, щойно відняти тестові транзакції.

Метод — спершу знай відповідь

Я взяв дві задачі зі своєї роботи й порахував правильні відповіді сам, окремим кодом. Не критерій якості — точні числа для звірки.

Легка

Зібрати з API WordPress топ-2000 плагінів, відібрати покинуті — не оновлювались понад два роки, від 10 тисяч установок — і дати п'ять показників.

покинутих:            139
сумарно інсталяцій:  4770000
з них >=50k:            28
живих (завантаження):  139
тег adopt-me:            0

Важка

Прочитати 17 МБ локального JSONL — 50 605 тендерів ProZorro — і застосувати описаний алгоритм до однієї фірми. Без мережі. Лише читання, фільтрація й утримання стану, поки контекст стискається під тобою.

виграних:              14
кандидатів:          1259
з 0 ставок:          1129
сума:            148183285

Формат виводу навмисно жорсткий: чотири рядки, самі числа. Ховатись нема за чим.

Результати

МодельПравильністьСпробВажкаЛегка$/міс
DeepSeek-V4-Pro2/2 *255с301с≈18
MiniMax M32/22278с861с≈23
GLM-5.22/27295с1066с≈175
Kimi K32/2239с268с≈146
GPT-5.6 Sol2/2243с143с≈259
GPT-5.6 Luna1/3370с353с≈10

* одна розбіжність в округленні, пояснення нижче. Вартість — оцінка на реальних обсягах: приблизно 1.3 млн вхідних і 158 тисяч вихідних токенів за робочий день.

Знахідка перша — вирішили перезапуски, а не відповіді

Подивіться на колонку правильності. П'ять моделей із шести взяли обидві задачі. За самими вихідними файлами вибір був би підкиданням монетки.

Усе корисне сиділо в колонці спроб. GLM-5.2 спалив сім запусків там, де інші обійшлися двома. Відповіді бездоганні. Агент раз за разом падав на помилці протоколу й стартував знову. На папері GLM удвічі дешевший за Kimi. З урахуванням перезапусків — утричі дорожчий і втричі довший.

Жоден лідерборд цього не показує, бо воно з'являється лише коли модель працює всередині агентного циклу з інструментами, а не відповідає на питання.

Знахідка друга — модель, яка відповіла на інше питання

GPT-5.6 Luna — найдешевша з випробуваних, у п'ятнадцять разів дешевша за те, що я крутив. Вона провалила дві спроби з трьох, і обидві варті опису.

У першому запуску вона взагалі пропустила формат із п'яти рядків і видала «шортлист дев'яти релевантних плагінів у категоріях security, commerce та ecosystem». Корисна робота. Не та, про яку просили.

Другий провал — той, що має значення:

виграних: 14        ✓
кандидатів: 1259    ✓
з 0 ставок: 1129    ✓
сума: 32917788      ✗   (правильно: 148183285)

Три числа з чотирьох збіглися точно. Четверте я відстежив. 32 917 788 — це сума лише тих тендерів, де конкурентів немає взагалі. Для бізнес-питання під цим усім вона, можливо, навіть цікавіша. Але просили не її.

Неправильна відповідь, яка виглядає правильною, гірша за відмову. Автономний агент працює тоді, коли ніхто не дивиться — саме тому три збіги з чотирьох небезпечніші за жодного.

Без наперед порахованої відповіді я б це число опублікував.

Знахідка третя — двозначність була моя

DeepSeek повернув 148 183 119 проти моїх 148 183 285. Різниця — 166 зі 148 мільйонів, одна десятитисячна відсотка. Я пішов шукати причину:

точна сума (float):   148,183,285.07
округлення в кінці:   148,183,285      ← мій еталон
int() на кожен запис: 148,183,119      ← DeepSeek

Він обрізав копійки в кожному записі перед додаванням. 343 тендери з 1259 мали дробову частину. У моїй постановці стояло «суму цілим числом» і жодного слова про те, коли округлювати.

Це не помилка моделі. Це двозначна інструкція, і модель обрала захищене прочитання. Різниця з випадком Luna — у цьому вся суть: Luna порахувала іншу величину, DeepSeek порахував ту саму з іншим округленням.

Що працює тепер

DeepSeek-V4-Pro основною: правильний на обох задачах, по одному запуску, другий за швидкістю на важкій, увосьмеро дешевший за попередника. Дрібна модель для субагентів, найнадійніша з дорогих — запасною на випадок відмов.

БулоСтало
Kimi K3 · ≈$146/місDeepSeek-V4-Pro · ≈$18/міс
субагенти на тій самій дорогій моделідешева модель для делегованого
без запасного провайдераавтоперемикання при відмові

Де цей тест слабкий

Дві задачі на модель — мала вибірка. Кількості спроб я довіряю більше, ніж колонці правильності, бо розкид там у рази, а не в десятих.

Обидві задачі — детерміновані обчислення з однією правильною відповіддю. Про відкрите дослідження, де еталона не існує, це не каже нічого. Показово, що падіння, які я бачив напередодні саме на таких відкритих задачах, тут не відтворились жодного разу.

Звичка, яку лишаю собі: порахуй відповідь, перш ніж її замовляти. Не критерій, не шкалу — число, отримане окремо. Інакше ви міряєте власну готовність повірити.