Я дав шістьом моделям дві задачі, відповіді на які порахував заздалегідь. П'ять повернули бездоганний результат. А вирішила вибір цифра, якої немає в жодному лідерборді.
Мій агент працює на дошці задач: читає дані, рахує, пише файл із результатом. Іноді задача падає й перезапускається. Я хотів знати, яка модель падатиме рідше й коштуватиме менше.
BFCL міряє окремий виклик інструмента: чи правильно обрано функцію й заповнено аргументи. Мої збої стаються не всередині одного виклику, а на тридцяти, де кожен крок залежить від попереднього. Це різні здатності.
З оглядами було ще гірше. Дві цифри розсипались при перевірці: розтиражована «точність викликів 97.2%» належить іншій моделі, ніж та, до якої її причепили, а обсяг одного розхваленого протоколу виявився вчетверо меншим, щойно відняти тестові транзакції.
Я взяв дві задачі зі своєї роботи й порахував правильні відповіді сам, окремим кодом. Не критерій якості — точні числа для звірки.
Зібрати з API WordPress топ-2000 плагінів, відібрати покинуті — не оновлювались понад два роки, від 10 тисяч установок — і дати п'ять показників.
покинутих: 139
сумарно інсталяцій: 4770000
з них >=50k: 28
живих (завантаження): 139
тег adopt-me: 0
Прочитати 17 МБ локального JSONL — 50 605 тендерів ProZorro — і застосувати описаний алгоритм до однієї фірми. Без мережі. Лише читання, фільтрація й утримання стану, поки контекст стискається під тобою.
виграних: 14
кандидатів: 1259
з 0 ставок: 1129
сума: 148183285
Формат виводу навмисно жорсткий: чотири рядки, самі числа. Ховатись нема за чим.
| Модель | Правильність | Спроб | Важка | Легка | $/міс |
|---|---|---|---|---|---|
| DeepSeek-V4-Pro | 2/2 * | 2 | 55с | 301с | ≈18 |
| MiniMax M3 | 2/2 | 2 | 278с | 861с | ≈23 |
| GLM-5.2 | 2/2 | 7 | 295с | 1066с | ≈175 |
| Kimi K3 | 2/2 | 2 | 39с | 268с | ≈146 |
| GPT-5.6 Sol | 2/2 | 2 | 43с | 143с | ≈259 |
| GPT-5.6 Luna | 1/3 | 3 | 70с | 353с | ≈10 |
* одна розбіжність в округленні, пояснення нижче. Вартість — оцінка на реальних обсягах: приблизно 1.3 млн вхідних і 158 тисяч вихідних токенів за робочий день.
Подивіться на колонку правильності. П'ять моделей із шести взяли обидві задачі. За самими вихідними файлами вибір був би підкиданням монетки.
Усе корисне сиділо в колонці спроб. GLM-5.2 спалив сім запусків там, де інші обійшлися двома. Відповіді бездоганні. Агент раз за разом падав на помилці протоколу й стартував знову. На папері GLM удвічі дешевший за Kimi. З урахуванням перезапусків — утричі дорожчий і втричі довший.
Жоден лідерборд цього не показує, бо воно з'являється лише коли модель працює всередині агентного циклу з інструментами, а не відповідає на питання.
GPT-5.6 Luna — найдешевша з випробуваних, у п'ятнадцять разів дешевша за те, що я крутив. Вона провалила дві спроби з трьох, і обидві варті опису.
У першому запуску вона взагалі пропустила формат із п'яти рядків і видала «шортлист дев'яти релевантних плагінів у категоріях security, commerce та ecosystem». Корисна робота. Не та, про яку просили.
Другий провал — той, що має значення:
виграних: 14 ✓
кандидатів: 1259 ✓
з 0 ставок: 1129 ✓
сума: 32917788 ✗ (правильно: 148183285)
Три числа з чотирьох збіглися точно. Четверте я відстежив. 32 917 788 — це сума лише тих тендерів, де конкурентів немає взагалі. Для бізнес-питання під цим усім вона, можливо, навіть цікавіша. Але просили не її.
Без наперед порахованої відповіді я б це число опублікував.
DeepSeek повернув 148 183 119 проти моїх 148 183 285. Різниця — 166 зі 148 мільйонів, одна десятитисячна відсотка. Я пішов шукати причину:
точна сума (float): 148,183,285.07
округлення в кінці: 148,183,285 ← мій еталон
int() на кожен запис: 148,183,119 ← DeepSeek
Він обрізав копійки в кожному записі перед додаванням. 343 тендери з 1259 мали дробову частину. У моїй постановці стояло «суму цілим числом» і жодного слова про те, коли округлювати.
Це не помилка моделі. Це двозначна інструкція, і модель обрала захищене прочитання. Різниця з випадком Luna — у цьому вся суть: Luna порахувала іншу величину, DeepSeek порахував ту саму з іншим округленням.
DeepSeek-V4-Pro основною: правильний на обох задачах, по одному запуску, другий за швидкістю на важкій, увосьмеро дешевший за попередника. Дрібна модель для субагентів, найнадійніша з дорогих — запасною на випадок відмов.
| Було | Стало |
|---|---|
| Kimi K3 · ≈$146/міс | DeepSeek-V4-Pro · ≈$18/міс |
| субагенти на тій самій дорогій моделі | дешева модель для делегованого |
| без запасного провайдера | автоперемикання при відмові |
Дві задачі на модель — мала вибірка. Кількості спроб я довіряю більше, ніж колонці правильності, бо розкид там у рази, а не в десятих.
Обидві задачі — детерміновані обчислення з однією правильною відповіддю. Про відкрите дослідження, де еталона не існує, це не каже нічого. Показово, що падіння, які я бачив напередодні саме на таких відкритих задачах, тут не відтворились жодного разу.
Звичка, яку лишаю собі: порахуй відповідь, перш ніж її замовляти. Не критерій, не шкалу — число, отримане окремо. Інакше ви міряєте власну готовність повірити.