Бенчмарки LLM сломались: 4 флагмана недели и кризис рейтингов

Бенчмарки LLM сломались: 4 флагмана недели и кризис рейтингов

Модель, которая заняла первое место в главном кодинг-бенчмарке недели, в реальном тесте сгенерировала кубик с цилиндром. А модель, которую рейтинги поставили заметно ниже, за двенадцать минут собрала полноценную игру с рыцарем, магом, скелетами и летучими мышами, похожими на летучих мышей. Если вы до сих пор выбираете LLM по лидербордам, у меня плохие новости.

Эта неделя выдалась редкостно плотной: четыре фронтир-лаборатории выпустили четыре новые модели почти одновременно. Anthropic представила Claude Fable 5.1 (а для тестировщиков кибербезопасности ещё и Mythos 5.1), Google выкатила Gemini 3.8 Flash, Meta открыла Muse Spark 1.3, а OpenAI начала ограниченный rollout GPT-6 Astra. Каждый релиз сам по себе был бы главной новостью месяца. Но интереснее другое: впервые расхождение между бенчмарками и практикой стало настолько наглядным, что даже авторы, чей канал построен на еженедельном тестировании моделей, публично заявили: рейтингам, которым они доверяли годами, больше верить нельзя.

Что показали официальные цифры

Начнём с того, что говорят таблицы. Claude Fable 5.1 в день выхода разгромил всё существующее: 52.6 в научных исследованиях против 22.4 у ближайшего конкурента, 55.8% на Terminal Bench, первое место в сводном рейтинге Artificial Analysis. Anthropic заявила, что модель стоит на 25% дешевле Fable 5 для типичных задач и блокирует на 60% меньше ложных срабатываний защиты.

Gemini 3.8 Flash вышел как скоростная и дешёвая альтернатива: $0.75 за миллион входных токенов и $3.75 за миллион выходных против $10 и $50 у Fable. При этом на кодинг-бенчмарке, который считается лучшим предиктором реального опыта программирования, Flash набрал 73.7%: всего на 0.3 процентного пункта ниже предыдущего лидера Claude Opus 5, при средней стоимости задачи $2.36 против $11.84.

Потом случился Muse Spark 1.3 от Meta. Модель набрала 75.4% на том же кодинг-бенчмарке, то есть формально стала лучшей кодинг-моделью в истории. Artificial Analysis поставил её на третье место среди всех моделей, выше GPT-6 и Gemini 3.8 Flash, чуть ниже Opus 5 и Fable 5.1. И вишенка: Spark 1.3 сейчас доступен бесплатно через OpenRouter.

Наконец, GPT-6 Astra: 74.1% на кодинг-бенчмарке (ниже Muse Spark, если верить таблице), зато 99.9% на Arc AGI 3. Да, девяносто девять и девять десятых. Бенчмарк, созданный как тест на общий интеллект, официально насыщен и больше ничего не измеряет. Сам rollout тоже показателен: OpenAI раздаёт Astra ограниченному кругу организаций, и только в ближайшие дни обещает доступ для подписчиков Plus, Pro, Business и Enterprise. Проверить заявленные цифры самостоятельно пока могут немногие, что само по себе создаёт идеальную почву для красивых таблиц без независимой верификации.

Экономика задачи: полная картина

Если свести замеры стоимости решённой задачи из разных тестов в одну таблицу, иерархия переворачивается окончательно. Gemini 3.8 Flash решает усреднённую задачу за $0.58, Muse Spark 1.3 за $0.55 (но посмотрите выше, что он решает), GPT-6 Astra обошлась бы примерно в $1.94 по стандартному API-прайсингу, Claude Opus 5 стоит $11.84 за задачу, Fable 5 все $21.63, а новый Fable 5.1 занял вершину ценового рейтинга с $3.69 в одних замерах и больше сотни долларов в реальном многочасовом сценарии. Разброс между «умной» и «быстрой» моделью достигает сорока раз, при том что разница в качестве результата на многих задачах уже не различима глазом. Для команды, которая прогоняет тысячи агентных вызовов в день, это разница между бюджетом на кофе и бюджетом на небольшой дата-центр.

Тест Megabonk: реальность против рейтингов

Чтобы проверить модели в деле, автор каждой из четырёх поручил одну и ту же задачу: написать клон игры Megabonk. Результаты оказались поучительными.

Fable 5.1 сделал красивую игру с узнаваемыми персонажами, лисой в главной роли и приличной цветовой гаммой. Мелкие огрехи были (при наведении курсора некоторые элементы мерцали), но в целом продукт выглядел законченным. Проблема оказалась в другом: модель работала над игрой около двух часов, съела весь дневной лимит подписки Anthropic за $200 в месяц, переключилась на платные кредиты и в сумме обошлась примерно в $120 за одну игрушку. Gemini 3.8 Flash сгенерировал заметно лучшую версию, чем его предшественник, и уложился в малую долю кредитов Cursor, без переплат.

Muse Spark 1.3, официальный чемпион кодинг-бенчмарка, выдал серый куб с цилиндром, стреляющий по другим кубам. Это не шутка и не сбой промпта: максимальные настройки, та же задача, тот же подход. GPT-6 Astra, стоящая в рейтинге ниже Spark, собрала самую цельную игру из четырёх за двенадцать минут: приятная стилистика, враги разных типов, понятная прогрессия.

Та же картина повторилась на SVG-генерации, по сути тесте на умение рисовать кодом. Fable 5.1 создал лучшую картинку, но потратил $4.35 и 18 минут. Gemini 3.8 Flash справился чуть хуже, зато за $0.09 и 92 секунды. Muse Spark, третья модель мира по Artificial Analysis, занял в этом тесте двадцатое место.

Где прячется обман

Первый слой проблемы: цена за токен и цена за задачу это разные вещи. Anthropic честно заявила про 25% снижения цены, но независимый замер Artificial Analysis показал обратное: Fable 5.1 оказался самой дорогой моделью в расчёте на решённую задачу, $3.69 против $3.14 у Fable 5. Умная модель дольше думает, генерирует больше токенов рассуждения и съедает экономию. Для бизнеса, считающего экономику внедрения, разница принципиальна.

Второй слой: насыщение. Arc AGI 3 с результатом 99.9% ушёл на пенсию, как до него ушли десятки других тестов. Жизненный цикл бенчмарка сократился с лет до месяцев: тест публикуется, лаборатории под него оптимизируются, тест умирает. MMLU, HumanEval, GSM8K прошли этот путь раньше, но у них было хотя бы несколько лет достойной жизни. Теперь промежуток между «новый сложный тест» и «очередное насыщение» измеряется одним-двумя поколениями моделей, а поколения сменяются каждые пару месяцев. Индустрия оценки физически не успевает за индустрией обучения.

Третий слой тоньше. Бенчмарки измеряют то, что легко измерить: однозначно проверяемые ответы, изолированные задачи, статичные промпты. Реальная работа это многошаговый контекст, вкус к дизайну, умение не сломаться на десятом файле проекта. Когда модель натаскана на короткие проверяемые задачи, она выигрывает таблицу и проигрывает Megabonk. Добавьте сюда оценки типа AI-as-a-judge, где качество картинки оценивает другая модель со своими слепыми пятнами, и картина расхождения становится полной.

Есть и четвёртый, самый неудобный слой: лаборатории знают, какие тесты читают журналисты и аналитики. Когда место в верхушке Artificial Analysis конвертируется в заголовки, контракты и венчурные оценки, оптимизация под бенчмарк становится не побочным эффектом, а частью стратегии запуска. Релиз, приуроченный к рекорду в рейтинге, это уже маркетинговый продукт. Показательно, что самые громкие расхождения случаются именно у моделей с аномально высокими позициями и непрозрачной методикой замера: красивое число появляется в пресс-релизе раньше, чем у независимых пользователей появляется возможность его проверить.

Чем измерять модели теперь

Вывод не в том, что бенчмарки бесполезны, а в том, что их роль изменилась. Они больше не отвечают на вопрос «какая модель лучше», но по-прежнему отвечают на вопрос «какие модели стоит попробовать». Лидерборд это шорт-лист, а не вердикт.

Практичный алгоритм выглядит так. Возьмите три-пять задач из вашей реальной работы: не абстрактные головоломки, а именно ваш код, ваши документы, ваши данные. Прогоните через двух-трёх кандидатов из верхушки рейтинга и обязательно включите дешёвую модель вроде Gemini 3.8 Flash: соотношение цены и качества у неё сейчас аномально хорошее. Считайте не токены, а стоимость решённой задачи и время до приемлемого результата. И проверяйте глазами: ни один агрегированный индекс не заменит десяти минут работы с моделью на своей задаче.

Отдельно стоит сказать про бесплатный доступ. Muse Spark 1.3 раздаётся через OpenRouter без оплаты, и как инструмент для экспериментов это подарок. Но бесплатность не делает его фронтир-моделью, как бы ни пели рейтинги.

Зрелый подход к этому рынку: маршрутизация. Большинство запросов в реальных продуктах рутинные, и их нет смысла отправлять модели за $20 за задачу. Простые вызовы идут дешёвым и быстрым моделям вроде Gemini 3.8 Flash, а дорогой фронтир резервируется для задач, где цена ошибки выше цены токенов. Команды, которые построили такой роутинг ещё полгода назад, сейчас смотрят на гонку флагманов с заметно меньшим волнением: для них каждый новый релиз это не повод переписывать стек, а очередной кандидат в один из слотов маршрутизатора.

Часто задаваемые вопросы

Значит ли это, что все бенчмарки куплены?

Нет, прямого обмана почти нигде нет. Проблема структурная: тесты измеряют узкий срез возможностей, лаборатории под него оптимизируют модели, а агрегаторы вроде Artificial Analysis усредняют всё в одно число, теряя профиль сильных и слабых сторон.

Какая из четырёх новых моделей реально лучшая?

Зависит от задачи. Для сложных рассуждений и исследований лидирует Fable 5.1, но с самой высокой ценой за задачу. Для кодинга при ограниченном бюджете лучшее соотношение цены и качества у Gemini 3.8 Flash. GPT-6 Astra выглядит сильнейшей в целостных творческих задачах вроде игрового прототипа.

Почему GPT-6 Astra набрала 99.9% на Arc AGI 3?

Потому что тест насыщен: задачи, задуманные как неразрешимые для ИИ, оказались в пределах досягаемости нового поколения моделей. Это не подвох OpenAI, а естественная смерть бенчмарка, на смену которому понадобится Arc AGI 4.

Как перестроить процесс выбора модели в команде?

Зафиксируйте три-пять типовых задач в виде повторяемого набора промптов и прогоняйте через него каждую новую модель в день выхода. Замеряйте стоимость и время до приемлемого результата, а не до идеального. Через месяц у вас будет собственный лидерборд, который отражает именно вашу работу, а не чужой маркетинг.

Итог

Неделя с четырьмя флагманскими релизами подарила нам не только новые модели, но и полезный стресс-тест самой системы оценки. Бенчмарки LLM официально перешли из категории «истина» в категорию «маркетинговый материал с элементами правды». Доверяйте таблицам как шорт-листу, а выбор делайте на своих задачах, своих данных и своём бюджете. Единственный рейтинг, который не врёт, это ваш собственный пайплайн.

← Все записи