Security-агенты на минималках: сколько стоит решение одной CTF-задачи

Security-агенты на минималках: сколько стоит решение одной CTF-задачи

Когда в начале 2026 года Anthropic опубликовал отчёт Claude Mythos Preview, мир кибербезопасности замер: модель решала сложные CTF-задачи, писала эксплойты, проходила penetration-testing с миллионными контекстными окнами и полной автономией. Заголовок отчёта звучал как приговор: «агенты достигли уровня, который раньше казался фантастикой». Но за этими восторгами скрывался один вопрос, который редко задавали вслух: а сколько это стоит? Не в_abstract_maksimum, а в реальных долларах за каждую решённую задачу.

Именно этот вопрос поставили во главу угла исследователи из Frontier Security Institute. Они взяли два популярных бенчмарка — наступательный Cybench и оборонительный BOTS v1 — и прогнали через них весь текущий зоопарк моделей: от GPT-5.5 до DeepSeek v4 Flash, от Claude Opus 4.8 до новых GPT-5.6 Luna, Terra и Sol. И вместо привычного рейтинга «кто больше решил» получили таблицу операционной эффективности, которая перевернула ожидания.

Почему «решил — не решил» больше не работает

Традиционные бенчмарки AI-агентов работают по бинарной логике: модель либо решила задачу, либо нет. GPT-5.5 решила 94.1% заданий Cybench — отлично, значит она лучшая. Но эта метрика не учитывает, сколько стоит каждый шаг рассуждения. В реальной операции безопасности каждый инструмент — Splunk-запрос, WHOIS-проверка, web-поиск — имеет цену. А каждый токен рассуждения потребляет бюджет. Если модель решает задачу за 200 шагов и $10, а другая — за 5 шагов и $0.50, они не эквивалентны, даже если обе «решили».

Исследователи взяли за основу идею cost-success кривой: они брали одну и ту же модель, один и тот же бенчмарк и одну и ту же трассировку выполнения, а затем ретроспективно накладывали бюджетные ограничения — $0.80, $2.10, $4.20 на одну задачу. Если модель превышала лимит, задача считалась проваленной, даже если при неограниченном бюджете она была бы решена. Это дало честное сравнение операционной полезности, а не академической способности.

Наступление: чем больше токенов, тем больше побед

С Cybench — бенчмарком, основанным на реальных CTF-задачах с песочницей для исполнения кода — получилась красивая восходящая кривая. GPT-5.5 остаётся сильнейшей точкой: 94.1% решённых задач при стоимости $1.16 за эквивалентную задачу. Среди новых GPT-5.6 семейство разделилось: Luna набрала 79.5%, Terra — 65.8%, а Sol достигла лишь 9.4%, отказавшись от 90.6% заданий ещё до первого инструмента.

Особенно интересна динамика DeepSeek v4 Flash. При ретроспективном капе $0.80 модель решает 76.1% задач. Когда бюджет поднимают до $2.10, показатель вырастает до 86.4%. Это означает, что модель не упирается в потолок возможностей — она просто экономит на каждом шаге. При ограниченном бюджете DeepSeek становится экономически выгоднее некоторых флагманов, хотя в абсолютном рейтинге «кто больше решил» его бы не заметили.

А вот Claude Fable 5 показал 0% — не потому, что не умеет, а потому что отказался от всех 117 sample-epochs ещё до первого вызова инструмента. Это уже не вопрос capability, это policy-решение разработчика: модель настроена не трогать наступательные задачи в принципе. Что, впрочем, тоже важная информация для тех, кто выбирает агента для SOC.

Кривая масштабирования для Cybench чёткая: больше долларов и токенов — больше решённых задач. Особенно заметно это у Claude Opus 4.8 и DeepSeek v4 Flash, где каждая дополнительная копейка действительно конвертируется в дополнительные решения. Это значит, что для offensive-security агента тестовое время вычислений — реальный ресурс, который можно инвестировать.

Защита: здесь больше денег не значит лучше

С BOTS v1 — бенчмарком оборонительных SOC-расследований на реальных Splunk-данных из Frothly — получилась совсем другая история. Claude Opus 4.8 набирает максимальный балл при относительно скромных затратах: меньше токенов, меньше платных инструментов, меньше времени. А DeepSeek v4 Flash при высоких бюджетах, потратив на порядок больше, не достигает того же результата.

Причина в том, что защитное расследование — это не поиск решения, а дисциплина поиска. Аналитик SOC (и его AI-агент) должен не просто генерировать гипотезы, а методично навигировать по телеметрии, выбирать правильные Splunk-запросы, понимать, когда нужна enrichment-проверка через WhoisXMLAPI или Brave Search, а когда это пустая трата денег. Больше вычислительного бюджета не помогает, если модель генерирует лишние запросы или уходит в ложные следы.

Это фундаментальное различие между red-team и blue-team задачами. Red-team может позволить себе брутфорс: больше попыток — больше шансов на уязвимость. Blue-team работает в режиме ограниченных ресурсов, где каждый запрос должен быть обоснован. И эта дисциплина не масштабируется линейно с бюджетом — она требует другой архитектуры агента.

Шок: модели решают задачи без инструментов

Самое неприятное открытие касается валидности самого BOTS v1 как бенчмарка. Исследователи запустили no-tools контроль: те же задачи, но без Splunk, без bash, без Python, без web-поиска. Только вопрос и опциональное предварительное описание контекста. Claude Opus 4.8 набрал 74.8% от максимального балла (7,700 из 10,300), GPT-5.5 — 62.1% (6,400 из 10,300).

Это означает, что значительная часть «успеха» этих моделей в BOTS v1 — не результат живого расследования. Это воспроизведение данных из обучающей выборки. Бенчмарк BOTS v1 публичный и старый, данные попали в предобучение, и теперь модели просто вспоминают ответ, а не находят его. Без инструментов Claude Opus 4.8 всё ещё набирает 50% даже без предварительного контекста.

Авторы предлагают обязательный протокол деконтаминации: no-tools, no-context, perturbed-question, answer-before-query, private-holdout или fresh-incident проверки должны сопровождать любой публичный SOC-бенчмарк. Без этого абсолютные цифры в таблицах — не доказательство capability, а артефакт переобучения на учебные данные.

Policy-отказы как новая реальность выбора

Один из самых неожиданных выводов исследования — роль policy-фильтров в offensive-задачах. Fable 5 отказался от всех 117 тестовых эпох до первого вызова инструмента. GPT-5.6 Sol отказалась от 90.6% задач ещё до начала работы. Это не баг и не техническое ограничение — это сознательное решение разработчиков моделей. Но для оператора SOC или red-team эти отказы имеют прямые операционные последствия.

Когда вы выбираете модель для автоматизированного penetration testing, вам нужен агент, который выполнит задачу. Если модель принципиально отказывается от offensive-инструментов, она не подойдёт независимо от того, насколько высок её capability-потенциал под капотом. Исследователи подчёркивают: policy-фильтры становятся таким же важным фактором выбора, как и capability-метрики. В их таблице результатов нулевые показатели Fable помечены как «policy-filter outcome rather than evidence of zero underlying capability» — но на практике это означает, что модель бесполезна для red-team.

Как это меняет экономику SOC-операций

Для команды безопасности, которая рассматривает внедрение AI-агентов, cost-aware подход даёт конкретные цифры для планирования бюджета. Если ваш SOC обрабатывает 50 инцидентов в день, и каждый требует $0.50 на агента с Claude Opus 4.8 (при максимальном балле) или $2.10 с DeepSeek v4 Flash (при меньшем результате), ежемесячная разница составляет $2,250 vs $9,450. Это при том, что первый вариант показывает лучший результат.

Для red-team автоматизации картина другая. Если Cybench-задачи решаются за $1.16 с GPT-5.5, а бюджет на penetration-testing ассессмент включает 200 задач, общий cost составит $232. С DeepSeek v4 Flash при $0.80 капе — $160, но с меньшим успехом (76.1%). Выбор зависит от того, насколько критично полное покрытие: если нужно максимизировать количество найденных уязвимостей, GPT-5.5 остаётся лидером; если бюджет ограничен, DeepSeek даёт разумный компромисс.

Исследователи отмечают важный нюанс: их эксперименты наблюдательные, а не проспективно рандомизированные. Они анализируют фиксированные бюджетные капы и ретроспективные капы, наложенные на завершённые трассировки. Это значит, что реальные цифры могут отличаться при изменении порядка инструментов или промптов. Но для первого приближения к операционной экономике AI-агентов в безопасности — это самая честная картина, которую мы пока имеем.

Что это значит для тех, кто выбирает AI-агента

Для offensive-security задач вывод ясен: тестируйте модели на разных бюджетах, а не на максимальном. Claude Opus 4.8 и DeepSeek v4 Flash демонстрируют здоровую кривую масштабирования — их можно инвестировать в сложные задачи. GPT-5.6 Luna стоит чуть дороже, но показывает хороший баланс между capability и стоимостью. А GPT-5.6 Sol практически бесполезен в offensive: отказы до начала работы делают его непригодным для red-team операций.

Для defensive-SOC задач картина другая. Не гонитесь за флагом «самая умная модель» — выбирайте ту, что работает дисциплинированно. Claude Opus 4.8 достигает максимального результата при минимальных затратах именно потому, что делает меньше лишних движений. И обязательно проверяйте, не вспоминает ли модель готовые ответы: no-tools контроль занимает минимум времени, но раскрывает контаминацию.

Важно также понимать, что BOTS v1 — это только первый шаг. BOTS v2 покрывает 51-вопросную enterprise-интрузию с endpoint, network, email и web-телеметрией. BOTS v3 добавляет 58 вопросов по AWS CloudTrail, osquery и Windows-событиям. Эти версии новее и сложнее, но cost-aware анализ для них пока не проведён.

Часто задаваемые вопросы

Почему DeepSeek v4 Flash эффективнее на малых бюджетах, но отстаёт на больших?

Архитектура DeepSeek построена на экономном использовании токенов: модель быстрее находит решение и меньше тратит на промежуточные рассуждения. При бюджете $0.80 это преимущество критично. Но когда бюджет снимается, более дорогие модели с развитыми инструментами планирования начинают обгонять — у них есть ресурсы на глубокую проверку альтернатив.

Что значит «Fable отказалась от всех задач»?

Fable 5 настроена policy-фильтром Anthropic так, что не трогает offensive-security задачи вообще. Все 117 тестовых эпох были отклонены до первого вызова инструмента. Это не техническая неспособность, а политическое решение разработчика. Для выбора агента важно: если вам нужен red-team оператор, Fable не подойдёт в принципе.

Как именно проверяли контаминацию BOTS v1?

Моделям давали те же вопросы, но отключали все инструменты — Splunk, bash, Python, web. Если модель без доступа к данным всё равно отвечает правильно на 50–75% вопросов, значит она вспоминает, а не исследует. Это стандартный приём проверки data leakage, но его редко применяют к SOC-бенчмаркам.

Подходят ли эти результаты для выбора агента в реальный SOC?

Пока частично. BOTS v1 даёт воспроизводимый тестbed, но ограничен 31 задачей. Для полного ответа нужны BOTS v2 (enterprise intrusions) и BOTS v3 (cloud-сценарии с AWS и osquery), на которых cost-aware анализ ещё не проводился. Исследователи подчёркивают: их SOC-вывод — это результат дизайна оценки, а не финальное заявление о готовности к production.

Итог

Исследование Frontier Security Institute меняет сам способ оценки AI-агентов в кибербезопасности. Вместо рейтинга «кто больше решил» появляется операционная карта «кто решает за разумные деньги». Для наступления ответ ясен: тестируемое время вычислений — реальный ресурс, вкладывай его, и Claude Opus 4.8 с DeepSeek v4 Flash ответят большей эффективностью. Для защиты ответ сложнее: больше денег не помогает, нужна дисциплина инструментов, и обязательно проверяйте, не вспоминает ли модель готовые ответы. А ещё один неприятный сюрприз — Fable 5, который отказался от всех задач, напоминает: policy-фильтры становятся таким же важным фактором выбора, как capability-метрики.

Интерактивная таблица результатов доступна на evals.frontier.security — можно посмотреть, как конкретная модель ведёт себя при разных бюджетах, и выбрать конфигурацию под свой operational-сценарий.

← Все записи