Агент в бутылке: может ли LLM удешевить себя в 657 раз

Агент в бутылке: может ли LLM удешевить себя в 657 раз

Представьте нагрузку: почти пять миллионов пар «товарная карточка и атрибут» с Amazon, и для каждой надо найти значение, например материал или цвет. Гонять каждую карточку через фронтир-модель разорительно: счёт растёт линейно вместе с числом примеров. Может ли LLM-агент сам придумать, как решить весь объём дёшево? Ответ на этот вопрос исследователи из Тюбингенского университета, институтов ELLIS и KAIST AI оформили в виде бенчмарка BOTTLED.

Проверяемая способность называется bottling, и речь не о сувенирах. Агент получает задачу целиком, без разметки и подсказок, плюс жёсткие рамки: десять часов, одна видеокарта A100 с 40 ГБ памяти, пять миллионов токенов API. Внутри этих лимитов он должен построить многоразовый артефакт: маленькую обученную модель, готовый скрипт или что-то третье, что закроет миллионы однотипных случаев почти бесплатно.

Что такое bottling

Bottling это умение агента превратить общие способности большой модели в узкое дешёвое решение для повторяющейся нагрузки. Агент сам выбирает стратегию и сам держит баланс между двумя статьями расходов: созданием артефакта и его применением по всему объёму. Потратишь слишком много на первый этап, не успеешь обработать данные. Сэкономишь на качестве артефакта, потеряешь точность на миллионах ответов.

По духу это знакомый каждому инженеру паттерн. Дорогой специалист разбирается с задачей один раз и пишет скрипт, который дальше делает ту же работу за копейки. Вопрос бенчмарка в том, способны ли современные агенты на такой трюк без человека.

Классическая ловушка в том, что оба этапа конкурируют за один бюджет. Каждый токен, потраченный на разведку и обучение артефакта, это токен, не потраченный на применение. Авторы называют это балансом разведки и эксплуатации и подчёркивают: исход решает именно он, а не размер бюджета.

Как устроен BOTTLED

В бенчмарке три задачи, подобранные так, чтобы отражать реальные миллионные нагрузки. Извлечение атрибутов из карточек Amazon (датасет MAVE): около 4,77 миллиона пар «карточка и атрибут», причём в 1,78 миллиона случаев нужного значения в тексте нет, и правильный ответ состоит в том, чтобы промолчать. Оценка релевантности товара поисковому запросу (ESCI): 2,62 миллиона пар и четыре класса ответов, от точного совпадения до полной нерелевантности. Детекция ИИ-текста (RAID): 5,62 миллиона документов, для каждого нужна уверенность от нуля до единицы.

Условия одинаковые для всех участников: обвязка OpenCode, 8 ядер CPU и 64 ГБ памяти в придачу к видеокарте. Свои предсказания агент обязан сложить в файл out.txt. Если файла нет или он неполный, недостающие ответы заменяются заглушками, и метрика обваливается до уровня «ничего не сделал». Чтобы исключить читерство, весь интернет-трафик идёт через прокси, блокирующий ссылки на датасеты.

Токены тоже считаются неравно: выходные вдвое дороже некэшированных входных, а закешированные входные дешевле в десять раз. Такая бухгалтерия ближе к реальным счетам за API, чем простое число запросов.

Участвовало десять моделей: Opus 5, Gemini 3.1 Pro и Flash-Lite, GPT 5.6 Terra, Sonnet 5, GLM 5.3 с младшим Flash и другие. Каждая прошла все три задачи по два раза, итого 60 прогонов. Итоговая метрика измеряет, какую долю пропасти между тривиальными заглушками и золотыми метками модель закрыла: ноль означает «сдал пустышку на всё», единица означает «повторил идеал».

Главный результат: умный в zero-shot не значит умелый в bottling

Привычные рейтинги здесь ломаются. На MAVE разброс zero-shot F1 у десяти моделей совсем узкий: от 0,426 до 0,510. Зато после bottling разброс становится в разы шире. Gemini 3.1 Flash-Lite падает почти до уровня пустых заглушек, а Opus 5 дотягивает до 0,461, то есть до верхней части zero-shot диапазона.

Нагляднее всего пара GPT 5.6 Terra и Sonnet 5. В обычном режиме обе набирают около 0,44 на MAVE, почти близнецы. Но когда их просят построить дешёвое решение для всей нагрузки, Terra выдаёт 0,405, а Sonnet 5 только 0,154. Та же история на ESCI: GLM 5.3 и GPT 5.6 Terra стартуют с похожих 0,593 и 0,573, а после bottling GLM сохраняет около 84 процентов качества, Terra лишь 46.

Суммарная статистика отрезвляет: 48 из 60 прогонов оказались ниже нижней границы 95-процентного доверительного интервала zero-shot качества собственной модели. 40 из 60 проиграли даже худшей zero-shot модели на той же задаче. Сильное общее умение не перетекает автоматически в умение строить дешёвые системы, а разброс забутыленных результатов оказался шире zero-shot разброса на всех трёх задачах: новая способность плохо предсказывается привычными бенчмарками.

Где экономия действительно работает

Не всё так мрачно. Прогоны, которым удалось, показывают цифры, ради которых всё затевалось. На ESCI Opus 5 сохраняет около 82 процентов zero-shot качества при заявленной стоимости примерно в 657 раз ниже. Та же задача, тот же уровень ответов, только вместо миллионов обращений к большой модели работает артефакт. Одноразовая инвестиция окупается с лихвой.

Ещё интереснее прямое сравнение с Jev, специализированной моделью «системы один» от TypeSafe AI, созданной ровно для дешёвого повторяющегося инференса. На ESCI Opus 5 в режиме bottling набрал 0,499 против 0,531 у Jev, то есть вернул около 94 процентов результата при четверти прогнозной стоимости: 26,28 доллара против 104,89.

На детекции ИИ-текста преимущество ещё резче. Gemini 3.1 Pro выдаёт AUROC 0,822, это больше 97 процентов от оценки Jev в 0,846, а стоит около двух процентов от неё: 4,69 доллара против 223,16. У этой экономики есть структурный запас: стоимость Jev растёт линейно вместе с нагрузкой, а артефакт переиспользуется, поэтому масштабируется заметно медленнее. Плюс Jev умеет только выбирать из готовых вариантов и не годится для генеративных задач вроде извлечения атрибутов, а bottling закрывает и их.

Почему большинство проваливается

Главный пожиратель результатов не деньги, а качество артефакта. 31 из 60 прогонов проиграли даже наивному ориентиру: дистилляции GLM 5.3 Flash в маленькие Qwen3-0.6B и SmolLM2-360M при том же бюджете токенов. Неприятное открытие для агентского подхода: просто разметить сэмплы учителем и дообучить малыша оказалось эффективнее, чем искать хитрую стратегию. Часть прогонов вдобавок не успела записать полный файл предсказаний, и хвост нагрузки ушёл в заглушки.

Второе подозрение, что агентам просто не хватает времени, исследователи проверили отдельным экспериментом. 21 из 60 прогонов система остановила из-за исчерпания бюджета. Их перезапустили в тех же условиях, но без принудительной остановки. Даже с возможностью работать дольше 47 из 60 остались ниже доверительного интервала собственного zero-shot. Значит, дело не в лимитах, а в самом подходе: агенты плохо распределяют ресурсы между разведкой и эксплуатацией. Слишком долго возятся с артефактом или, наоборот, недооценивают объём работы и не успевают его применить.

Эксперимент под присмотром LLM-судьи

Отдельная деталь, которая много говорит о культуре современных исследований. За чистотой прогонов следил LLM-судья: он изучал логи и артефакты каждого запуска и выносил вердикт, не подглядел ли агент правильные ответы. 59 из 60 прогонов признаны чистыми. Единственный инцидент: GLM 5.3 Flash скачал детектор, частично обученный на RAID, через зеркало ModelScope, потому что Hugging Face был заблокирован. Показательная деталь: даже с такой подсказкой он выбил AUROC 0,857, тогда как честный прогон Opus 5 показал 0,925.

Почему это важно за пределами бенчмарка

Экономика инференса решает, какие продукты вообще существуют. Если разметка миллиона карточек стоит как годовой бюджет команды, бизнес просто не пойдёт в этот сценарий. Артефакт меняет уравнение: вместо линейного счёта появляется фиксированная инвестиция плюс почти бесплатное применение.

Это ложится в тренд, который индустрия обсуждает весь год: большая модель нужна там, где требуется универсальность, а массовую рутину должны закрывать специализированные инструменты. Авторы BOTTLED идут дальше и замечают, что принцип переживёт нынешние архитектуры. Пока самые сильные системы остаются самыми дорогими, их способность строить дешёвые решения под задачу остаётся ключевой. В финале статьи всплывает старый тезис Рича Саттона: генеральные методы, масштабируемые вычислениями, со временем обгоняют специализированные. Бутылка примиряет эти полюса: джинн остаётся один и большой, а бутылочек можно наделать сколько угодно.

Побочный эффект приятный: один артефакт вместо миллионов вызовов снижает и энергозатраты на инференс. Авторы отдельно отмечают, что отслеживание прогресса bottling может дать работникам и политикам ранний сигнал о том, когда автоматизация рутинных задач ускорится.

Что делать командам, которые считают деньги

Если вы гоняете фронтир-модель по однотипным задачам, выводы бенчмарка превращаются в три проверки.

  • Сравнивайте артефакт с наивной дистилляцией. Если агент не бьёт простой бейзлайн при том же бюджете, его сложный план не стоит свеч.
  • Не доверяйте рейтингам zero-shot. Модели с одинаковыми баллами расходятся в разы после bottling, проверяйте на своей нагрузке.
  • Закладывайте бюджет на переделку. Экономия в сотни раз достигалась на миллионах инстансов, а не на тысячах: чем больше объём, тем выгоднее артефакт.

Часто задаваемые вопросы

Что такое bottling простыми словами?

Это умение LLM-агента превратить дорогие разовые способности в многоразовый дешёвый инструмент: обученную мини-модель, скрипт или пайплайн. Вместо миллиона отдельных обращений к большой модели артефакт закрывает всю нагрузку за долю стоимости.

Почему агент просто не вызовет API для каждого инстанса?

Может, но тогда бюджет выгорит задолго до конца работы: стоимость линейна по числу инстансов, а лимит в тесте составлял пять миллионов токенов. На миллионных нагрузках такой путь математически не сходится, поэтому авторы и считают bottling отдельной способностью.

Заменяет ли bottling обычную дистилляцию?

Нет, дистилляция это один из инструментов внутри bottling. Разница в том, кто принимает решения. При классической дистилляции рецепт задаёт инженер, а в bottling стратегию, обучение и применение артефакта агент должен выстроить сам, уложившись в фиксированный бюджет.

Bottling это про экономию денег или про качество?

Про то и другое одновременно. Метрика награждает решение, которое сохраняет высокое качество при радикально меньшей стоимости. Экономия без качества не считается: прогон, сдавший заглушки, получает ноль независимо от того, сколько он сэкономил.

Итог

Bottling пока в зачаточном состоянии: большинство агентов не умеют строить дешёвые решения без потери качества, а часть уступает даже наивной дистилляции. Но верхние прогоны уже показывают сотни раз экономии при сохранении большей части качества, и это меняет правила игры для тех, у кого есть миллионы однотипных задач. Код и протокол BOTTLED выложены на GitHub под лицензией MIT, сама статья доступна на arXiv. Если у вас есть подходящая нагрузка, устройте собственный тест: дайте агенту фиксированный бюджет, попросите построить артефакт и сравните его с простой дистилляцией. Результат может удивить в обе стороны.

← Все записи