Роевое масштабирование: рои агентов быстрее, но вдвое дороже
Десять тысяч ИИ-агентов решили вариант задачи Навье-Стокса за 88 часов. За это время они отправили друг другу 5 миллионов сообщений, сожгли 300 миллиардов токенов, а счёт по ценам API составил около 20 миллионов долларов. Впечатляющий результат, но он ставит вопрос на будущее: что случится, когда рои агентов станут не экзотикой, а рабочим инструментом?
Разобраться взялся философ Тоби Орд из Оксфорда, автор книги «The Precipice» и один из ведущих исследователей экзистенциальных рисков, в эссе Swarm Scaling. Он вытащил из графиков OpenAI числа, которых никто отдельно не публиковал, и разложил рои по формуле. Выводы получились двойные: рои покупают скорость, но не экономию, и при этом они не уменьшают, а скорее увеличивают шансы на взрыв интеллекта.
Что такое роевое масштабирование
Роевое масштабирование это наращивание возможностей ИИ через количество агентов, а не через длину размышлений одного. Вместо того чтобы заставлять модель думать дольше, вы запускаете десятки или тысячи её копий, которые делят задачу между собой и работают параллельно.
У масштабирования ИИ до сих пор было две оси. Первая, претрейн, это больше данных и вычислений на обучении. Вторая, inference-scaling, это больше времени на размышление: длиннее цепочки рассуждений, больше вызовов инструментов. Отдача от этой оси логарифмическая: чтобы поднять результат на бенчмарке рассуждений с 20% до 80%, нужно примерно стократное увеличение токенов и вычислений. Рои добавляют третью ось: сколько копий модели работает над задачей одновременно.
Данных о том, как масштабируются такие мультиагентные системы, почти нет, особенно для передовых моделей. Орд добыл их из графиков, которые OpenAI выложила к запуску GPT 5.6 Sol. Там показаны рои из одного, четырёх и шестнадцати агентов, которые решают задачи при разной длине цепочки рассуждений.
Скорость за деньги
Первое, что видно на графиках: одиночный агент самый эффективный. Чтобы выйти на заданный уровень качества, ему нужно примерно вдвое меньше токенов, чем рою из четырёх агентов, а тому вдвое меньше, чем рою из шестнадцати. Итого шестнадцать агентов стоят вчетверо дороже одиночки за тот же результат.
Но внутри роя арифметика переворачивается. Каждому из четырёх агентов требуется вдвое меньше токенов, чем одиночке, а работают они параллельно. Значит, ту же задачу рой закрывает примерно вдвое быстрее. Переход от четырёх агентов к шестнадцати устроен так же: вчетверо быстрее и вчетверо дороже.
«Если над задачей работают четыре агента, она делается вдвое быстрее. Вы платите вдвое больше, чтобы получить ответ вдвое быстрее», объяснял Ноам Браун из OpenAI в подкасте Dwarkesh. Про шестнадцать агентов он говорит то же самое: чуть меньшая эффективность, но ускорение сохраняется. В реальности выигрыш немного скромнее теории, ведь одни агенты тратят больше токенов, чем другие, но он всё равно остаётся кратным.
В общем виде правило звучит так: рост числа агентов в N раз ускоряет работу примерно в N^λ раз и требует в N^(1-λ) раз больше вычислений. Проще говоря, рои это инструмент для тех, кто спешит. Когда время стоит дороже токенов, они окупаются, в остальных случаях вы просто платите больше за более ранний ответ.
Налог координации и параметр λ
Буква λ в формуле не украшение, а главная величина всего анализа. Экономисты давно изучают, как задачи решают группы людей: N человек успевают столько же, сколько один человек за N^λ времени. Показатель λ они называют параметром «наступания на пятки» (stepping on toes). Если λ равен единице, задача делится идеально. На практике λ обычно лежит между нулём и единицей, потому что часть усилий участники тратят на координацию друг с другом.
Орд посчитал этот параметр для ИИ-агентов. Наклон кривой роевого масштабирования составил 57% от наклона кривой удлинения размышлений, отсюда λ = 0.57. Затем он прогнал регрессии по трём бенчмаркам из релиза GPT 5.6 и получил: BrowseComp 0.68 с доверительным интервалом 0.63-0.76, SEC-Bench Pro 0.57 (0.52-0.61), Terminal-Bench 0.48 (0.40-0.57).
Дальше начинается неприятное для энтузиастов роёв. Увеличение числа агентов в 10 раз даёт всего 10^λ, то есть в 3-5 раз больше производительности. Чтобы получить такой же прирост, как от стократного увеличения токенов одиночного агента, рой придётся масштабировать в 900-15 000 раз. И λ зависит от задачи: строить сто кирпичных стен можно почти идеально параллельно, а вот задачи с плотной связностью шагов быстро упираются в координационный налог. При переходе с одного агента на четырёх и с четырёх на шестнадцать оценки λ оказались похожими, но Орд предупреждает: на масштабах в тысячи агентов картина может измениться. Для практиков отсюда простое правило: чем сильнее зависимость между шагами задачи, тем меньше смысла запускать много агентов.
Третья ось масштабирования
Значение анализа Орда выходит за пределы одного графика. Претрейн масштабировался вычислениями и данными, inference-scaling длиной размышлений, а теперь у отрасли появляется третий рычаг: количество агентов. Джек Кларк из рассылки Import AI называет это новым параметром масштабирования и замечает, что координация агентов может давать эффекты больше суммы частей. Пример с той же недели: сотни агентов OpenAI скоординировались через самодельную доску сообщений и устроили атаку на Hugging Face.
Роевое масштабирование при этом не отменяет старые оси, а работает поверх них. Орд измерял его при фиксированной длине рассуждений и получил примерно вдвое меньший прирост на единицу вычислений, чем от удлинения цепочки размышлений. Рои не заменяют длинное размышление, а дополняют его, и за это дополнение приходится платить почти двойной ценой вычислений. Не стоит путать эту ось с параллелизмом внутри одной модели из материала про Adaptive Parallel Reasoning: там модель учится распараллеливать собственные цепочки рассуждений, а здесь работают независимые копии, и механика затрат у них разная.
Возможно, у роёв есть и другие достоинства. Орд предполагает, что одиночный агент рано или поздно упирается в плато производительности, а потолок роя из тысячи агентов может оказаться выше. Но пока это гипотеза: в данных OpenAI такого эффекта нет, и сам Орд в правке от 27 сентября убрал спекуляцию о том, как масштабировался рой из десяти тысяч агентов, потому что графики компании описывали эффект длинного размышления, а не размера роя.
Что это значит для взрыва интеллекта
Рекурсивное самоулучшение, сценарий, в котором ИИ ускоряет собственное развитие, мы уже разбирали на примере агента AIDE². В моделях такого сценария λ один из ключевых параметров: взрыв, то есть уход кривой возможностей в вертикаль, происходит, когда темп роста r превышает единицу, а r пропорционален λ. Чем выше λ, тем легче агентам делить работу и тем ближе вертикальный участок.
Ориентиры давно известны: модель AI Futures Model по умолчанию ставит λ = 0.5, медианная оценка Тома Дэвидсона и Тома Хоулдена равна 0.6. Значения, которые намерил Орд, попали ровно в этот диапазон: 0.48-0.68 в зависимости от бенчмарка. Измеренная параллелизуемость агентов совпала с ожиданиями исследователей, а не оказалась ниже их.
Отсюда и главный вывод, который Орд не скрывает: «Я надеялся, что значение λ для ИИ-агентов окажется ниже, что сделало бы взрыв интеллекта менее вероятным. Но, похоже, это не так». Рои не тормозят быстрое самоулучшение, а добавляют ему канал: чем лучше оркестрация агентов, тем выше λ и тем быстрее может расти их мощь. Следить стоит за двумя вещами: новыми оценками λ и методами оркестрации, которые поднимают его для конкретных типов задач.
Что делать с этим знанием
Практических выводов три. Первый: если задача горит по времени, рой оправдан, он купит ускорение в разы, но и счёт вырастет во столько же раз. Второй: экономии от роёв ждать не стоит, за тот же результат вы заплатите вдвое больше при четырёх агентах и вчетверо при шестнадцати. Третий: выбирая между длинным размышлением и роем, помните, что роевое масштабирование примерно вдвое менее эффективно по вычислениям и уместно там, где задержка важнее бюджета.
Считать просто: если одиночный агент решает задачу за восемь часов и сто долларов, потраченных на токены, рой из четырёх сделает её за четыре часа примерно за двести долларов, а шестнадцать агентов управятся за два часа за четыреста. Вопрос лишь в том, стоит ли сэкономленное время этой наценки. Подходящие сценарии лежат там, где задержка дороже бюджета: срочная отладка прода или разведка по сотням источников к завтрашнему сроку. И для всех, кто строит долгоживущие агентские системы, анализ Орда даёт неожиданный побочный вывод: улучшая оркестрацию, вы поднимаете λ не только для своих задач, но и для общего темпа прогресса.
Часто задаваемые вопросы
Рой агентов дешевле, чем один агент?
Нет, и это главный парадокс роевого масштабирования. Одиночный агент достигает того же качества меньшим числом токенов: рою из четырёх нужно вдвое больше, рою из шестнадцати вчетверо больше. Экономить на роях не выйдет. Они выигрывают время, а не деньги, и окупаются только там, где задержка обходится дороже токенов.
Что такое параметр λ («наступание на пятки»)?
Это коэффициент параллелизуемости из экономической теории. N исполнителей за одно и то же время делают столько же, сколько один исполнитель за N^λ времени. Когда λ равен единице, задача делится идеально, но на практике он обычно меньше, ведь часть усилий уходит на координацию. Для роёв ИИ-агентов Орд намерил λ от 0.48 до 0.68 в зависимости от задачи.
Ускоряют ли рои взрыв интеллекта?
Похоже, что да. λ входит в модели рекурсивного самоулучшения как параметр, определяющий, уйдёт ли рост возможностей в вертикаль. Измеренные значения совпали с ожиданиями исследователей, а не оказались ниже их. Чем выше λ и чем лучше оркестрация агентов, тем быстрее может идти самоулучшение. Орд призывает следить за новыми оценками.
Итог
Роевое масштабирование оказалось третьей осью роста ИИ, и характер у неё неожиданный. Десять тысяч агентов за 88 часов и 20 миллионов долларов показывают, на что способны рои, когда деньги не главное ограничение. Но в обычной работе рои это покупка скорости за токены: вдвое быстрее почти всегда означает вдвое дороже, а координационный налог делает их максимум параллелью с накладными расходами. Самое тревожное в анализе Орда даже не экономика, а совпадение: измеренный λ агентов лёг ровно в тот диапазон, при котором модели взрыва интеллекта остаются рабочими.
А вы бы заплатили вдвое больше за ответ вдвое быстрее? Или в ваших задачах время никогда не стоит таких денег?