Стоимость ИИ-агентов: $5 за два месяца вместо $200 в месяц

Стоимость ИИ-агентов: $5 за два месяца вместо $200 в месяц

Откройте любой гайд по стоимости ИИ-агентов, и вы увидите одни и те же цифры: $185–480 в месяц за персональный стек, $200 и выше за self-hosted вариант. Разработчик Суман Дебнат опубликовал нечто, чего в этих гайдах нет: собственный счёт. Его флот агентов MIGI работает с 8 июля 2026 года, выполняет 40–50 запусков в день — и за два месяца обошёлся дешевле пяти долларов. Суммарно, не в месяц.

Разница не в экономии на мелочах. Это две разные архитектуры, которые оценивают в одних и тех же статьях как одну. Публикуемые оценки описывают деплой с управляемой оркестрацией, сервером и фронтирной моделью на каждый вызов. Счёт Дебната описывает систему, где платная модель — запасной вариант, а не дефолт. Разберём, как это устроено и что сломалось за два месяца, потому что сломалось многое — и ни разу не из-за того, что модель оказалась «недостаточно умной».

Что вообще делает программу агентом

Прежде чем говорить о деньгах, стоит зафиксировать определение, потому что половина рыночной путаницы растёт именно из него. Агент решает, что делать, делает это и запускается без нажатия кнопки. Все три условия обязательны. Скрипт выполняет фиксированную последовательность — это не агент. Модель, которая производит текст, а действовать по нему должен человек, — это ассистент, причём часто отличный, но не агент.

Третье условие — автономный запуск — именно то место, где живёт вся инженерия. Агенту, за которым вы наблюдаете, не нужен запасной провайдер: вы увидите сбой и нажмёте кнопку ещё раз. Агенту, который срабатывает в 04:12, пока вы спите, приходится либо пережить отказ, либо шуметь достаточно громко, чтобы вас разбудить. Каждая секция этой истории — следствие именно этого предложения.

Кстати, тест Гартнера на «agent washing» — это то же самое определение, применённое к каталогу вендоров. Из тысяч компаний, продающих «агентов», реальным агентам соответствуют порядка 130. Чат-бот, обёрнутый вокруг пары API-вызовов, в лучший день выполняет первые два условия и никогда — третье.

Откуда берутся $185–480 в месяц и почему им нельзя верить

Цифры в обращении удивительно консистентны и одинаково мрачны. Gartner ждёт, что больше 40% агентских ИИ-проектов будут закрыты к концу 2027 года. Fiddler оценивает долю отказов в продакшене в 70–95%. IDC говорит, что 88% ИИ-прототипов никогда не доходят до масштабирования.

Проблема в том, чьи это агенты. Все эти числа выходят из опросов — 650 технологических лидеров в одном, 3412 участников вебинара в другом — и публикуются компаниями, которые продают обсервабилити, оркестрацию и консалтинг ровно в ту проблему, которую измеряют. Это не заговор, а естественный перекос выборки: изучать феномен есть бюджет только у тех, кто продаёт лекарство от него. Чего в этой статистике нет вообще, так это хоть одного реального счёта оператора.

Счёт MIGI выглядит так: планировщик и база данных бесплатны, единственная растущая статья расходов — вызовы моделей, а вызовы моделей — это задача маршрутизации.

Архитектура за $5: нет сервера, есть очередь провайдеров

В MIGI нет ни сервера, ни контейнера, ни платного оркестратора. Каждый агент — обычный Node.js-процесс, который будит workflow в GitHub Actions по cron-расписанию. Состояние живёт в Postgres на бесплатном тарифе, результаты приходят в Telegram и на почту — а не в дашборд, про который нужно помнить.

Ключевое решение — каждый агент называет не одну модель, а упорядоченный список провайдеров. Когда один отказывает, вызов уходит вниз по цепочке. По флоту распределено семь провайдеров: платный ведёт там, где качество — весь смысл задачи, а бесплатные тарифы несут рутинный трафик, который составляет большинство дневной работы.

Здесь Дебнат признаётся, что угадал бы неправильно. Бесплатные тарифы ограничивают двумя несовместимыми способами: запросами в минуту и токенами в минуту, и потолки различаются между провайдерами более чем вшестеро. Причём тянут они в противоположные стороны. Провайдер с самым щедрым лимитом запросов имеет самое узкое окно по токенам — он не годится первым для агента, который иногда отправляет огромный промпт. Провайдер, который проглатывает большие промпты, имеет самый жёсткий лимит запросов — он не годится первым для самого «болтливого» агента флота. Лучшего порядка не существует. Существует лучший порядок для конкретного агента, и он выводится из измеренного медианного размера его вызовов, а не из чьих-то предпочтений.

Одна цепочка устроена не ради пропускной способности. Агенты, которые касаются личного дневника, трат и финансов, не допускают ни одного бесплатного провайдера ни на одну позицию. Это решение о приватности, а не о производительности, и оно принудительно проверяется тестом: добавь удобный бесплатный хоп в эту цепочку — и сборка упадёт.

HTTP 429: одна ошибка, две разные болезни

31 августа в 14:30 UTC баланс OpenAI у Дебната обнулился. Он его не пополнял. Пост написан 7 сентября, и все агенты продолжали работать всё это время — что и есть лучшее доказательство того, что запасные маршруты были настоящим дизайном, а платная модель — удобством.

Но разобраться в произошедшем было непросто. Дашборд показывал 102 ошибки rate-limit за неделю, и это число было неверно сразу по трём причинам. Во-первых, большинство из них вовсе не были троттлингом: OpenAI возвращает HTTP 429 и для исчерпанного баланса, и для превышения частоты — классификатор складывал два разных состояния под одну метку. Во-вторых, счёт был завышен примерно втрое, потому что каждый ретрай писал собственную строку в лог. В-третьих, один агент падал, вообще не доходя до рабочего запасного маршрута.

Различить два состояния можно за тридцать секунд, если смотреть на форму сбоев, а не на их текст. Всплеск — это троттлинг: если ошибки кучкуются вокруг самых нагруженных минут, отступить и подождать поможет. Стена — это биллинг: если всё падает с одного таймстемпа и дальше, включая одиночные вызовы в пустые минуты, счёт пуст, и никакие ретраи ничего не изменят, кроме читабельности логов. В данных Дебната картина была чистой: 140 успехов до 14:30:39, 66 отказов после 14:54:08, ни одного успеха после переключения. Одиночный вызов в минуту физически не может пробить поминутный лимит, а пиковый трафик за ту неделю — девять вызовов в минуту при потолке в сотни.

Под этой ловушкой лежала вторая, скучнее. Классификатор искал слово «quota» в тексте ошибки — и это неверно, потому что обычный поминутный троттлинг как минимум одного провайдера открывается фразой про квоты и биллинг, которая читается как умерший аккаунт. Правда находилась строкой ниже, где называлась поминутная метрика, — но тело ошибки обрезалось на 400 символах, и на 400 символах влезает как раз шаблон, а не полезная часть. Расширение захвата до 800 символов было всем фиксом.

Одиннадцать агентов с запасным провайдером, который никогда не был подключён

Провайдер без API-ключа пропускается молча. Поведение правильное — отсутствующая креденшел не должна ронять прогон в четыре утра, — но у него есть следствие, которое Дебнат заметил смущающе поздно: цепочка может работать короче, чем читается. Файл маршрутизации называет шесть провайдеров, workflow передаёт четыре ключа, а оставшиеся два — декорация, и ничто нигде этого не говорит.

В таком состоянии находились одиннадцать агентов. Худший из них — тот самый, что доминировал в неверно прочитанной статистике rate-limit: его цепочка называла запасной вариант, ключ от которого workflow никогда не передавал. На бумаге у него была страховка, на практике — один провайдер и обрыв. Теперь есть скрипт, который читает определения цепочек и окружение каждого workflow как текст и падает с ненулевым кодом, если они расходятся. На написание ушёл час. Он должен был существовать с первого дня.

Это, к слову, форма почти каждого серьёзного сбоя за два месяца: не крах, а вещь, которая выглядит сконфигурированной, ведёт себя как несконфигурированная и не сообщает ни о чём.

Неделя, когда GitHub перестал запускать агентов и не оставил записей

Каждый агент MIGI — это cron-scheduled workflow в GitHub Actions, а GitHub относится к schedule-триггеру как к best-effort. Дебнат знал это заранее, но не представлял, сколько места в этом слове.

Измеренное опоздание низкочастотных запусков против собственного расписания: 24 августа — медиана 53 минуты, худшее 1,4 часа. 25 августа — 42 минуты и 1,3 часа. 26 августа — 62 минуты и 2,5 часа. 27 августа — 10,5 часа медианы. 28 августа — 11,6 часа медианы и 12,1 часа худшего. Получасовой workflow даже в здоровый период выполнял примерно половину своих прогонов; за ту неделю флот упал с сорока запусков в день до одного. Утренний стендап на 08:00 пришёл в 20:00. Страница статуса GitHub всё это время была чистой.

Коварство в том, что пропущенное расписание не оставляет вообще ничего. GitHub не создаёт объект запуска, пока реально его не отправил. Отклонённый schedule не производит ни очереди, ни ожидания, ни строки в логе, ни поля статуса. Запрос к API за бэклогом честно вернул ноль — в то время как бэклог был реален. Не на что алертить: единственный способ узнать — сравнить то, что запустилось, с тем, что должно было запуститься.

Из той недели вынесены два практических вывода. Перевод получасового cron на часовой почти ничего не даёт — платформа и так уже доставляла примерно раз в час, реальное облегчение начинается с двухчасового. А ручной dispatch не троттлится: workflow, запущенный руками, стартует немедленно, пока его запланированный близнец опаздывает на десять часов.

У изменений тоже есть ловушка. Несколько workflow блокируют job по расписанию, которое его вызвало, сравнивая как точную строку. Сдвинь cron, не сдвинув условие — и job молча не запустится больше никогда: ни ошибки, ни упавшего прогона, ничего на дашборде, потому что с точки зрения платформы ничего не случилось. Зелёная галочка на job, который ничего не сделал, — самый дорогой «успех» из существующих.

Тесты проходили на 100%, пока 15% реального выхлопа было нечитаемым

Логика решений MIGI покрыта офлайн-наборами оценок, которые гоняются на каждое изменение без сети и секретов. Строить так Дебнат стал бы снова — но теперь в README этих наборов висит предупреждение, написанное после того, как он сам на этом погорел.

Один набор покрывает агента, который превращает посты в слайд-карусели. Он сидел на ста процентах, пока 15,4% слайдов, построенных из реальных постов, выходили нечитаемыми. Набор не был сломан: он проходил на четырёх образцах постов, которые Дебнат написал сам как фикстуры, и каждый из них случайно оказался аккуратным самодостаточным предложением. Ничто из того, что он реально пишет, так не выглядит.

Выдуманные фикстуры всегда чище реальных данных, поэтому оценка, построенная на них, измеряет ваше воображение, а не вашу систему. Теперь там, где существует реальный корпус, MIGI меряется и по нему — в read-only аудитах, которые печатают собственный бейзлайн и намеренно не являются гейтами сборки: их эвристики завышают показания специально. Они отвечают на единственный вопрос, на который не отвечает ни один eval: это изменение сделало реальный выхлоп лучше или хуже?

Агенты падают не потому, что модель глупая

За два месяца сломались три вещи: биллинговый отказ, надевший код ошибки rate-limit; цепочка запасных маршрутов, оказавшаяся короче, чем читалась; планировщик, который тихо перестал планировать и не записал, что сделал это. Ни одна из них — не проблема модели.

Именно поэтому статистику отказов, по мнению Дебната, читают наоборот. Аргумент про накапливающуюся ошибку цитируют все: три агента с надёжностью 70% дают 34% end-to-end. Арифметически это верно и указывает не на ту переменную. Из него читается, что лечение — модель получше. Но каждый отказ выше жил в слое под моделью: что происходит, когда вызов не вернулся, кто об этом узнаёт и как быстро.

Ничто в этом слое не стоит дорого. Он просто негламурный и не демонстрируется. Проверку соответствия ключей и цепочек не покажешь в ролике запуска — а компания, заложившая бюджет на фронтирную модель для каждого вызова и ноль на неделю, когда планировщик замолчит, закончит в тех самых 40% Гартнера.

Часто задаваемые вопросы

Сколько стоит запускать ИИ-агентов?

Опубликованные оценки ставят персональный стек из пяти-шести агентов в $185–480 в месяц, а self-hosted конфигурацию — в $200 и выше. Флот MIGI, работающий с 8 июля 2026 года по 40–50 запусков в день, обошёлся меньше чем в $5 суммарно. Разница архитектурная: бесплатный планировщик, бесплатная база и платная модель как запасной вариант, а не дефолт.

Что такое ИИ-агент?

ИИ-агент — это программа, которая решает, что делать, делает это и запускается без нажатия кнопки. Важны все три части. Скрипт с фиксированной последовательностью — не агент, а модель, производящая текст для человека, — ассистент. Автономный запуск — условие, которое и порождает всю инженерию: каждый отказ должен быть либо переживаемым, либо громким.

Почему большинство проектов с ИИ-агентами проваливается?

Gartner ждёт, что больше 40% агентских ИИ-проектов закроют к концу 2027 года, ссылаясь на стоимость, неясную ценность и слабый контроль рисков. На практике отказы сидят ниже модели, а не в ней: биллинговая ошибка, неотличимая от rate-limit; запасная цепочка без переданных ключей; планировщик, который остановился и ничего не записал. Ни одно из этого не лечится более сильной моделью.

Итог

Стоимость ИИ-агентов — это не свойство агентов, а свойство архитектуры. Один и тот же флот стоит $200 в месяц на управляемом стеке с фронтирной моделью на каждый вызов — или $5 за два месяца на бесплатном планировщике, семи провайдерах в цепочке и платной модели в роли последнего рубежа. Баланс OpenAI Дебнат так и не пополнил: каждый день без пополнения — ещё одно доказательство, что запасные маршруты и были настоящим дизайном. Если строите своих агентов, начните не с выбора модели, а с вопроса: что произойдёт, когда вызов не вернётся в четыре утра — и кто об этом узнает?

← Все записи