Zhipu ускорила запуск модели втрое: внешний цикл самоулучшения
Более 100 000 китайских ускорителей, меньше двух недель и трёхкратный рост пропускной способности: Zhipu доверила доводку продакшен-инференса для GLM-5.3 Flash ИИ-агенту на базе самой GLM-5.3. Агент закрыл работу, на которую обычно уходят недели труда целой команды инфраструктурных инженеров.
Лаборатория описывает это без привычной осторожности. «Наши преемники это ИИ-системы, которые мы сами создаём», пишут в Zhipu. Рядом вторая фраза, куда менее удобная: «GLM-5.3 стал незаменимым партнёром по кодингу для всей команды и уверенно движется к тому, чтобы заменить нас».
За этими словами стоит конкретный инженерный кейс: что делал агент, почему у него получилось и какие три принципа обратной связи могут забрать себе команды, которые строят автоматизацию на LLM.
Что именно построила Zhipu
GLM-5.3 Flash это быстрая и дешёвая версия флагманской модели: MoE на 320 млрд параметров, контекст на миллион токенов, мультимодальный вход и лицензия MIT. Для её запуска Zhipu собрала с нуля полный продакшен-стек инференса на кластере из более чем 100 000 китайских AI-ускорителей. По словам лаборатории, до этого никто не разворачивал кластер китайских чипов такого масштаба, и теперь весь продакшен-трафик GLM-5.3 Flash идёт через эту систему.
Условия были жёсткие: дефицит памяти и пропускной способности чипов, новая архитектура, окно на миллион токенов, мультимодальные запросы, незрелая экосистема и неполная поддержка ядер. Часть того, что обычно описано в документации, приходилось угадывать.
Итоговый стек собрали из intra-node tensor parallelism для linear attention и LM Head, ReplaySSM, квантизации W8A8, кэша смешанной точности INT8/FP8/BF16, Layer Split и EPD-архитектуры (Encode-Prefill-Decode). Вместе это дало примерно трёхкратный рост end-to-end производительности, а утилизация железа и стоимость одного токена вышли на уровень мейнстримных GPU NVIDIA.
Проверку модель прошла в бою: её выложили анонимно под именем Ox-Alpha на OpenCode и OpenRouter. За шесть дней она обработала больше 62 трлн токенов и стала самой используемой моделью на обеих площадках. Как аудиторы вычислили её личность до официального анонса, мы разбирали отдельно.
Ключевая деталь всего кейса: большую часть работы выполнил не отдел инженеров, а Infra-агент на базе GLM-5.3.
Что такое внешний цикл самоулучшения
Это другой уровень, чем у исследовательских прототипов. В сентябре мы разбирали AIDE² от Weco: агент за восемь дней переписал собственный harness и обошёл версию, которую инженеры настраивали два года. Но то была песочница, пусть и с честными замерами.
В кейсе Zhipu цикл прикладной. Агент строит и оптимизирует продакшен-систему, на которой работает сам, и ускоряет лабораторию, выпускающую следующую модель. Джек Кларк из Import AI называет этот контур внешним циклом самоулучшения: пока внутренний цикл улучшает конкретную систему, внешний ускоряет саму машину прогресса. Сигналы о том, что RSI перестал быть теорией, теперь приходят не из философских эссе, а из отчётов о запуске сервисов.
Разделение труда: агент, инженеры и среда
Роли в цикле Zhipu описывает одной фразой: инженеры задавали цели и границы системы, агент вёл анализ, гипотезы и правки кода, экспериментальная среда давала многослойную и проверяемую обратную связь. Вместе это превратило диагностику, которую раньше держал в голове опытный инженер, в процесс, который агент проходит непрерывно.
За людьми остались три зоны ответственности: формулировать цели и ограничения, строить среду обратной связи, ревьюить критичные изменения, где на кону численная семантика, асинхронная конкурентность и продакшен-риски. Всё остальное агент берёт на себя: предлагает гипотезы, правит код, ставит эксперименты и по фидбеку решает, что оставить. Формулировка лаборатории звучит как слоган: «Модель оптимизирует систему; система запускает модель».
Три принципа плотной обратной связи
Самая полезная для других команд часть кейса это организация обратной связи для агента. Отправная точка простая: упавшая метрика ничего не объясняет. Сообщения «тест точности не прошёл», «TTFT (время до первого токена) вырос на 30%», «вывод просел на 20%» говорят агенту, что стало хуже, но не отвечают, какой слой виноват, почему гипотеза не сработала и что проверять следующим. Код это статический контекст, а проблемы инференса живут в динамике: ядра, стратегии параллелизма, коммуникации, управление памятью, оркестрация.
Zhipu называет решение «плотной» (dense) обратной связью и формулирует три её свойства.
Локальность. Сигнал привязан к конкретным параметрам запуска, изменениям, ядрам, входным данным, потокам или путям исполнения. Вместо «точность упала после оптимизации» агент получает разницу выходов конкретного запроса до и после правки и может собрать минимальное воспроизведение проблемы.
Дешевизна и скорость. Гипотеза проверяется микробенчмарком или локальным тестом ядра, а не полным деплоем сервиса с нагрузочным прогоном. Чем короче цикл, тем меньше усилий агент тратит на тупиковые ветки и тем быстрее корректирует курс.
Объективная проверка. Корректность изменения и прирост производительности подтверждают reference-реализации, тесты и сравнимые метрики, а не корреляции из мониторинга. Наблюдения позволяют найти подозреваемого, причинность устанавливают контролируемые эксперименты.
Дальше принцип превратился в инфраструктуру: тесты корректности, логи, трейсы, runtime-события, микробенчмарки и end-to-end метрики стали набором инструментов, доступных агенту напрямую. Локальные проверки отсеивают слабые изменения рано, полные прогоны подтверждают, что локальный выигрыш превращается в реальную скорость сервиса. Это разделение ролей снимает главную боль агентной оптимизации: агент не гадает по одной цифре, а видит, где именно потерялись миллисекунды.
Три бага, которые нашёл агент
В отчёте Zhipu приведены эпизоды на трёх разных слоях системы: численная корректность, поведение рантайма и производительность ядер.
Численная ошибка в ядре KDA. Сравнение двух путей исполнения, с context parallelism и без, показало расхождение на длинных контекстах. Расследование вывело на слияние состояний между шардами: tl.dot по умолчанию считал в TF32 даже при FP32-входах, и ошибка накапливалась при передаче состояния. Фикс на одну строку, явная точность tf32x3, убрал расхождение. Патч ушёл в открытый проект Flash Linear Attention (PR #1180).
20% против 5% в KV Transfer. Инженеры задали критерий: разрыв между сценарием Prefill + KV Transfer и чистым Prefill не должен превышать 5%. Агент нашёл сценарии с разрывом больше 20% и добрался до стыка Python и C++: в DeepEP v1.2.1 функции intranode_dispatch и intranode_combine не отпускали GIL, из-за чего поток Mooncake Transfer не мог вовремя отправлять задачи. После фикса разрыв упал ниже 1%.
Четырёхкратный пересчёт в Decode-ядре. История в три шага: переход на ReplaySSM обменял память на вычисления и поднял время исполнения ядра, оптимизация деления вернула 9,6%, а затем агент нашёл проблему глубже. Тайлинг по измерению V заставлял систему четыре раза пересчитывать одну и ту же нормализацию и гейтинг. Агент объединил тайлы в один thread block, оставил промежуточные значения в регистрах и заменил повторный пересчёт warp-level reduction: ускорение в 1,71 раза к версии до разбора. Приёмы он доставал из существующих ядер SGLang, Flash Linear Attention и DeepGEMM, превращая их в «оптимизационные скелеты» с условиями применимости.
Проверенные приёмы возвращаются в библиотеку скелетов, и каждый следующий раунд оптимизации требует меньше усилий: опыт накапливается, цикл разгоняется. Именно это делает внешний контур самоподдерживающимся: система оптимизирует себя и снижает стоимость следующей оптимизации.
Что говорят в Zhipu сами
Тон отчёта выбивается из жанра корпоративных блогов. Он начинается почти исповедально: «Когда мы разрабатываем GLM, модель иногда показывает возможности, которые удивляют и даже пугают нас». Дальше честная динамика: до GLM-4.7 внутреннее использование модели для кодинга было «в известной степени обязанностью», сегодня это незаменимый рабочий инструмент всей команды, «и он уверенно движется к тому, чтобы заменить нас».
При этом Zhipu не устраивает спектакль из апокалипсиса. Лаборатория прямо говорит: RSI ещё не наступил, выбирать цели, задавать границы и оценивать риски остаётся за людьми, и эту линию нужно удерживать как можно дольше. Финальная строка расставляет акценты: цифры «две недели, трёхкратный рост, 100 000 ускорителей» говорят, что прогресс на этой границе «не замедлится только потому, что нам этого хочется».
Та же волна: ИИ-учёные и роботы
Zhipu не одиноки. В той же рассылке Import AI рядом стоят два похожих сюжета из других областей.
ИИ-учёные переезжают в реальные лаборатории. Стартап Periodic Labs дообучал модель Periodic Neon на триллион параметров с подкреплением на данных прямо из физической лаборатории. На внутреннем тесте по анализу рентгеновской дифракции модель показала 55,3% успеха против 2,7% у Kimi 2.6, рост в 20 раз, и обошла GPT-6 Astra и Claude Fable 5.1 на отложенных системах. На весь цикл ушло всего 1 300 ускорителей H200, на порядки меньше, чем при претрейне фронтьерных моделей. Логика компании: научный поиск разбивается на цикл из гипотезы, синтеза, анализа и уточнения, и этот цикл можно замкнуть на ИИ.
Робототехника ждёт свой рецепт пост-тренинга. Перри Донг и Челси Финн из Стэнфорда пишут, что робототехника сейчас там, где языковой моделинг был до эпохи RLHF: претрейн масштабируется красиво, а вторая половина, обучение на собственном опыте, до сих пор ручная. Нужен стандартный рецепт: как определять успех, как сбрасывать сцену между попытками, как превращать подсказки человека в обучение. Их кандидат, алгоритм EXPO(-FT), учится улучшать действия фронтьерной модели с помощью лёгкой политики, а затем впитывает правки в саму модель.
Один выпуск рассылки, три разных контура, один сюжет: ИИ всё плотнее участвует в производстве самого ИИ и сопутствующей науки.
Часто задаваемые вопросы
Что такое внешний цикл самоулучшения?
Это уровень рекурсивного самоулучшения, на котором ИИ улучшает не собственный код, а инфраструктуру и процессы лаборатории, создающей следующее поколение моделей. Внутренний контур, итерации над задачей, уже привычен. Внешний замыкается, когда агент оптимизирует продакшен-систему, на которой работает сам, и ускоряет выход преемника. Кейс Zhipu показывает этот контур в работе.
Zhipu уже заменила инженеров ИИ-агентом?
Нет. Люди формулировали цели и ограничения, строили среду обратной связи и ревьюили критичные изменения: численную семантику, конкурентность, продакшен-риски. Агент выполнял анализ, гипотезы и правки кода. Но Zhipu сама признаёт, что сравнительное преимущество человека в этой петле сокращается, и удерживать линию становится всё сложнее.
Можно ли применить эти принципы без кластера на 100 000 чипов?
Да, и это самая практичная часть кейса. Локальный сигнал вместо полного прогона, дешёвые и быстрые проверки гипотез, объективные критерии вместо корреляций: эти правила работают в любой команде, которая строит агентную автоматизацию. Большинство проектов спотыкается не на модели, а на среде обратной связи вокруг неё.
Итог
Zhipu показала, как внешний цикл самоулучшения выглядит в продакшене: агент на базе GLM-5.3 собрал инференс-стек на кластере из 100 000+ китайских ускорителей, утроил пропускную способность и довёл модель до продакшена меньше чем за две недели. Люди остаются в цикле, но их роль сжимается до целей, границ и ревью.
Главный урок для команд за пределами фронтьера: скорость агента определяется не столько мощностью модели, сколько качеством обратной связи вокруг неё. Разница между агентом, который что-то делает, и агентом, который закрывает инженерные задачи, почти всегда лежит в среде: насколько локально, дёшево и объективно система отвечает ему на вопрос «почему не сработало».
Возьмите одну повторяющуюся задачу своей команды и распишите, какой локальный сигнал покажет агенту, что он движется в верную сторону. Час на проектирование обратной связи окупается неделями ручной работы, которые вы больше не делаете.