Стелс-модели в API: как вычислить анонимную нейросеть
20 августа 2026 года на OpenRouter появилась модель Ox Alpha: контекстное окно 1 048 576 токенов, мультимодальный ввод, вызов инструментов, нулевая цена и ни одного упоминания вендора. Три дня спустя независимый аудиторский протокол указал на линейку GLM-5.3 от Zhipu AI, а 26 августа компания официально подтвердила: Ox Alpha это GLM-5.3-Flash. Анонимную модель вычислили до того, как она назвала себя сама.
Этот случай разобран в статье «Auditing Anonymous AI Models: A Four-Stage Protocol for Black-Box Identity Verification» (arXiv: 2608.31142), и он интересен не сам по себе, а как симптом. За 2025–2026 годы авторы насчитали 20 стелс-релизов от девяти вендоров через три канала дистрибуции. Анонимные превью перестали быть экзотикой: они стали способом вывода фронтирных моделей на рынок.
Что такое стелс-релиз модели
Стелс-релиз это запуск модели на API-платформе под кодовым именем без указания разработчика. Провайдер прямо пишет, что модель «разработана и обслуживается сторонним поставщиком, пожелавшим остаться анонимным». Пользователь получает доступ к фронтирным возможностям, но не знает, чьи веса обрабатывают его запросы.
Казалось бы, какая разница, кто за endpoint'ом, если модель отвечает хорошо. Разница есть, и она практическая. Условия хранения и обработки данных привязаны к конкретному провайдеру и каналу: отправляя код или документы анонимной модели, вы не знаете, чья политика удержания данных применяется на самом деле. Риск цепочки поставок невозможно застраховать без атрибуции: кто обслуживает модель, на какой инфраструктуре, в какой юрисдикции. Даже инженерные решения зависят от идентичности: семейство модели и эпоха её обучения определяют, чего от неё ждать.
Масштаб проблемы подтверждают независимые проверки. Аудит сторонних endpoint'ов, заявляющих себя как официальные, показал: 45,83% проверок отпечатков провалились на теневых API (Zhang et al., 2026b). Почти каждый второй «официальный» endpoint обслуживает не ту модель, которую заявляет.
Почему нельзя просто спросить модель
Первый инстинкт практика: спросить у модели, кто она. Сообщество провело около 300 проб на идентификацию Ox Alpha и получило ноль достоверных самоидентификаций. Анонимные модели спроектированы так, чтобы не раскрывать себя: системные промпты и выравнивание подавляют любые намёки на происхождение. Инфраструктура платформы дополнительно обфусцирует данные об использовании.
Существующие методы идентификации тоже не подходят. Детекторы сгенерированного текста атрибутируют авторство текста, а не происхождение модели. Вотермарки и выходные отпечатки требуют сотрудничества со стороны модели, которого у анонимного превью нет. Активный чёрноящичный фингерпринтинг вроде LLMmap или ZeroPrint рассчитан на цель, которая не сопротивляется: стиль ответов и статистика выхода у стелс-моделей намеренно подавлены.
Четырёхстадийный протокол аудита
Авторы предлагают подход из цифровой криминалистики: восстановить идентичность по артефактам, которые обслуживающий стек не может легко подделать, и оставить проверяемый след доказательств. Протокол состоит из четырёх стадий, и если доказательств недостаточно, он честно выдаёт «атрибутировать невозможно» вместо угадывания.
Стадия 0: форензика деклараций конфигурации
Первая задача: установить, что модель заявляла о себе на момент запуска, и не дрейфовала ли декларация со временем. Аудитор поднимает архивные снимки страницы модели на платформе через Internet Archive и извлекает поля конфигурации: контекстное окно, максимальный вывод, управление рассуждением, модальности, поддерживаемые параметры. В двух разобранных кейсах этот метод вскрыл расхождение между превью и продакшеном: заявленные характеристики менялись после запуска.
Стадия 1: отпечаток конфигурации по каталогу
Дальше конфигурация цели сравнивается со всем каталогом платформы. В случае Ox Alpha сопоставление по 422 моделям сузило пул кандидатов до единственного кросс-вендорного класса эквивалентности: {ox-alpha, glm-5.3, glm-latest}. Сочетание контекстного окна, потолка вывода, рассуждающих контролей и модальностей оказалось уникальной подписью линейки GLM от Zhipu.
Стадия 2: дифференциальный тест токенизатора
Самая изящная стадия. Разные семейства моделей токенизируют один и тот же текст по-разному, и разница в подсчёте токенов это артефакт, который endpoint'у трудно подделать. Но есть ловушка: на коротких промптах случайные коллизии неизбежны. Поэтому протокол требует обязательный кросс-длинный дифференциал: тест на коротких и длинных текстах одновременно. Постоянство разницы на коротком промпте доказательством не считается.
Для Ox Alpha прогнали пять текстов: три коротких, длинный китайский и длинный английский. Разница с glm-5.3 и glm-5.2 составила ровно 75 токенов и оставалась константной на всех пяти текстах. Три ложных совпадения с моделями вне семейства GLM рассыпались именно на длинных текстах. Это семейный уровень идентификации; различение версии внутри линейки дала Стадия 1.
Стадия 3: поведенческие пробы
Финальный слой корроборации: возможности модальностей, рассуждающие контроли, границы знаний. У Ox Alpha мультимодальность и профиль рассуждения совпали с сервинг-профилем GLM. Правда, тест на границу знаний оказался менее точным сигналом, чем конфигурационные свидетельства, и после официального раскрытия авторы понизили вес этой стадии.
Проверка на известных кейсах
Протокол валидировали ретроспективно на 10 стелс-релизах с известной идентичностью от шести вендоров: OpenAI, xAI, Xiaomi, Zhipu AI, NVIDIA, Mistral. Результат: 7 точных совпадений деклараций, 2 случая с различием в точности, 1 частичный и ни одного контрнаправленного. Важно понимать, что здесь проверялась согласованность деклараций, а не сквозная идентификация под анонимностью: большинство этих кейсов были полураскрытыми.
Сама валидация принесла три методических урока. Первая версия протокола сравнивала цель с моделями из текущего листинга и получила лишь 1 точное совпадение из 7: сравнение с более поздними моделями систематически занижало совпадения. Исправление: сравнивать с официальными спецификациями истинной модели на момент её запуска, что подняло результат до 5 из 7. Третья версия перепроверила все спецификации по первоисточникам вендоров. Эволюция с 1/7 до 7/7 показывает, насколько результат зависит от выбора базовой линии.
Флагманский кейс: прогноз против раскрытия
Единственная полностью слепая проверка прошла на живой анонимной модели. 23 августа 2026 года, когда Ox Alpha была в сети трое суток, датированные измерительные артефакты (снимок каталога, база конфигурационных отпечатков, JSONL второй стадии) зафиксировали атрибуцию к Zhipu AI, линейка GLM-5.3, по трём независимым потокам доказательств. Вариант развёртывания (flash, turbo, max) авторы сознательно не утверждали заранее.
26 августа Zhipu AI официально подтвердила: Ox Alpha это GLM-5.3-Flash, мультимодальный вариант на новой архитектуре. Семейство и линейка версий совпали с прогнозом полностью. Сообщество независимой стилометрии пришло к тем же выводам о семействе, что служит внешним подтверждением.
Отдельно авторы отмечают слабость собственной процедуры: прогноз был зафиксирован в датированных измерительных артефактах, но не в виде хешированного публичного депозита. Теперь протокол рекомендует коммитить прогнозы заранее, например публиковать SHA-256 карточки предсказания в публичном канале с меткой времени до раскрытия. Это защищает аудитора от обвинений в подгонке под ответ.
Проверка на взлом: два контролируемых эксперимента
Хороший протокол проверяют не только на честных целях, но и на активного противника. Авторы поставили два эксперимента.
Первый, E1: прокси с подделкой использования. Endpoint заявляет GLM-5.3, но обслуживает запросы через Kimi от Moonshot AI, при этом подделывая поле prompt_tokens так, чтобы счётчики совпадали с честными значениями заявленной модели. Вторая стадия в одиночку обманывается: дифференциал постоянно равен нулю, тест принимает подделку. Спасает перекрёстная сигнализация между стадиями: поведенческие пробы третьей стадии возвращают самоидентификацию Kimi/Moonshot, маркер не совпадает, тревога срабатывает. Вывод неприятный, но честный: изолированную Стадию 2 полноценный фальсификатор обходит, защита протокола в несогласованности между слоями.
Второй эксперимент, E2: тихая подмена сервинга. Endpoint держит фиксированную метку, но сначала обслуживает премиальный бэкенд, а потом молча переключается на дешёвый. Продольные замеры второй стадии во времени вскрывают подмену: токенизаторный профиль меняется при неизменной декларации. Для корпоративного пользователя это сценарий из реальной жизни: вы купили доступ к одной модели, а получаете другую.
Big Pickle: протокол против модели, которая никогда не раскроется
Отдельного упоминания заслуживает кейс Big Pickle, ещё одной анонимной модели, которая на момент публикации так и не была раскрыта. 24 августа 2026 года, пока endpoint оставался анонимным, авторы депонировали карточку предсказания с двумя исходами: градуированная гипотеза с указанием уровня уверенности, а не категоричное утверждение. Это дизайн для реального мира: часть стелс-моделей никогда не получит официального признания, и для них протокол сознательно выдаёт вероятностные заключения вместо придуманной определённости. В трёх кейсах, где выживала только нулевая стадия, протокол либо выдал градуированную гипотезу, либо отказался от атрибуции. Отказ от ответа здесь не слабость, а функция: ложная уверенность в аудите цепочки поставок дороже честного «не знаем».
Почему это становится вопросом комплаенса
Проверка идентичности перестаёт быть академическим упражнением, когда смотришь на регуляторику. Статья 53 AI Act Евросоюза с приложениями XI и XII закрепляет обязанности провайдеров моделей общего назначения по документации и прозрачности. Анонимный сервинг размывает саму точку приложения этих обязанностей: если неизвестно, кто провайдер, неясно, кто обязан предоставлять документацию. Для европейской компании, строящей продукт на анонимном endpoint'е, аудит идентичности превращается из любопытства в элемент должной осмотрительности.
Ограничения протокола
Авторы аккуратны в претензиях и прямо перечисляют слабые места. Сквозная слепая идентификация под анонимностью продемонстрирована на одном флагманском кейсе, а не на панели моделей. Валидация покрывает только бесплатные стелс-окна: платных анонимных релизов в выборке нет. Окончательное подтверждение идентичности всё равно зависит от будущего раскрытия: для моделей, которые никогда не раскроются, протокол по дизайну выдаёт лишь градуированные гипотезы. Платформенные счётчики использования могут трансформироваться, поэтому протокол опирается на дифференциалы, а не на абсолютные значения.
Ретроспективная выборка тоже смещена: в неё попали только кейсы, где есть и архивная спецификация, и известная идентичность. Это отбор по проверяемости, а не случайная выборка из всех стелс-endpoint'ов, поэтому цифры описывают надёжность канала деклараций, а не популяционную точность идентификации.
Часто задаваемые вопросы
Зачем вендоры выпускают модели анонимно?
Стелс-релиз позволяет собрать честную обратную связь без брендового шума: сообщество тестирует модель вслепую, и оценки не искажены ожиданиями от имени. За 2025–2026 годы зафиксировано 20 таких релизов от девяти вендоров, включая OpenAI, xAI, Xiaomi, Zhipu AI, NVIDIA и Mistral.
Можно ли использовать этот протокол самостоятельно?
Да. Авторы приложили реализацию audit-tool на чистом Python без сторонних зависимостей: ключи читаются из переменных окружения и нигде не логируются. CLI реализует первую и вторую стадии (каталожный отпечаток и кросс-длинный дифференциал) плюс поведенческие пробы третьей. Нулевая стадия, реконструкция через Wayback Machine, задокументирована как процедура, а не упакованный краулер.
Протокол гарантирует идентификацию любой анонимной модели?
Нет, и авторы этого не обещают. Протокол валидирован как пирамида доказательств: десять ретроспективных кейсов проверки деклараций, контролируемые адверсариальные эксперименты и один слепой флагманский прогноз, подтверждённый раскрытием. При недостатке свидетельств он выдаёт «атрибутировать невозможно» вместо вынужденной догадки.
Итог
Анонимные AI-модели в API перестали быть курьёзом и стали каналом дистрибуции, а вместе с ними появилась новая дисциплина: форензика идентичности моделей. Четырёхстадийный протокол показывает, что даже спроектированная для молчания модель оставляет следы, которые дорого подделать сразу на всех слоях: архивные декларации, конфигурационную подпись, токенизаторный дифференциал и поведение. Кейс Ox Alpha, вычисленной как GLM-5.3 за три дня до официального признания, доказывает, что метод работает вживую.
Если ваша команда принимает решения об использовании API-моделей, заведите привычку фиксировать конфигурации endpoint'ов на момент интеграции. Когда поставщик молча поменяет бэкенд или анонимное превью окажется не тем, чем кажется, именно эти датированные снимки станут вашей страховкой.