Six Sigma для ИИ: почему ваши агенты работают на уровне брака 1950-х
В авиации считают инциденты на час полёта. В банках — капитал-резервы. На заводе — дефекты на миллион деталей. Спросите у любого из них, как дела, и получите конкретную цифру. Спросите у команды AI Governance то же самое про их агента — и услышите «да» или «нет». Прошли ли мы чеклист? Закрыли ли compliance-гейт? Это говорит о том, пытался ли кто-то управлять ИИ. Но не о том, насколько хорошо это работает.
Разрыв между «мы что-то делаем с ИИ» и «вот насколько хорошо наш ИИ работает» становится критическим. И именно здесь методология Six Sigma — подход, который 40 лет назад спас Motorola и Toyota от брака — оказывается полезнее всех современных AI-eval фреймворков.
Три измерения качества ИИ-агента
Идея проста: разбить качество работы ИИ-системы на три уровня, где каждый следующий зависит от предыдущего. Это не три независимых показателя для красивого дашборда — это цепь, и её прочность определяется самым слабым звеном.
Data Sigma — качество данных, на которых работает агент. Полнота, точность, актуальность, согласованность между источниками, соответствие правилам. Большинство компаний измеряют не то: проверяют, есть ли данные, а не правильные ли они. Сырые корпоративные данные обычно набирают меньше 3,5 сигма. После очистки — 4–5 сигма. Но чистит их мало кто по-настоящему.
Process Sigma — воспроизводимость. Один и тот же агент, одна и та же задача, два запуска — два одинаковых ответа? Для большинства современных агентов результат — 1–1,5 сигма. То есть от 310 000 до 500 000 «дефектов» на миллион запусков. Причины банальны: температура выше нуля, контекстное окно плавает, порядок вызова тулов меняется, формулировка промпта чуть другая. Всё это не баги — это фичи архитектуры. Но именно они убивают воспроизводимость.
Agent Sigma — то, что происходит, когда агенты передают работу друг другу. Здесь ошибки не складываются — они умножаются. Если агент A с 3-сигма качеством передаёт результат агенту B с 3-сигма качеством, итог — не 3 сигма, а хуже. Рассогласование в интерфейсах, потеря контекста при хэндоффе, конфликт интерпретаций — всё это съедает качество на каждом стыке.
На практике это выглядит так. Первый агент классифицирует запрос клиента и извлекает его намерение. Второй агент ищет подходящее решение в базе знаний. Третий — формулирует ответ. Четвёртый — проверяет на соответствие compliance-правилам. Каждый переход — это шанс потерять часть контекста, исказить намерение или пропустить ограничение. Даже если каждый агент в отдельности работает на 3,5 сигма, после четырёх хэндоффов итоговая система едва дотягивает до 2 сигма. Именно поэтому мультиагентные пайплайны так часто разочаровывают в продакшене: отдельные демо впечатляют, а итоговое качество — посредственное.
Что означают эти цифры на практике
Для контекста — вот шкала, с которой работает всё мировое производство. Six Sigma (уровень аэрокосмической отрасли) — 3,4 дефекта на миллион. Пять сигма (точная медицина) — 233. Три сигма (типичный промышленный процесс) — 66 700. Два сигма — уровень сырых корпоративных данных.
А теперь главное: большинство ИИ-агентов, работающих в продакшене сегодня, находятся на уровне 1–1,5 сигма. Это от 500 000 до 690 000 дефектов на миллион действий.
Технически говоря, индустрия ИИ-агентов operates at a quality level that manufacturing abandoned decades ago. Звучит как провокация, но давайте посчитаем. Агент, который «прав в 90% случаев» — это 3,8 сигма, уже неплохо. Но если этот агент обрабатывает 1000 запросов в день, он выдаёт 100 ошибок ежедневно, 36 500 в год. В финансах это 36 500 неверных транзакций. В медицине — 36 500 неверных интерпретаций.
Почему «лучше модель» не поможет
Самое важное следствие из фреймворка — constraint chain. Process Sigma не может быть выше Data Sigma. Agent Sigma не может быть выше Process Sigma. Общий уровень системы — это минимум из трёх.
Это значит, что если вы потратили год и миллионы на переход с GPT-4 на GPT-5, но данные по-прежнему мусорные, вы не увидите никакого улучшения качества реальных выходов. Модель не была узким местом. Данные были. Улучшение модели выше того уровня, на котором её ограничивают данные, — это как поставить гоночный двигатель в машину с квадратными колёсами.
Правильный порядок инвестиций: сначала Data Sigma (самый высокий рычаг), потом Process Sigma (структурированные промпты, детерминированный вызов инструментов, валидационные чекпоинты), и Agent Sigma улучшится автоматически, когда первые два встанут на место.
Практический расчёт: как посчитать сигма для вашего агента
Давайте пройдём конкретный пример. Представьте, что у вас есть агент для обработки заявок клиентов. Он читает письмо, классифицирует его (техподдержка, продажи, возврат), извлекает ключевые данные (номер заказа, сумма, продукт) и маршрутизирует в нужный департамент.
Шаг первый — определяете эталон. Берёте 50 исторических заявок, где человек-оператор уже проставил все метки. Это ваш ground truth.
Шаг второй — прогоняете все 50 через агента 10 раз подряд (500 запусков суммарно). Фиксируете температуру, промпт, контекст — всё одинаковое.
Шаг третий — считаете дефекты. Каждый случай, когда классификация не совпала с эталоном, извлечённый номер заказа неверен, или маршрут назначен ошибочно — это один дефект. Не «катастрофический провал», а любое отклонение от эталона.
Результат: допустим, из 500 запусков 78 дали отклонения. Это 156 000 дефектов на миллион (DPMO). По стандартной таблице конвертации — это около 2,4 сигма. Уровень, который в автомобилестроении 1980-х считался неприемлемым.
Теперь повторяете то же самое с данными: берёте те же 50 заявок, но проверяете входные данные. Насколько часто номер заказа в письме совпадает с реальным номером в ERP? Насколько актуальна информация о продукте? Насколько полны контактные данные? Получаете Data Sigma — скажем, 2,8 сигма.
Вывод: ваш агент работает на 2,4 сигма, но ограничен данными на 2,8. Даже если вы найдёте способ поднять процесс до 3 сигма (уменьшите температуру, добавите валидацию, зафиксируете порядок тулов), вы не увидите улучшения — потому что мусорные данные всё равно тянут вниз. Сначала чистите данные.
Почему чеклисты не работают
Большинство AI Governance сегодня устроено так: команда составляет список из 20–50 пунктов (fairness, safety, transparency, privacy...) и раз в квартал проходит по ним галочками. Вопрос «прошли ли мы governance» сводится к «все ли галочки стоят».
Проблема в том, что чеклист бинарен — а реальность непрерывна. «Fairness: ✓» не говорит вам, насколько fair система. «Safety: ✓» не говорит, безопасна ли она на уровне, приемлемом для продакшена. Это всё равно что спрашивать у завода «вы выпускаете брак?» — и получать ответ «ну, мы проверяем».
Six Sigma-подход превращает бинарные чеклисты в непрерывные шкалы. Вместо «fairness: да/нет» — конкретное число сигма, с методологией измерения, доверительным интервалом и динамикой. Это позволяет увидеть тренды, сравнивать версии, выявлять деградацию до того, как она станет катастрофой.
Что с этим делать
Если вы управляете ИИ-агентами в продакшене, начните с измерения. Не с улучшения — именно с измерения. Возьмите один процесс (один агент, одну задачу), прогоните его 100 раз с одинаковыми входными данными, и посчитайте, сколько раз результат отклоняется от эталона. Это даст вам Process Sigma — отправную точку.
Затем посмотрите на данные, которые агент потребляет. Насколько они полны? Насколько свежи? Насколько согласованы между источниками? Это ваш Data Sigma — и скорее всего, он ниже, чем вам кажется.
И наконец — если у вас мультиагентная система — измерьте, что происходит на стыках. Передаётся ли контекст без потерь? Совпадают ли интерпретации? Не теряется ли информация при каждом хэндоффе?
Инструменты измерения уже появляются. Идея не в том, что нужно бежать и внедрять конкретный фреймворк от конкретного вендора — а в том, что сам подход «измерять качество числами, а не чеклистами» должен стать стандартом для индустрии, которая управляет всё более автономными системами.
Часто задаваемые вопросы
Что такое Six Sigma и почему это применимо к ИИ?
Six Sigma — методология управления качеством, разработанная в Motorola в 1986 году. Одна сигма — это стандартное отклонение от среднего; шесть сигма означают, что спецификация допускает ±6 стандартных отклонений, что соответствует 3,4 дефектам на миллион операций. К ИИ это применимо, потому что агенты — это процессы: они принимают входы, выполняют преобразования, выдают выходы. Любой процесс можно измерить на воспроизводимость и точность.
Почему 90% точности недостаточно?
Потому что масштаб имеет значение. Агент с 90% точностью — это 3,8 сигма, и это звучит как пятёрка в школе. Но при 1000 действий в день это 100 ошибок ежедневно, 36 500 в год. В контексте обработки документов это терпимо. В контексте медицинских решений или финансовых транзакций — это катастрофа. Six Sigma показывает, что «90% правильно» — это уровень, который производство не приняло бы для критических процессов.
Как повысить Data Sigma, если корпоративные данные плохие?
Начните с аудита: измерьте полноту (какой процент обязательных полей заполнен?), точность (какой процент значений верен при ручной проверке выборки?), актуальность (какой средний возраст данных?), согласованность (совпадают ли одни и те же данные в разных системах?). Типичный корпоративный результат — 2 сигма, то есть около 308 000 дефектов на миллион записей. Это не значит, что данные «плохие» — это значит, что каждый процесс, построенный на этих данных, ограничен этим потолком.
Чем этот подход отличается от существующих AI evaluation frameworks?
Большинство AI-eval фреймворков (OpenAI Evals, LangSmith, Arize Phoenix) фокусируются на точности модели: правильный ли ответ на бенчмарке? Six Sigma-подход шире — он включает качество данных, воспроизводимость процесса и координацию между агентами. Бенчмарк отвечает «насколько умна модель». Sigma-метрики отвечают «насколько надёжна система в целом» — и показывают, где именно находится узкое место.
Итог
ИИ-индустрия измеряет прогресс бенчмарками и демо. Но бенчмарк — это лабораторный тест. Реальность — это агент, который работает 16 часов в день на данных, которые никто не чистил, в пайплайне из четырёх агентов, где каждый передаёт результат следующему с потерями. Если вы хотите знать, насколько хороша ваша система — перестаньте спрашивать «прошли ли мы governance» и начните спрашивать «на каком мы сигма». Ответ, скорее всего, вас удивит.