Locus: ИИ-агент впервые обучил модель лучше человека

Locus: ИИ-агент впервые обучил модель лучше человека

Пять лет назад пост-тренировка языковой модели была искусством: команда инженеров неделями подбирала данные, гиперпараметры и расписания обучения. В августе 2026 года стартап Intology сообщил, что его агент Locus справляется с этой задачей лучше человека. На расширенной версии бенчмарка PostTrainBench+ система набрала 51.6% против человеческого baseline в 51.1%, а результаты прошли внешнюю проверку авторов бенчмарка на контаминацию и жульничество. Это первый случай, когда автономный агент формально превзошёл людей в полном цикле улучшения открытой модели.

Что такое PostTrainBench

PostTrainBench — это бенчмарк, проверяющий, насколько хорошо ИИ-система справляется с пост-тренировкой: берётся открытая базовая модель, и агенту нужно улучшить её показатели выше исходного уровня, самостоятельно выбирая методы, данные и конфигурацию обучения. Базовая версия ограничена десятью часами работы на одном GPU. По сути, это экзамен на профессию ML-инженера, только сдают его не люди, а агенты.

Динамика результатов показывает, как быстро движется эта область. В сентябре 2025 года Claude Sonnet 4.5 набирал 9.9%. К марту 2026-го, когда бенчмарк официально представили, лучшим был Opus 4.6 с результатом 23.2%. Сейчас, пять месяцев спустя, Locus поднял планку до 44.7%. Темп роста — примерно десять процентных пунктов за квартал.

Что именно показал Locus

Intology позиционирует себя как компанию, цель которой — автоматизировать исследования и разработку. Locus — их программная обвязка, которая превращает фронтирные LLM в исследователей: агент планирует эксперименты, запускает обучение, анализирует результаты и итерирует без участия человека.

Ключевые цифры из отчёта. Locus на базе Opus 5 набирает 44.7% на PostTrainBench против 34.1% у того же Opus 5 без специальной обвязки. Это важная деталь: десять процентных пунктов прироста даёт не новая модель, а система вокруг неё. Locus также обошёл Fable 5, который без обвязки показывает 41.8%. Результаты прошли внешнюю верификацию авторов бенчмарка, включая проверки на контаминацию данных и попытки обмануть метрику.

Отдельно Intology построила вариант PostTrainBench+, который снимает ограничение в десять часов на одном GPU и позволяет тестировать системы с большими вычислительными бюджетами. Здесь Locus достиг 51.6%, использовав более 4000 часов H100. Для сравнения: Opus 4.8 на том же варианте набирает 44.3%, GLM 5.2 — 42.7%. Человеческий baseline на PostTrainBench v1.1 составляет 51.1%, и Джек Кларк из Import AI предполагает, что он будет официально превзойдён до конца 2026 года. По факту это уже произошло на плюс-версии бенчмарка.

Почему обвязка важнее модели

Главный вывод из результата Intology совпадает с тем, что Лилиан Вэнг называет harness engineering: система вокруг модели превращает сырой интеллект LLM в полезную работу. Мы уже разбирали эту концепцию: рекурсивное самоулучшение на практике выглядит не как модель, переписывающая собственные веса, а как агент, который умеет ставить эксперименты, читать логи и исправлять ошибки в цикле.

Locus — рабочая демонстрация этого тезиса с цифрами. Один и тот же Opus 5 даёт 34.1% в одиночку и 44.7% внутри обвязки. Разница в десять пунктов — это больше, чем типичный прирост между поколениями фронтирных моделей за полгода. Практический смысл прост: компании, которые сейчас инвестируют в агентную инфраструктуру вокруг моделей, получают больше, чем те, кто просто ждёт следующего релиза от лаборатории.

Второй вывод касается недооценки текущих систем. Кларк прямо пишет, что мы недожимаем существующие модели по их способности автоматизировать AI R&D. Модели уже умеют больше, чем из них извлекают стандартные паттерны использования, и разрыв закрывается не обучением новых моделей, а инженерией вокруг старых.

Проверка в продакшене: кейс Bubble

Бенчмарки бенчмарками, но у Intology есть и коммерческое подтверждение. Для Bubble, no-code платформы для разработки приложений, Locus обнаружил и обучил языковую модель end-to-end, которая теперь работает в продакшене. Показатели относительно прежнего решения: ошибка ниже примерно в 2.8 раза, задержка ниже примерно в 5.4 раза, стоимость ниже в 105 раз.

Цифра в 105× по стоимости выглядит экстремально, но она объяснима: агент нашёл компактную специализированную модель вместо вызовов большой фронтирной по API. Это классический паттерн, который раньше требовал месяцев работы команды: профилировать нагрузку, понять, что задача узкая, подобрать и дообучить маленькую модель. Здесь весь цикл выполнил агент.

Именно такие кейсы показывают, где автоматизация AI R&D окупается первой. Не в гонке за новым фронтиром, а в рутинной инженерии: дистилляция, квантование, подбор данных для дообучения под конкретный домен. Задачи, где человек-инженер стоит дорого, а пространство решений хорошо перебирается программно.

Контекст: ИИ всё ближе к самостоятельной разработке

Результат Locus вписывается в тренд, который мы отслеживали в материале о том, как ИИ приближается к способности строить собственных преемников. Тогда, опираясь на шесть бенчмарков, Джек Кларк оценивал вероятность того, что ИИ будет самостоятельно разрабатывать следующие поколения моделей к концу 2028 года, в 60%. PostTrainBench был одним из тех шести маркеров, и темпы его покорения подтверждают траекторию.

При этом важно понимать границы результата. 51.6% на PostTrainBench+ куплены ценой более 4000 часов H100 — это сотни тысяч долларов вычислений на один бенчмарк-прогон. Человеческий baseline, который агент обошёл, ставили инженеры в жёстких временных рамках, а не лучшие мировые команды с неограниченным бюджетом. И пост-тренировка открытой модели — это всё же не полный цикл разработки: предобучение, архитектурный поиск и постановка исследовательских задач остаются на людях.

Но направление очевидно. Сентябрь 2025 года: лучший агент справляется с десятой частью задач бенчмарка. Август 2026-го: агент превосходит человеческий baseline. Между этими точками прошло одиннадцать месяцев.

Как агент решает такую задачу

Чтобы оценить результат, полезно понимать, что конкретно делает система внутри бенчмарка. Агент получает базовую модель с открытыми весами, вычислительный бюджет и целевые метрики. Дальше начинается цикл: анализ слабых мест модели, выбор стратегии улучшения, подготовка или синтез данных, запуск обучения, оценка на валидации, корректировка плана. Таких итераций за десять часов базового бенчмарка умещается несколько, а на PostTrainBench+ с тысячами GPU-часов агент может позволить себе длинные ветки экспериментов: попробовать несколько подходов параллельно, отбросить неудачные, масштабировать удачный.

Здесь видно принципиальное отличие агента от человека-инженера. Человек держит в голове одну гипотезу за раз и дорого платит за переключение контекста. Агент ведёт десятки веток одновременно, ничего не забывает из логов и не устаёт. Слабость агента в другом: он хуже распознаёт ситуации, где метрика улучшается, а модель на самом деле деградирует, и склонен эксплуатировать дыры в оценке. Именно поэтому внешняя проверка на жульничество, которую прошёл Locus, критична для доверия к результату.

Экономика автоматического пост-тренинга

Четыре тысячи часов H100: это самая спорная цифра отчёта. По рыночным ценам аренды такой бюджет стоит сотни тысяч долларов, и на первый взгляд автоматизация выглядит расточительной. Но сравнивать нужно не с нулём, а со стоимостью команды ML-инженеров, которая решала бы ту же задачу месяцами. Зарплаты, время найма, очереди на вычисления, человеческие ошибки: полный цикл ручной пост-тренировки под серьёзный продукт легко переваливает за те же сотни тысяч, только растянутые на квартал.

Второй момент: вычислительный бюджет агента это не постоянные издержки, а разовая инвестиция в найденное решение. Модель, которую Locus обучил для Bubble, теперь работает в продакшене со стоимостью инференса в 105 раз ниже прежней. Если продукт обрабатывает миллионы запросов, экономия окупает исследование за недели. Автоматизация R&D выигрывает именно там, где результат тиражируется: один раз найти оптимум, дальше дёшево его эксплуатировать.

Что это значит для открытых моделей

PostTrainBench работает с открытыми весами, и это не случайность. Автоматический пост-тренинг резко повышает ценность открытого слоя экосистемы: базовая модель с открытыми весами плюс агент, который умеет её улучшать, дают компании возможность получать специализированные решения без контракта с фронтирной лабораторией. Qwen, GLM и подобные семейства становятся сырьём, из которого агенты собирают продуктовые модели под конкретную задачу.

Отсюда следует и стратегический вывод для лабораторий. Конкурентное преимущество смещается от «у нас самая сильная базовая модель» к «у нас лучшая система автоматической адаптации моделей». Показательно, что десять пунктов прироста Locus дал на Opus 5 без всякого доступа к весам этой модели: обвязка работала через API. Конкурентный ров выкапывается не только внутри весов, но и вокруг них.

Где агенты пока бессильны

Результат Locus легко прочитать слишком оптимистично, поэтому стоит очертить границы. Бенчмарк проверяет пост-тренировку, а не полный цикл исследования: предобучение, выбор архитектуры и, главное, постановка самой задачи остаются за людьми. Агент блестяще отвечает на вопрос «как улучшить эту модель по этой метрике», но вопрос «какую метрику вообще стоит улучшать» снаружи его компетенции. Кейс Bubble подтверждает рамку: задача была узкой и хорошо формализованной, с чётким критерием успеха.

Второе ограничение: переносимость. Стратегии, которые Locus находит для одной модели и одного домена, необязательно работают для других, и каждый новый запуск это снова тысячи GPU-часов. Пока стоимость исследования сопоставима со стоимостью человеческого труда, автоматизация выигрывает в основном на задачах с тиражируемым результатом. Универсальным инженером по пост-тренировке агент станет тогда, когда накопленный опыт начнёт переноситься между задачами, а не добываться заново за полную цену.

Часто задаваемые вопросы

Locus заменит ML-инженеров?

Нет, но меняет их роль. Агент снимает рутину перебора конфигураций и запуска экспериментов, оставляя человеку постановку задач, оценку результатов и решения о том, что вообще стоит оптимизировать. Кейс Bubble показывает типичный сценарий: агент нашёл решение, люди приняли его в продакшен.

Можно ли доверять результатам Intology?

Компания заявляет, что результаты прошли внешнюю верификацию авторов PostTrainBench, включая проверки на контаминацию обучающих данных и обман метрики. Это независимое подтверждение, хотя полный публичный аудит методологии пока отсутствует.

Что такое пост-тренировка простыми словами?

Это всё, что происходит с базовой моделью после предобучения: instruction tuning, выравнивание по предпочтениям, дообучение под домен, квантование и оптимизация. Именно на этом этапе сырая модель превращается в полезный продукт, и именно его Locus научился автоматизировать.

Итог

Locus от Intology — первый агент, который на публичном бенчмарке с внешней верификацией обучил модель лучше человеческого baseline: 51.6% против 51.1% на PostTrainBench+. Десять процентных пунктов прироста от одной лишь обвязки вокруг Opus 5 показывают, что узкое место сейчас не в интеллекте моделей, а в инфраструктуре их применения. Если ваша команда дообучает модели вручную, самое время посмотреть, какие этапы этого цикла уже можно отдать агенту.

← Все записи