METR time horizons: главная метрика ИИ оказалась нелинейной

METR time horizons: главная метрика ИИ оказалась нелинейной

График METR time horizons сравнивали с законом Мура и кривой Килинга. На него опирались лауреат премии Тьюринга Йошуа Бенжио и сенатор Берни Сандерс, когда призывали замедлить разработку ИИ, а New York Times называл METR «неформальным арбитром» индустрии. Но ось Y на этом графике не физическая величина, а статистическая оценка. Двое статистиков пересчитали её заново и обнаружили, что главная метрика прогресса ИИ нелинейна: скачок с 3 до 30 минут значит в ней совсем не то же самое, что скачок с 30 минут до 5 часов.

Что такое METR time horizons

METR, некоммерческая исследовательская организация из Беркли, измеряет способности моделей в единицах человеческого времени. В наборе 228 задач и 26 моделей, и каждой задаче присвоена длина: сколько минут или часов потратил бы на неё профессиональный программист. Time horizon модели это та длина задачи, которую она решает автономно с вероятностью 50%. У GPT-4 горизонт был 4 минуты, у моделей последних поколений он измеряется часами.

Оригинальный график вышел в марте 2025 года и обновлялся с каждым релизом крупных моделей, последней точкой стал Claude Mythos в мае 2026-го. Ровный экспоненциальный рост убедил многих в стремительном прогрессе ИИ. New York Times сравнивала график с законом Мура, а специалист по безопасности ИИ Джейкоб Штайнхардт сопоставил его с кривой Килинга, которая когда-то развернула глобальную климатическую политику.

Отличие принципиальное: концентрация CO2 на кривой Килинга это прямое измерение физической величины, а time horizon это результат статистической модели. А раз так, оценку можно уточнять, и именно это сделали Дрю Нгуен и Уильям Фитиан в работе «On the estimation and validity of AI time horizons» (arXiv 2610.12466, 8 октября 2026 года).

Почему график вообще можно пересчитать

Формально time horizon это точка, в которой кривая успеха p(t) пересекает уровень 50%: слева задачи короче и решаются чаще, справа длиннее и решаются реже. Чтобы построить график, нужно для каждой модели восстановить её кривую успеха по таблице результатов: какая модель, какую задачу, сколько прогонов и с каким исходом. Потом кривая инвертируется, и получается горизонт.

Человеческое время в наборе измерено не абстрактно. Каждую задачу решали несколько профессиональных инженеров под хронометраж, обычно около четырёх попыток, а в зачёт шло геометрическое среднее времени успешных попыток. Для 29% задач валидное измерение получить не удалось, и там использовали экспертную оценку.

METR в оригинальной методике использовал логистическую регрессию: предполагалось, что логарифм шансов успеха линейно убывает с логарифмом человеческого времени задачи. Допущение сильное. Оно означает, что рост задачи в 10 раз всегда одинаково труднее, в каком бы диапазоне это ни происходило: что 30 секунд против 5 минут, что 3 часа против 30 часов. Авторы проверили именно это допущение.

За точку отсчёта они берут не оригинальную модель METR, а её вариант с общим наклоном, который в 2026 году предложил Александр Барри в исследовательской заметке METR. Эта версия показывает лучшие результаты на кросс-валидации, так что сравнение идёт с более сильным соперником, чем исходный график.

Две новые модели: сплайн и IRT

Первая модель заменяет линейную зависимость монотонным сплайном. Форма связи между человеческим временем и сложностью задачи теперь оценивается из данных, а не задаётся формулой, и одна общая функция f описывает, как человеческое время конвертируется в сложность для ИИ.

Вторая модель это explanatory IRT, вариация модели Раша из теории тестирования. У каждой задачи появляется латентная сложность, у каждой модели способность, а вероятность успеха связывает их логистической функцией. Добавлены два усложнения: эффект семейства задач (всего 79 семейств) и овердисперсия. Последняя нужна, потому что прогоны одной модели на одной задаче не независимы. Проверка простая: базовая линия предсказывала, что около 60% серий из нескольких прогонов будут единогласными, а в реальных данных единогласны 83% серий.

Обе модели оценивали строго: 12 метрик качества (log score, Brier score и элементарные оценки на уровнях 50% и 80% в трёх схемах взвешивания) с пятикратной кросс-валидацией по семействам задач. На всех 12 метриках новые модели превзошли базовую линию. Для контекста: сама базовая линия обходит оригинальную модель METR почти по всем метрикам.

Излом между 2 и 30 минутами

Главный результат спрятан в форме функции f. Зависимость почти линейна на коротких и длинных задачах, но в диапазоне от 2 до 30 минут она почти плоская: задачи с человеческим временем 2 минуты и 30 минут имеют для ИИ примерно одинаковую сложность. Рост в 10 раз на этом участке даётся модели заметно легче, чем такой же рост за его пределами.

Следствия конкретные. Скачок time horizon с 3 минут до 30 минут и скачок с 30 минут до 5 часов выглядят на графике одинаково, как умножение на 10, а по факту означают разные приросты способностей. Первый куда легче второго. Это не придирка к формулировкам: именно одинаковые скачки на графике читаются как равные шаги прогресса, из них делаются прогнозы и выводы о скорости развития.

Сильнее всего пересчёт затронул модели эпохи GPT-4 с горизонтами от 2 до 15 минут, то есть середину диапазона. Для части из них новые оценки 50% горизонта вышли за пределы 95% доверительных интервалов оригинального графика METR. Выигрыш по качеству предсказаний сосредоточен там же, где старые оценки были наиболее неточными.

Что на самом деле измеряет линейная модель

Самый интригующий результат касается способностей Раша. У модели 2, как и у любой IRT-модели, есть параметры способностей: безразмерные числа, которые напрямую описывают силу модели. Если пересчитать их в единицы времени и наложить на график METR, совпадение оказывается почти идеальным, R² = 0,996.

Получается парадокс. Линейная логистическая модель формально оценивает time horizons, но фактически измеряет нечто близкое к абстрактным способностям Раша. Совпадение с оригинальным графиком возникает потому, что излом функции f локализован в узком диапазоне, а оценка способности опирается на все задачи сразу.

Вывод авторов аккуратный, но жёсткий: если f действительно нелинейна, результат линейной модели не стоит называть time horizon. Как измерение способностей он по-прежнему ценен, но это другая величина. Экспоненциальный рост при этом не оспаривается: он полностью эмпирический, и авторы его не трогают.

Как читать метрику: два диагностических графика

Вторая часть работы посвящена construct validity, то есть вопросу, измеряет ли метрика то, что мы думаем. Авторы вводят понятие capability anchoring: способность модели привязывается к внешней шкале, и валидность привязки зависит от двух свойств. Predictiveness: предсказывает ли человеческое время успех ИИ во всём диапазоне. Comparability: читаются ли одинаковые скачки одинаково в разных регионах шкалы.

Для проверки предлагаются два графика. Первый, time-to-difficulty conversion: по оси X человеческое время, по оси Y оценённая сложность задачи для ИИ, плюс ориентир SNR = 1, наклон, при котором одно стандартное отклонение времени даёт 0,71 стандартного отклонения сложности. Плоская кривая на таком графике означает, что время плохо предсказывает сложность и скачки метрики в этой зоне мало что значат. Второй график, conditional success: вероятность успеха для фиксированных длительностей от 15 секунд до 16 часов по мере выхода моделей. Чем шире расходятся кривые, тем полезнее шкала.

На данных METR оба графика работают. В целом predictiveness сильная, но именно в зоне 2–30 минут она локально проваливается. А скачок между моделями с горизонтами 4 и 15 минут по всем условным вероятностям оказывается куда меньше других скачков. Это уже не критика ради критики: авторы показывают, как калибровать интерпретацию.

Контекст важен. Проблемы с time horizons в других доменах известны и раньше: в задачах на понимание видео корреляция между человеческим временем и успехом ИИ оказалась низкой (Kwa и Cheng, 2025), а на широком наборе экономически значимых задач predictiveness тоже подводил (Mertens et al., 2026). Критиковали график и до этой работы, но, по словам авторов, до сих пор никто не предлагал полноценно лучший статистический оценщик и не разбирал систематически условия применимости метрики.

Что будет с метрикой дальше

Сейчас набор задач упирается в потолок примерно в 30 часов человеческого времени. Если его расширят на более длинные задачи, гарантий сохранения линейности нет: новые участки могут снова оказаться плоскими или, наоборот, крутыми. Проверка на линейность такое не поймает, а предложенные диагностические графики поймают.

Отдельное направление это перенос подхода на другие домены. Для робототехники, «физического интеллекта», человеческое время может оказаться не лучшей аннотацией: у физических задач другая структура, и шкалу надо подбирать под домен. Альтернативы существуют. Например, Epoch Capabilities Index объединяет много бенчмарков в один индекс, но не привязывается к внешней шкале, и потому менее интерпретируем.

Практический вывод для тех, кто следит за метрикой: экспоненциальный тренд остаётся, но перестаёт быть универсальной линейкой. Точнее говорить не «модель X обошла модель Y вдвое по горизонту», а «модель X стабильно решает более длинные задачи, и вот насколько труднее ей даются задачи в конкретном диапазоне». Для прогнозов и разговоров о политике разница принципиальная.

Часто задаваемые вопросы

Означает ли это, что график METR неправильный?

Нет. Экспоненциальный рост на графике реален, и авторы его не оспаривают. Работа улучшает статистическую оценку: новые модели точнее предсказывают успех на отложенных данных, а часть точечных оценок горизонта для моделей эпохи GPT-4 сдвигается. Это конструктивная критика, а не отрицание результата.

Почему проблемы сосредоточены в диапазоне 2–30 минут?

На этом участке задачи с разным человеческим временем оказываются для ИИ почти одинаково сложными, кривая конверсии там плоская. Причина в составе набора задач и в том, как модели справляются с короткими многошаговыми заданиями. Сильнее всего задеты модели среднего уровня с горизонтами от 2 до 15 минут.

Что значит «способность Раша»?

В IRT-моделях у каждой модели есть параметр способности, который не зависит от выбора шкалы человеческого времени. Пересчитанные способности почти идеально совпали с графиком METR (R² = 0,996). То есть линейная модель, возможно, всё это время измеряла абстрактный уровень способностей, а не время решаемых задач, и называть результат time horizon не совсем корректно.

Итог

График METR time horizons пережил первый серьёзный статистический апгрейд. Сплайн вместо линейной формулы и IRT-модель с эффектами семейств задач и овердисперсией дают оценки, которые лучше предсказывают успех моделей на отложенных данных. Главное следствие: скачок метрики в 10 раз не универсальная единица прогресса, особенно в зоне от 2 до 30 минут. Сам рост возможностей ИИ при этом остаётся, меняется способ его измерения и интерпретации.

Если вы используете time horizons в прогнозах или презентациях, проверьте, в каком диапазоне находятся ваши скачки, и не сравнивайте одинаковые множители как равные шаги. Полная версия статьи с графиками доступна на arXiv (2610.12466), а мы продолжим следить за реакцией METR и других команд на эту критику.

← Все записи