OpenAI и задача Навье–Стокса: триумф, скандал и 719 рукописей

OpenAI и задача Навье–Стокса: триумф, скандал и 719 рукописей

Восемьдесят восемь часов, около 10 000 параллельных агентов и 300 млрд токенов. Примерно столько, по словам OpenAI, понадобилось её невыпущенной модели, чтобы получить доказательство для задачи Навье–Стокса. Это одна из семи задач тысячелетия, за решение каждой институт Клэя обещает $1 млн. Новость от 8 сентября должна была стать триумфом: сначала решение знаменитой математической проблемы, через месяц ещё и публикация 719 рукописей с результатами. Получилось иначе. История превратилась в самый громкий спор года о том, кому принадлежат открытия, сделанные ИИ, и кому за них отвечать.

Что такое задача Навье–Стокса

Уравнения Навье–Стокса описывают движение вязкой жидкости, от воды в трубе до атмосферных потоков. Задача о существовании и гладкости ставит вопрос так: могут ли скорости течения, начавшись гладкими, за конечное время стать бесконечными? Если да, уравнения допускают физически бессмысленную сингулярность; если нет, у них есть скрытая устойчивость, на которую опираются все инженерные симуляции.

Проблему сформулировали ещё в XIX веке, а в 2000 году институт Клэя включил её в список задач тысячелетия. За четверть века приз получил только Григорий Перельман за гипотезу Пуанкаре, и тот от денег отказался. Остальные шесть пунктов списка, включая Навье–Стокса, до сих пор открыты.

Как агенты OpenAI получили результат

1 сентября OpenAI запустила агентную кампанию по всем открытым задачам тысячелетия, услышав слухи о том, что две из них уже кем-то решены. Около сотни агентов за 50 часов нашли решение для уравнения Эйлера без внешней силы. Дальше ресурсы переключились на Навье–Стокса, и к работе подключили примерно 10 000 агентов одновременно. 5 сентября кампания объявила о результате, ещё 17 часов ушло на формализацию и проверку доказательства в Lean, уже силами GPT-6 Astra.

Саму модель, которая нашла решение, компания не выпустила: по описанию она заметно мощнее GPT-6 Astra. За неделю кампания израсходовала 300 млрд выходных токенов, TechCrunch оценил это в $22,5 млн по текущим ценам Astra. В отчёте описан и механизм: вихрь закручивается внутрь и вытягивается, как спагетти, его ядро сжимается и разгоняется, и скорость течения уходит в бесконечность за конечное время.

Схема, если присмотреться, знакомая по другим историям про агентов. Сначала разведка небольшим отрядом: сотня агентов проверяет направление за 50 часов. Потом массовый штурм, когда десяток тысяч копий модели параллельно перебирает варианты, а человек только ставит задачу. Победу принесла не одна блестящая догадка, а вычислительная ферма, работавшая меньше четырёх суток. Читая заголовки про «ИИ решил задачу тысячелетия», полезно помнить именно этот сценарий, а не красивую теорему.

Спор об атрибуции

7 сентября, за день до публикации OpenAI, свой результат выложили Тристан Бакмастер из Нью-Йоркского университета и математик Anthropic Левент Альпёге. Они решали родственную задачу, взрыв для уравнения Эйлера во внешнем поле, и получили ответ в основном с помощью Codex и Claude. Бакмастер рассказывает, что работал над этим месяцами и что «почти никто больше» этой темой не занимался, а на вопросы о том, когда начался проект OpenAI, ответы становились уклончивыми, пока стороны не сошлись на том, что первый промпт ушёл уже после того, как информация об их работе попала в компанию.

Отдельный сюжет это благодарности. Бакмастер утверждает, что Себастьен Бубек из OpenAI просил убрать упоминание Альпёге и на попытку вынести вопрос на публику ответил: «Зачем ты рушишь свою карьеру?» Бубек назвал обвинения ложными и провокационными, подчеркнув, что у команды OpenAI нет исследовательской экспертизы в гидродинамике.

Компания настаивает: ни исследователи, ни агенты не видели работу пары до публикации, данные конкретных пользователей не использовались. При этом OpenAI не исключила, что обезличенные данные из продукта могли улучшить её модели. Проверка, о которой компания сообщила 10 сентября, показала, что промпты Бакмастера в Codex за два предыдущих месяца не могли повлиять на результат.

Суть спора в том, была ли работа OpenAI независимой или стартовала после того, как компания узнала о чужом прогрессе. Публичного регламента для таких ситуаций не существует: математики привыкли к годам приоритетных разбирательств в журналах, а тут спорят о хронологии промптов. Ответить могла бы техническая хронология, но она остаётся внутри компании, которая проверяет саму себя.

Реакция математиков

Теренс Тао раскритиковал лаборатории за то, что они превращают знаменитые задачи в маркетинговые козыри. 25 лауреатов Филдсовской премии подписали открытое письмо: по их мнению, поспешные анонсы поднимают «серьёзные вопросы об атрибуции и плагиате». OpenAI отозвала спонсорство математического мероприятия в Калтехе после критики со стороны исследователей оттуда.

Институт Клэя не спешит засчитывать результат: задача остаётся в списке нерешённых до длительной проверки и широкого признания, а компания заявила, что не станет претендовать на приз. Математическую часть работы при этом почти никто не оспаривает. Профессор Луис Мартинес из университета CUNEF назвал её «поистине выдающимся результатом». Спор идёт вокруг процесса, приоритета и норм научной этики, а не вокруг самих уравнений.

Второй акт: 719 рукописей

6 октября история получила продолжение. OpenAI выложила в публичный репозиторий большой пакет результатов той же невыпущенной модели: 719 рукописей, 372 семейства тем, формализации в Lean для многих доказательств, десять конспектов рассуждений модели и оценки затраченных вычислений в единицах подписки ChatGPT Pro. По словам руководителя проекта Дэна Робертса, доказательства появились как побочный продукт тестирования внутренних моделей, которое нужно было для создания лучших инструментов. У репозитория описан протокол ревизий и цитирования, чтобы к рукописям можно было относиться как к научным публикациям.

Перед публикацией компания советовалась с Консультативной группой по математике и ИИ при Институте перспективных исследований в Принстоне. 29 сентября группа выпустила рекомендации: раскрывать имена моделей, промпты и вычислительные затраты, не превращать результаты в маркетинг и не тестировать сложные задачи на закрытых моделях, недоступных научному сообществу. Последний пункт OpenAI, судя по всему, проигнорировала: модель так и не выпущена, на что обратил внимание Gizmodo. Группа сопроводила свои рекомендации напоминанием, что публикация результатов это «начало, а не завершение» процесса их осмысления.

Что это значит для науки

Машинно-проверяемые доказательства стали новым стандартом для громких заявлений. Формализация в Lean позволяет независимо проверить каждый шаг вывода, и без неё никто всерьёз не воспринимает слова о решённой знаменитой задаче. Но Lean проверяет корректность вывода, а не приоритет и не новизну. Вопрос «кто первый» остаётся людям, а с ним и весь спор.

Кампания OpenAI вписалась в общую гонку лабораторий за научные результаты. Google DeepMind показывала олимпиадный уровень ещё до эпохи агентов, и с тех пор математика стала одной из главных витрин возможностей моделей. Формализация в Lean добавляет таким витринам знак качества, но не отвечает на вопрос, нужны ли научному сообществу витрины, за которыми нельзя заглянуть.

Атрибуция в мире, где открытие делает ферма из тысяч копий одной модели, не вписывается в нормы академической математики. Они рассчитаны на годы обсуждений, рецензий и приоритетных споров, а лаборатории живут в темпе продуктовых релизов: блог-пост, репозиторий, заголовки. Конфликт двух скоростей и породил большую часть драмы вокруг Навье–Стокса.

Есть и инфраструктурный слой. 719 рукописей одномоментно не может прочитать ни одно научное сообщество: это больше, чем многие математики публикуют за карьеру. Площадки уже трещат от сгенерированного контента: arXiv ограничил авторов двумя статьями в месяц и тремя одновременными отправками, потому что волонтёры-модераторы не справляются с потоком. Если лаборатории продолжат выкладывать открытия такими партиями, главным вопросом станет не «что доказано», а «кто это проверит».

За скобками остаётся вопрос, который будет звучать всё громче: если машина генерирует доказательства быстрее, чем люди успевают их читать, кто вообще будет их читать. Ответ напрашивается неприятный: другие машины. Формальные верификаторы вроде Lean возьмут на себя первую линию обороны, а людям останется самое сложное: решать, какие вопросы стоило задавать.

Для тех, кто пользуется ИИ в работе, вывод приземлённый: заголовки и пресс-релизы это не результаты, а анонсы. Настоящий результат можно прочитать, воспроизвести и оспорить. Когда следующая лаборатория объявит об очередном прорыве, смотреть придётся не на бенчмарки, а на два вопроса: есть ли у доказательства формальная проверка и можно ли повторить путь к нему.

Часто задаваемые вопросы

Получит ли OpenAI миллион долларов от института Клэя?

Скорее всего нет. Институт считает задачу нерешённой, пока результат не пройдёт длительную проверку и не будет принят сообществом, а на это уходят годы. Сама компания также заявила, что не станет претендовать на приз.

Почему математики сомневаются, если доказательство проверено формально?

Сомнения касаются не выкладок, а контекста: приоритета, атрибуции и процедуры анонса. Lean подтверждает, что вывод корректен при данных определениях, но не говорит, кто первым нашёл решение, какую роль сыграли промпты и не был ли использован чужой результат. Раздражение добавляет маркетинговая подача: за месяц до релиза рукописей компания уже собирала заголовки.

Что такое Lean и почему он важен для таких заявлений?

Lean это ассистент доказательств, созданный в Microsoft Research и развиваемый международным сообществом. В нём доказательство записывают так, что компьютер проверяет каждый логический шаг, а библиотека mathlib хранит формализованную математику, на которую можно опираться. Проверка в Lean занимает часы, зато снимает вопросы об арифметических ошибках, оставляя только споры об интерпретации и приоритете.

Насколько можно доверять оценкам вроде «300 млрд токенов»?

Это внутренние цифры OpenAI, которые независимо никто не подтверждал. Стоимость в $22,5 млн это оценка TechCrunch по прайсу GPT-6 Astra, а не бухгалтерия компании. Как ориентир масштаба такие числа полезны: за результатом стояла ферма вычислений, а не один удачный запрос.

Итог

История с Навье–Стоксом не про то, умеет ли ИИ заниматься математикой. Умеет, и учится всё быстрее. Она про то, что наука ещё не придумала, как жить с открытиями, у которых нет человека-автора и которые выходят партиями по 700 штук. Формальные доказательства проверять уже научились, а вот с атрибуцией, приоритетом и скоростью публикации всё намного сложнее.

А вы как считаете: если доказательство машинно-проверяемое, но сделано агентами, кому должен достаться кредит за открытие? Компании, математикам, работавшим в той же области, или никому?

← Все записи