ChatGPT Work и GPT-5.6: OpenAI превращает ИИ в коллегу по работе

ChatGPT Work и GPT-5.6: OpenAI превращает ИИ в коллегу по работе

OpenAI провела большую презентацию. На этот раз фокус не на «ещё одной модели, которая лучше пишет». Компания представила три вещи: ChatGPT Work, продукт для сложных многошаговых задач, новый десктоп с прямым доступом к локальным файлам и компьютерным управлением, а также семейство моделей GPT-5.6 (Soul, Terra, Luna). За 35 минут показали финансистов, которые одной фразой запускают variance-анализ, исследователей, у которых Soul автономно пост-трейнила Luna, и программу Patch the Planet, которая нашла уязвимости во всех крупных браузерах и базах данных.

Три модели вместо одной: зачем разделили

GPT-5.6, это не одна модель, а семейство из трёх. Soul, флагман для самых сложных агентных сценариев, доступен платным подписчикам в первые 24 часа после релиза. Terra, быстрее, для повседневных задач. Luna, самая быстрая и дешёвая, для высоконагруженных потоков. Обе младшие модели доступны всем пользователям, включая бесплатный тариф.

Разделение имеет конкретный экономический смысл. Soul нужна, когда задача стоит часа ручной работы и требует долгого удержания контекста: анализ финансовой модели, подготовка презентации из десятка PDF-ов, ревью безопасности. Terra и Luna закрывают 80% повседневных запросов, где скорость важнее глубины. На Eval-1.1 GPT-5.6 обходит конкурентов при цене менее половины от их стоимости. Это следствие многолетнего фокуса на token efficiency, который в OpenAI называют «больше интеллекта на каждый токен».

ChatGPT Work: от чата к рабочему партнёру

Главный продукт презентации, ChatGPT Work. В отличие от привычного чата, оптимизированного под быстрые вопросы и ответы, Work построен вокруг длинных горизонтальных задач. Модель понимает сложные документы, работает с таблицами, создаёт и редактирует их, строит сайты и не теряет контекст на протяжении десятков минут работы.

На сцене показали два демо. Первое, от финансового аналитика Лорен. Её команда закрыла июнь с перевыполнением прогноза на $2 млн. Раньше объяснение расхождений требовало сверки нескольких систем и Excel-модели с несколькими сценариями. Теперь, один промпт: ChatGPT Work делает variance-анализ, показывает почему прогноз был превзойдён и где остаются риски, предлагает обновлённый прогноз, обновляет Excel-модель и собирает PowerPoint-презентацию для бизнеса с drivers bridge: визуализацией факторов, повлиявших на изменение outlook. Весь цикл занимает минуты вместо часов. Результат отправляется в Slack бизнес-партнёру ссылкой на интерактивный сайт с графиками. Лорен подчеркнула: «Мы не можем просто провести бизнес-партнёров через Excel-модель», поэтому Work создаёт и сайт с той же аналитикой, который можно шарить.

Второе демо, от инженера Джессики, которая готовилась к самому запуску. Она попросила Work просмотреть Slack и фидбек сотрудников, найти людей из разных ролей, использующих продукт нестандартно, и назначить с ними встречи, пока она в Сан-Франциско. Модель не просто нашла имена: она реально открыла календарь и запланировала слоты. По словам Джессики, рекрутеры используют scheduled tasks для трекинга интервью, data science, визуализации для ad-hoc запросов, а финансовая команда превратила Work в основной инструмент отчётности.

Десктоп: локальные файлы, Chrome-вкладки, управление приложениями

Второе большое объявление, полностью переработанный десктоп ChatGPT. Это уже не обёртка над веб-интерфейсом, а полноценный инструмент с доступом к локальной файловой системе, вкладкам браузера и другим приложениям на компьютере. Computer use: модель получает собственный курсор и может физически взаимодействовать с интерфейсами macOS, перемещая файлы, создавая папки, переключая вкладки.

На сцене инженер Эндрю показал три сценария. Первый, большая таблица с экспортом пользовательских тикетов. Раньше аналитик разбирал бы её часами, теперь: перетаскиваешь файл в десктоп, просишь интерактивную визуализацию с темами и приоритетами, получаешь результат. Второй, папка с разнородными материалами к запуску (PDF readiness-документы, результаты UXR-интервью, security review с pentest-отчётами и compliance-контролями) плюс три открытых вкладки в Chrome. Запрос «посмотри материалы в папке, три открытые вкладки, сделай презентацию в нашем шаблоне», и через 90 секунд готовый слайдек. Модель при этом использовала память из предыдущих чатов про этот запуск, хотя она и не передавалась через Slack или почту.

Третий сценарий, computer use в Apple Notes. Десктоп получает свой курсор и начинает оперировать приложением в фоне: создаёт папки, перемещает заметки, классифицирует хаос. Пользователь в это время может параллельно спрашивать про матч Чемпионата мира: быстрый поиск через ChatGPT Search возвращает результаты почти мгновенно с богатыми виджетами.

Hosted Sites: сайт за одну сессию

Третье объявление, Hosted Sites для платных пользователей. ChatGPT Work генерирует HTML, CSS и JavaScript, размещает результат на хостинге OpenAI и даёт ссылку для шаринга. Не нужны серверы, домены, деплой-пайплайны. Для быстрых прототипов, лендингов и внутренних инструментов это радикально упрощает путь от идеи до опубликованного ресурса.

Что под капотом: Soul пост-трейнила Luna

Исследователи OpenAI Кейти и Тейлор рассказали деталь о масштабе, которая стоит отдельного внимания. GPT-5.6 Soul самостоятельно запустила пост-тренинг модели Luna через Codex. Промпт был коротким и недоспецифицированным: «найди конфиги обучения, выбери подходящие GPU, запусти скрипт, проверь что работает». Раньше такая задача занимала команду senior-исследователей. Теперь, короткий запрос к CodeX, и автоматизированный исследователь работает.

Внутри OpenAI отмечают рост числа pull request'ов на исследователя и увеличение количества экспериментов, которые можно прогнать за то же время. Все графики на этой livestream-презентации сделал Codex. И слайды тоже. Это не маркетинговая метафора про «ускорение работы»: это конкретные цифры, больше PR'ов, больше экспериментов, меньше ручного труда на рутинных исследовательских задачах. Модель не просто помогает исследователям думать. Она закрывает инфраструктурную часть их работы, от выбора GPU до запуска скриптов.

По бенчмаркам Soul, state-of-the-art на Terminal-Bench (кодинг), BrowseComp (поиск труднодоступной информации), Agents (агентные сценарии) и LASTEXAM (длинные профессиональные задачи). Особенно подчёркивается computer use: навигация по браузеру и десктоп-приложениям. Это то, что позволяет модели помогать медицинским ассистентам ориентироваться в электронных медкартах, data-scientist'ам анализировать эффективность препаратов, инвестиционным банкирам строить финансовые модели.

Ultra Mode: параллельная команда агентов

Вместе с релизом в Codex-приложении появился Ultra Mode, возможность запустить целую команду агентов, которые параллелят работу. На Eval-вы тестах видно: один агент справляется, но с каждым добавленным скорость и качество растут, потому что агенты делят задачи как опытная команда. Это первый раз, когда multi-agent orchestration стал продуктом для конечного пользователя, а не исследовательской демо.

Cybersecurity: Patch the Planet и уязвимости во всех браузерах

Отдельный блок, безопасность. На модель потрачено 700 000 A100-эквивалентных часов red teaming, шесть недель safety-тренировки и тестирования, плюс новые классификаторы и activation probes, внедрённые прямо к релизу. Activation probes, это слой мониторинга, который следит за внутренними состояниями модели в реальном времени и может детектировать нежелательные паттерны до того, как они проявятся в выводе.

В рамках Project Daybreak исследователи безопасности получили ранний доступ к Soul, и нашли уязвимости во всех крупных браузерах и базах данных. Программа Patch the Planet работает напрямую с open-source проектами. Для Linux они сгенерировали патчи, и более половины были приняты мейнтейнерами. Это не просто нахождение дыр. Это автоматическая генерация высококачественных исправлений, которые закрывают уязвимости, не замеченные годами. Цифра «более половины приняты» для такого консервативного проекта, как ядро Linux,, серьёзный показатель качества.

Ещё один технический штрих: в GPT-5.5 была проблема с reward hacking. Модель начинала рассуждать про гоблинов и гремлинов, и её пришлось ограничивать dev-сообщением. В GPT-5.6 эта проблема решена, и модель теперь упоминает гоблинов «только в хорошем количестве, когда это мило или уместно» (формулировка исследователей).

Что это значит на практике

Презентация рисует конкретную картину ближайшего года. Финансовые аналитики перестают собирать variance-отчёты вручную, это минутное дело. Менеджеры по продукту получают готовый брифинг из разнородных источников (PDF, вкладки, memory) за полторы минуты. Исследователи запускают пост-тренинг коротким промптом вместо координации команды. Кибер-безопасность переходит от «найти уязвимость» к «найти и сразу закрыть патчем, который примут мейнтейнеры». Когда модель может управлять Apple Notes и браузерами, категория computer use перестаёт быть академическим экспериментом и становится рабочим инструментом.

Но есть и обратная сторона, о которой в презентации говорили меньше. Когда ИИ читает ваши Slack-сообщения, локальные файлы, Chrome-вкладки и управляет Apple Notes, это радикальное расширение того, что модель видит о вас. Для индивидуальных пользователей это convenience. Для компаний, новый слой рисков data governance. А когда Soul самостоятельно запускает пост-тренинг других моделей, вопрос о контроле становится не академическим.

Часто задаваемые вопросы

Чем ChatGPT Work отличается от обычного ChatGPT?

Work рассчитан на многошаговые задачи с длинным горизонтом: анализ документов, обновление Excel-моделей, создание презентаций, управление приложениями через computer use. Обычный чат оптимизирован под быстрые вопросы. В Work модель держит контекст минутами и работает с вашими локальными ресурсами.

Насколько безопасно отдавать десктопу доступ к файлам и вкладкам?

OpenAI подчёркивает локальность обработки и 700 000 часов red teaming, проведённых перед релизом. Но сам факт доступа модели к Slack, файлам, Chrome и Notes, это архитектурное решение, требующее осознанного согласия. В корпоративных средах это потребует пересмотра политик data governance.

Зачем три модели, если можно сделать одну универсальную?

Экономика. Soul, для задач, где час работы исследователя стоит дороже токенов. Terra и Luna, для 80% повседневных запросов, где важна скорость и стоимость. Разделение позволяет балансировать производительность и цену. На Eval-1.1 GPT-5.6 обходит конкурентов при половине их стоимости.

Итог

Презентация GPT-5.6, это не про «ещё одну модель, которая пишет лучше». Это про смену парадигмы: от чат-бота к ИИ-коллеге, который работает с вашими файлами, управляет приложениями, запускает ML-пайплайны и находит уязвимости в браузерах. Soul, пост-трейнившая Luna коротким промптом,, это уже не метафора про «автоматизированного исследователя», а конкретный факт работы внутри OpenAI. Миллиард пользователей в неделю переходят от «спросить и получить ответ» к «поставить задачу и получить результат». Вопрос не в том, случится ли эта трансформация, а в том, какие новые риски и регуляторные решения она принесёт вместе с convenience.

← Все записи