ChatGPT Ultrafast: как Cerebras ускорил GPT-5.6 в 14 раз
Одна и та же задача, два окна рядом. Слева финансовый терминал для аналитиков готов через 1 минуту 50 секунд. Справа тот же самый запрос всё ещё выполняется: 7 минут, 8, 9, и финиш только на отметке 12 минут 20 секунд. Разница между окнами не в модели, она одна и та же, GPT-5.6 Soul. Разница в железе, на котором она крутится: слева чипы Cerebras, справа стандартный инференс OpenAI. Так выглядит ChatGPT Ultrafast, новый сверхбыстрый режим, который OpenAI запустила в превью на этой неделе.
Что такое ChatGPT Ultrafast
ChatGPT Ultrafast это режим инференса, в котором модели OpenAI работают на специализированных чипах Cerebras вместо привычных GPU-кластеров. Заявленное ускорение составляет 14-15 раз по сравнению со стандартным режимом. Режим доступен в превью и стоит дополнительных денег, но сам факт его появления говорит о смене приоритетов: индустрия начала битву не за качество моделей, а за скорость их работы.
Новость началась с твита Пола Грэма, который сформулировал экономику вопроса в одну строчку: ускорять модель очень разумно, когда клиенты платят за токены. Чем больше токенов в секунду выдаёт система, тем больше выручка провайдера в единицу времени. Но это только половина картины. Вторая половина важнее для пользователя: быстрые агенты ценны сами по себе, потому что меняют сам способ работы с ними.
Кто такой Cerebras и почему он быстрый
Cerebras называют самым быстрым провайдером инференса на планете, и это не маркетинговое преувеличение, а следствие архитектуры. Компания не покупает чипы у NVIDIA, а проектирует собственные. Их фирменное решение это wafer-scale процессор: вместо того чтобы нарезать кремниевую пластину на сотни отдельных чипов, Cerebras использует пластину целиком. Получается один гигантский чип размером с тарелку, на фотографиях с презентаций CEO компании держит его двумя руками.
Зачем это нужно, объясняется физикой инференса. Большая языковая модель при генерации каждого токена должна прочитать все свои веса из памяти. На обычных GPU веса лежат в отдельной HBM-памяти, и узкое место это шина между чипом и памятью. У Cerebras сотни гигабайт SRAM находятся прямо на кристалле рядом с вычислительными ядрами, и веса не нужно никуда таскать по медленной шине. Отсюда и порядки ускорения на автoregressive-генерации, где всё упирается именно в пропускную способность памяти.
Партнёрство Cerebras и OpenAI объявили несколько месяцев назад, и Ultrafast это первый видимый пользователю результат. Важно понимать: модель не изменилась ни на один параметр. Те же веса, тот же reasoning, то же качество ответов. Поменялась только скорость, с которой эти веса превращаются в токены.
Что показало демо
Демонстрация в обзоре Forward Future проста и потому убедительна. Промпт: разработай панель управления в стиле финансового терминала для финансовых аналитиков. Это типичная агентная задача, где модель должна сгенерировать десятки файлов, компонентов и стилей, а не просто абзац текста.
GPT-5.6 Soul на Cerebras завершил работу за 1 минуту 50 секунд. Обычный Soul над тем же заданием трудился 12 минут 20 секунд. Если вы пользовались Codex или другими кодовыми агентами, вы знаете, что сложный запрос может выполняться 30, 60, а то и 90 минут. Сокращение такого ожидания в 14 раз это не косметическое улучшение, а качественный скачок, примерно как переход с модема на широкополосный интернет.
Почему раньше не получалось быстро
Чтобы оценить скачок, стоит понять, как устроена экономика обычного инференса. GPU-кластер обслуживает тысячи пользователей одновременно, и провайдеру выгодно набивать запросы в большие батчи: чем больше батч, тем выше суммарная пропускная способность и ниже себестоимость токена. Но у батчирования есть обратная сторона. Каждый отдельный пользователь получает свои токены медленнее, потому что его запрос делит вычислительные ресурсы с сотнями чужих. Скорость для одного клиента и эффективность для провайдера тянут в противоположные стороны.
Ускорить инференс для конкретного пользователя на GPU можно, но ценой резкого роста себестоимости: меньше батч, больше простаивающих мощностей. Именно поэтому «быстрый режим» от традиционных провайдеров оставался экономически бессмысленным. Cerebras ломает это уравнение на уровне железа: когда вся модель живёт в SRAM на одном кристалле, генерация для одного потока и так упирается в физические пределы памяти на кристалле, а не в компромиссы планировщика батчей. Быстрый инференс перестаёт быть люксом и становится свойством архитектуры.
Как скорость меняет работу с агентами
Самое интересное в этой истории не цифры, а то, как медленный инференс деформирует рабочий процесс прямо сейчас. Автор обзора описывает свою текущую практику честно: он запускает десять агентов параллельно, потому что каждый из них будет думать полчаса. Пока первый пишет код, он переключается на второго, третьего, пятый. Цена этой параллельности, переключение контекста. Вернуться к агенту номер три через двадцать минут и вспомнить, что именно ты от него хотел, стоит заметных когнитивных усилий. Десять параллельных контекстов это не суперсила, а налог на медленный инференс.
Когда агент отвечает за две минуты вместо получаса, вся эта конструкция рассыпается. Не нужно десять параллельных потоков, достаточно двух-трёх, а то и одного: задал задачу, выпил глоток кофе, получил результат, задал следующую. Цикл «промпт, ожидание, проверка» сжимается настолько, что работа с агентом начинает напоминать обычный диалог, а не управление очередью фоновых задач. Это и есть настоящий смысл Ultrafast: он возвращает разработчику состояние потока.
Узкое место сместилось, и это неожиданно
Есть в этой истории и тонкий технический момент, который легко пропустить. Когда модель стала в 14 раз быстрее, bottleneck переместился. Теперь тормозит не «мышление» нейросети, а всё остальное: вызовы инструментов, выполнение сгенерированного кода, сетевые запросы, рендеринг превью. Одним словом, обычные CPU и традиционный код. Как замечает автор обзора, процессоры вернулись в игру.
Отсюда следует нетривиальный вывод. Старый твит Тибо из команды Codex, «следующему поколению моделей нужно больше, чем твой ноутбук», внезапно обрёл новый смысл. Если модель выдаёт токены с бешеной скоростью, локальная машина просто не успевает обслуживать её запросы к инструментам. Ваш компьютер становится самым медленным звеном в цепочке. Логичное разрешение этого противоречия, перенос агентов в облако целиком, где быстрая модель и быстрое окружение живут рядом в одном дата-центре. Ultrafast это ещё один толчок к миру, где агент работает не на вашей машине, а рядом с моделью, а вы лишь смотрите на результат.
Параллельно идёт ценовая война
Ускорение инференса происходит не в вакууме. Та же неделя принесла целую серию релизов, которые показывают вторую сторону тренда: инференс дешевеет так же стремительно, как ускоряется.
DeepSeek выпустила V4 Pro с результатом 87.9 на Terminal Bench, вплотную к Kimi K3 и Fable 5 с их 88. Но интереснее бенчмарков ценовая политика: в непиковые часы миллион входных токенов стоит 66 центов, миллион выходных, 1.98 доллара, а попадание в кэш обходится в 2 цента за миллион токенов. Два цента. Это цена, при которой можно позволить себе запихивать в контекст целые репозитории, не задумываясь о счёте. В пиковые часы тарифы удваиваются, и сама идея дифференцированного по времени суток ценообразования на инференс, как на электричество, кажется тихой революцией.
Grok 4.6 от xAI, к слову, тоже демонстрирует то же направление: почти фронтирное качество за 2 доллара на входе и 6 на выходе. А Meta вернулась в открытые веса с Muse Glimmer, 30-миллиардной моделью, которая целиком помещается на десктопную видеокарту 40-й или 50-й серии. Скорость сверху, цена снизу, открытые модели сбоку. Рынок инференса сжимается с трёх сторон одновременно.
Что это значит на практике
Если отступить на шаг, картина складывается в простую формулу. Качество моделей выровнялось настолько, что выбирать между фронтирными системами по бенчмаркам стало почти бессмысленно. Конкуренция переместилась в два измерения: кто быстрее и кто дешевле. OpenAI отвечает чипами Cerebras и режимом Ultrafast. DeepSeek отвечает тарифами с непиковыми часами и двухцентовым кэшем. xAI отвечает ценой Grok 4.6.
Для разработчика это означает, что проектировать системы стоит под изобилие, а не под дефицит. Агент, который ждёт ответа модели две минуты, а не полчаса, может позволить себе больше итераций проверки, больше попыток, больше самокритики. Дешёвые токены позволяют не экономить на контексте. Архитектуры, которые вчера казались расточительными, завтра станут стандартом, просто потому что стоимость и время перестали быть ограничением.
Часто задаваемые вопросы
Ultrafast уже доступен всем пользователям ChatGPT?
Нет. Режим работает в статусе превью, доступ ограничен, и за скорость придётся доплачивать. Точных цен OpenAI пока не раскрыла, но логика подсказывает, что премиум за 14-кратное ускорение будет заметным, как когда-то премиум за GPT-4 относительно GPT-3.5.
Качество ответов на Cerebras отличается от обычного режима?
Нет, модель остаётся той же самой. Cerebras ускоряет инференс тех же весов GPT-5.6 Soul, не меняя архитектуру и не дистиллируя модель. Разница только в скорости генерации токенов, качество и поведение модели идентичны стандартному режиму.
Почему быстрый инференс важнее умной модели для агентов?
Потому что агентная работа это цикл из десятков вызовов модели, а не один ответ. Когда каждый вызов занимает минуты, агент «думает» часами, и разработчик вынужден распараллеливать задачи, теряя фокус. Быстрый инференс сжимает весь цикл до диалогового темпа и убирает необходимость жонглировать десятью контекстами.
Стоит ли переплачивать за Ultrafast, если я не разработчик?
Зависит от сценария. Для одиночных вопросов и ответов выигрыш почти не ощущается: разница между ответом за 5 и за 40 секунд редко критична. Режим окупается там, где модель работает длинными цепочками: кодовые агенты, многошаговый анализ документов, итеративная генерация интерфейсов. Чем длиннее цикл, тем сильнее эффект.
Что такое непиковые тарифы DeepSeek и почему это важно?
DeepSeek V4 Pro продаёт инференс дешевле в часы низкой нагрузки, примерно как ночной тариф на электричество. Разница с пиковыми часами около двух раз, а кэшированный контекст стоит 2 цента за миллион токенов. Для фоновых задач вроде ночной обработки данных это позволяет планировать вычисления по расписанию и резать расходы вдвое.
Заменит ли быстрый облачный инференс локальные модели?
Нет, это разные ниши. Релиз Meta Muse Glimmer на той же неделе показывает: 30-миллиардная открытая модель работает прямо на десктопной видеокарте. Локальные модели выигрывают в приватности, офлайне и нулевой стоимости токена, облачные в скорости и фронтирном качестве. Рынок развивается в обе стороны сразу, и конкуренция между ними только усиливается.
Итог
ChatGPT Ultrafast на чипах Cerebras это не очередной апдейт модели, а смена оси конкуренции. 1 минута 50 секунд вместо 12 минут 20 секунд на реальной агентной задаче показывает, что узким местом стало всё, кроме самой модели. Параллельно DeepSeek опускает цену контекста до двух центов за миллион токенов, а xAI продаёт почти фронтирное качество по бросовым тарифам. Скорость и цена стали новым полем битвы, и это отличные новости для всех, кто строит на агентах. Если вы откладывали эксперименты с многошаговыми агентными системами из-за стоимости или времени ожидания, самое время вернуться к ним: ограничения, которые останавливали вас полгода назад, исчезают на глазах.