Opus 5.5 против GPT-6 Sol: реальные тесты вместо бенчмарков

Opus 5.5 против GPT-6 Sol: реальные тесты вместо бенчмарков

Поговорка про то, что всё происходит одновременно, на этой неделе сработала буквально: два главных конкурента в области ИИ выпустили новые флагманы с разницей в полтора часа. Anthropic представила Claude Opus 5.5 во вторник, а OpenAI почти сразу ответила GPT-6 Sol, который стоит вдвое дешевле за токен API. Автор YouTube-канала Paul J Lipsky целую неделю гонял обе модели на настоящей работе и опубликовал подробный разбор. Его вывод оказался неожиданным для тех, кто выбирает модель по цене.

GPT-6 Sol и Opus 5.5 это две новые флагманские модели для одних и тех же задач: кодинг, агенты, тексты, дизайн и видеомонтаж. Sol заявлен как более дешёвый и быстрый, Opus выигрывает около 10 пунктов в независимом бенчмарке интеллекта. При этом оба теста проходили на одинаковых тарифах за $100 в месяц, и каждый прогон съел меньше 1% недельного лимита, так что в пересчёте на одну сложную задачу разница в цене почти неразличима.

Тест первый: скрипт и исследование в браузере

Первое задание знакомо любому автору: написать сценарий видео под названием «GPT-6 Sol против Opus 5.5». Обе модели должны были сами собрать материал через встроенный браузер, без доступа к локальным файлам и заметкам, чтобы не подглядывать в чужие записи. Sol управился с исследованием примерно за полторы минуты, Opus чуть больше чем за две. Разрыв по скорости небольшой, но Lipsky отдельно отметил, что Opus 5.5 впервые в его практике двигался по интернету с той же лёгкостью, что и лучшие модели OpenAI.

Решающим стало качество текста. Обе модели выдали рабочие сценарии, но у Sol рассказ прыгал между фактами, а у Opus получилась ясная история: во вторник Anthropic выпустила Opus 5.5, через 90 минут OpenAI ответила Sol за половину цены, и это не совпадение, потому что обе компании идут к одной аудитории. Автор признался, что пишет с Opus 5.5 всю неделю и считает его лучшей моделью для текста из всех, что пробовал. Она всё ещё звучит как ИИ, но заметно лучше копирует его авторский тон, чем любой другой конкурент.

Дизайн: слепой тест с тремя участниками

Дальше пошла задача из реального продакшена: сгенерировать motion-графику для будущего видео про Gemini Notebook. К дуэли подключили третьего участника, модель Fable 5.1, которая до этой недели была у Lipsky рабочей лошадкой именно в дизайне. Три ролика проиграли подряд без подписей, чтобы выбор был честным, вслепую.

Места распределились однозначно. Ролик GPT-6 Sol оказался худшим и откровенно разочаровал. Лучшую графику выдала Fable 5.1, а Opus 5.5 финишировал вторым, совсем немного отстав от лидера. С учётом цены Opus готов забрать эту роль себе: доплачивать за Fable ради небольшого прироста качества Lipsky больше не собирается. Для него это первый случай, когда одна модель закрывает сразу и тексты, и монтаж, и графику.

Видеомонтаж: Opus вдвое быстрее и точнее

Третий тест оказался самым показательным. Обеим моделям скормили сырые 15 минут записи и попросили сделать первый проход монтажа: убрать паузы, вырезать неудачные дубли, расставить зумы, подсветки и смену кадров. Обычно Lipsky доделывает такой черновик руками, доводя последние 20% полировки. Тесты шли на высоком уровне усилий, то есть модели могли думать сколько нужно, без экономии на качестве.

Sol справился плохо. Зумы срабатывали не там, где стоял курсор, камера дёргалась туда-обратно-обратно подряд, подсветки блоков не совпадали с границами, а вёрстка кадра вдруг переключалась в странный полноэкранный режим с пустым фоном. Автор не скрывал удивления: настолько слабых результатов он не получал даже от прошлой версии GPT. Opus 5.5, напротив, выдал лучший монтаж за всю его историю работы с ИИ-редакторами: точные границы подсветок, зум ровно в нужную точку, естественные переходы и привычная схема кадра с подписью автора в углу.

Отдельный удар по конкуренту нанёс секундомер. Opus потратил на задачу 7 минут 15 секунд, а Sol 15 минут 30 секунд. В большинстве других тестов быстрее оказывался именно Sol, поэтому разворот удивил вдвойне: вдвое медленнее и заметно хуже по результату. Паузы и ложные дубли обе модели вычистили одинаково аккуратно, здесь ничья, но по остальным пунктам победитель очевиден.

Почему Sol проиграл именно на монтаже

Разница между тестами показательна сама по себе. В задачах, где нужно быстро бегать по вебу и собирать факты, обе модели держат примерно один уровень, и там Sol даже выигрывает по темпу. Но монтаж, дизайн и тексты требуют не скорости, а точности: попасть зумом ровно в точку клика, совместить подсветку с границей блока, сохранить ритм кадров. Здесь каждая ошибка видна глазом, и «почти правильно» не считается. Sol как будто торопится отчитаться, а Opus доводит детали. Ровно та же картина была в дизайне: у Sol ролик развалился по композиции, а у Opus почти дотянул до уровня Fable. Похоже, OpenAI оптимизировала новую модель под агентные и аналитические сценарии, где важнее скорость и цена, а сложный креатив остался слабым местом.

Итог недели: дешевле не значит лучше

Общий вывод Lipsky получился жёстким для OpenAI. GPT-6 Sol дешевле и в большинстве сценариев быстрее, но по качеству он уступил, а местами выглядел хуже собственной прошлой версии. «Разочарование», сказал автор прямо. Opus 5.5, наоборот, превзошёл ожидания: предыдущий Opus 5 был настолько слабым, что в работу Lipsky его не взял, а новая версия закрыла старые проблемы и стала лучшей доступной моделью, особенно если сравнивать скорость, цену и качество в одной корзине. Даже против Fable 5.1 Opus теперь выигрывает по совокупности, хотя в чистом дизайне та ещё чуть впереди.

Почему релизы совпали? Лучше всех объяснил сам Opus в том самом сценарии: Sol вышел через 90 минут после Opus 5.5 за половину цены, и это не случайность, ведь обе компании целятся в одних людей, тех, кто использует ИИ для кода, агентов и повседневной работы. Получилась не пара независимых релизов, а открытие ценовой войны. Для пользователя вывод простой: выбор модели превращается из задачи про бенчмарки в задачу про собственные сценарии. Творческие и сложные работы пока уверенно берёт Opus, массовые и дешёвые прогоны логичнее отдавать Sol, а вопрос «какая модель лучшая» окончательно распался на «лучшая для чего».

Ценовая война: что это значит для пользователя

Ситуация «два флагмана в один день» это не только красивая новость. Подписки на обе модели стоят одинаково, $100 в месяц, и конкуренция теперь идёт не через повышение цен, а наоборот, через снижение стоимости за токен и рост лимитов. Пользователю это даёт редкое окно: можно держать обе подписки, развести задачи по стоимости и сложности и спокойно ждать следующего витка. Единственное, за чем стоит следить, это за переносом результатов из бенчмарков в реальную работу: как показала неделя, лидеры лидербордов и победители живых тестов могут не совпадать. Компании синхронизировали не только даты релизов: Google и Meta в те же дни показали обновления продуктов, а не моделей, голос, устройства и агентов. Складывается картина, где качество моделей становится фоном, а борьба переходит на уровень экосистем.

Что ещё случилось на этой же неделе

Gemini Notebook получил живой чат с блокнотами, пока для подписчиков Ultra, причём ответ можно прерывать на полуслове. Блокноты теперь подключаются к Google Docs как источник через символ @, а в студии появились интерактивные отчёты: прямо по ходу чтения в них добавляются инфографика, слайды, карточки, интеллект-карты и квизы. Google также выпустил Gemini 3.8 TTS, выразительную модель озвучки текста, которая уже воспроизводит даже взрывные согласные у микрофона, и подключил Gemini ещё к 13 приложениям.

SpaceX AI выкатила Grok 4.7: заметное улучшение 4.6 за те же деньги и скорость, но первые отзывы разделились. Интереснее обстоят дела у Grok Bot. У ботов появились голосовые заметки и голосовые звонки, каждый бот получает собственный голос с настраиваемой скоростью, а трафик бота можно пускать через свой домашний компьютер, чтобы сайты перестали блокировать его как облачного гостя.

Meta на конференции Connect сделала главную ставку на своего агента Muse, который уже пару недель держится в топе App Store. У каждого Muse появится почтовый адрес, придут видеозвонки с оживающим аватаром и управление любыми приложениями на Mac. Базовая версия останется бесплатной, а зарабатывать Meta планирует на комиссии с покупок, поэтому список магазинов растёт: Walmart, Best Buy, Sephora, Wayfair, плюс Shop Pay и PayPal на оплату.

Amazon при этом заблокировал агента от своего сайта и, по мнению автора, совершил колоссальную ошибку: агентские покупки это уже не фантастика, а повседневность. Отдельно анонсирован Muse Charm, маленький брелок в стиле тамагочи с датчиком пальца, через который можно болтать с агентом из кармана, и выход Muse в очки, включая новую модель Ray-Ban без камеры.

OpenAI тем временем подтянула ChatGPT: в десктопное приложение добавили поддержку Chrome-расширений, включая менеджеры паролей, нескольким плагинам можно подключить несколько аккаунтов сразу, голосовой режим научился работать с почтой, календарём и Slack, а ещё ChatGPT теперь умеет следить за вашим кредитным рейтингом. Общий вектор недели виден без микроскопа: модели воюют за цену, а продукты одновременно учатся говорить, жить в кармане и отвечать за ваши письма и встречи.

Часто задаваемые вопросы

Чем GPT-6 Sol отличается от Opus 5.5?

Обе модели вышли с разницей в 90 минут. Sol стоит вдвое дешевле за токен и обычно быстрее, Opus выигрывает около 10 пунктов в независимом бенчмарке и оказался точнее в живых тестах на текстах, дизайне и видеомонтаже. На сложных творческих задачах Sol заметно уступает конкуренту.

Стоит ли переходить на Opus 5.5?

Если вы пишете тексты, монтируете видео или делаете графику, по свежим тестам это лучший выбор недели. Если задачи простые и массовые, GPT-6 Sol остаётся выгоднее по цене. Оптимальная стратегия держать обе модели и разводить работу по сложности.

Почему релизы вышли так близко друг к другу?

Совпадение исключено. OpenAI выпустила Sol через 90 минут после Opus 5.5, за половину цены, и обе компании целятся в одну аудиторию людей, использующих ИИ для ежедневной работы. Началась ценовая война, и для пользователей она выгодна.

Итог

Неделя показала, что гонка флагманов перешла в новую фазу: релизы приходят дуэтами, а цена перестаёт быть главным аргументом. Opus 5.5 выиграл живые тесты и стал новой рабочей моделью даже для скептиков, GPT-6 Sol взял ценой и скоростью, но проиграл там, где важно качество, а остальные игроки подтянули голос, носимые устройства и агентов. Если сомневаетесь, что выбрать, возьмите одну настоящую задачу из своей работы и прогоните её через обе модели: разница станет видна быстрее, чем по любым лидербордам.

А вы на какой модели остались после этой недели?

← Все записи