Kimi K3: первая open-weight модель на 2,8 трлн параметров обходит GPT-5.5
Ещё год назад модель с 2,8 триллиона параметров казалась чем-то из научной фантастики. Сегодня Moonshot AI объявила, что открывает веса именно такой модели — Kimi K3. И цифры на бенчмарках заставляют переосмыслить баланс сил между закрытыми и открытыми LLM.
На SWE-Bench (один из самых строгих бенчмарков для оценки реального кодинга) Kimi K3 набирает результат, сопоставимый с GPT-5.6 и Claude Opus 5, обходя при этом GPT-5.5, Claude Opus 4.8 и GLM 5.2. На Terminal-Bench модель превосходит даже Opus 5 — и это впервые, когда open-weight модель выходит на первое место в таком классе задач.
Что такое Kimi K3
Kimi K3 — это языковая модель от китайской лаборатории Moonshot AI с 2,8 триллиона параметров. Это первая open-weight модель в истории, перешагнувшая порог в 2 триллиона. Для сравнения: предыдущий рекордсмен среди открытых моделей — Llama 3.1 405B (405 миллиардов параметров), а Kimi K3 больше её почти в 7 раз.
Размер файла модели — около 5,6 ТБ в полном формате. Это означает, что запуск на локальном оборудовании пока невозможен даже для энтузиастов с несколькими H100. Однако сам факт доступности весов для скачивания, файн-тюнинга и развёртывания на облачных GPU меняет экономику всей отрасли.
Весовая открытость в таком масштабе — это не просто техническое достижение. Это сигнал рынку: монополия закрытых лабораторий на модели уровня GPT-5 больше не абсолютна.
Бенчмарки: где Kimi K3 обходит конкурентов
На SWE-Bench, который оценивает способность модели решать реальные задачи из репозиториев с открытым исходным кодом (исправление багов, написание тестов, рефакторинг), Kimi K3 опережает GPT-5.5 и Claude Opus 4.8. Эти два модели до сих пор считались золотым стандартом для агентного кодинга. Результат Kimi K3 показывает, что разрыв между закрытыми и открытыми моделями в этой дисциплине фактически исчез.
На Terminal-Bench — бенчмарке, который оценивает работу с терминалом и сложные многошаговые задачи автоматизации — Kimi K3 обходит даже Claude Opus 5. Это особенно показательно, потому что Terminal-Bench ближе к реальным сценариям использования: агент получает доступ к файловой системе, должен читать логи, запускать команды, интерпретировать ошибки. Именно такие задачи составляют 80% работы разработчика с AI-ассистентом.
При этом Kimi K3 уступает GPT-5.6 и Claude Opus 5 по нескольким позициям, особенно в задачах на общее рассуждение и мультимодальность. Модель не универсальна — она доминирует в кодинге и агентных задачах, но не является безусловным лидером во всех категориях.
Почему 2,8 триллиона параметров — это не просто число
Масштаб модели имеет прямое следствие: Kimi K3 обучалась на значительно большем объёме данных, чем конкуренты. При таком размере параметры модели содержат больше паттернов, больше связей между концепциями, больше «знания» о том, как устроен код и как решать инженерные задачи.
Но есть и обратная сторона. Модель такого размера требует огромных вычислительных ресурсов для инференса. На одном A100 она не поместится — нужны как минимум 8 GPU с 80 ГБ памяти, соединённых через NVLink. Это делает Kimi K3 экономически нецелесообразной для малых компаний, которые хотят развернуть модель у себя.
Однако через API облачных провайдеров (Together AI, Anyscale, Replicate и другие) стоимость инференса будет сопоставима с конкурентами. Разница в том, что теперь у пользователей есть выбор: можно файн-тюнить модель под свои задачи, адаптировать под внутренние кодбейсы, и это невозможно с закрытыми моделями.
Контекст: что ещё произошло на неделе
Kimi K3 — не единственная значимая новость. На той же неделе появилось несколько событий, которые в совокупности рисуют картину ускоряющейся гонки:
Bonsai 27B от Prism ML — 1-битная модель с 27 миллиардами параметров, которая помещается в 4 ГБ и работает на смартфоне. Она генерирует текст со скоростью 94 токена в секунду. Конечно, она не решает сложные задачи кодинга (попытка пройти SWE-Bench привела к таймауту), но демонстрирует, что крайняя квантизация достигла практического уровня для быстрого ответа на устройстве.
Thinking Machines Labs (компания Mira Murati, бывшего CTO OpenAI) выпустила свою первую публичную open-weight модель Inkling. На бенчмарках она уступает GLM 5.2 и Kimi K3, но сам факт появления показывает, чтоMurati строит инфраструктуру для открытой конкуренции.
GLM 5.2 (Zhipu AI) остаётся сильнейшей open-weight моделью прошлого поколения — она всё ещё лидирует по большинству бенчмарков среди моделей до 2 трлн параметров. Но с выходом Kimi K3 эта позиция под угрозой.
Groq Build (кодинг-агент от xAI) был открыт на GitHub. Теперь любой может форкнуть терминальный агент от команды Илона Маска. Параллельно Grok получил автоматизации — аналог того, что уже есть в Claude и ChatGPT: можно задавать расписания, триггеры по событиям, циклические задачи.
Bonsai 27B: полная противоположность — 27 миллиардов на вашем телефоне
Пока Kimi K3 устанавливает рекорд масштаба, другая модель из той же недели доказывает, что индустрия движется в обе стороны одновременно. Prism ML выпустила Bonsai 27B — 1-битную модель с 27 миллиардами параметров, которая занимает всего 4 ГБ и работает на смартфоне со скоростью 94 токена в секунду.
Что значит «1-битная»? Каждый параметр модели хранится не как 32-битное число с плавающей точкой (стандартный FP32), не как 16-битное (FP16/BF16), не даже как 8-битное — а буквально как один бит. Это экстремальная квантизация, которая жертвует качеством ради размера. Результат: 27 миллиардов параметров в 4 гигабайтах — на телефоне.
Bonsai 27B решает логические задачи, генерирует текст и отвечает на вопросы достаточно хорошо для быстрого бытового использования. Но код она писать не умеет — попытка пройти SWE-Bench заканчивается таймаутом после 20 минут без единого результата. Это не замена Claude Code или Copilot. Это ответ на вопрос «что, если вообще нет интернета и нет сервера?» — приватный ассистент прямо в кармане.
Сочетание Kimi K3 и Bonsai 27B на одной неделе — это не случайность. Это две грани одного тренда: LLM стремятся стать либо максимально большими и мощными (облако), либо максимально маленькими и приватными (устройство). Средние модели всё больше теряют смысл.
Thinking Machines и Inkling: Mira Murati входит в игру
Ещё один open-weight релиз недели — Inkling от Thinking Machines Labs. Эта компания основана Мирой Мурати, которая была CTO OpenAI во время временного увольнения Сэма Альтмана в 2023 году, а потом стала CEO на 24 часа перед уходом.
Inkling — первая публичная модель компании. На бенчмарках она уступает GLM 5.2 и Kimi K3, но сам факт её появления значителен. Мурати строит лабораторию с нуля, и если первые демо показали «крутые модели» (по её словам), то публичный релиз — это проверка того, насколько команда может конкурировать с гигантами.
Для открытого сообщества Inkling — ещё один вариант для экспериментов. Модель можно загрузить, протестировать, сравнить. Площадка Tinker предоставляет бесплатный playground для тестирования — аналог OpenAI Playground, но с open-weight моделями.
Что это значит для разработчиков
Для разработчиков Kimi K3 открывает несколько практических возможностей, которых раньше не существовало:
Файн-тюнинг на собственном кодбейзе. Если у вас специфический стек (например, legacy-код на COBOL или проприетарный фреймворк), вы можете дообучить Kimi K3 на своих данных. Закрытые модели так не умеют — максимум, что даёт OpenAI, это fine-tuning API, но для моделей уровня GPT-5.5 он стоит астрономических денег.
Приватный деплоймент. Компании в регулируемых отраслях (медицина, финансы, гособорона) могут развернуть Kimi K3 на своей инфраструктуре без отправки данных в облако. С моделью в 2,8 трлн параметров качество будет близко к GPT-5.5, но данные никуда не уходят. Для банков, которые обрабатывают транзакции, или больниц с конфиденциальными записями пациентов — это критическое преимущество перед облачными API.
Исследования и безопасность. Открытые веса позволяют независимым исследователям изучать, как устроены сверхбольшие модели, проводить аудит на bias, тестировать устойчивость к jailbreak-атакам. Это критически важно для безопасности — закрытые модели непрозрачны, и единственный способ понять их ограничения — работать с открытыми аналогами.
Часто задаваемые вопросы
Можно ли запустить Kimi K3 локально?
Технически — нет. Модель весит 5,6 ТБ и требует минимум 8×H100 (80 ГБ) для инференса. На потребительских GPU (даже 4×RTX 4090) это невозможно. Однако через облачные провайдеры стоимость инференса будет сопоставима с GPT-5.5 API — от $3 до $15 за миллион токенов в зависимости от провайдера.
Чем Kimi K3 лучше GLM 5.2?
Kimi K3 масштабнее (2,8 трлн против ~1 трлн параметров у GLM 5.2) и показывает лучшие результаты на SWE-Bench и Terminal-Bench. Однако GLM 5.2 остаётся более эффективной моделью — она быстрее и дешевле в инференсе. Для задач, где не нужен абсолютный максимум качества, GLM 5.2 по-прежнему практичнее.
Когда откроют веса Kimi K3?
Moonshot AI объявила, что веса будут открыты «в течение этого месяца». Обычно это означает релиз в последние дни месяца или в первую неделю следующего. Ожидайте анонс на Hugging Face и ModelScope с инструкциями по загрузке.
Квантованная ли версия будет для запуска на меньших GPU?
Да, практически наверняка. Модели такого масштаба почти всегда выпускаются с квантованными вариантами (GPTQ, AWQ, GGUF) в течение нескольких недель после релиза. Ожидается 8-битная (~2,8 ТБ) и 4-битная (~1,4 ТБ) версии, которые можно будет запустить на меньшем числе GPU.
Итог
Kimi K3 — это момент, когда открытые модели впервые догнали закрытые в самом важном для индустрии сегменте: агентном кодинге. Модель с 2,8 триллиона параметров обходит GPT-5.5 и Opus 4.8 на реальных инженерных задачах — и её веса скоро будут доступны каждому.
Это не означает конец закрытых моделей — у них остаётся преимущество в мультимодальности, скорости инференса и экосистеме. Но монополия на качество кода сломана. Если вы разработчик, который полагался исключительно на ChatGPT или Claude для кодинга — самое время посмотреть, что Kimi K3 может дать через API или после файн-тюнинга под ваш стек.
Следите за релизом весов на Hugging Face — вероятно, в ближайшие дни.