Jev: модель без языка, которая в 200 раз быстрее LLM

Jev: модель без языка, которая в 200 раз быстрее LLM

Есть странная особенность у топовых ИИ-моделей: они не умеют молчать. Попросите самую мощную из них вернуть обычное «да» или «нет», и она сначала подумает на четыре тысячи токенов, изобретёт третий вариант ответа, а потом ещё и выставит счёт. В сентябре 2026 года бывший исследователь OpenAI показал радикальный способ лечения этой болезни: удалить из модели язык целиком. Продукт получил имя Jev и обещает быть в 200 раз быстрее LLM, до 440 раз дешевле и вообще не галлюцинировать. Вокруг заявки уже кипит спор, и он многое говорит о том, куда движется индустрия.

Jev выпустила компания TypeSafe AI, основанная Диогу Алмейдой, приложившим руку к работам по instruction following в OpenAI. Именно эти исследования в итоге превратились в ChatGPT. Два года стелса, 40 миллионов долларов инвестиций и тезис, который бьёт по основам индустрии: большая языковая модель не обязана уметь говорить.

Что такое Jev

Jev это не генеративная модель и не чат-бот, а типобезопасный классификатор. Вы отправляете ему вопрос и неструктурированный контекст, как обычной языковой модели, но ответ возвращается не текстом, а одной из трёх строго определённых форм: выбор одного из вариантов, числовая оценка или null, то есть отказ от срабатывания. Создатели называют Jev system 1 моделью, по аналогии с быстрыми интуитивными решениями из книги Даниэля Канемана «Думай медленно, решай быстро».

Разница между system 1 и system 2 в терминах Канемана простая: первая система думает быстро и на рефлексах, вторая медленно и обдуманно. Нынешние reasoning-модели, включая GPT-6 и Claude, это чистый system 2. Они способны сжечь 40 тысяч токенов на то, чтобы выбрать имя для переменной в коде, и для чата это даже мило. Для приложения, которое фильтрует миллионы запросов в день, это разорение.

Почему большие модели не умеют молчать

Изъян, на котором построена вся ставка TypeSafe AI, лежит на поверхности: языковые модели обучены продолжать текст, поэтому они всегда порождают текст. Попросите топовую модель вернуть примитивный true или false, и она уйдёт размышлять, найдёт третий вариант ответа и обойдётся в 11 центов там, где нужен один бит информации. Для пары запросов в минуту это незаметно, для промышленной модерации контента это приговор.

Нужна была не модель, которая умеет всё, а модель, которая умеет ровно одно, зато молниеносно. Отсюда и жёсткая рамка из трёх форм ответа: выбор, оценка, null. Разработчик описывает вопрос как строго типизированную форму, а модель не может выдать ничего, что этой форме не соответствует.

Три формы ответа и типизация

Главная инженерная идея Jev в том, что у модели нет свободного вывода. Схема ответа гарантирована, и с точки зрения математики типобезопасная ошибка в принципе невоспроизводима: если вопрос требует ответа «да» или «нет», третьего варианта не появится. Создатели сравнивают это с типизированным языком программирования вроде TypeScript, где компилятор не даст собрать программу с несовпадающими типами.

Для разработчика это снимает целый класс ежедневной боли. Не нужно парсить свободный текст, ловить обрезанный JSON при генерации, писать регулярки поверх ответов модели и молиться, что сегодня она выдаст ответ в нужном формате. Формат гарантирован контрактом, как у обычного API.

На практике это выглядит почти скучно, и в данном случае это комплимент. Сервис спрашивает у Jev, нарушает ли комментарий правила, и получает одно из двух значений. Нужно оценить токсичность по шкале, приходит число. Сообщение не требует реакции вообще, возвращается null, и код просто ничего не делает. Никакого разбора свободного текста, никаких исключений из-за формата ответа.

Откуда берётся скорость

Механику ускорения стоит проговорить отдельно, потому что она объясняет и цену. Обычная языковая модель генерирует ответ последовательно, токен за токеном, и каждый следующий токен требует отдельного прогона через сеть. Ответ на сто токенов, это сто с лишним прямых проходов, и все они стоят денег. Классификатору вроде Jev такой цикл не нужен: ответ считывается за один прямой проход, потому что модели не нужно ничего сочинять, ей нужно только выбрать.

Именно поэтому у Jev заявлены бесплатные выходные токены: выходных токенов в привычном смысле нет вовсе. А заявленный разрыв в скорости и цене, в 200 раз быстрее и в районе 440 раз дешевле лучших коммерческих моделей, это прямое следствие того, что из архитектуры убрали авторегрессионную генерацию. Насколько честные множители, вопрос открытый, и об этом чуть ниже.

Отсюда же и интерес инвесторов, давших компании 40 миллионов: бесплатные выходные токены ломают привычную модель биллинга. Экономика топовых лабораторий во многом держится на оплате сгенерированных токенов, а продукт, который вообще не генерирует, в эту схему не вписывается. В этом смысле Jev бьёт по устоявшейся картине мира не как ещё одна модель того же класса, а как отказ от самого принципа «плати за каждый токен».

Калиброванная уверенность

Каждый ответ Jev сопровождает число уверенности. Если модель возвращает 60 процентов, это означает, что примерно в 60 процентах случаев такой ответ окажется верным. Звучит как техническая деталь, но именно этого качества катастрофически не хватает чат-моделям: их годами учили звучать уверенно, потому что людям нравится уверенность. Результат все видели: ассистенты ошибаются с уверенностью профессионального шоумена, а на вопрос «ты уверен?» отвечают бодрое «да» независимо от того, знают они ответ или нет.

В Jev для этого применили отдельную технику, RLCD, обучение с подкреплением для калиброванных решений. Задача стояла не сделать модель всезнающей, а научить её честно оценивать собственные шансы. Для автоматизированных решений это подчас важнее сырой точности: системе, которая пропускает через себя миллионы запросов, полезно уметь отличать «я почти уверен» от «я гадаю», чтобы спорные случаи можно было эскалировать человеку.

Что не так с Jev

Теперь про скепсис, и его здесь хватает. Первое: архитектура закрыта. Создатели держат детали при себе и обещают научную статью когда-нибудь в будущем, а пока предлагают верить бенчмаркам в стиле «доверься мне». Цифры в 200 раз по скорости и сотни раз по стоимости независимыми тестами не подтверждены.

Второе: у истории есть предшественники, о которых в TypeSafe AI предпочитают не вспоминать. Zero-shot классификаторы существуют больше десяти лет, и часть сообщества считает, что Jev переизобретает известную технику без ссылок на пионеров. Один разработчик утверждает, что его статья, вышедшая годом ранее, описывает ровно то же самое. А другой уже собрал OpenJev: воспроизвёл интерфейс, считывая вероятности вариантов с замороженной модели Qwen-4B за один прямой проход. Без всякого дополнительного обучения, на одной RTX 3090, с демо, которое крутится прямо в браузере через WebGPU.

Третье: Jev не детерминирован. Один и тот же вопрос с одним и тем же контекстом может получить разные ответы, как у любой нейросети. Типобезопасность гарантирует форму ответа, но не его правильность: аккуратно оформленный «да» может быть аккуратно оформленной ошибкой. Так что тезис про отсутствие галлюцинаций стоит читать как маркетинговое упрощение: у модели другого класса просто нет механизма выдумывать факты, но ошибаться она умеет.

Где это уже применяют

Типичные сценарии для system 1 модели там, где решение бинарное, мгновенное и массовое. Модерация: проверка аккаунтов и контента с баном за миллисекунды вместо секунд. Игры: поведение NPC, которым нужны рефлексы, а не рассуждение на сорок тысяч токенов. Продакшен-пайплайны, где каждый лишний вызов дорогой модели умножается на миллионы запросов и превращается в отдельную строку бюджета.

Экономика здесь не менее важна, чем скорость. Когда выходные токены бесплатны, а решений в секунду десятки тысяч, открываются приложения, до которых раньше просто не дотягивались по цене: фильтрация в реальном времени, мгновенные проверки в играх, живые калькуляторы, реагирующие на ввод в тот же момент. Разработчики уже строят такие штуки на Jev, если верить демонстрациям и отзывам первых пользователей.

Хорошо ложится это и в общий тренд на гибридные системы. Большие reasoning-модели решают сложные задачи и пишут длинные рассуждения, а дешёвые узкие сети берут на себя рефлексы: классификацию, фильтрацию, быстрые решения. Jev претендует на место именно в этом втором слое, и неслучайно его появление совпало с разговорами о том, что дуополия OpenAI и Anthropic теряет монополию на стоимость инференса.

Слой рефлексов для агентов

Отдельный сюжет в том, как такие модели встраиваются в агентные системы. Агенту постоянно нужно принимать мелкие решения: выбрать инструмент, проверить, пришёл ли валидный результат, решить, пора ли звать человека. Сейчас каждое из этих решений прогоняют через большую рассуждающую модель, потому что другой нет. Выходит дорого и медленно: на один полезный шаг приходится десяток вспомогательных, и все они оплачиваются как полноценные размышления.

Классификатор меняет экономику этого слоя. Здесь важно не то, как именно устроен Jev внутри и переживёт ли он конкурентов, а то, что сам приём рабочий: сообщество воспроизвело интерфейс на открытой Qwen-4B за один прямой проход и без дополнительного обучения. Значит, любой, кто строит агента, может уже сегодня посмотреть на свой пайплайн и посчитать, сколько вызовов дорогой модели на деле являются бинарным решением в костюме чата. Каждый такой вызов заменяется на почти бесплатный классификатор, и бюджет на инференс сокращается, иногда в разы.

Частые вопросы

Jev это языковая модель?

Нет. Это классификатор без языковой генерации: он не пишет текст, а возвращает выбор, оценку или null. Начинка внутри нейросетевая, но класс задач другой: не разговор и не генерация, а мгновенное решение по входным данным.

Правда ли, что Jev в 200 раз быстрее LLM?

Пока это цифры самой команды и их маркетинга, независимо не подтверждённые. Сообщество уже воспроизвело похожий интерфейс на открытой модели, так что направление работает, но конкретные множители разумно делить на два до появления технической статьи.

Заменит ли Jev большие модели?

Скорее дополнит. Он забирает быстрые решения там, где текст не нужен, а рассуждения, генерация и сложные задачи остаются за большими моделями. Это два слоя одной системы, а не конкуренты за одну и ту же работу.

Итог

Jev это ставка на то, что следующий заметный шаг в прикладном ИИ будет не про способность говорить, а про способность быстро и дёшево решать. Идея безъязыковой system 1 модели упакована в интерфейс, понятный разработчику: три формы ответа, калиброванная уверенность и цена, которая на порядки ниже привычной. Скепсис здесь уместен: пока нет статьи и независимых замеров, называть это прорывом рано. Но если хотя бы половина заявлений подтвердится, год в прикладном ИИ обещает быть очень интересным.

А вопрос к вам такой: доверили бы вы модерацию или фильтрацию узкой модели с честной уверенностью на выходе, или предпочли бы неограниченную большую модель с её крайне убедительными ошибками?

← Все записи