i
Новости
Новости · 2026-09-22

Почему все говорят о Jev — ИИ, который не ведёт диалогов

@neuronium_ai @neuronium_ai

На прошлой неделе TypeSafe AI выпустила Jev — модель для принятия структурированных решений внутри ПО и ИИ-агентов. Она не пишет письма, не генерирует код и не ведёт диалоги: классифицирует данные, выставляет оценки и возвращает вероятности. Заявленная цена составляет 0,042 доллара за миллион входных токенов, а выходные токены не тарифицируются. В ранних тестах Jev отвечала в 5–18 раз быстрее обычной языковой модели, а внутри рабочих процессов TypeSafe оказалась примерно в 194 раза быстрее и в 445 раз дешевле выбранных передовых моделей. При этом её точность и устойчивость к атакам остаются отдельными вопросами.

Обложка: Почему все говорят о Jev — ИИ, который не ведёт диалогов

Модель для решений

TypeSafe AI основал бывший исследователь OpenAI Диогу Алмейда. Jev предназначена для решений, которые программное обеспечение и ИИ-агенты могут использовать напрямую.

Модель классифицирует информацию, выставляет оценки и возвращает вероятности, не создавая текстовые абзацы, через которые обычные большие языковые модели передают ответы. Разработчики платят 0,042 доллара за миллион входных токенов, а за выходные токены отдельной платы нет. Для тех, кто использует языковую модель ради нескольких слов структурированной информации, это может быть выгоднее обычного подхода.

Вопрос, вокруг которого строится идея Jev, простой: зачем генерировать разговор, если приложению требуется только решение?

Экономика уже привлекла внимание разработчиков. Инженер Vercel Пранит Шарма сообщил, что замена обычной языковой модели на Jev для классификации безопасности команд дала ответы в 5–18 раз быстрее и повысила точность в его тесте. Другой разработчик обнаружил, что Jev классифицирует деловые письма за небольшую долю стоимости Google Gemini, хотя Gemini оказалась немного точнее.

По данным TechCrunch, после запуска TypeSafe некоторое время с трудом справлялась со спросом на API. Для компаний, чьи автоматические системы принимают тысячи решений в час, ранние эксперименты указывают на возможность сократить расходы на рутинные ИИ-задачи без перестройки ПО. Одновременно зависимость от сторонних моделей, принимающих решения, может создавать проблемы.

Сколько интеллекта нужно приложению

Jev поднимает более широкий вопрос: сколько интеллекта действительно требуется приложению. Технологические компании годами улучшали языковые модели, которые умеют рассуждать, писать и разговаривать с людьми. TypeSafe сосредоточилась на модели для быстрых структурированных суждений внутри уже существующего ПО.

Появление Jev заставило разработчиков заново оценить задачи, которым нужна сложная разговорная модель, и задачи, с которыми справится более дешёвый специализированный инструмент. Ранние показатели выглядят заметно, но точность, безопасность и надёжность автоматизированных решений остаются открытыми.

Чтобы объяснить отличие Jev от Claude или GPT, авторы приводят пример с поддержкой. Клиент пишет боту, что с него дважды списали деньги за подписку, и просит вернуть средства.

Разговорному боту нужно определить, к чему относится сообщение:

биллинг;
техническая поддержка;
продажи.

Обычная языковая модель воспринимает жалобу как языковой ввод, выбирает нужный отдел и формирует текстовое объяснение. Для этого ей требуется понять сообщение, пройти несколько этапов рассуждения и создать ответ или другой вывод.

Такой процесс может потребовать много токенов и шагов, а его результаты не всегда предсказуемы.

Jev сокращает последовательность действий: получает сообщение и список разрешённых категорий, после чего возвращает выбранную категорию вместе с вероятностями. Вводы и выводы становятся предсказуемее, токенов требуется меньше, а обработка проходит быстрее.

Если таких сообщений 100 000, ритейлеру не нужно письменное объяснение каждого решения о маршрутизации. Ему нужен результат, который сможет обработать уже установленное ПО.

Обычная языковая модельобъясняет решение текстом
Jevвозвращает структурированный выбор

Три типа решений

Jev поддерживает три типа вопросов:

Choice — выбирает ответ из заранее заданных вариантов.
Score — оценивает информацию по числовой шкале или рубрике.
Noul — так TypeSafe называет третий тип; оценивает вероятность истинности утверждения.

Несколько вопросов можно оценивать параллельно на основе одного и того же ввода.

TypeSafe называет Jev «моделью System One», отсылая к разделению психолога Даниэля Канемана на быстрое интуитивное и медленное обдуманное мышление. Компания утверждает, что использует новую архитектуру и метод обучения обучение с подкреплением for Calibrated Decisions (RLCD). Он должен точнее отражать неопределённость в вероятностных оценках.

Диогу Алмейда описывал цель модели как вызов функции с передовым интеллектом: на вход поступает неструктурированное состояние, а на выходе появляются типизированные вероятностные решения.

Вывод Jev изначально структурирован. Разработчику не нужно запрашивать текстовое объяснение, извлекать из него решение и удалять всё остальное.

Ограничения Jev

Поскольку Jev сосредоточена на трёх видах решений, она не подходит для всего спектра задач языковых моделей. Она:

не напишет ответ клиенту;
не создаст новую категорию, если существующие варианты не подходят;
не выполнит самостоятельно сложный бизнес-процесс.

Разработчикам по-прежнему нужно передать модели релевантную информацию, определить доступные действия и создать системы, которые интерпретируют результат.

Идея структурированных ответов появилась до Jev. В августе 2024 года OpenAI представила Structured Outputs, позволяющие требовать от ответов соответствия заранее заданным JSON-схемам. Jev решает ту же задачу другой конструкцией модели: ставит в приоритет типизированные решения и параллельную оценку, а не генерацию текста. Достаточность преимуществ такой архитектуры по сравнению с альтернативами покажут дальнейшие сравнительные испытания.

Цена и скорость

Название Jev отсылает к экономисту XIX века Уильяму Стэнли Джевонсу. Он изучал, как повышение эффективности использования ресурсов может увеличивать их потребление. TypeSafe ожидает похожего эффекта в ИИ: более дешёвый инференс может сделать оправданным внедрение интеллектуальных решений в процессы, где сегодня используются жёсткие правила или требуется участие человека.

TypeSafe заявляет время отклика от 70 до 500 миллисекунд и цену 0,042 доллара за миллион входных токенов. Выходные токены бесплатны. Миллиард входных токенов при такой ставке стоил бы 42 доллара без учёта другой инфраструктуры и операционных расходов.

70–500 мсзаявленное время отклика
0,042 долларамиллион входных токенов
42 долларамиллиард входных токенов

Такой же объём входных токенов обошёлся бы примерно в:

4 000 долларов у Anthropic Claude Opus 5.5 или OpenAI GPT-5.6 Sol;
5 000 долларов у Claude Opus 5;
10 000 долларов у Claude Fable 5.1 или GPT-6 Astra.

Эти суммы не учитывают выходные токены, которые создают дополнительные расходы.

Компания утверждает, что во внутренних оценках рабочих процессов Jev была примерно в 194 раза быстрее и в 445 раз дешевле выбранных передовых языковых моделей. TypeSafe признаёт, что это верхняя граница ожидаемого выигрыша.

Однако скорость и низкая цена не гарантируют точности. Опубликованные TypeSafe результаты показывают компромисс: независимое тестирование Explainx.ai зафиксировало у Jev совокупную точность 67,8%, тогда как у лучшей модели в сравнении компании этот показатель составил 74,1%.

Разница в точности требует не меньшего внимания, чем разница в цене. Система, сортирующая низкоприоритетные обращения клиентов, может допустить отдельные ошибки классификации. Для системы, одобряющей финансовые транзакции или разрушительные программные команды, пространство для ошибок гораздо меньше.

Первые проверки в компаниях

Jev заинтересовала компании, которые создают инфраструктуру для ИИ-агентов. Пранит Шарма из Vercel проверял её как замену языковой модели, классифицировавшей безопасность исполнения команд. Как сообщал TechCrunch, замена ускорила ответы в 5–18 раз и повысила точность в тесте.

CTO Bryo AI Никхил Мудхолкар, по данным TechCrunch, испытывал Jev на классификации деловых писем. В его эксперименте Gemini оказалась немного точнее, но стоила примерно в 10–20 раз дороже Jev.

Эти примеры показывают экономический компромисс: специализированная модель может обеспечить достаточную точность при гораздо меньшей стоимости, но её пригодность зависит от последствий ошибки.

Как Jev проверяла LangChain

LangChain нашла для модели другое применение — оценку поведения ИИ-агентов. Разработчики часто используют языковые модели, чтобы изучать работу агента и определять, правильно ли он выполнил задачу. При тысячах запусков в день такие оценки могут обходиться дорого.

В эксперименте 20 сентября LangChain сравнила Jev с тремя обычными языковыми моделями на пяти сохранённых ответах погодного агента. Каждый оценщик многократно анализировал одни и те же ответы. Это позволило сопоставить точность, согласованность, скорость и цену.

Jev совпала с бинарными суждениями человека-рецензента во всех 500 повторных решениях. Среднее время составило 0,44 секунды, а цена — 0,00035 доллара за оценку. Непрерывные оценки качества у Jev в этом тесте заметно меньше колебались, чем у конкурирующих моделей.

При этом эксперимент охватывал одного агента и ограниченный набор задач. Стабильные решения не обязательно оказываются правильными.

Что означает «без галлюцинаций»

Заявление TypeSafe о том, что Jev не может галлюцинировать, вызвало споры среди разработчиков. Компания имеет в виду, что модель не может выдать ответ за пределами заранее определённой структуры. Если приложению нужно выбрать одну из пяти категорий, Jev не изобретёт шестую.

Но модель всё ещё может выбрать неправильную категорию или присвоить высокую вероятность ошибочному ответу. Гарантия касается структуры результата, а не фактической правильности решения.

Расследование VentureBeat от 21 сентября описало эксперимент с потенциально разрушительной компьютерной командой. Сначала Jev оценила вероятность блокировки команды в 0,76. Затем инженер добавил во входные данные сфабрикованное сообщение об авторизации, после чего вероятность блокировки снизилась до 0,48.

Эксперимент касался одной команды и не позволяет определить, как часто подобные атаки срабатывают. Но он показывает, что вредоносная информация, попавшая во вход приложения, способна повлиять на суждение Jev. Система безопасности, одобрившая несанкционированную команду, не становится надёжнее только потому, что приняла решение за 70 миллисекунд.

Споры вокруг запуска

Тему широко обсуждали в ветке запуска на Hacker News. Разработчики оспаривали описание TypeSafe устойчивости Jev к галлюцинациям. Одни сомневались, оправдывают ли её возможности сравнение с моделями, способными писать код и выполнять открытые задачи. Другие указывали, что обычные языковые модели уже поддерживают ограниченные форматы вывода, а главные отличия Jev — скорость и цена.

Недовольство Диогу Алмейды обычными языковыми моделями сформировало подход TypeSafe. В разговоре с TechCrunch он описал разочарование ограничениями разговорного ИИ для автоматизации ПО. По его словам, у индустрии есть «молния в бутылке», но практической пользы от неё нет.

Это отражает проблему корпоративного ПО. Многим автоматизированным процессам нужно изучить информацию и выбрать действие, тогда как подробное объяснение может лишь увеличить задержку и расходы, не улучшив результат.

Сочетание разных моделей

Возможность Jev не ограничивается заменой дорогой модели дешёвой. Разработчики могут использовать её, чтобы:

оценивать действия, предложенные агентом;
определять момент, когда требуется более мощная языковая модель;
проверять завершённые задачи до продолжения автоматизированного процесса.

Такие системы могли бы сочетать разные формы машинного интеллекта и назначать моделям задачи в соответствии с их способностями, вместо того чтобы использовать одну разговорную модель для каждой операции.

Ранние эксперименты с Jev показывают, что такой подход способен снизить стоимость и время отклика в отдельных задачах. Но остаются вопросы о работе при длительных производственных нагрузках, точности на незнакомых данных и последствиях неверных решений.

Для компаний, оценивающих Jev, главным показателем может оказаться не скорость и не цена, а стоимость ошибки. Неверная маршрутизация отправит клиента не в тот отдел, а ошибочная классификация безопасности может разрешить разрушительную команду. Эти риски принципиально различаются, поэтому одна и та же модель может подходить для одного сценария и не подходить для другого.

TypeSafe сделала этот эксперимент необычно дешёвым. Станет ли Jev постоянной частью корпоративного ПО, будет зависеть от того, что разработчики обнаружат после перехода от рекламных цен и ранних бенчмарков к длительной работе в продакшене.

Anthropic: Claude Opus 5.5 обошла Fable 5.1 в агентных тестах при API на 60% дешевле Как получить свою долю в компенсации Apple на $250 млн по делу Siri Говорить необязательно: Jev показывает ценность моделей принятия решений Насколько безопасно жить рядом с дата-центром? Возможные риски Tokenmaxxing: опасный новый тренд, который бизнесу пора остановить Оптический проект MIT подстёгивает ловкость роботов Не дайте блеску генеративного ИИ заслонить лёгкие победы предсказательного ИИ От дашбордов к решениям: ИИ меняет правила игры в SaaS ИИ помогает метаосознанности следить за осознанностью и сдерживать бездумность Грузовик-робот уверяет: его ИИ ездит по шоссе без предварительного обучения Агентный ИИ может найти свой идеальный полигон в женском спорте Дочь Робина Уильямса в ужасе от ИИ-роликов о нём с теориями заговора спустя годы после смерти Claude Opus 5.5 не уступает Fable 5.1, дешевле и обещает меньше «клау́довского» текста DraftKings использует ИИ, чтобы выявлять зависимых игроков и подсаживать их Как UK AISI и EvalEval делают результаты бенчмарков воспроизводимыми AstroForge передаёт ИИ управление своим следующим космическим аппаратом Джордж Осборн из OpenAI: противники дата-центров тормозят развитие Британии Rabbit возвращается — теперь с приложением ИИ-агента OpenAI призывает к международным стандартам для ИИ, способного к самоулучшению Трамп в ООН: США теперь называют ИИ «сверхинтеллектом» во всех официальных документах

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram