i
Новости
Новости · 2026-10-01

Amazon представила быструю бесплатную модель с открытым кодом в противовес Jev: Strands Decider 2B принимает решения за доли секунды

@neuronium_ai @neuronium_ai

Amazon представила Strands Decider 2B — открытую модель примерно на 2 млрд параметров, которая выбирает из заранее заданных вариантов и оценивает их вероятности за один проход. Её можно бесплатно скачать на Hugging Face и использовать по лицензии Apache 2.0; запускать модель нужно на собственном оборудовании или в облаке. Amazon предлагает применять её внутри пайплайна ИИ-агента: например, чтобы выбирать инструменты, проверять ответы и решать, можно ли выполнить предложенное действие. Выпуск стал частью проекта Strands Labs от AWS и продолжил начавшуюся после появления Jev гонку за более быстрыми и дешёвыми моделями для принятия решений.

Обложка: Amazon представила быструю бесплатную модель с открытым кодом в противовес Jev: Strands Decider 2B принимает решения за доли секунды

Что разработала AWS

Strands Decider создана на основе предварительно обученной модели Qwen3.5-2B. По словам AWS, разработчики убрали компонент, который предсказывает следующее слово, и заменили его небольшим компонентом-указателем: тот оценивает предложенные варианты ответа.

Базовую модель адаптировали с помощью LoRA ранга 16 и обучили новый компонент оценки. AWS сообщает, что он добавляет чуть больше миллиона параметров. На схеме архитектуры, опубликованной вместе с анонсом, эта конструкция названа «Hobson». В отличие от чат-бота, модель делает один проход и возвращает распределение вероятностей по доступным вариантам.

AWS быстро перебирала версии модели и планирует выпустить версию 20 вместе с кодом, обучающими данными и скриптами. Разработчики смогут изучить процесс обучения, дообучить модель и запускать её на своей инфраструктуре, не отправляя каждое решение во внешний API.

В примере AWS модель проверяет вызов погодного инструмента перед тем, как ИИ-агент его выполнит. Если пользователь спрашивает погоду, но не называет город, агент в демке сам предполагает местоположение. Strands Decider анализирует переписку и предложенный вызов: выясняет, указал ли город пользователь и не рано ли обращаться к инструменту. Затем код приложения использует ответы модели, чтобы вернуть агента к уточнению города.

В примере применяется уже существующий механизм вмешательства фреймворка Strands. Он может разрешить или запретить вызов инструмента, запросить подтверждение либо направить агента с помощью обратной связи.

AWS уточняет, что вопросы и пороговые значения для этой демки задали вручную, а библиотеки для интеграции моделей принятия решений ещё разрабатываются. Модель выносит суждение, но разработчик сам определяет, как приложение будет на него реагировать.

Скорость и точность

По данным AWS, модель принимает решения локально за десятки миллисекунд на коротких задачах и укладывается менее чем в 100 миллисекунд на некоторых распространённых конфигурациях оборудования и входных данных.

TypeSafe, в свою очередь, сообщает, что полный ответ Jev через облачный сервис занимает примерно от 70 до 500 миллисекунд.

На графике AWS со сравнением задержек Jev приведены более конкретные результаты с оговорками: версия 18 показала медианную задержку 106 миллисекунд и 296 миллисекунд на 95-м процентиле в 230 запросах на локальной Nvidia RTX 3090, включая время на HTTP-обмен. Более длинные промты обычно обрабатывались дольше.

В результаты не включён первый запрос длительностью 7,7 секунды, пока сервер запускался. AWS также приводит медианную задержку около 150 миллисекунд на небольших задачах на MacBook с M3. Эти данные не подтверждают, что модель всегда отвечает менее чем за 100 миллисекунд.

Качество AWS оценивает по точности и надёжности вероятностных оценок на открытой части JevBench. На графике показаны последовательные версии модели вплоть до версии 19; поздние контрольные точки команды улучшались по сравнению с ранними.

Версия 19 набрала примерно 72% точности при оценке Брайера 0,35. У модели Mapika decider-2b v11 схожего размера на графике около 76% точности и оценка Брайера 0,32. Чем выше точность и ниже оценка Брайера, тем лучше; по обоим показателям в этом сравнении впереди Mapika.

AWS заявляет, что на этом тесте её модель занимает второе место среди открытых моделей сопоставимого размера и первое — среди тех, для которых опубликован полный рецепт обучения. На графике нет результата запланированной версии 20, а сама Jev в сравнении не представлена. Ни письмо AWS, ни графики не доказывают, что Strands Decider в целом превосходит Jev.

При этом отличаются расстояние до сети, формат запросов и расходы на запуск. Представитель Amazon сообщил VentureBeat не для публикации имени, что пока AWS предлагает только открытую модель — без облачного API и платы за каждый вызов.

По словам представителя, Strands Decider можно запускать на MacBook. Но собственный компьютер и облачная инфраструктура всё равно потребляют ресурсы, а Amazon не привела общей оценки расходов на токен или запрос, сопоставимой с тарифом API.

Поэтому пока нельзя установить, дешевле ли запускать Strands Decider, чем пользоваться Jev.

После Jev появились конкуренты

TypeSafe запустила Jev 15 сентября и назвала её моделью «System One». Она принимает состояние приложения и вопросы с заданными типами ответов, а затем возвращает варианты, оценки или вероятности «да» и «нет» — без написания текстового ответа. TypeSafe берёт $0.042 за миллион входных токенов и не взимает плату за выходные токены. Компания говорит, что при последующем обучении уделяет особое внимание калибровке вероятностей. Jev доступна через API; TypeSafe не публиковала веса модели или полный рецепт её обучения.

У подхода уже появились и сторонники, и критики. VentureBeat писал, что он возвращает в практику классификацию, но использует более сильные современные предварительно обученные модели: многим корпоративным системам нужны метка или решение о маршрутизации, а не абзац текста. В другом расследовании VentureBeat показал, почему дешёвую вероятностную проверку нельзя считать безотказной границей безопасности: враждебный текст во входных данных ИИ-агента может повлиять на решение модели. TypeSafe и партнёры по интеграции признавали этот риск.

Новых моделей в этой категории становится почти столько же, сколько обсуждений вокруг неё. Laya использует значительно меньшую модель на 421 млн параметров на основе ModernBERT для локального принятия решений. Джаред Палмер публикует семейство моделей Kev и материалы об их исследованиях.

Bespoke Nimble 9B предлагает адаптер с лицензией Apache и пример кода. Семейство моделей decider от Mapika охватывает несколько размеров; компания также выпускает обучающий код и карточки моделей.

Ещё один небольшой вариант, который можно запускать локально, — this-that-model от FLock. Модели различаются архитектурой, обучением, требованиями к оборудованию и надёжностью оценок уверенности. Общее название «модель принятия решений» не делает их бенчмарки взаимозаменяемыми.

Исследователи из Stanford и Nvidia выбрали близкий подход и представили открытую CLM-8B, способную кэшировать представления повторно используемых действий. По данным VentureBeat, в тестах исследователей она работала на некоторых задачах до девяти раз быстрее Jev, но уступала ей по точности вызова инструментов. Результат относится к конкретным задачам и условиям проверки, однако показывает, как быстро специализированные модели исследуют разные компромиссы между скоростью и точностью.

Что пока можно сравнить

AWS предлагает скачать и использовать модель бесплатно, без размещённого API и платы за отдельные вызовы. Однако для запуска нужно предоставить собственные процессоры или графические ускорители либо оплатить облачные вычисления. AWS не дала оценки стоимости запроса или токена, поэтому пока нельзя утверждать, что самостоятельный запуск действительно дешевле очень недорогого облачного API Jev.

AWS измеряла задержку более ранней контрольной версии Strands, тогда как для Jev приводятся показатели полного цикла обработки через облачный сервис. Различия в оборудовании и сети не позволяют уверенно определить победителя по скорости.

AWS проверяла качество на открытой части JevBench, но Jev в сравнении отсутствует. Поэтому график не подтверждает преимущество Strands по точности. Для версии 19 AWS приводит результаты отдельно, однако и там Jev не показана. TypeSafe отдельно подчёркивает калибровку вероятностей Jev при последующем обучении, но опубликованные материалы не позволяют установить, какая модель лучше справляется с этой задачей.

AWS планирует выпустить модель, код, обучающие данные и скрипты. Jev пока доступна только через API: TypeSafe не раскрывала её веса и полный рецепт обучения.

Strands можно запускать локально, в том числе на MacBook. Это позволяет компаниям оставить решения внутри собственной инфраструктуры, не отправляя запросы внешнему API.

Публикация рецепта и обучающих материалов даст разработчикам возможность проверять и дообучать Strands. Jev не предоставляет такого контроля на уровне модели.

Jev работает как облачный API: компания отправляет запрос и платит небольшую сумму за использование. Strands нужно самостоятельно разворачивать и обслуживать. Такой вариант гибче, но требует больше операционной работы.

AWS показала, как Strands Decider работает с механизмом вмешательства Strands: модель проверяет действие агента перед вызовом инструмента.

В стоимости есть простой контраст: скачать Strands можно бесплатно, а работа Jev и без того обходится почти незаметно. По указанному тарифу $0.042 за миллион входных токенов обработка миллиарда токенов стоит всего $42. AWS пока не показала, что самостоятельный запуск Strands экономит деньги с учётом оборудования, облачных вычислений и расходов на обслуживание. Экономия может быть привлекательнее для компаний, у которых уже есть свободные вычислительные ресурсы или которым важен локальный запуск ради контроля и конфиденциальности.

Главное отличие предложения Amazon — открытость и воспроизводимость. TypeSafe предлагает пользоваться Jev как сервисом, тогда как AWS публикует небольшую модель, рецепт, данные и инструменты, чтобы разработчики могли запускать и менять её самостоятельно. Для предприятий это может оказаться важнее, чем несколько дополнительных процентных пунктов в бенчмарке.

Поэтому главное преимущество AWS — пока не доказанное превосходство над Jev, а открытый и воспроизводимый слой принятия решений, встроенный в уже существующий фреймворк для ИИ-агентов.

Разработчик на Strands может поставить небольшую локальную модель перед вызовом инструмента, решать, когда из-за неопределённости нужно обратиться к человеку или вернуть управление агенту, а для задач, требующих генерации, оставить большую языковую модель. Опубликованный рецепт и возможность запуска на ноутбуке могут упростить эксперименты командам, которым важно контролировать собственную инфраструктуру.

Решающая проверка состоится за пределами примеров из анонса: нужно выяснить, сохранит ли опубликованная версия точность и хорошую калибровку на собственных правилах, документах и редких случаях компаний, а также окажутся ли локальный запуск и обслуживание выгоднее необычно дешёвого облачного Jev. Для чувствительных вызовов инструментов демка с погодой показывает возможную точку проверки, но не доказывает, что одно лишь решение модели делает ИИ-агента безопасным.

Иными словами, Amazon выпустила конкурентную альтернативу Jev. Её главное отличие — открытая модель, которую можно запускать самостоятельно и воспроизводить процесс обучения; превосходство по бенчмаркам пока не доказано.

Похоже, это старые твиты сотрудника Anthropic, уволившегося из-за угрозы человечеству, — и они… весьма странные Брайан Чески: ИИ-агентам нужна собственная операционная система Anthropic выводит Claude в гражданские ведомства, пока конфликт с Пентагоном затягивается Команда Olmo представила Olmo-core 3 — открытую масштабируемую инфраструктуру для обучения больших MoE-моделей Новая кисть робота Atlas может превзойти человекоподобные конструкции Anthropic добивается права обучать модели на контенте из Австралии с возможностью отказа, а ABC предупреждает: ИИ «поглотит» новости Стартап в сфере кибербезопасности нашёл более 13 000 скриншотов из внутренних систем компаний, которые ИИ-агенты выложили в открытый доступ Высокопоставленный руководитель BBC посмотрел полностью созданный ИИ эпизод «Доктора Кто» и назвал его «неплохим» Photon устроила похороны мобильных приложений. Теперь у неё есть $4,5 млн, чтобы заменить их агентами ИИ обыграл сильнейшего игрока в Stratego, покончив с одним из последних оплотов людей в настольных играх Satlyt, основанная бывшим продакт-менеджером Google и SpaceX, привлекла $8 млн на запуск ИИ на спутниках OpenAI пресекла кампанию по краже рассуждений своих моделей, но на Azure уловка сработала Аналитики предупреждают: дата-центры могут стать бомбой замедленного действия на $6 трлн Как старейший ИИ-стартап пытается защитить себя от пузыря изнутри ИИ научился «читать мысли» и восстанавливать увиденное по снимкам мозга ИИ-чат-боты снимают хиджабы с изображений мусульманок по просьбе пользователей Забудьте о «сверхразуме»: из-за ошибки ИИ в этом месяце мир едва не оказался на пороге третьей мировой войны Barclays масштабирует Claude, чтобы модернизировать работу и улучшить обслуживание клиентов Знакомьтесь: робот, который заботится о 74-летней Вере у неё дома Голосовой ИИ-стартап ElevenLabs удвоил оценку — до $22 млрд

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram