Бенчмарк Vals AI показывает стоимость приложения в сравнении с результатом в Vibe Code Bench. Стрелки ведут от одиночного агента каждой модели к команде агентов при той же интенсивности рассуждений. Команды обходятся гораздо дороже, но почти не улучшают результаты
Источник: the-decoder.com
Результаты указывают, что в большинстве случаев дополнительные расходы на команды агентов не оправданы — особенно если модели и так работают на максимальных вычислительных ресурсах.
В двух собственных тестах Anthropic качество улучшалось всё меньше по мере добавления агентов в команды с Opus 5.5. Большие команды быстрее достигали заданного уровня качества, но переход от 10 агентов к 100 лишь немного поднял баллы за 24 часа. В отдельных тестах ProgramBench ускорение также потребовало больше токенов.
На задаче доказательства теорем Lean модель Fable 5.1 показала более заметный прирост качества при увеличении команды свыше 10 агентов, но во всех тестах всё равно уступила Opus 5.5. А на задаче с базой знаний результат Fable немного снизился при переходе от 30 агентов к 100.
Больше агентов — быстрее, но не лучше
Исследователь OpenAI Ноам Браун подтвердил в подкасте Dwarkesh Podcast, что мультиагентные системы в основном дают выигрыш в скорости, а не в качестве. Четыре агента решали задачи вдвое быстрее, но и стоили вдвое дороже. При 16 агентах соотношение сохранялось, хотя эффективность немного снижалась.
Эффект сильно зависит от задачи, отметил Браун. Веб-исследования и математику удобно распараллеливать, а написание романа — нет. Отправить на эту работу 10 000 агентов было бы так же бессмысленно, как привлечь 10 000 человек. По словам Брауна, работу с очень большими командами агентов пока почти не изучали: такие испытания обходятся слишком дорого.
Разработчик OpenAI Эрик Прованшер недавно по той же причине предостерёг от использования больших групп агентов. По его мнению, это, скорее всего, пустая трата денег: агенты плохо координируются друг с другом. Прованшер назвал эту проблему «налогом на координацию».
Источник: the-decoder.com
Читайте также
Эксперты предупреждают: камеры Flock — лишь начало антиутопической слежки, которая превращает жизнь в ад
Этот график расходов на дата-центры на фоне всего остального строительства вас ужаснёт
Эти руководители считают, что голосовой ИИ ещё не пережил свой момент ChatGPT
Исследование: ИИ-агенты завышают свои результаты и пока далеки от автономных исследований
Криптогуру опасаются, что ИИ взломает математику блокчейна и позволит хакерам безнаказанно красть средства
Даже между ИИ-агентами-мужчинами и женщинами есть разрыв в оплате труда
При Трампе вернулось обещание эпохи Рейгана: ИИ разгонит экономику — и долг перестанет быть проблемой
Я сделал ужасные игры с ИИ-песочницей Google
ArXiv ограничивает подачу двумя статьями в месяц: поток ИИ-публикаций перегружает сервер препринтов
Дешёвые токены ИИ подстёгивают спрос — именно на это и рассчитывает Дженсен Хуанг
Odyssey-3 — новая генеративная модель мира, которую можно опробовать бесплатно
Оценка Lancet: ядерная война и злонамеренное применение ИИ грозят гибелью человечества к 2100 году
Сатья Наделла из Microsoft: моделям ИИ нужен «аварийный тормоз»
Apple раскрыла сделку по найму команды и лицензированию технологий стартапа персонализированных подкастов Huxe
Одна из последних уцелевших в США каштановых рощ может вскоре исчезнуть ради ИИ-дата-центра
Пользователи Mac стирают с устройств все следы Apple Intelligence
OpenAI: сбившаяся с курса модель намеренно разрушила собственную среду, рассчитывая начать заново с лучшими данными
Умники из Anthropic заявили, что с помощью Claude «решили» задачу юмора
Microsoft вступила в борьбу за быстрорастущий рынок ИИ-моделей для принятия решений с Decision-1
Ведущие новостных каналов заговорили о скором крахе пузыря ИИ
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram