i
Новости
Новости · 2026-10-08

Доля компаний, готовых доверить ИИ-агентам изменения в рабочих системах, снизилась с 75% до 56% в последнем опросе VB Intelligence

@neuronium_ai @neuronium_ai

В августовском опросе VentureBeat Intelligence 56% участников из компаний, использующих автономных ИИ-агентов, сообщили, что уже разрешают некоторым изменениям попадать в рабочие системы без проверки человеком или готовят такую возможность в течение года. В июле таких ответов было 75%. При этом внедрение средств оценки надёжности продолжает расти: использование встроенных инструментов OpenAI увеличилось с 31% до 59%. Опрос также показал, что многие компании сталкивались с клиентскими сбоями после того, как функция проходила внутренние проверки, а автоматические проверки качества в реальном времени остаются основным способом мониторинга лишь у меньшинства.

Обложка: Доля компаний, готовых доверить ИИ-агентам изменения в рабочих системах, снизилась с 75% до 56% в последнем опросе VB Intelligence

Изменение заметно и среди тех, кто принимает окончательные решения о закупках ИИ: доля участников из компаний с автономными агентами, которые разрешают изменения без проверки или готовятся к этому, снизилась с 88% в июле до 61% в августе. В августовском опросе таких руководителей было 53% из 140 респондентов, тогда как в июльском — 44%. Состав участников мог повлиять на общий результат, но сдвиг произошёл и внутри группы лиц, принимающих решения.

Это указывает на изменение взглядов среди опрошенных компаний, хотя результаты не обязательно отражают весь рынок: оба опроса VentureBeat проводились среди разных групп читателей и участников панели, которые сами согласились ответить.

Сдвиг начался до того, как генеральный директор Anthropic Дарио Амодей опубликовал 12 сентября резонансное эссе «Нам нужно замедлить развитие передовых ИИ». В нём он призвал замедлить развитие передовых моделей и усилить контроль за безопасностью. Позже за большую осторожность высказались и другие руководители отрасли, включая генерального директора OpenAI Сэма Альтмана и Демиса Хассабиса из Google DeepMind.

Поскольку опрос проходил в августе, изменения в ответах не могли быть прямой реакцией на эссе Амодея. При этом данные не показывают, что именно заставило компании осторожнее относиться к автономному развёртыванию.

Среди результатов заметен контраст: компании реже готовы полагаться на автоматические оценки при принятии решений о выпуске изменений, но продолжают внедрять инструменты для таких оценок. Использование встроенных средств оценки OpenAI выросло с 31% в июле до 59% в августе.

Кроме того, 61% респондентов из компаний, которые проверяют системы до выпуска, сообщили хотя бы об одном случае за последние 12 месяцев, когда ИИ-агент или функция на основе большой языковой модели прошла внутреннюю проверку, но затем вызвала проблему у клиентов.

Вместе эти результаты показывают, что компании разделяют две задачи: использовать автоматические оценки для проверки ИИ-систем и поручать им единолично решать, можно ли выпускать изменения в рабочие системы.

Компании сохраняют человеческий контроль

Ответы за август разделили компании на несколько групп. Среди всех 140 участников опроса 27% уже разрешают некоторым агентам с низким уровнем риска выпускать изменения без проверки человеком, 35% не планируют этого в обозримом будущем, а 20% готовят такую возможность в течение следующих 12 месяцев. Ещё 16% не используют автономных агентов, а 2% затруднились ответить.

Если исключить компании, которые не используют автономных агентов, 32% респондентов уже разрешают выпускать без проверки изменения или обновления с низким уровнем риска, а ещё 24% создают для этого условия. При этом 42% рассчитывают сохранять проверку человеком в обозримом будущем.

Последняя доля стала одним из наиболее заметных изменений: среди компаний с автономными агентами доля тех, кто намерен сохранять человеческое одобрение, выросла с 20% в июле до 42% в августе. Изменение было статистически значимым.

Однако рост поддержки человеческого контроля не сопровождался сопоставимым изменением приоритетов расходов на надёжность. На вопрос, в какую одну область надёжности или оценки компании больше всего увеличат вложения в течение следующего года, участники августовского опроса ответили так:

Процессы проверки человеком — 30%
Инструменты наблюдения за рабочими системами — 26%
Автоматизированные пайплайны оценки — 21%
Оценка безопасности и соблюдения политик — 11%
Увеличения бюджета на надёжность не будет — 11%

Эти цифры показывают, какую область участники считают наиболее быстро растущей по инвестициям, а не то, как компании фактически распределяют расходы.

Июльские результаты были похожими: 31% выбрали процессы проверки человеком, 30% — наблюдение за рабочими системами, 19% — автоматизированные пайплайны оценки и 16% — оценку безопасности и соблюдения политик.

Проверка человеком осталась самым частым ответом и в августе, но её отрыв от наблюдения за рабочими системами оказался слишком мал, чтобы считать разницу статистически значимой. Результаты также не доказывают, что компании сокращают расходы на оценку или перенаправляют деньги от автоматизации.

Оценка безопасности и соблюдения политик охватывает больше, чем точность модели: она проверяет, откажется ли агент от запроса, когда это необходимо, будет ли следовать правилам и станет ли избегать вредных ответов.

Доля участников, которые назвали оценку безопасности и политик самой быстрорастущей областью вложений, снизилась с 16% до 11%. Это не означает, что фактические расходы на такие проверки упали. Лишь меньше участников августовского опроса выбрали эту область как единственное направление, где их компания ожидает наибольшего роста вложений в надёжность.

В целом компании продолжают развивать и человеческий, и автоматизированный контроль, одновременно пересматривая, какие решения можно доверять только машинам.

Внутренние проверки не предотвращают все сбои у клиентов

Одна из причин, по которой компании могут не спешить отказываться от проверки человеком, — разрыв между внутренними оценками и работой системы в реальных условиях. Однако опрос не доказывает, что именно сбои проверок изменили отношение компаний к развёртыванию агентов.

VentureBeat спросил, случалось ли, что функция на основе ИИ или большой языковой модели прошла внутренние проверки, но затем вызвала проблему у клиентов. Если не учитывать 5% участников, чьи компании не проводят проверки перед выпуском, 61% сообщили хотя бы об одном таком случае за последние 12 месяцев. Ещё 22% сообщили о нескольких случаях.

Сопоставимый показатель за июль составил 53% среди 101 респондента. Ранее VentureBeat публиковал долю 49%, рассчитанную по всем 108 июльским участникам.

В августе доля оказалась численно выше, но статистически значимой разницы нет. Поэтому опрос не подтверждает, что организаций, столкнувшихся со сбоем после успешной проверки, действительно стало больше.

Одно более узкое изменение было статистически значимым: доля компаний, сообщивших ровно об одном таком сбое, выросла с 27% в июле до 39% в августе.

Важно учитывать, что речь идёт о доле компаний, столкнувшихся хотя бы с одним сбоем, а не о частоте отказов отдельных агентов или выпусков. У компании, которая внедрила сотни ИИ-функций, больше возможностей столкнуться с проблемой у клиентов, чем у компании с несколькими такими функциями.

Доверие к системам, призванным выявлять подобные проблемы, остаётся невысоким. Лишь 9% участников августовского опроса выбрали ответ «сегодня мы доверяем автоматизированной оценке», когда их спросили, какое ограничение сильнее всего снижает доверие к автоматическим проверкам ИИ-агентов. В июле так ответили 13%, в июне — 5%.

Снижение с июля по август не было статистически значимым. Кроме того, участникам предлагалось выбрать только одну главную причину для беспокойства. Поэтому результат не означает, что остальные 91% совсем не доверяют автоматическим оценкам.

Чаще всего участники называли несоответствие оценок результатам в реальных условиях — 27%. Другими опасениями стали недостаток объяснимости — 24%, предвзятость или непоследовательность оценки — 16%, утечка данных или вопросы конфиденциальности — 13% и незрелость инструментов — 12%.

При этом участники, чьи компании сталкивались со сбоями после успешной внутренней проверки, не проявляли заметно меньшей готовности двигаться к автономному развёртыванию. Среди августовских респондентов из компаний с автономными агентами 59% тех, кто сообщил о таком сбое, уже разрешали выпускать изменения без проверки человеком или готовились к этому. Среди тех, кто не сообщал о сбое, доля составила 55%. Разница слишком мала, чтобы говорить о значимой связи.

Это отличается от результатов июльского опроса: тогда компании, столкнувшиеся со сбоями после успешной оценки, выглядели более склонными к развёртыванию без участия человека. В августе эта связь не подтвердилась.

Августовские результаты говорят о более сложной картине, чем простой отказ компаний от автоматизации из-за ненадёжности проверок. Компании осторожнее относятся к снятию человеческого контроля при выпуске изменений, но продолжают внедрять инструменты оценки и вкладываться в инфраструктуру.

Вопрос теперь не в том, будут ли компании автоматизировать оценку агентов, а в том, сколько полномочий они дадут этим оценкам без вмешательства человека.

Как компании проверяют агентов после выпуска

Проверки перед выпуском — лишь один уровень контроля. Не менее важно понимать, что агент делает уже после запуска.

Среди 118 участников августовского опроса, чьи компании используют автономных агентов, только 29% назвали основным способом производственного мониторинга автоматические проверки качества ответов в реальном времени.

Ещё 36% в основном полагаются на журналирование трасс транзакций. Оно записывает активность инфраструктуры, число токенов, входные и выходные данные для последующей отладки, но само по себе не обязательно оценивает правильность ответа агента.

Это создаёт риск: быстрый и уверенный, но ошибочный ответ может оставить чистую трассу и код состояния 200 — то есть запрос HTTP будет считаться успешно выполненным.

Основные способы мониторинга в компаниях с автономными агентами распределились так:

Журналирование трасс транзакций — 36%
Проверки качества в реальном времени — 29%
Отслеживание инфраструктуры через шлюз API — 16%
Не знаю или это не моя область — 11%
Нерегулярная проверка — 8%

Всего 53% участников назвали основным способом мониторинга журналирование транзакций или отслеживание через шлюз. Оба метода помогают выявлять проблемы инфраструктуры, но, как было сформулировано в опросе, напрямую не проверяют правильность ответов агента.

Разрыв особенно заметен среди компаний, которые уже разрешают автономное развёртывание. Согласно анализу августовского опроса VentureBeat Intelligence, лишь 10 из 38 участников из таких компаний назвали основным способом мониторинга автоматические проверки качества ответов в реальном времени.

Это около 26% — примерно столько же, сколько 28% среди 40 сопоставимых участников в июле. Результаты показывают, что отказ от человеческого одобрения при выпуске изменений не обязательно означает, что компании делают автоматическую проверку качества ответов основной защитой в рабочей среде.

Однако результаты не доказывают, что у остальных компаний нет дополнительных средств контроля качества. Некоторые могут использовать другие автоматические проверки или дополнительные формы проверки, которые не охватывал вопрос с одним вариантом ответа.

Тем не менее мониторинг во многих компаниях, по-видимому, чаще проверяет, работает ли система технически, чем правильно ли она отвечает. Это особенно важно, когда компании разрешают ИИ-агентам выпускать изменения без одобрения человека.

Отказ от проверки человеком перед выпуском не исключает автоматического обнаружения проблем после него. Но если компания в основном следит за инфраструктурой, правдоподобный, но неверный ответ агента может не вызвать ни ошибки, ни предупреждения.

Августовский опрос не показывает, сколько компаний, разрешающих выпуск без проверки человеком, вовсе не используют мониторинг качества ответов в реальном времени. Он также не устанавливает, как обычно обнаруживаются проблемы: с помощью автоматических оповещений, сотрудников или жалоб клиентов.

Для компаний, которые хотят расширить автономность агентов, остаётся практическая задача: автоматические проверки должны выявлять не только сбои инфраструктуры, но и ответы, которые корректно сформированы и доставлены, однако остаются неверными.

Компаниям, расширяющим применение агентов, нужно понять, как наладить эффективный контроль качества после выпуска, не полагаясь только на клиентов или сотрудников, которые заметят проблему.

Рынок поставщиков

Рынок инструментов для оценки ИИ и наблюдения за его работой тоже неоднороден.

Платформа разработчика OpenAI присутствует в 59% технологических стеков против 31% в июле. Рост статистически значим. Среди участников августовского опроса, ответивших на вопрос о платформе, 40% назвали OpenAI основной платформой оценки.

Среди компаний, использующих встроенные инструменты оценки OpenAI, около 69% назвали их своей основной платформой. Это разные показатели: первый отражает долю OpenAI среди основных платформ всех участников, второй — как часто компании, уже использующие инструменты OpenAI, выбирают их в качестве главной платформы.

Confident AI присутствует в 36% стеков, а 10% всех респондентов назвали её основной платформой. Среди компаний, использующих Confident AI, 29% указали её как основную.

Braintrust используется в 23% стеков и является основной платформой для 12% всех участников. Anthropic присутствует в 16% стеков и указана как основная платформа 10% респондентов. LangSmith есть в 13% стеков, но основной её назвали 2% участников.

Для корректного сравнения долей использования и выбора основной платформы в августе использовали одну и ту же базу из 136 респондентов. Участники могли отметить несколько используемых инструментов, но выбрать только одну основную платформу, поэтому доли использования не исключают друг друга.

Главное изменение за месяц — рост использования OpenAI с 31% до 59%. Доля Confident AI тоже увеличилась: с 27% в июле до 36% в августе, но это изменение не было статистически значимым.

VentureBeat Intelligence не сравнивала доли поставщиков среди основных платформ за два месяца: в июльском опросе участники могли выбрать основной платформой инструмент, который не отметили среди используемых. Это мешает прямому сравнению.

Что касается планов развития инфраструктуры, 62% участников августовского опроса собираются в течение 12 месяцев внедрить новую платформу оценки, добавить её к существующей или заменить имеющуюся. Более трети — 35% — планируют сделать это в течение трёх месяцев.

Такие планы не обязательно означают, что компании недовольны нынешними поставщиками или собираются от них отказаться. Среди участников есть те, кто хочет добавить платформу к уже используемым инструментам, и те, кто рассматривает замену.

Для поставщиков это показывает разницу между платформой, которая играет ключевую роль в технологическом стеке, и инструментом, который просто в него входит. По мере развития технологий это может повлиять на конкурентные позиции и риск непродления контрактов.

Однако опрос напрямую не измеряет удержание клиентов, долю продления контрактов или вероятность отказа от платформы, используемой как дополнительный инструмент. Пока это возможные последствия для конкуренции, а не установленные результаты.

Разрыв в доверии к ИИ в компаниях меняется, но не исчезает

Августовский опрос VentureBeat Intelligence выявил противоречие на рынке корпоративного ИИ: компании продолжают внедрять инфраструктуру оценки, но осторожнее относятся к использованию её результатов как единственного основания для выпуска изменений без одобрения человека.

Среди участников из компаний с автономными агентами доля тех, кто уже разрешает выпуск без проверки или готовится к нему, статистически значимо снизилась с 75% до 56%. Доля ожидающих, что человеческая проверка сохранится в обозримом будущем, более чем удвоилась — с 20% до 42%.

При этом большинство участников из компаний, проводящих проверки до выпуска, сообщили хотя бы об одном сбое у клиентов после успешной внутренней проверки. А среди компаний с автономными агентами лишь 29% назвали основным способом мониторинга проверку качества ответов в реальном времени.

Это указывает на нерешённые проблемы в системах, с помощью которых компании оценивают надёжность агентов. Но результаты не доказывают, что оценки стали менее эффективными или что именно описанные сбои заставили компании пересмотреть уровень автономности.

Компании не отказываются от технологии: использование инструментов оценки OpenAI заметно выросло, а почти две трети участников августовского опроса рассчитывают в течение года внедрить, добавить или заменить платформу оценки.

Для команд, работающих с корпоративным ИИ, автоматизация оценки и автоматизация одобрения выпуска — разные решения, и ошибки проверок несут для них разные последствия.

По мере того как агенты получают возможность менять всё более важные бизнес-системы, компаниям предстоит решить не только, полезны ли автоматические оценки, но и когда их результат достаточно надёжен, чтобы убрать человека из процесса окончательного одобрения.

Августовский опрос показывает, что для всё большей доли его участников этот порог пока не достигнут.

Блогеры продвигают дешёвые копии очков Meta AI без «раздражающего мигающего огонька» записи Умное кольцо Natura за $99 переносит ИИ-агентов на ваш палец Тейлор Свифт подала заявку на домен верхнего уровня .taylorswift Anthropic укрепляет приверженность научным открытиям в США Бум ИИ взвинтил аренду в Сан-Франциско до небес: «людям больше некуда деваться» Едва вышла новая книга Кевина Руса об ИИ-индустрии, как мошенники на Amazon начали продавать её ИИ-копии ИИ-ролик One Nation — мерзкий и бездарный, но превращение австралийской политики в ИИ-помойку на этом не заканчивается Прорывы ИИ в математике заставили исследователей Ethereum спорить, как скоро рухнет защита криптокошельков Исследователи Zenity: одной фразы хватило, чтобы захватить всех ИИ-агентов в аккаунте AWS Этой бесплотной кисти хватает, чтобы заменить целого робота Google Cloud представила постоянных Gemini-агентов для долгих задач с собственными Gmail, Calendar и Drive-хранилищами «Кто-нибудь сделает это дешевле»: беженцы в Кении зарабатывают всё меньше, помогая развивать технологии Некоммерческая организация Тристана Харриса увольняет большую часть сотрудников и переходит к управлению основателями Прорывы в робототехнике на базе ИИ ещё нескоро изменят вашу жизнь Co-op Legal Services оценивает с помощью ИИ звонки сотрудников клиентам Microsoft выпускает новые ИИ-ПК на чипах Nvidia с обновлённой Windows 11 Healthleap привлекла $38 млн на ИИ-платформу, которая выявляет пациентов, требующих внимания врачей Завышенная оценка Firmus может снизиться перед ожидаемым выходом на ASX Стартап Mecka AI привлёк от Sequoia $60 млн на данные для роботов Всегда ли лучшая работа означает, что и специалисты стали лучше?

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram