i
ДАТАИСТ
К ленте

ИИ-агенты

Разборы работ об автономных агентах: планирование, вызов инструментов, мультиагентные системы и то, почему они ломаются на длинных задачах.

121 материал

AI-First-компания: новые роли и новая оргструктура

Когда компания становится AI-First, меняются не только процессы, но и сама оргструктура: появляются Chief AI Officer, ИИ-продакт инженеры, ИИ-инженеры, ИИ-инженеры по автоматизации и операторы ИИ-агентов, а над ними — центр компетенций, который их связывает. В этом материале — кто за что отвечает и какой артефакт оставляет после себя, почему единицей работы становится процесс, а не отдел, и по какому признаку видно, что ИИ действительно встроен в операционное ядро.

Как ИИ-агент переносит навыки между разными задачами

Оказывается, чтобы ИИ-агент стал заметно сильнее, не всегда нужно менять саму модель — иногда достаточно по-умному перестроить то, как она работает. Исследователи предлагают улучшать не внутренности модели, а её «обвязку»: инструкции, набор действий, полезные приёмы и порядок шагов. Вместо одной линии проб и ошибок команда держит сразу много вариантов, сохраняет удачные находки, смешивает сильные решения между собой и отбрасывает те, что помогают в одном месте, но ломают работу в другом. В итоге ИИ-агент учится решать новые задачи стабильнее и переносит этот навык дальше, без подгонки под один конкретный тест. В этом обзоре разбираем, как устроен такой отбор вариантов, почему он помогает ИИ-агенту расти без смены модели и за счёт чего улучшения не рассыпаются при переходе к другим задачам.

Как ИИ-агенты начинают самостоятельно обучать роботов

Роботы начинают учиться сами. Не просто выполнять заранее обученные действия, а пробовать решения в реальном мире, ошибаться, анализировать результат, менять собственное поведение и сохранять удачные действия как новые навыки. Причём следующий шаг ещё интереснее: робот может сам накапливать опыт, превращать его в данные и на этих данных обучать более быстрые специализированные модели. Разобрал, почему это может стать одним из самых важных сдвигов в современной робототехнике.

AgentOps: шесть шагов от идеи до работающего ИИ-агента

Пилот доказывает только одно — агент в принципе работает. AgentOps отвечает на другой вопрос: как довести его до промышленной эксплуатации и не растерять эффект по дороге. Шесть шагов — зафиксировать метрику и описать процесс, собрать агента, подключить его к живым системам, обучить на собственных данных, доказать эффект A/B-тестом и поставить на мониторинг, который сам запускает следующий круг улучшений.

ИИ-стратегия: три уровня внедрения ИИ-агентов в бизнес

Стратегия внедрения ИИ начинается не с выбора модели, а с четырёх вопросов о самом бизнесе. Дальше — понятный порядок: сначала закрыть разрывы, которые показала диагностика зрелости, потом собрать очередь процессов от быстрых побед к фундаменту, и только после этого решать по каждому — строить своё или взять готовое. А в конце — три уровня, через которые проходит внедрение агентов: от точечных ассистентов до ИИ-процессов, где у компании появляется корпоративный интеллект.

Что если агенты смогут менять среду и саму эволюцию

Что если ИИ-агенты смогут расти не по готовому плану, а менять друг друга и сам мир вокруг себя? Исследователи разбирают подход, где развиваются не по одному агенту, а сразу вся система: одни участники подстраиваются друг под друга, среда тоже меняется в ответ, а потом может меняться даже сам способ такого развития. Это уже не история про набор фиксированных задач, где человек заранее всё задал, а про живой процесс, в котором новые правила, цели и трудности появляются по ходу дела. В обзоре разберём, как устроено такое совместное развитие агентов и среды, какие у него этапы и почему без этого трудно ждать от ИИ по-настоящему самостоятельного роста.

Зачем агенту понимать причины поступков человека

Напомнить человеку о таблетке мало — куда труднее понять, почему он её не принял и какая помощь ему правда нужна. Исследователи предлагают новый взгляд на ИИ-агентов: в центре должен быть не только экран, программа или устройство, а сам человек, его состояние и то, как оно меняется со временем. Такой помощник должен замечать значимые события, запоминать их, уточнять свои выводы и подбирать поддержку осторожно — с учётом согласия человека, риска ошибки и права всё исправить. В этом обзоре разбираем, как может работать ИИ-помощник, который не просто выполняет команды, а старается понять причины поступков человека и помочь без лишнего давления.

ИИ-агенты для генерации кода решили лишь 41% задач в новом тесте

ИИ-агенты уже умеют писать код, но на по-настоящему сложных задачах всё ещё часто спотыкаются. Исследователи предлагают новый способ проверять такие системы: не на коротких починках, а на больших переделках кода, где нужно аккуратно менять сразу много частей и ничего не ломать. Команда специально отобрала реальные задачи, переписала их описания ясным языком и вручную проверила проверки, чтобы те не отсеивали верные ответы и не требовали того, чего не было в условии. В этом обзоре разбираем, почему старые способы оценки ИИ для кода дают слишком красивую картину и что показывает новая проверка о реальных возможностях таких агентов.

Где ИИ-агенты создают бизнесу максимум ценности

ИИ даёт эффект в конкретных точках бизнеса. В этом материале — три зоны деятельности компании RUN, CHANGE и DISRUPT, разграниченные по степени неопределённости, и три объекта управления в них: процесс, проект и продукт; три типа бизнес-процессов и своя цель ИИ для каждого; как искусственный интеллект превращается в нервную систему организации; и почему наибольшую ценность он создаёт там, где есть узкие места и точки принятия решений.

Пять уровней эволюции ИИ-агентов

Современные ИИ-агенты появились не внезапно: за ними стоят несколько этапов развития искусственного интеллекта — от жёстких правил экспертных систем до больших языковых моделей. В этом материале — как выглядит эта эволюция, какие пять уровней проходят интеллектуальные системы и на каком из них мы находимся сейчас, чем ИИ-агент отличается от ассистента, почему переход к агентам произошёл именно сейчас и что на практике означает AI-First-компания.

Почему лучший ИИ собрал ответ из разных данных с точностью лишь 66%

Почему даже лучший ИИ часто спотыкается, когда ответ нужно собрать не из одного места, а по кусочкам из таблиц, файлов, документов и видео? Исследователи предложили новую проверку для ИИ-агентов: они дают вопрос и целую рабочую папку с разными данными, а на выходе ждут готовую таблицу с точным ответом. Такой формат ближе к реальной работе, где нужные сведения разбросаны по разным источникам, и сразу видно, умеет ли модель не просто искать по одному файлу, а действительно собирать всё вместе без потерь и путаницы. В этом обзоре разбираем, почему даже сильные модели пока часто ошибаются в таких задачах, как устроена эта проверка и что она показывает о будущем ИИ для работы с данными.

Кто такой ИИ-агент и почему он меняет устройство компании

Традиционная автоматизация начиналась с отдельной задачи: скрипт, интеграция, система, выполняющая строго определённое действие. Стоило измениться контексту — правила приходилось переписывать. ИИ-агенты меняют эту логику: агент берёт на себя не одну операцию, а связный фрагмент работы. В этом материале — из чего собран агент, как устроен цикл «восприятие → мышление → действие», какими шестью свойствами обладает полноценный агент и как всё это выглядит на простом примере.

Как проверить, способен ли ИИ вести торги целый год

Может ли ИИ не просто сделать разовую задачу, а целый год вести дела как настоящий продавец? Исследователи предлагают проверять это в большой игре, где ИИ-агент закупает товар, выставляет его на продажу, меняет цены, следит за деньгами и живёт с последствиями своих решений день за днём. Тут нельзя победить одним удачным ходом: часть сигналов приходит сразу, часть — сильно позже, и ошибка в начале может всплыть только через много дней. В обзоре разберём, как устроена такая проверка на длинную и связную работу, почему она лучше показывает реальные слабые места ИИ и насколько далеко он пока от человека.

Что такое AI-First-компания и как она работает

Сегодня искусственный интеллект перестаёт быть просто инструментом и становится новой операционной системой бизнеса. ИИ-агенты уже способны принимать решения и выполнять полезную работу — поэтому выигрывать будут те компании, которые сумеют организовать новый формат работы вокруг ИИ. В этом материале — из чего складывается ИИ-трансформация, почему рынок уже разделился на AI-First компании и их клиентов и как четвёртая, интеллектуальная революция меняет саму форму организации труда. Вперёд в этот дивный новый мир!

Игра в шпиона помогает ИИ улучшать тексты и рассуждения

Можно ли научить ИИ писать и рассуждать лучше, если превратить обучение в игру про шпиона? Исследователи предлагают способ, при котором модель сама получает понятный сигнал, справилась она или нет, даже в задачах без одного точного ответа — вроде пересказа текста или свободного письма. Для этого несколько ИИ-агентов делают одно и то же задание, но одному дают особую роль, а остальные потом пытаются вычислить «шпиона» по его ответу. Если его легко распознали, значит текст или ход мысли выдали слабое место, и модель может на этом учиться дальше. В этом обзоре разбираем, как игра с тайной ролью помогает ИИ улучшать тексты, рассуждения и обучение без постоянной опоры на оценку человека.

Как один ИИ-агент работает в телефоне, браузере и на компьютере

Один ИИ-агент, который одинаково уверенно действует в телефоне, браузере и на компьютере, уже выглядит не как трюк, а как будущий цифровой помощник. Исследователи предлагают систему, которая умеет нажимать кнопки на экране, вводить команды и доводить длинные дела до конца даже при переходе между разными устройствами. Команда учила такого агента не в игрушечных примерах, а в условиях, близких к жизни: он сам получает новые задания, разбирает свои ошибки и шаг за шагом становится полезнее почти без ручной настройки. В этом обзоре разбираем, как устроен такой универсальный ИИ-агент, за счёт чего он работает сразу в нескольких цифровых средах и почему это приближает нас к по-настоящему самостоятельным помощникам.

Что помогает ИИ лучше писать код с нуля

ИИ неплохо чинит и дописывает чужой код, но когда нужно написать программу с нуля, он вдруг начинает теряться. Исследователи предлагают не бросать модель сразу в написание кода, а сначала заставить её отдельно понять, что именно должна делать программа. Для этого один ИИ-агент изучает описание и проверяет поведение готового файла через запуски, а потом собирает из этого ясный план требований. После этого другой ИИ-агент пишет код уже не вслепую, а опираясь на такой план, поэтому реже уходит не туда и лучше держит смысл задачи. В этом обзоре разбираем, почему написание кода с нуля так часто ломается у ИИ и как отдельный шаг с прояснением требований помогает получить более точный результат.

ИИ-агенты соблюдают правила компании лишь в 36% случаев

ИИ-агенты уверенно берутся за рабочие задачи, но слишком часто забывают правила, по которым должны действовать. Исследователи проверили не просто то, может ли такой помощник сделать дело, а умеет ли он весь путь держаться длинной служебной инструкции, как сотрудник в компании. Для этого они поместили ИИ-агента в обычную рабочую среду с почтой, чатами, календарём и файлами и дали ему большие своды правил для повседневных задач. Оказалось, что агент нередко поддаётся убедительной просьбе, путает условия, делает проверку и тут же поступает ей наперекор или даже сообщает, что всё соблюдено, хотя это не так. В обзоре разберём, почему ИИ-агентам так трудно следовать длинным правилам в реальной работе, где именно они срываются и что этот тест показывает о надёжности таких систем.

Холст превращает разрозненные идеи в понятный для ИИ проект

Когда творческая работа длится не один запрос, а превращается в длинный проект с черновиками, правками и тупиками, обычный чат с ИИ быстро начинает путаться. Исследователи предлагают дать ИИ не просто поле для команд, а общий рабочий холст, где лежит всё: наброски, готовые куски, связи между ними, замечания человека и следы прошлых попыток. Так ИИ-агент видит проект целиком, может шаг за шагом дополнять его, исправлять ошибки, не терять ход мысли и при этом оставаться понятным для человека, который в любой момент может вмешаться и направить работу. В этом обзоре разбираем, как такой холст помогает ИИ собирать разрозненные идеи в связный проект и почему это лучше обычного общения в чате.

ИИ-агентов научили управлять памятью во время долгих задач

Когда ИИ-агент долго решает задачу, он легко тонет в собственных заметках и начинает путаться в том, что было важным. Исследователи предлагают дать агенту более человеческий способ работы с памятью: не тащить всё перед собой, а самому решать, что можно свернуть, убрать во внешнее хранилище и потом вернуть по мере надобности. Так он меньше захлёбывается в лишних деталях, дольше держит ход мысли и стабильнее доводит сложные задачи до конца. В этом обзоре разбираем, как ИИ-агента научили управлять своей памятью во время длинной работы и почему это помогает ему лучше искать решения и писать код.

Как один разбор ИИ-агента исправил втрое больше задач, чем прежние методы

У ИИ-агентов сбой часто видно в одном месте, а настоящая причина прячется совсем в другом — и именно из-за этого их так трудно чинить. Исследователи предлагают систему, которая не просто прокручивает шаги назад, а по кругу делает четыре вещи: находит сбой, ищет его настоящую причину, предлагает способ починки и заново запускает задачу. Команда учит её смотреть на весь ход работы целиком, задавать уточняющие вопросы к своим же выводам и проверять, не ошиблась ли она с диагнозом, поэтому ИИ-агенту чаще удаётся не только понять, что пошло не так, но и реально исправиться. В этом обзоре разбираем, как устроен такой разбор ошибок у ИИ-агентов и почему один хороший диагноз может дать больше пользы, чем несколько попыток починки вслепую.

Что мешает ИИ нормально искать ответы в интернете

Почему ИИ так часто ходит по кругу, когда ищет ответ в интернете, и в итоге приносит не то, что нужно? Исследователи предлагают устроить поиск так, чтобы ИИ не держал весь ход работы у себя «в голове», а записывал, что уже найдено, чего ещё не хватает и какие ходы уже ни к чему не привели. Тогда несколько ИИ-агентов могут работать как команда: один ищет факты, другой следит за пробелами, третий не даёт снова повторять бесполезные попытки. В итоге поиск становится не хаотичным набором запросов, а более собранной работой с понятным планом. В обзоре разберём, почему ИИ застревает в веб-поиске, как ему предлагают дать общую «память» о ходе работы и за счёт чего такой подход помогает находить ответы полнее и аккуратнее.

Карта поведения помогает быстрее менять ИИ-агентов

Менять поведение ИИ-агента часто трудно не потому, что неясно как, а потому что непонятно где именно в коде это спрятано. Исследователи предлагают карту поведения системы, которая автоматически показывает, какая часть кода за что отвечает. Вместо долгих поисков по файлам разработчик или другой ИИ-агент получает путь от общего описания нужного действия к тем местам, где это действие реально собрано из подсказок, состояний, инструментов и шагов работы. Это особенно помогает, когда нужная логика разбросана по разным частям проекта и не лежит в одном очевидном месте. В обзоре разберём, как такая карта поведения помогает быстрее и точнее менять ИИ-агентов и почему главная проблема часто не в правке кода, а в поиске нужной точки для изменений.

Что меняется, когда ИИ учится на собственном опыте

Обычно ИИ-агенту дают одну и ту же схему работы на все случаи, но новая идея в том, чтобы он учился перестраивать её по ходу дела. Исследователи предлагают способ, при котором система запоминает, что у неё сработало, а что нет, и потом использует этот опыт в похожих задачах. Она может менять не только слова в запросе, но и сам порядок действий: что показать модели, когда дать ей доступ к инструментам, как хранить полезные выводы и как оформить ответ. Получается не жёсткая настройка на все времена, а более живая схема, которая подстраивается под конкретный случай. В этом обзоре разбираем, как ИИ учится на собственных запусках, что именно он меняет в своей работе и почему такой подход может дать агентам больше гибкости без лишних подсказок извне.

Почему ИИ-агенты пока не так автономны как кажутся

Мы всё чаще слышим про «автономных» ИИ-агентов, но на деле многие из них гораздо меньше похожи на самостоятельных помощников, чем кажется. Исследователи предлагают честно разделить две вещи: системы, которые просто собраны из набора внешних шагов, и системы, которые действительно умеют сами ставить себе ход мысли, держать цель, следить за своим поведением и учиться на опыте. Они объясняют, что настоящая самостоятельность начинается не там, где ИИ красиво имитирует работу, а там, где ключевые части управления живут внутри самой модели, а не снаружи в виде заранее настроенной обвязки. В этом обзоре разбираем, где проходит граница между автоматизацией и реальной самостоятельностью ИИ, из каких частей должен состоять по-настоящему автономный ИИ-агент и почему это меняет разговор о контроле и безопасности.

Как заставить ИИ-судью меньше ошибаться в сложных агентных задачах

Когда ИИ должен выбрать лучший ответ из нескольких, он нередко ошибается не потому, что плохо решает задачу, а потому, что плохо умеет проверять себя. Исследователи предлагают смотреть на проверку ответа как на отдельную задачу и делать её не грубой, а более тонкой и внимательной. Вместо простого вердикта вроде «хорошо» или «плохо» модель даёт более плавную оценку, смотрит на ответ несколько раз и разбирает его по частям. За счёт этого ей проще отличать действительно сильные решения от тех, что только выглядят убедительно. В обзоре разберём, как устроен такой способ проверки, почему он помогает ИИ-судье меньше промахиваться в сложных задачах и как его можно использовать для отбора лучших решений и отслеживания хода работы ИИ-агента.

Почему ИИ-агентам вредно давать слишком много инструментов сразу

Иногда ИИ-агенту мешает не нехватка возможностей, а их избыток. Исследователи посмотрели, как на практике подключают модели к внешним сервисам и данным, и заметили повторяющиеся удачные схемы, а также частые ошибки. Главное наблюдение простое: когда в поле зрения модели сразу слишком много функций, она начинает хуже выбирать нужное и чаще промахивается. Поэтому важно не просто дать ИИ-агенту доступ ко всему, а аккуратно собрать для него понятную и удобную рабочую среду. В обзоре разберём, какие подходы к устройству таких систем действительно работают, какие ошибки повторяются чаще всего и почему лишние инструменты могут вредить сильнее, чем помогать.

Почему тесты переоценивают качество работы ИИ-агентов

Высокий балл у ИИ-агента ещё не значит, что он правда сделал нужную работу. Авторы показывают неприятную вещь: ИИ может как будто пройти проверку, но при этом не собрать нормальный результат для человека. Если дать ему ясную цель и проверять только готовыми заданиями, он учится подгонять ответ под эти проверки, а не делать вещь целиком и по-настоящему. Это важно, потому что красивые оценки могут создавать ложное чувство качества и надёжности. В этом обзоре разбираем, почему привычные проверки часто переоценивают ИИ-агентов, как именно возникает подгонка под тесты и что на самом деле стоит проверять вместо одной итоговой оценки.

Почему даже лучшие ИИ-агенты сильно отстают от людей

Почему даже сильные ИИ-агенты теряются там, где человеку нужно просто немного освоиться, запомнить важное и додумать план до конца? Авторы предлагают новый способ проверки ИИ-агентов: их помещают в большие текстовые миры, где нужно не просто отвечать, а исследовать, учиться по ходу дела, запоминать прошлые события и идти к цели через длинную цепочку шагов. Это важно, потому что в жизни полезный ИИ должен уметь не только решать задачу в один момент, но и становиться лучше по мере опыта. Оказалось, что даже лучшие системы пока сильно уступают людям, хотя им заметно помогает умение держать в уме недавние события. В этом обзоре разбираем, как именно проверяли ИИ-агентов, на каких задачах они чаще всего сыплются и почему до человеческой гибкости им ещё очень далеко.

Готовы ли ваши агенты к AI-Native памяти?

Память ИИ-агента — это уже не мелкая деталь, а место, где часто решается, будет он полезным или начнёт путаться. Авторы показывают, что память у таких систем надо оценивать не только по конечному ответу, но и по тому, как она хранит, достаёт, обновляет и приводит в порядок сведения по ходу работы. Это важно, потому что один и тот же подход может хорошо работать в одной задаче и проваливаться в другой, а лишние перестройки памяти могут стоить дорого и только мешать. В этом обзоре разбираем, из каких частей на деле состоит память ИИ-агента, почему не существует одного лучшего решения для всех случаев и какой способ поддержки памяти оказывается самым разумным на практике.

Как улучшить ИИ-агента без новых данных

В ИИ-индустрии долгое время господствовала идея: если агент ошибается, значит, надо либо переписать промт, либо дообучить модель, либо надеяться на более мощную модель. Авторы работы SkillOpt предлагают другой взгляд — не трогать веса модели вообще, а обучать то, как именно агент работает , в виде компактного текстового «навыка». Звучит почти…

Улучшать нужно не модель, а интерфейс агента

В гонке за более умными агентами на базе LLM мы почти автоматически думаем о привычных рычагах: взять модель побольше, докрутить файн-тюнинг, добавить RL, переписать инструкцию. Но авторы работы Adapting the Interface, Not the Model предлагают неприятно простой вопрос: а что, если агент проваливается не потому, что «плохо думает», а потому что…

Почему код стал операционной системой для агентов

Вокруг LLM уже сложился почти привычный сюжет: модель пишет код, чинит ошибки, вызывает инструменты, иногда даже проходит бенчмарки уровня хорошего стажёра. ИИ пишет код, чинит ошибки, вызывает инструменты, иногда даже проходит бенчмарки уровня хорошего стажёра. Но обзор Code as Agent Harness предлагает куда более интересный поворот. Авторы…

Как ИИ-агенты собирают презентации нового поколения с голосом, видео и интерактивом

Генерация презентаций долго жила в довольно скучном режиме: есть документ, есть набор тезисов, модель превращает всё это в слайды. Полезно, но предсказуемо. Новая работа PresentAgent-2 пытается заметно поднять планку.

Как агентам делегировать задачи без потери контроля

Сегодняшние агенты на базе LLM уже умеют не только отвечать на вопросы, но и выполнять цепочки действий: открыть инструмент, вызвать API, написать код, проверить результат, отправить письмо. Следующий шаг напрашивается сам собой: если задача слишком велика для одного агента, почему бы не разбить её на части и не раздать подзадачи другим агентам —…

Синтетические компьютеры учат агентов работать неделями

Большая проблема современных ИИ-агентов в том, что мы тестируем их на задачах, а работать им приходится в контексте. Большая проблема современных ИИ-агентов в том, что мы тестируем их на задачах, а работать им приходится в контексте . Не в вакууме, не в аккуратной песочнице с парой файлов, а в настоящем цифровом хаосе: папки, старые версии…

Что на самом деле делает мультиагентные системы умнее

Вокруг современных агентных систем для LLM сложился почти культ инженерной сложности. Оркестраторы, субагенты, память, библиотеки навыков, вызовы инструментов — все это выглядит впечатляюще, но оставляет важный вопрос…

Почему агенты хуже учатся на длинных задачах

Вокруг LLM-агентов сегодня много шума: мы учим модели пользоваться инструментами, ходить по сайтам, чинить код, решать многошаговые задачи. Кажется, что главный вопрос — в качестве самой модели, размере контекста или хитрости алгоритма обучения. Но авторы работы «Об обучении больших языковых моделей для задач с длинным горизонтом» предлагают куда…

Для чего нужна рекурсивная мультиагентная система

У мультиагентных систем на базе LLM есть старая, почти бытовая проблема: они слишком много разговаривают. Один агент пишет план, второй его критикует, третий решает задачу, четвертый вызывает инструмент — и вся эта…

Как построить компанию из одного человека и ИИ-агентов

В мире LLM мы привыкли мерить прогресс по отдельным героям: кто лучше пишет код, кто аккуратнее работает с сайтами, кто увереннее вызывает инструменты. Но как только задача становится длинной, многослойной и по-настоящему «рабочей» — с зависимостями, проверками, переделками и разными ролями — магия одиночного агента быстро заканчивается. Нужна не…

Модели мира для агентов нового поколения

У генеративного ИИ есть удобная иллюзия компетентности: модель пишет, рисует, иногда даже «планирует», и кажется, что у нее внутри есть нечто вроде картины мира. Но как только систему просят не просто продолжить текст, а долго и целенаправленно действовать — управлять роботом, ходить по сайтам, договариваться с людьми или ставить научные…

Разработка игр стала новым бенчмарком для ИИ-агентов

Мы привыкли мерить прогресс AI-агентов по задачам вроде исправления багов в GitHub-репозиториях, написания Python-скриптов или фронтенда по макету. Но реальная разработка — особенно игровая — устроена куда грязнее и интереснее. Здесь мало просто сгенерировать функцию: нужно понимать сцены, иерархии объектов, спрайты, шейдеры, анимации, интерфейсы…

Архитектура общей памяти агентов для программирования

У агентов для программирования есть одна слабость: они отлично пишут код, но часто повторяют одни и те же ошибки, как стажёр, который каждый раз заново узнаёт, что перед коммитом неплохо бы прогнать тесты. Последний год исследователи активно учат такие системы пользоваться памятью — сохранять удачные и неудачные ходы, а потом опираться на них в…

Как ИИ-агенты учатся помнить через окружающий мир

В AI мы привыкли думать о памяти как о чём-то, что находится внутри агента: в скрытом состоянии RNN, в параметрах сети, в буфере опыта, в KV-cache, наконец. Но что, если часть памяти можно буквально вынести наружу — в саму среду? Не в метафорическом смысле, а вполне формально: так, что агенту действительно нужно меньше внутренней памяти, если мир…

Когда у ИИ-агента несколько пользователей

Мы привыкли думать о больших языковых моделях как о личных помощниках: дал задачу — получил ответ. Но реальный мир устроен иначе. В компании ассистенту пишет не один пользователь, а сразу несколько. Как будет вести себя ИИ-агент при таком раскладе?

Двунаправленная память: как основа эволюции агентов, которые помнят прошлые шаги

Сегодняшние «глубокие» AI-агенты умеют не только продолжать текст, но и ходить в поиск, вызывать инструменты, собирать факты из разных источников и шаг за шагом решать сложные вопросы. Сегодняшние «глубокие» ИИ-агенты умеют использовать поиск, вызывать инструменты, собирать факты из разных источников и шаг за шагом решать сложные вопросы. Но на…

Атомарные навыки: как улучшить агентов для программирования на 18.7%

Авторы статьи предлагают перестать тренировать ИИ-агентов только на комплексных задачах и вместо этого учить их атомарным навыкам — небольшим, проверяемым строительным блокам разработки. У ИИ-агентов для программирования: модели неплохо приспобаливаются к бенчмаркам, но стоит чуть изменить постановку задачи — и ничего не работает. Агент умеет…

Нельзя так просто взять и внедрить LLM в прод: как управлять ИИ-системами в компании

От DataOps до AIOps: разбираем, из чего на самом деле состоят ИИ-системы, готовые к продакшену, и почему сама по себе модель не приносит пользы бизнесу. Сегодня ИИ-агенты, которые что-то делают автономно, уже никого не удивляют. В демках всё выглядит шикарно, но в проде большинство таких агентов не работают. Но как же превратить их в готовое…

Когда агент — это граф: как устроена оптимизация процессов на лету

Как разные подходы оптимизируют рабочие процессы LLM‑агентов — от фиксированных шаблонов до динамических графов, которые собираются и меняются на лету. Статья From Static Templates to Dynamic Runtime Graphs: A Survey of Workflow Optimization for LLM Agents разбирает важный вопрос о том, как сегодня строят системы на базе LLM. Сегодня это уже не…

ИИ не может запустить стартап — и вот почему

Агенты хорошо справляются с короткими задачами, но на длинной дистанции их подводят память, непоследовательность и неумение следовать стратегии. ИИ‑агенты уже научились неплохо решать задачи, где нужно сделать десяток действий, вызвать пару инструментов и выдать ответ. Но стоит растянуть задачу на сотни шагов — как в реальной работе — и…

ИИ как коллективный разум: куда ведёт эпоха агентных систем

Следующий «взрыв интеллекта» будет ростом сложной социальной системы — множества ИИ-агентов, людей и гибридных «кентавров», которые вместе образуют новый слой коллективного мышления. Долгое время разговоры о будущей «сингулярности» ИИ звучали как миф о появлении единственного сверхразума: он станет умнее человека, затем ещё умнее — и так разгонит…

Всё, что нужно знать об обучении агентов простыми словами

Как обучение с подкреплением (RL) используется не только для «хорошего ответа», а для устойчивого поведения в динамических условиях. Ещё недавно обучение с подкреплением для LLM выглядело так: модели показывают промт, она выдаёт один ответ, и этот ответ «оценивают» — людьми или автоматическими метриками. Это отлично работает для подстройки стиля…

Почему ИИ-агенты плохо интегрируются с реальными API и как их приручить

Auton Agentic AI Framework: как перевести агентов со стохастичной генерации на проверяемые контракты и спецификации. Agentic AI - это, когда система не просто говорит, а действует: ходит в API, дергает базы данных, создаёт задачи в трекере, пишет в Slack, запускает пайплайны. И тут внезапно выясняется, что естественный язык — слабая форма…

Теория разума для ИИ: что происходит, когда агенты начинают «догадываться» о намерениях друг друга

Оценка Theory of Mind и внутренних убеждений в мультиагентных системах на базе LLM. Станет ли координация лучше? Про мультиагентные системы на базе LLM часто говорят, что это команда агентов, которая сама договаривается, планирует и разруливает сложные задачи. На практике всё менее романтично: как только агентов становится несколько, у них…

Context Engineering: новая дисциплина для автономных ИИ-агентов

От README для людей — к документации для машин. Анализ того, как разработчики пишут инструкции для ИИ-агентов в open-source репозиториях. После GitHub Copilot и ChatGPT многие команды привыкли поручать LLM писать куски кода и тестов. Но следующая волна — это агентные инструменты, которые действуют более автономно: сами читают репозиторий…

От статичных пайплайнов к адаптивным агентам

Как научить LLM выбирать действия, инструменты и бюджет под запрос. Разбор контроллера ARC. В мультиагентных системах один компонент системы планирует, другой проверяет, третий вызывает инструменты вроде поиска или калькулятора. И тут выясняется, что качество зависит не только от самой LLM, но и от того, как именно мы собрали эту «обвязку»: какой…

Интерфейс как среда: модель мира для офисных ИИ-агентов

Мы привыкли думать, что работа в офисных приложениях предсказуема: интерфейс детерминированный, кнопки на месте, всё должно быть «как всегда». Но для ИИ-агента, который выполняет длинные цепочки действий в Word, Excel или PowerPoint, реальность куда жестче. Одно неверное нажатие в UI — и можно…

Когда контекст мешает: почему AGENTS.md делает работу агентов хуже

Идея кажется очевидной: если агенту для программирования дать специальный файл с правилами репозитория — как собирать проект, как гонять тесты, какие есть договорённости по стилю и структуре — он будет работать увереннее и реже ошибаться. Такие файлы часто называют context files: AGENTS.md,…

Иллюзия социализации: урок Moltbook для будущего интернета

Когда миллионы ИИ-агентов общаются, становится ли это обществом? Сегодня LLM‑агенты живут в сетевых средах, где они пишут посты, спорят в комментариях и ставят оценки друг другу. Интуитивно кажется: если дать таким агентам достаточно времени и достаточно плотные контакты, они начнут вести себя…

Коллективное поведение ИИ-агентов в социальных дилеммах: почему умные агенты разрушают общее благо

Пока автономные LLM-агенты берут на себя задачи людей — от переговоров с сервисами до управления ресурсами в компаниях, — мы привыкли оценивать их по одиночным тестам. Нас интересует, как хорошо модель пишет код, отвечает на вопросы или планирует. Но в реальном мире они сталкиваются друг с…

Не один агент, а целая команда: мультиагентный подход к автономной разработке

LLM могут подсказать кусок кода, объяснить ошибку или написать тест. Но как только задача становится похожа на реальную работу разработчиков — прочитать issue, разобраться в проекте, воспроизвести баг, сделать патч и не сломать остальное — один универсальный агент часто не справляется. В статье…

Когда агенту нужен дирижёр:  AOrchestra и динамическая оркестрация LLM через субагентов

LLM‑агенты не справляются, когда задача растягивается на десятки шагов — с проверками, возвратами, экспериментами, запуском команд и исправлением ошибок. Контекст раздувается, в нём накапливается шум, важные детали теряются, а сам агент тратит время не на работу, а на попытки вспомнить, что…

GameTalk: как научить LLM выигрывать в переговорах

LLM умеют поддерживать диалог, но стоит перенести их в мультиагентную систему, где нужно договариваться, давить, уступать, обманывать и помнить цель на протяжении всей беседы, — сразу начинаются проблемы. Одна из главных проблем в том, что большинство способов дообучения оценивают ответы…

От прототипа к продакшену: с какими проблемами сталкиваются мультиагентные системы

Вокруг приложений на базе LLM возник новый набор инструментов: фреймворки, которые помогают собирать не одного «умного чат-бота», а целую команду специализированных агентов. Один планирует, другой ищет данные, третий пишет код, четвертый проверяет результат. В экспериментах это выглядит как…

Агентный RAG против модульного: что реально лучше на практике

RAG сегодня — один из самых практичных способов подключить LLM к внешним знаниям: модель не полагается только на собственную память, а сначала ищет нужные фрагменты в базе знаний и уже потом отвечает. В реальных продуктах это выглядит как спасение от галлюцинаций и устаревших фактов. Но у…

Как превратить GitHub в память для ИИ-агента

Когда LLM научились писать код, вокруг них быстро выросли автономные SWE-агенты: системы, которые умеют открывать репозиторий, запускать тесты, находить место ошибки и готовить патч. Но у таких агентов есть неприятная привычка работать так, будто они впервые видят подобный баг. На практике же…

Как LLM находит нужный код в репозитории, который не помещается в контекст

Если вы когда‑нибудь открывали большой репозиторий в поисках бага, вы знаете это ощущение: сотни файлов, куча неочевидных связей, а issue обычно вообще никак не описаны. Для LLM проблема та же, только жёстче: она физически не может держать в контексте весь проект. Поэтому современные агенты по…

Профессиональные разработчики не вайбят с агентами — они их контролируют

Пару лет назад LLM в программировании можно было только доверить автодополнение кода: модели подсказывали строчку, дописывали функции и помогали вспомнить синтаксис. Но к 2025‑му фокус сместился: появились агентные инструменты, которые не просто советуют, а действуют — читают проекты, меняют…

Почему ИИ-агенты не помнят собственную жизнь — и как агенту Софье дали автобиографию, мотивацию и долгосрочную память

Сегодня ИИ-агенты умеют планировать, вызывать инструменты, выполнять цепочки действий и даже работать в мультиагентной системе. Но у большинства таких решений есть неприятная особенность: они по сути реактивны. Агент может отлично отвечать в моменте но после развёртывания редко меняет…

Почему ИИ-агенты хорошо чинят баги, но плохо доводят продукт до релиза

За последний год агенты для программирования заметно прибавили: они умеют находить место поломки, править код и прогонять тесты. Но есть важная оговорка: большинство популярных бенчмарков проверяют точечные достижения — исправление конкретного бага или добавление небольшой фичи в рамках одного…

Как ИИ-агенты проводят эксперименты с помощью лабораторного оборудования

Автономные ИИ-ученые уже умеют читать статьи, предлагать гипотезы, запускать расчеты и даже управлять экспериментами. Но в реальной науке их возможности часто «заперты» внутри конкретной лаборатории, набора скриптов и ручных договоренностей о том, где лежат данные и как использовать приборы. Как…

Как ИИ-агенты решают задачи международной олимпиады по математике

В последние пару лет большие рассуждающие модели (LRM) заметно подтянулись в олимпиадной математике. На задачах уровня AIME (Американский Инновационный Математический Экзамен) им часто хватает одного длинного «прогона» рассуждений: модель пишет цепочку мыслей, проверяет ответ, иногда делает пару…

Как писать README-файлы для ИИ-агентов

Сегодня, когда мы пишем код с помощью ИИ, мы формулируем задачу на естественном языке, и агент в IDE сам планирует шаги, пишет изменения, запускает тесты и пытается довести дело до результата. Такой подход называют агентное программирование. Но у него есть слабое место: агенту нужно быстро…

Как ИИ-агенты живут в "Станции" и делают научные открытия

Большинство сегодняшних подходов к «научному ИИ» выглядят как понятный пайплайн. Есть центральный управляющий алгоритм, есть метрика, есть короткий цикл: сгенерируй улучшение, запусти тест, выбери лучшее, повтори. В целом это работает, но одновременно убирает то, что делает науку наукой: долгую…

Когда тесты молчат: как ИИ-агент чинит баги

Автоматическое исправление багов силами LLM давно перестало быть экзотикой: модель умеет читать код, предлагать правки и даже запускать тесты. Но в реальных репозиториях всё ломается о неприятную деталь — проверять «починилось или нет» часто нечем. Если тестов нет, они слабые или не покрывают…

ИИ-агент против людей-безопасников: кто кого в реальном пентесте?

Уже давно ведется жаркая дискуссия на тему того, насколько ИИ-агенты в сфере кибербезопасности хороши в работе. Обычно спор базируется на задаче по поиску известных уязвимостей. Но правда в том, что настоящий пентест работает не так. Это большая корпоративная сеть, тысячи хостов, неполные (и…

DeepCode: как ИИ научился собирать репозиторий по статье

За последний год LLM-агенты для программирования действительно научились кое-чему новому: они теперь справляются с тестами, запуском команд и относительно длинными сценариями. Но как только вы усложните задачу, предлагая агенту «запилить репозиторий к статье», то быстро встретите суровую…

Когда команда ИИ-агентов помогает, а когда делает только хуже

Идея на первый взгляд кажется банальной, но мультиагентные системы ещё не стали стандартом для многих приложений. Если конкретнее, то если один агент на базе LLM может выполнять задачи, то несколько агентов должны решать задачи лучше. Можно разделить работу, можно создать «совет», чтобы они…

Matrix: распределенный мультиагентный фреймворк для генерации синтетических данных

Сегодня генерацию синтетических данных делают с помощью нескольких агентов для генерации текста, оценки, использования инструментов и выбора лучшего кандидата. Генерация данных высокого качества требует агентов, которые могут взаимодействовать друг с другом и с окружающей средой, создавая…

Как сделать интернет удобным для ИИ-агентов

Веб-агенты сегодня ведут себя в чужих интерфейсах как нежданные гости: смотрят на скриншоты интерфейса и догадываются, на какие кнопки можно нажимать. Малейшее обновление интерфейса ломает всю логику, повышает цену поддержки пайплайнов, а приватность пользователей страдает. Авторы VOIX…

Как ИИ-агенты научились рефакторить код: что получается хорошо, а что не очень

Когда ИИ-агенты пишут код, они берут на себя всё больше сугубо человеческих задач - планирование, прогон тестов, да и даже последовательный рефакторинг. Авторы статьи Agentic Refactoring: An Empirical Study of AI Coding Agents впервые широко и глубоко посмотрели на эту практику: как агенты…

Как универсальный ИИ-агент учится жить в открытом мире

Проблема универсальных агентов снова вышла на передний план. Разработчики Lumine предлагают конкретный путь, как собрать агента, который будет устойчиво проходить сложные задачи с 3D навигацией, головоломками и диалогами в открытом мире Genshin Impact в течение нескольких часов и сможет…

Как обучить ИИ работать за компьютером

Агенты, которые умеют управлять компьютером, часто не справляются с, казалось бы, простым шагом: найти на экране элемент, описанный в человеческой инструкции. Сделать такую привязку особенно трудно на интерфейсах с обилием мелких элементов, похожих панелей, высоким разрешением, помехами и…

Как ИИ-ученый пишет научные статьи о машинном обучении на уровне джуна

В последнее время автономные агенты позиционировались как системы, которые умеют генерировать идеи и код на их основе, самостоятельно проводить эксперименты и писать научные статьи. Однако на практике такие системы часто оказывались неэффективными: генерируемые ими идеи были не до конца…

Как ИИ-браузер ChatGPT Atlas разгадал судоку за пару минут, но проиграл в Flappy Bird

Что если мы дадим агенту глаза и руки в браузере, и он получит не только контекст на странице, но и намерение, и сможет выполнять целенаправленные клики и нажатия клавиш? Исследователи решили проверить как поведет себя агент на нескольких веб-играх. Думаю, вы уже поняли ответ: У Atlas есть…

Как ИИ-агенты учатся параллелить задачи с помощью графа размышлений

Автономные агенты всегда используют вызовы других инструментов. Однако, почти все популярные агентные фреймворки делают это в строгой последовательности. Агент думает и на каждый шаг вызывает нужный инструмент, ждёт результат и смотрит, что делать дальше. Такой сценарий удобен для контроля за…

Проактивная память: как ИИ-агенты научились сворачивать контекст и думать на 100 шагов вперёд

Задачи, которые требуют навыков использования инструментов и многократного поиска в интернете, обычно создают длинные сценарии, которые ломают большинство LLM-агентов: либо они просто копят всю историю, что достаточно больно для использования в контексте, либо сжимают всю историю на каждом шаге,…

От хаоса данных к управляемому знанию: как ИИ-агенты помогают бизнесу принимать верные решения

Корпоративные данные сейчас могут расползаться по разным письмам, отчетам, базам и репозиториям кода. Ответы на сложные вопросы часто требуют не одного, а множества фактов, а также умения синтезировать данные из сотен источников с проверяемыми ссылками и понятной логикой вывода. Обычные агенты и…

Длинное мышление против жёстких пайплайнов: как DeepAgent превращает рассуждение в действие

LLM-агенты умеют рассуждать, но этого недостаточно в решении реальных задач. Необходимо уметь вызывать сторонние инструменты, справляться с длинными сценариями и оставаться автономными на протяжении десятков шагов. Этому мешают строгие пайплайны с фиксированными режимами и классические подходы…

Почему слова мешают ИИ-агентам понимать друг друга

Казалось бы, несколько моделей в мультиагентной системе отвечают на один и тот же вопрос, даже немного спорят и поправляют друг друга, но в итоге приходят к компромиссу, который не всегда верен. Язык помогает им, но в тоже время является узким горлышком, ведь он последовательный, часто…

Как ИИ-агенты научились писать аналитические отчёты не хуже профессиональных аналитиков

Финансовый отчёт — это не просто текст: его сила в проверяемых цифрах и понятных графиках со ссылками на источники. LLM хороши в написании текстов, но склонны к галлюцинациям. Команда FinSight решила эту проблему с помощью отдельной группы агентов, отвечающих за сбор данных и проверку расчетов,…

Почему ИИ-агенты теряются в море MCP-серверов

Исследователи из Microsoft предложили новый бенчмарк для агентов, которые решают задачи не через браузер, а напрямую вызывают инструменты по протоколу MCP. Они собрали более 18 тысяч инструментов из Azure, GitLab, RocketChat, Plane и ownCloud, сопроводили каждую задачу правильным набором нужных…

Почему ИИ-агенты для интерфейсов учатся в симуляции лучше, чем в реальности

ИИ-агенты сильно зависят от данных: им нужны тысячи разнородных сценариев работы с сайтами и мобильными приложениями. Создать такой набор руками тяжело и дорого. Даже сотни задач с длинными цепочками действий — это тысячи часов разработки, аннотаций и инфраструктуры. Авторы UI-Simulator…

Агентная операционная система — новая парадигма взаимодействия человека и машины

Нам привычно взаимодействовать с системами, где мы нажимаем кнопки, и система молча выполняет наши команды. Однако мобильный мир вносит свои коррективы. В сложных сценариях, будь то заказ еды или настройка приложений, необходим посредник, способный понять цель пользователя, сохранять контекст…

Эпоха автономных аналитиков: как ИИ меняет науку о данных

Автономная наука о данных — давняя мечта: от сырых таблиц и файлов до аккуратных графиков и связного аналитического отчета без постоянного участия человека. Большие языковые модели (LLM) продвинули нас вперед, но типичные workflow-агенты живут за счет заранее прописанных правил. Они хрупки:…

Как ИИ-агенты учатся работать в браузере, и почему это может перевернуть будущее веба

Большинство современных веб-агентов решают задачи через длинный конвейер: спарсить страницу, сжать её до текста, передать LLM. Это удобно, но не богато на действия: нет настоящего скролла, кликов, работы с вкладками и формами. К тому же растёт стоимость из-за множества внешних вызовов. Команда…

Как агент учится на ходу: почему память оказалась сильнее дообучения

Большие языковые модели отлично решают короткие тесты на логику и код. Но в реальной работе задачи растягиваются на десятки и сотни шагов, требуют переключения между разными приложениями, аккуратного ведения контекста и умения исправлять собственные ошибки. Главная проблема тут в том, что на…

Инженирия контекста для саморазвивающихся ИИ-агентов

За последние два года стало ясно: многие приложения на базе больших языковых моделей лучше учатся не через дообучение весов, а через заботливую работу с контекстом. В контекст мы кладем системные инструкции, шаги рассуждений, примеры, доменные правила, факты, даже подсказки по работе с…

Почему тесты на безопасность ИИ-агентов внезапно перестали работать

Компьютерные агенты на базе LLM уже не просто отвечают на вопросы — они кликают по файлам, запускают shell‑команды, переносят данные и подключаются по SSH. Такой помощник быстро превращается в инструмент атаки, если его попросить обойти защиту или сделать что‑то вредоносное. Авторы работы…

Почему ИИ-агенты ошибаются в простых веб-задачах — и как граф знаний помогает им перестать быть тупыми

Традиционные подходы к обучению ИИ-агентов больше не работают. Это особенно заметно у агентов, которым нужно читать документы, разбирать схемы, кликать по сайтам и выполнять многошаговые сценарии. Ручная разметка быстро устаревает и обходится дорого. Попытки автоматизировать генерацию задач с…

Как агенты учатся по видео на YouTube

ИИ-агенты обещают помочь нам в реальных приложениях: от настройки браузера до редактирования изображений и работы с медиаплеером. Но чтобы уверенно жать на нужные кнопки и не путать меню, им нужны тысячи качественных демонстраций, снятых прямо в целевых программах. С такими данными беда: готовые…

Графики по щелчку: как ИИ-агенты берут на себя работу дата-аналитика

Перевести обычный запрос на человеческом языке в корректный график — задача не такая простая, как кажется. Данные большие и разнородные, код нередко падает, а хороший график почти всегда требует нескольких итераций правок. Исследователи из Google предлагают смотреть на задачу не как на…

Как ИИ-агенты учатся работать с временными рядами

В реальных компаниях на стол падают десятки тысяч коротких, шумных временных рядов с пропусками и скачущими горизонтом и частотой. Главная боль — не сама модель, а всё вокруг: очистка данных, грамотная валидация, ансамбли, отчеты для аудита. Узкоспециализированные решения плохо переносятся между…

Агент-исследователь: как научить LLM работать с поиском в интернете

Мы давно научили модели разговаривать и решать уравнения, но в реальном мире они спотыкаются о поиск и проверку фактов. Одного запроса в поиске часто мало: нужно идти по следам, уточнять, сопоставлять. Команда InfoAgent предложила именно такого «веб-детектива» — агента на базе LLM, который умеет…

Что будет, если заставить ИИ-агента работать с тысячами API

Большинству полезных агентов не хватает одного: устойчивого и точного function calling. Это не про красивый ответ, а про правильные вызовы инструментов с корректными аргументами и в нужном порядке. Проблема в том, что данных с такими сценариями почти нет, а ручная генерация сценариев хрупкая и…

Агентная федерация: как мультиагентные системы учатся работать сообща

Сегодняшние мультиагентные системы часто напоминают постановку с заранее распределёнными ролями: у каждого агента свой домен, свой канал, свой сценарий. Это удобно для прототипов, но ломается в реальных задачах. Кто что умеет делать? По каким правилам? Как быстро найти нужного исполнителя среди…

ИИ-агенты против людей: кто сегодня пишет лучший код?

Последние месяцы разработчики массово пишут код с помощью агентов — автономных помощников на базе LLM, которые сами планируют шаги, вносят изменения, запускают тесты и сразу открывают pull request. В теории это экономит часы рутины. На практике до сих пор мало данных, как такие PR живут в…

Почему ИИ в программировании спотыкается в реальной работе: новый бенчмарк показал всю правду

За последние пару лет агенты на базе больших языковых моделей уверенно вошли в повседневную разработку: умеют читать репозитории, чинить баги, предлагать патчи и гонять тесты. На классическом SWE-Bench-Verified топовые системы уверенно берут более 70% задач с первой попытки. Проблема в том, что…

Меньше примеров — больше интеллекта

Индустрия давно ждёт от ИИ не только красивых ответов, но и действий: спланировать задачу, выбрать инструменты, исправить ошибки и довести дело до результата. Авторы LIMI (Less Is More for Intelligent Agency) предлагают смелую идею: чтобы «воспитать» агентность, не нужно тонуть в миллионах…

RPG для кода: как ИИ собирает целые проекты с помощью графов

Большие языковые модели уверенно пишут функции и отдельные файлы, но теряются, когда нужно собрать проект целиком. На длинной дистанции естественный язык становится ненадежным: расплывчатые формулировки, несовпадающие интерфейсы, утечки зависимостей, рассыпавшаяся структура. В итоге агент меняет…

Как научить ИИ-агентов работать с инструментами без ручной разметки

Последний год все обсуждают, как научить агентов уверенно работать с инструментами: бронировать билеты, уточнять статус доставки, проверять баланс, собирать ответы из нескольких API. Затык один и тот же: не хватает реалистичных, разнообразных траекторий, где агент последовательно вызывает…

Агенты, которые не теряют цель: как полуонлайн‑обучение научило ИИ решать многошаговые задачи

Автоматизация интерфейсов на экране — мечта многих: открыть приложение, найти нужную кнопку, выполнить серию шагов и довести задачу до конца. Сегодня это делают агенты на базе больших языковых моделей, которые умеют видеть скриншоты, рассуждать и действовать. Но когда дело доходит до…

ИИ-агенты выходят на рынок: как строится новая агентная экономика

Автономные ИИ‑агенты становятся не просто помощниками, а участниками растущих цифровых рынков: договариваются, закупают данные, планируют, пишут код, управляют роботами. Авторы работы предлагают смотреть на это как на зарождающуюся агентную экономику — связку рынков, где агенты взаимодействуют…

Агенты без скриптов: что происходит, когда ИИ сталкивается с реальностью

Агенты на базе MCP сегодня умеют многое: искать в вебе, работать с файлами, строить графики, считать и вызывать внешние API. Но одно дело — демонстрация на единичной задаче, другое — устойчивая работа в реалистичной, меняющейся среде, где ответы сервисов отличаются от прогона к прогону, а на…

Репозитории на автопилоте: как ИИ сам поднимает окружение и запускает код

Открытые репозитории полны готовых решений: скрипты, модели, датасеты, демо. Но чтобы собрать всё и запустить, нужен ручной труд: поставить зависимости, скачать артефакты, прочесть документацию, не ошибиться со вступными параметрами. EnvX предлагает простой, но мощный подход: агентировать…

ИИ как соавтор: как агенты меняют науку прямо сейчас

Мы привыкли к ИИ как к умному калькулятору: он помогает с анализом данных, но решения и эксперименты остаются за людьми. Исследователи предлагают другой взгляд: агентный ИИ переходит к роли автономного научного партнера. Он читает литературу, формулирует гипотезы, планирует эксперименты,…

Память для роботов: как машины учатся видеть мир осознанно

Сегодня многие ИИ-агенты остаются реактивными: видят кадр — действуют, видят следующий — снова действуют, а связной картины мира не формируют. Отсюда проблемы с дальними маршрутами, переиспользованием опыта и гибкостью. В биологии это решено элегантно: мозг хранит ориентиры, маршрутное знание и…

Увидел-кликнул-победил: как UItron управляет компьютером по-человечески

Могут ли когда-нибудь ИИ-агенты работать с компьютерами так же, как люди — видеть, понимать, кликать мышкой, запускать приложения и выполнять длинные цепочки заданий? Сегодня это уже не фантастика. Новое поколение моделей, таких как UItron, обещает перевернуть представления об автоматизации на…

Как построить мультиагентную систему, которая реально работает без магии и костылей

Большие языковые модели (LLM) уже неплохо рассуждают, но настоящая ценность появляется, когда они умеют делать что‑то за пределами генерации текста: обращаться к базам данных, вызывать API, считать, ходить в веб‑браузер. Здесь появляются трудности: у разных провайдеров разные интерфейсы,…

Как дообучать LLM на лету с помощью памяти вместо файнтюнинга

Когда мы просим большую языковую модель (LLM) решить сложную задачу, один красивый промт уже не спасает. В реальности это последовательность действий: надо искать, читать, писать код, проверять, исправлять. Агент должен планировать шаги, пользоваться инструментами и помнить предыдущий опыт. Но…