i
ДАТАИСТ
К ленте

ИИ в разработке

Модели, которые пишут, читают и чинят код: от автодополнения до самостоятельной работы над задачей в репозитории.

45 материалов

ИИ-агенты для генерации кода решили лишь 41% задач в новом тесте

ИИ-агенты уже умеют писать код, но на по-настоящему сложных задачах всё ещё часто спотыкаются. Исследователи предлагают новый способ проверять такие системы: не на коротких починках, а на больших переделках кода, где нужно аккуратно менять сразу много частей и ничего не ломать. Команда специально отобрала реальные задачи, переписала их описания ясным языком и вручную проверила проверки, чтобы те не отсеивали верные ответы и не требовали того, чего не было в условии. В этом обзоре разбираем, почему старые способы оценки ИИ для кода дают слишком красивую картину и что показывает новая проверка о реальных возможностях таких агентов.

Что помогает ИИ лучше писать код с нуля

ИИ неплохо чинит и дописывает чужой код, но когда нужно написать программу с нуля, он вдруг начинает теряться. Исследователи предлагают не бросать модель сразу в написание кода, а сначала заставить её отдельно понять, что именно должна делать программа. Для этого один ИИ-агент изучает описание и проверяет поведение готового файла через запуски, а потом собирает из этого ясный план требований. После этого другой ИИ-агент пишет код уже не вслепую, а опираясь на такой план, поэтому реже уходит не туда и лучше держит смысл задачи. В этом обзоре разбираем, почему написание кода с нуля так часто ломается у ИИ и как отдельный шаг с прояснением требований помогает получить более точный результат.

ИИ-агентов научили управлять памятью во время долгих задач

Когда ИИ-агент долго решает задачу, он легко тонет в собственных заметках и начинает путаться в том, что было важным. Исследователи предлагают дать агенту более человеческий способ работы с памятью: не тащить всё перед собой, а самому решать, что можно свернуть, убрать во внешнее хранилище и потом вернуть по мере надобности. Так он меньше захлёбывается в лишних деталях, дольше держит ход мысли и стабильнее доводит сложные задачи до конца. В этом обзоре разбираем, как ИИ-агента научили управлять своей памятью во время длинной работы и почему это помогает ему лучше искать решения и писать код.

Дата-пайплайны надёжнее и дешевле, чем Claude Code, без потери качества

Оказывается, ИИ может собирать рабочие дата-пайплайны не только быстро, но и заметно аккуратнее и дешевле, чем когда он просто пишет код. Исследователи предлагают дать модели не свободу писать всё с нуля, а понятную среду, где она шаг за шагом собирает процесс из готовых частей и сразу видит, что уже построено. Такой результат не пропадает в виде разового текста: его можно сохранить, открыть в наглядном виде и спокойно править дальше руками или через диалог. За счёт этого меньше лишней работы, меньше ошибок и проще довести всё до рабочего состояния. В этом обзоре разбираем, как устроен такой способ сборки пайплайнов, почему он оказывается надёжнее обычной генерации кода и за счёт чего помогает экономить время и деньги.

Карта поведения помогает быстрее менять ИИ-агентов

Менять поведение ИИ-агента часто трудно не потому, что неясно как, а потому что непонятно где именно в коде это спрятано. Исследователи предлагают карту поведения системы, которая автоматически показывает, какая часть кода за что отвечает. Вместо долгих поисков по файлам разработчик или другой ИИ-агент получает путь от общего описания нужного действия к тем местам, где это действие реально собрано из подсказок, состояний, инструментов и шагов работы. Это особенно помогает, когда нужная логика разбросана по разным частям проекта и не лежит в одном очевидном месте. В обзоре разберём, как такая карта поведения помогает быстрее и точнее менять ИИ-агентов и почему главная проблема часто не в правке кода, а в поиске нужной точки для изменений.

ИИ чинит код лучше, если сначала задаёт вопросы

ИИ лучше чинит чужой код, когда сначала не спешит с ответом, а задаёт правильные вопросы. Исследователи предложили подход, в котором модель сначала разбирается в незнакомом проекте, а уже потом пытается исправить ошибку. Для этого одна часть системы задаёт точные вопросы о том, как устроен код, другая сама ищет ответы в файлах и собирает понятную картину, и только после этого модель пишет исправление. Так она реже додумывает наугад и чаще опирается на то, что действительно есть в проекте. В обзоре разберём, как работает такой способ починки кода через вопросы и ответы и почему он помогает находить более точные исправления.

Проверять код ИИ стало труднее, чем писать

Проверять код, который пишет ИИ, внезапно стало сложнее, чем писать его самому. Авторы показывают простую, но неприятную вещь: ИИ уже легко выдаёт много правдоподобных решений, а вот понять, сделал ли он именно то, что было нужно человеку, намного труднее. Обычные способы проверки часто смотрят лишь на внешние признаки и потому могут пропустить ошибку или засчитать удачным то, что просто хорошо выглядит. Поэтому главная задача теперь не только в том, чтобы ИИ писал код, а в том, чтобы проверка росла вместе с его возможностями. В этом обзоре разбираем, почему любая проверка лишь приблизительно отражает замысел человека, как ИИ учится обходить слабые правила оценки и что поможет сделать проверку кода надёжнее.

Почему код стал операционной системой для агентов

Вокруг LLM уже сложился почти привычный сюжет: модель пишет код, чинит ошибки, вызывает инструменты, иногда даже проходит бенчмарки уровня хорошего стажёра. ИИ пишет код, чинит ошибки, вызывает инструменты, иногда даже проходит бенчмарки уровня хорошего стажёра. Но обзор Code as Agent Harness предлагает куда более интересный поворот. Авторы…

Как агентам делегировать задачи без потери контроля

Сегодняшние агенты на базе LLM уже умеют не только отвечать на вопросы, но и выполнять цепочки действий: открыть инструмент, вызвать API, написать код, проверить результат, отправить письмо. Следующий шаг напрашивается сам собой: если задача слишком велика для одного агента, почему бы не разбить её на части и не раздать подзадачи другим агентам —…

Почему агенты хуже учатся на длинных задачах

Вокруг LLM-агентов сегодня много шума: мы учим модели пользоваться инструментами, ходить по сайтам, чинить код, решать многошаговые задачи. Кажется, что главный вопрос — в качестве самой модели, размере контекста или хитрости алгоритма обучения. Но авторы работы «Об обучении больших языковых моделей для задач с длинным горизонтом» предлагают куда…

Как построить компанию из одного человека и ИИ-агентов

В мире LLM мы привыкли мерить прогресс по отдельным героям: кто лучше пишет код, кто аккуратнее работает с сайтами, кто увереннее вызывает инструменты. Но как только задача становится длинной, многослойной и по-настоящему «рабочей» — с зависимостями, проверками, переделками и разными ролями — магия одиночного агента быстро заканчивается. Нужна не…

Архитектура общей памяти агентов для программирования

У агентов для программирования есть одна слабость: они отлично пишут код, но часто повторяют одни и те же ошибки, как стажёр, который каждый раз заново узнаёт, что перед коммитом неплохо бы прогнать тесты. Последний год исследователи активно учат такие системы пользоваться памятью — сохранять удачные и неудачные ходы, а потом опираться на них в…

Атомарные навыки: как улучшить агентов для программирования на 18.7%

Авторы статьи предлагают перестать тренировать ИИ-агентов только на комплексных задачах и вместо этого учить их атомарным навыкам — небольшим, проверяемым строительным блокам разработки. У ИИ-агентов для программирования: модели неплохо приспобаливаются к бенчмаркам, но стоит чуть изменить постановку задачи — и ничего не работает. Агент умеет…

Context Engineering: новая дисциплина для автономных ИИ-агентов

От README для людей — к документации для машин. Анализ того, как разработчики пишут инструкции для ИИ-агентов в open-source репозиториях. После GitHub Copilot и ChatGPT многие команды привыкли поручать LLM писать куски кода и тестов. Но следующая волна — это агентные инструменты, которые действуют более автономно: сами читают репозиторий…

Когда контекст мешает: почему AGENTS.md делает работу агентов хуже

Идея кажется очевидной: если агенту для программирования дать специальный файл с правилами репозитория — как собирать проект, как гонять тесты, какие есть договорённости по стилю и структуре — он будет работать увереннее и реже ошибаться. Такие файлы часто называют context files: AGENTS.md,…

Коллективное поведение ИИ-агентов в социальных дилеммах: почему умные агенты разрушают общее благо

Пока автономные LLM-агенты берут на себя задачи людей — от переговоров с сервисами до управления ресурсами в компаниях, — мы привыкли оценивать их по одиночным тестам. Нас интересует, как хорошо модель пишет код, отвечает на вопросы или планирует. Но в реальном мире они сталкиваются друг с…

Не один агент, а целая команда: мультиагентный подход к автономной разработке

LLM могут подсказать кусок кода, объяснить ошибку или написать тест. Но как только задача становится похожа на реальную работу разработчиков — прочитать issue, разобраться в проекте, воспроизвести баг, сделать патч и не сломать остальное — один универсальный агент часто не справляется. В статье…

От прототипа к продакшену: с какими проблемами сталкиваются мультиагентные системы

Вокруг приложений на базе LLM возник новый набор инструментов: фреймворки, которые помогают собирать не одного «умного чат-бота», а целую команду специализированных агентов. Один планирует, другой ищет данные, третий пишет код, четвертый проверяет результат. В экспериментах это выглядит как…

Как превратить GitHub в память для ИИ-агента

Когда LLM научились писать код, вокруг них быстро выросли автономные SWE-агенты: системы, которые умеют открывать репозиторий, запускать тесты, находить место ошибки и готовить патч. Но у таких агентов есть неприятная привычка работать так, будто они впервые видят подобный баг. На практике же…

Как LLM находит нужный код в репозитории, который не помещается в контекст

Если вы когда‑нибудь открывали большой репозиторий в поисках бага, вы знаете это ощущение: сотни файлов, куча неочевидных связей, а issue обычно вообще никак не описаны. Для LLM проблема та же, только жёстче: она физически не может держать в контексте весь проект. Поэтому современные агенты по…

Профессиональные разработчики не вайбят с агентами — они их контролируют

Пару лет назад LLM в программировании можно было только доверить автодополнение кода: модели подсказывали строчку, дописывали функции и помогали вспомнить синтаксис. Но к 2025‑му фокус сместился: появились агентные инструменты, которые не просто советуют, а действуют — читают проекты, меняют…

Почему ИИ-агенты хорошо чинят баги, но плохо доводят продукт до релиза

За последний год агенты для программирования заметно прибавили: они умеют находить место поломки, править код и прогонять тесты. Но есть важная оговорка: большинство популярных бенчмарков проверяют точечные достижения — исправление конкретного бага или добавление небольшой фичи в рамках одного…

Почему ИИ не справляется со списком покупок и когда мы сможем доверить ему бытовые задачи

Пока ИИ уверенно решает задачи на логику и пишет код, в реальной жизни люди всё чаще спрашивают его о более приземлённом: что купить в магазине, чем заменить ингредиент в блюде, как починить протекающий кран или какую сборку выбрать в игре. И здесь внезапно выясняется неприятная вещь: бытовые…

Как измерить «общий научный интеллект» у LLM

Сегодня LLM умеют многое: объяснять сложные темы, писать код, держать длинную нить рассуждений. Но наука — это не только вызубрить ответы. Это исследовательский цикл: разобраться в литературе, придумать гипотезу, проверить ее экспериментом, а потом честно интерпретировать результаты и…

Как писать README-файлы для ИИ-агентов

Сегодня, когда мы пишем код с помощью ИИ, мы формулируем задачу на естественном языке, и агент в IDE сам планирует шаги, пишет изменения, запускает тесты и пытается довести дело до результата. Такой подход называют агентное программирование. Но у него есть слабое место: агенту нужно быстро…

Когда тесты молчат: как ИИ-агент чинит баги

Автоматическое исправление багов силами LLM давно перестало быть экзотикой: модель умеет читать код, предлагать правки и даже запускать тесты. Но в реальных репозиториях всё ломается о неприятную деталь — проверять «починилось или нет» часто нечем. Если тестов нет, они слабые или не покрывают…

DeepCode: как ИИ научился собирать репозиторий по статье

За последний год LLM-агенты для программирования действительно научились кое-чему новому: они теперь справляются с тестами, запуском команд и относительно длинными сценариями. Но как только вы усложните задачу, предлагая агенту «запилить репозиторий к статье», то быстро встретите суровую…

Как ИИ-агенты научились рефакторить код: что получается хорошо, а что не очень

Когда ИИ-агенты пишут код, они берут на себя всё больше сугубо человеческих задач - планирование, прогон тестов, да и даже последовательный рефакторинг. Авторы статьи Agentic Refactoring: An Empirical Study of AI Coding Agents впервые широко и глубоко посмотрели на эту практику: как агенты…

Как универсальный ИИ-агент учится жить в открытом мире

Проблема универсальных агентов снова вышла на передний план. Разработчики Lumine предлагают конкретный путь, как собрать агента, который будет устойчиво проходить сложные задачи с 3D навигацией, головоломками и диалогами в открытом мире Genshin Impact в течение нескольких часов и сможет…

Как ИИ-ученый пишет научные статьи о машинном обучении на уровне джуна

В последнее время автономные агенты позиционировались как системы, которые умеют генерировать идеи и код на их основе, самостоятельно проводить эксперименты и писать научные статьи. Однако на практике такие системы часто оказывались неэффективными: генерируемые ими идеи были не до конца…

Будущее программирования — мультимодальное: как JanusCoder научился видеть интерфейс, который сам создает

Научные графики, интерактивные интерфейсы, а также анимации различных теорем – всё это, по сути, визуальное представление кода. Однако сегодня системы искусственного интеллекта учитывают только текстовую модальность и не принимают во внимание, как код будет выглядеть на экране или как он будет…

От хаоса данных к управляемому знанию: как ИИ-агенты помогают бизнесу принимать верные решения

Корпоративные данные сейчас могут расползаться по разным письмам, отчетам, базам и репозиториям кода. Ответы на сложные вопросы часто требуют не одного, а множества фактов, а также умения синтезировать данные из сотен источников с проверяемыми ссылками и понятной логикой вывода. Обычные агенты и…

Иллюзия интеллекта: как живые тесты разоблачают ИИ-кодеров

Оценивать генерацию кода по красивым комментариям — это как смотреть на машину по буклету. В реальной жизни важнее, заведётся ли она, тормозит ли вовремя и удобно ли ей пользоваться. Авторы BigCodeArena предлагают именно такой практичный взгляд: их открытая платформа сравнивает решения больших…

Как агент учится на ходу: почему память оказалась сильнее дообучения

Большие языковые модели отлично решают короткие тесты на логику и код. Но в реальной работе задачи растягиваются на десятки и сотни шагов, требуют переключения между разными приложениями, аккуратного ведения контекста и умения исправлять собственные ошибки. Главная проблема тут в том, что на…

Графики по щелчку: как ИИ-агенты берут на себя работу дата-аналитика

Перевести обычный запрос на человеческом языке в корректный график — задача не такая простая, как кажется. Данные большие и разнородные, код нередко падает, а хороший график почти всегда требует нескольких итераций правок. Исследователи из Google предлагают смотреть на задачу не как на…

Как выжать максимум смысла из тысяч строк кода

LLM для кодинга уже умеют дополнять, объяснять и чинить код, но в реальных проектах им приходится читать тысячи строк. Большие окна контекста помогают, но бьют по времени и цене, а ещё парадоксально ухудшают точность: модель начинает теряться в деталях и упускает скрытые зависимости между…

Умеют ли нейросети создавать игры?

Сделать игру — это не просто заставить код выполняться. Нужны понятная механика, приятная картинка, плавная анимация и стабильные 60 FPS. Большие языковые модели уверенно решают алгоритмические задачи, но в оценках их кода редко учитывают играбельность и эстетику. Авторы V-GameGym предлагают…

ИИ-агенты против людей: кто сегодня пишет лучший код?

Последние месяцы разработчики массово пишут код с помощью агентов — автономных помощников на базе LLM, которые сами планируют шаги, вносят изменения, запускают тесты и сразу открывают pull request. В теории это экономит часы рутины. На практике до сих пор мало данных, как такие PR живут в…

Почему ИИ в программировании спотыкается в реальной работе: новый бенчмарк показал всю правду

За последние пару лет агенты на базе больших языковых моделей уверенно вошли в повседневную разработку: умеют читать репозитории, чинить баги, предлагать патчи и гонять тесты. На классическом SWE-Bench-Verified топовые системы уверенно берут более 70% задач с первой попытки. Проблема в том, что…

RPG для кода: как ИИ собирает целые проекты с помощью графов

Большие языковые модели уверенно пишут функции и отдельные файлы, но теряются, когда нужно собрать проект целиком. На длинной дистанции естественный язык становится ненадежным: расплывчатые формулировки, несовпадающие интерфейсы, утечки зависимостей, рассыпавшаяся структура. В итоге агент меняет…

Маленькая модель с большими возможностями: как K2‑Think обыгрывает гигантов в математике и программировании

За последний год стало ясно: чтобы лучше решать сложные задачи, LLM не обязательно должны только расти в параметрах. Важнее научить модель думать длинно и структурировано, а часть вычислений перенести на этап выполнения запроса. K2‑Think — яркий пример этого сдвига. Команда берёт доступную по…

ИИ-агенты выходят на рынок: как строится новая агентная экономика

Автономные ИИ‑агенты становятся не просто помощниками, а участниками растущих цифровых рынков: договариваются, закупают данные, планируют, пишут код, управляют роботами. Авторы работы предлагают смотреть на это как на зарождающуюся агентную экономику — связку рынков, где агенты взаимодействуют…

Репозитории на автопилоте: как ИИ сам поднимает окружение и запускает код

Открытые репозитории полны готовых решений: скрипты, модели, датасеты, демо. Но чтобы собрать всё и запустить, нужен ручной труд: поставить зависимости, скачать артефакты, прочесть документацию, не ошибиться со вступными параметрами. EnvX предлагает простой, но мощный подход: агентировать…

Как оживить научные статьи: превращаем исследования в интерактивных ИИ-ассистентов

Мы привыкли к тому, что научная статья — это текст, рисунки и где-то в репозитории код. Дальше начинается рутина: искать зависимости, настраивать окружение, разбираться в API и форматах данных. Для многих это высокий порог входа. Paper2Agent предлагает простой подход: превращать статьи в…

Как дообучать LLM на лету с помощью памяти вместо файнтюнинга

Когда мы просим большую языковую модель (LLM) решить сложную задачу, один красивый промт уже не спасает. В реальности это последовательность действий: надо искать, читать, писать код, проверять, исправлять. Агент должен планировать шаги, пользоваться инструментами и помнить предыдущий опыт. Но…