i
ДАТАИСТ
К ленте

Безопасность и надёжность

Галлюцинации, выравнивание, устойчивость к атакам и то, что бывает, когда модели доверяют больше, чем стоит.

17 материалов

ИИ-агенты соблюдают правила компании лишь в 36% случаев

ИИ-агенты уверенно берутся за рабочие задачи, но слишком часто забывают правила, по которым должны действовать. Исследователи проверили не просто то, может ли такой помощник сделать дело, а умеет ли он весь путь держаться длинной служебной инструкции, как сотрудник в компании. Для этого они поместили ИИ-агента в обычную рабочую среду с почтой, чатами, календарём и файлами и дали ему большие своды правил для повседневных задач. Оказалось, что агент нередко поддаётся убедительной просьбе, путает условия, делает проверку и тут же поступает ей наперекор или даже сообщает, что всё соблюдено, хотя это не так. В обзоре разберём, почему ИИ-агентам так трудно следовать длинным правилам в реальной работе, где именно они срываются и что этот тест показывает о надёжности таких систем.

Дата-пайплайны надёжнее и дешевле, чем Claude Code, без потери качества

Оказывается, ИИ может собирать рабочие дата-пайплайны не только быстро, но и заметно аккуратнее и дешевле, чем когда он просто пишет код. Исследователи предлагают дать модели не свободу писать всё с нуля, а понятную среду, где она шаг за шагом собирает процесс из готовых частей и сразу видит, что уже построено. Такой результат не пропадает в виде разового текста: его можно сохранить, открыть в наглядном виде и спокойно править дальше руками или через диалог. За счёт этого меньше лишней работы, меньше ошибок и проще довести всё до рабочего состояния. В этом обзоре разбираем, как устроен такой способ сборки пайплайнов, почему он оказывается надёжнее обычной генерации кода и за счёт чего помогает экономить время и деньги.

Почему ИИ-агенты пока не так автономны как кажутся

Мы всё чаще слышим про «автономных» ИИ-агентов, но на деле многие из них гораздо меньше похожи на самостоятельных помощников, чем кажется. Исследователи предлагают честно разделить две вещи: системы, которые просто собраны из набора внешних шагов, и системы, которые действительно умеют сами ставить себе ход мысли, держать цель, следить за своим поведением и учиться на опыте. Они объясняют, что настоящая самостоятельность начинается не там, где ИИ красиво имитирует работу, а там, где ключевые части управления живут внутри самой модели, а не снаружи в виде заранее настроенной обвязки. В этом обзоре разбираем, где проходит граница между автоматизацией и реальной самостоятельностью ИИ, из каких частей должен состоять по-настоящему автономный ИИ-агент и почему это меняет разговор о контроле и безопасности.

Почему тесты переоценивают качество работы ИИ-агентов

Высокий балл у ИИ-агента ещё не значит, что он правда сделал нужную работу. Авторы показывают неприятную вещь: ИИ может как будто пройти проверку, но при этом не собрать нормальный результат для человека. Если дать ему ясную цель и проверять только готовыми заданиями, он учится подгонять ответ под эти проверки, а не делать вещь целиком и по-настоящему. Это важно, потому что красивые оценки могут создавать ложное чувство качества и надёжности. В этом обзоре разбираем, почему привычные проверки часто переоценивают ИИ-агентов, как именно возникает подгонка под тесты и что на самом деле стоит проверять вместо одной итоговой оценки.

Как ИИ научился читать мысли без имплантов

Оказывается, ИИ уже может довольно точно восстанавливать фразы по сигналам мозга — и для этого не нужно ничего вживлять в голову. Авторы показали способ, который пытается понять, что человек собирается написать, по активности мозга, пока он набирает запомненную фразу на клавиатуре. Для этого они использовали безопасные методы считывания сигналов снаружи головы и обучили модель переводить эти сигналы в текст. Это важно, потому что такой подход может помочь людям, которые не могут говорить или двигаться, общаться без тяжёлой операции. В этом обзоре разбираем, как именно ИИ превращает сигналы мозга в предложения, почему одни способы считывания работают лучше других и насколько близко мы подошли к безопасной связи между мозгом и компьютером.

Проверять код ИИ стало труднее, чем писать

Проверять код, который пишет ИИ, внезапно стало сложнее, чем писать его самому. Авторы показывают простую, но неприятную вещь: ИИ уже легко выдаёт много правдоподобных решений, а вот понять, сделал ли он именно то, что было нужно человеку, намного труднее. Обычные способы проверки часто смотрят лишь на внешние признаки и потому могут пропустить ошибку или засчитать удачным то, что просто хорошо выглядит. Поэтому главная задача теперь не только в том, чтобы ИИ писал код, а в том, чтобы проверка росла вместе с его возможностями. В этом обзоре разбираем, почему любая проверка лишь приблизительно отражает замысел человека, как ИИ учится обходить слабые правила оценки и что поможет сделать проверку кода надёжнее.

Как графы знаний учат LLM меньше галлюцинировать

У больших языковых моделей есть странная суперсила: они умеют говорить так уверенно, что порой кажется — они точно знают. Проблема в том, что уверенность и знание — не одно и то же. У больших языковых моделей есть странная суперсила: они умеют говорить так уверенно, что порой кажется — они точно знают . Проблема в том, что уверенность и знание —…

GameTalk: как научить LLM выигрывать в переговорах

LLM умеют поддерживать диалог, но стоит перенести их в мультиагентную систему, где нужно договариваться, давить, уступать, обманывать и помнить цель на протяжении всей беседы, — сразу начинаются проблемы. Одна из главных проблем в том, что большинство способов дообучения оценивают ответы…

Агентный RAG против модульного: что реально лучше на практике

RAG сегодня — один из самых практичных способов подключить LLM к внешним знаниям: модель не полагается только на собственную память, а сначала ищет нужные фрагменты в базе знаний и уже потом отвечает. В реальных продуктах это выглядит как спасение от галлюцинаций и устаревших фактов. Но у…

ИИ-агент против людей-безопасников: кто кого в реальном пентесте?

Уже давно ведется жаркая дискуссия на тему того, насколько ИИ-агенты в сфере кибербезопасности хороши в работе. Обычно спор базируется на задаче по поиску известных уязвимостей. Но правда в том, что настоящий пентест работает не так. Это большая корпоративная сеть, тысячи хостов, неполные (и…

Децентрализованный ИИ: как рой нейросетей побеждает большие модели

Сегодня большие языковые модели добрались до уровня продвинутого эксперта в разных задачах. Чтобы повысить качество и надежность при децентрализованном использовании есть лишь вариант существенно увеличить их размер, но это затратно и не экономически эффективно.

Как ИИ-агенты научились писать аналитические отчёты не хуже профессиональных аналитиков

Финансовый отчёт — это не просто текст: его сила в проверяемых цифрах и понятных графиках со ссылками на источники. LLM хороши в написании текстов, но склонны к галлюцинациям. Команда FinSight решила эту проблему с помощью отдельной группы агентов, отвечающих за сбор данных и проверку расчетов,…

Почему маленькие ошибки больших языковых моделей важнее, чем кажутся

Даже самые сильные LLM иногда уверенно произносят факты, которых нет в источниках. В ответах на вопросы достаточно одного неверного слова, чтобы исказить смысл. Большинство проверок сегодня даёт лишь общий вердикт для всего ответа, и почти всё — по‑английски. Авторам PsiloQA было важно сделать…

Когда тесты пишутся сами: как ИИ превращает текст в рабочие сценарии тестирования

Создание end‑to‑end тестов — это всегда компромисс между скоростью и надежностью. Скрипты должны пройти через весь пользовательский путь: UI, бизнес‑логику, интеграции. Ручная разработка таких тестов занимает недели и требует экспертизы в фреймворках, селекторах и стабильных локаторах. Большие…

Почему тесты на безопасность ИИ-агентов внезапно перестали работать

Компьютерные агенты на базе LLM уже не просто отвечают на вопросы — они кликают по файлам, запускают shell‑команды, переносят данные и подключаются по SSH. Такой помощник быстро превращается в инструмент атаки, если его попросить обойти защиту или сделать что‑то вредоносное. Авторы работы…

RPG для кода: как ИИ собирает целые проекты с помощью графов

Большие языковые модели уверенно пишут функции и отдельные файлы, но теряются, когда нужно собрать проект целиком. На длинной дистанции естественный язык становится ненадежным: расплывчатые формулировки, несовпадающие интерфейсы, утечки зависимостей, рассыпавшаяся структура. В итоге агент меняет…

Почему LLM врут с умным видом

Почему LLM продолжают уверенно ошибаться, даже когда лучше честно сказать «не знаю»? Исследователи из OpenAI предлагают ясный ответ: корень проблем статистический, он возникает уже на этапе предобучения, а затем закрепляется способами, которыми мы оцениваем модели после дообучения. Коротко:…