i
ДАТАИСТ
К ленте

Рассуждения

Как модели приходят к ответу: цепочки рассуждений, планирование, самопроверка и цена длинных размышлений.

30 материалов

Ваши файлы остаются на месте: гибридный ИИ Perplexity не отправляет конфиденциальные данные в облако

Perplexity запустила гибридные вычисления для агентной платформы Computer. Теперь один ИИ-агент может начинать задачу в облаке, а затем передавать её конфиденциальные части локальной модели на Mac с чипами Apple — без перезапуска и потери контекста. В облаке остаются веб-исследование, планирование и сложное рассуждение, а работа с личными файлами и данными на устройстве выполняется локально. Функция доступна корпоративным клиентам, которые подключили её через настольное приложение, а также подписчикам Pro и Max на Mac с чипами Apple под управлением macOS 15 или новее.

GPT-5 и Gemini-3 вспоминают забытые факты благодаря рассуждению

Когда большие языковые модели галлюцинируют, разработчики обычно считают, что им не хватает нужных знаний. Новое исследование Google Research и Technion показывает: во многих случаях факт уже записан в параметрах модели, но система не может извлечь его во время генерации. GPT-5 и Gemini-3 кодируют 95–98% проверенных фактов, однако без дополнительного рассуждения не вспоминают 26–34% из них. Дополнительные вычисления помогают восстановить 40–65% таких фактов. Это означает, что для повышения точности иногда нужны не более крупные модели или внешние базы, а способы лучше использовать уже имеющиеся знания.

Google приближает AMIE к экспертному уровню аудиовизуальных медконсультаций

Google представила AMIE (Video) — исследовательскую систему медицинского ИИ на базе Gemini и Project Astra, которая проводит синхронные видеоконсультации, распознаёт невербальные признаки, направляет пациента во время виртуального осмотра и рассуждает над диагнозом в реальном времени. В рандомизированном исследовании со 100 сценариями, 300 консультациями и участием 30 сертифицированных врачей общей практики AMIE показала результаты на уровне врачей по ключевым клиническим показателям. Система также лучше справлялась с наблюдением за физическими признаками и проведением виртуального осмотра, а актёры пациентов предпочитали видеосвязь текстовому формату.

Новая техника рассуждения OpenAI встревожила экспертов по безопасности ИИ

Новая модель OpenAI Astra будет использовать технику рассуждения «рекуррентная глубина», сообщила во вторник издание The Information. Её также называют «непрозрачной рекурсией»: модель несколько раз обрабатывает один и тот же запрос в цикле, а не движется по последовательной цепочке рассуждений. Из-за этого контролировать ход её мыслей может стать сложнее. Хотя применение техники в Astra, по имеющимся данным, ограничено, эксперты по безопасности ИИ опасаются, что дальнейшее увеличение рекурсии способно почти полностью убрать рассуждения из наблюдаемого канала.

Gemini 3.8 Flash — третья бюджетная модель Google за шесть недель, а передовые всё ещё не вышли

Google представила Gemini 3.8 Flash — третью бюджетную модель серии за шесть недель и следующую версию спустя три недели после Gemini 3.7 Flash. Новинка выпускается в обычной версии для рассуждений и программирования и в варианте Gemini 3.8 Flash Cyber для кибербезопасности. В бенчмарке DeepSWE v1.1 модель набрала 73,7%, почти догнав Claude Opus 5, а её стартовая цена составила $0,75 за миллион входных токенов. При этом Google по-прежнему не выпустила передовые Gemini 3.5 Pro и Gemini 4.

ИИ-агент собирает законы физики из видео

Можно ли научить ИИ не просто смотреть видео, а самому выводить из него законы мира? Исследователи предлагают подход, в котором ИИ собирает увиденное в понятное описание мира: какие есть объекты, в каком они состоянии, как они движутся и что будет, если на них повлиять. Для этого ИИ-агент выдвигает догадки, проверяет их в виде работающего описания, сверяет с видео и шаг за шагом исправляет ошибки, пока не получит картину, которая действительно объясняет происходящее. В этом обзоре разбираем, как ИИ превращает видео в проверяемую модель физического мира и почему такой способ помогает машине рассуждать о причинах и последствиях, а не просто узнавать знакомые картинки.

Пустые полки или потерянные ключи? Узкое место — извлечение фактов

Исследователи Google Research Nitay Calderon и Gal Yona изучили, почему большие языковые модели ошибаются в фактах. Их методика профилирования знаний показывает: передовые модели обычно кодируют почти все проверяемые сведения, но не всегда могут их вспомнить. В Gemini-3-Pro и GPT-5 закодировано 95–98% фактов, однако без режима рассуждения они не извлекают 26–34% из них, а с рассуждением ошибаются в 11–12% случаев. Узким местом становится использование уже сохранённых знаний, а не их получение.

Мама, разъезжающая по работе, создала ИИ-клона, чтобы составить компанию сыну-подростку

Когнитивный нейроучёный Сара Балдео провела прошлый год в рабочих поездках и создала ИИ-клона себя, чтобы оставаться рядом с 15-летним сыном. Она загрузила в чат-бот переписку с ним, документы о своих ценностях и семейных правилах, а затем предложила сыну обращаться к системе за советами. Подросток использовал её, чтобы придумать аргументы для настоящей мамы и уговорить её отпустить его в кофейню в Чикаго. Балдео призналась, что почувствовала себя манипулируемой собственными рассуждениями, но позже решила: сын нашёл неожиданное применение системе, которое она сама не закладывала.

NVIDIA выпустила Alpamayo 2 Super для разработки беспилотников

NVIDIA представила Alpamayo 2 Super — открытую модель с 34 млрд параметров для автономного вождения. Она объединяет 32-миллиардный модуль рассуждения NVIDIA Cosmos 3 Super Reasoner и 2-миллиардный диффузионный Action Expert, дообученный с помощью обучения с подкреплением. Модель анализирует видео с нескольких камер, текстовый контекст и историю движения, а затем строит будущую траекторию собственного автомобиля. Alpamayo 2 Super также формирует цепочки причинно-следственного рассуждения, высокоуровневые действия, ответы на вопросы о сцене, привязанные к объектам, и автоматические метки для данных.

Постобучение NVIDIA Cosmos 3 Edge для управления роботами на устройстве

NVIDIA выпустила руководство по постобучению Cosmos 3 Edge — 4B-модели с рассуждающим модулем на базе 2B NVIDIA Nemotron для управления роботами прямо на устройстве. Модель запускается на NVIDIA Jetson Thor, формирует действия в реальном времени без обращения к серверной GPU и достигает 22,9% успешных попыток в замкнутой симуляции RoboLab. Руководство, исходный код в открытом репозитории cosmos-framework и готовая контрольная точка опубликованы для воспроизводимого запуска.

Meta представила мультимодальную модель Muse Spark 1.1

Лаборатория сверхинтеллекта Meta выпустила Muse Spark 1.1 — мультимодальную модель рассуждения для агентных задач. По сравнению с первой Muse Spark она заметно улучшила работу с инструментами и компьютером, программирование и мультимодальное понимание, а также научилась координировать мультиагентные системы. Модель уже доступна в режиме «Рассуждение» в приложении Meta ИИ и на meta.ai. Одновременно Meta открыла публичный предварительный доступ к Meta Model API, через который разработчики могут подключаться к Muse Spark 1.1.

Бывшие исследователи Meta хотят внедрить визуальный ИИ на производстве

Компания Perceptron, основанная двумя бывшими исследователями Meta, представила Isaac 0.5 — передовую визуальную модель для промышленной автоматизации. Она помогает роботам воспринимать обстановку, рассуждать и действовать на складах и фабриках: читать маркировку, анализировать расположение коробок, выбирать предметы и планировать последовательность действий. Модель выпускается как открытая: её параметры и материалы обучения доступны для проверки. Perceptron обучала Isaac 0.5 на миллионе часов видео и планирует применять её в производстве, логистике, складской работе, безопасности, сфере мобильности, медиа и развлечениях.

Как сильная модель улучшает слабую без переобучения

Можно ли сделать слабую модель заметно умнее прямо во время работы, не меняя её изнутри? Исследователи показывают, что сильная модель может собрать для слабой понятную «обвязку»: она задаёт порядок шагов, перекладывает шаткие рассуждения в чёткие правила и следит, чтобы ответ был в нужном виде. За счёт этого слабая модель начинает ошибаться реже не потому, что её доучили, а потому, что ей лучше организовали сам процесс решения. В обзоре разберём, как сильная модель помогает слабой без переобучения, за счёт чего это работает на практике и почему иногда важнее не менять саму модель, а правильно выстроить её работу.

Игра в шпиона помогает ИИ улучшать тексты и рассуждения

Можно ли научить ИИ писать и рассуждать лучше, если превратить обучение в игру про шпиона? Исследователи предлагают способ, при котором модель сама получает понятный сигнал, справилась она или нет, даже в задачах без одного точного ответа — вроде пересказа текста или свободного письма. Для этого несколько ИИ-агентов делают одно и то же задание, но одному дают особую роль, а остальные потом пытаются вычислить «шпиона» по его ответу. Если его легко распознали, значит текст или ход мысли выдали слабое место, и модель может на этом учиться дальше. В этом обзоре разбираем, как игра с тайной ролью помогает ИИ улучшать тексты, рассуждения и обучение без постоянной опоры на оценку человека.

Метапознание как следующий рубеж для LLM

Может ли ИИ не только отвечать, но и понимать, где он ошибается, чего не знает и как ему лучше думать дальше? Авторы собрали большой обзор о том, что происходит, когда модель учат следить за собственными мыслями и шагами. Речь о способности не просто выдавать ответ, а замечать сомнения, проверять себя, выбирать более удачный путь решения и понятнее объяснять ход рассуждений. Такой подход помогает лучше понять, насколько ИИ надёжен в реальных задачах и где его уверенность может быть ложной. В этом обзоре разбираем, как ИИ учат оценивать себя, проверять свои ответы, видеть пробелы в знаниях и зачем всё это нужно для более разумных и предсказуемых систем.

Оказалось, память может быть важнее самого мышления

Оказалось, что для ИИ иногда важнее не лучше думать, а лучше помнить. Исследователи предлагают учить модель не только решать задачу, но и самой разбираться со своей памятью: что сохранить, когда к этому вернуться и как разложить знания так, чтобы потом не потеряться. Для этого команда дала ИИ право управлять своими записями и отдельно улучшала две вещи: как устроена сама память и насколько умело модель ею пользуется. В итоге даже без изменений в самом способе рассуждать ИИ начинает заметно лучше справляться с длинными и запутанными задачами. В этом обзоре разбираем, почему умение обращаться с памятью можно развивать отдельно, как ИИ учат на его собственных удачных решениях и что это меняет для сложных задач, где ошибка может аукнуться намного позже.

RoboBrain: как робот понимает глубину 3D-сцены и учится самоконтролю

В робототехнике есть старая боль: даже сильные визуальные и языковые модели неплохо рассуждают о сцене, но иногда плохо справляются с тем, чтобы действовать в физическом мире. В быту это выглядит просто: «подвинь кружку на 10 сантиметров вправо» или «лей воду над цветами на высоте 1–5 см». Для…

Общество мыслей: как LLM становятся сильнее, когда спорят сами с собой

Мы привыкли думать, что reasoning-модели сильнее просто потому, что они пишут более длинные рассуждения и тратят больше вычислений перед ответом. В работе Reasoning Models Generate Societies of Thought авторы предлагают более любопытное объяснение: такие модели не только «думают дольше», они…

Когда данных нет совсем, а учиться всё равно нужно: как ИИ сам придумывает задачи и сам себя проверяет

В последние пару лет обучение рассуждению LLM делают через Reinforcement Learning with Verifiable Rewards (RLVR): модель решает задачу, получает награду, которую можно строго проверить, и постепенно начинает рассуждать лучше - так не нужно размечать цепочки рассуждений, достаточно уметь…

Как измерить «общий научный интеллект» у LLM

Сегодня LLM умеют многое: объяснять сложные темы, писать код, держать длинную нить рассуждений. Но наука — это не только вызубрить ответы. Это исследовательский цикл: разобраться в литературе, придумать гипотезу, проверить ее экспериментом, а потом честно интерпретировать результаты и…

Как ИИ-агенты решают задачи международной олимпиады по математике

В последние пару лет большие рассуждающие модели (LRM) заметно подтянулись в олимпиадной математике. На задачах уровня AIME (Американский Инновационный Математический Экзамен) им часто хватает одного длинного «прогона» рассуждений: модель пишет цепочку мыслей, проверяет ответ, иногда делает пару…

Почему мышление через видео может быть следующим шагом в развитии ИИ

Когда мы просим модель рассуждать, она делает это с помощью слов в случае текста или с помощью статичной сцены в случае картинки. Однако окружающий мир не является статичным: объекты могут перемещаться, а правила часто складываются только по их поведению во времени. Авторы предлагают…

Как ИИ-агенты учатся параллелить задачи с помощью графа размышлений

Автономные агенты всегда используют вызовы других инструментов. Однако, почти все популярные агентные фреймворки делают это в строгой последовательности. Агент думает и на каждый шаг вызывает нужный инструмент, ждёт результат и смотрит, что делать дальше. Такой сценарий удобен для контроля за…

Длинное мышление против жёстких пайплайнов: как DeepAgent превращает рассуждение в действие

LLM-агенты умеют рассуждать, но этого недостаточно в решении реальных задач. Необходимо уметь вызывать сторонние инструменты, справляться с длинными сценариями и оставаться автономными на протяжении десятков шагов. Этому мешают строгие пайплайны с фиксированными режимами и классические подходы…

Инженирия контекста для саморазвивающихся ИИ-агентов

За последние два года стало ясно: многие приложения на базе больших языковых моделей лучше учатся не через дообучение весов, а через заботливую работу с контекстом. В контекст мы кладем системные инструкции, шаги рассуждений, примеры, доменные правила, факты, даже подсказки по работе с…

Как думают ИИ-модели: раскладываем рассуждения на эпизоды

Большие модели рассуждений (Large Reasoning Models, LRM) сегодня не просто отвечают, а разворачивают длинные цепочки размышлений. Это помогает им решать более сложные задачи, но создает новую проблему: как понять структуру этих рассуждений и насколько они напоминают человеческое мышление.…

Как научить ИИ мыслить по-человечески: разбор WebResearcher и его революционной стратегии

Большинство открытых исследований по глубокому поиску работают по простому принципу: складывать всё найденное в одно большое окно контекста. С каждым шагом туда летят новые выдержки, ссылки, заметки. В итоге полезное тонет в шуме, ранние ошибки остаются навсегда, а место для размышления…

Агенты, которые не теряют цель: как полуонлайн‑обучение научило ИИ решать многошаговые задачи

Автоматизация интерфейсов на экране — мечта многих: открыть приложение, найти нужную кнопку, выполнить серию шагов и довести задачу до конца. Сегодня это делают агенты на базе больших языковых моделей, которые умеют видеть скриншоты, рассуждать и действовать. Но когда дело доходит до…

Как обучение с подкреплением перестраивает мышление LLM

Задачи на рассуждение — больное место многих ИИ-систем, даже если у них хорошие фактические знания. Новая работа показывает, что усиление через RL (Reinforcement Learning, обучение с подкреплением) не просто повышает точность, а перестраивает внутреннюю логику модели: появляется иерархия от…

Как построить мультиагентную систему, которая реально работает без магии и костылей

Большие языковые модели (LLM) уже неплохо рассуждают, но настоящая ценность появляется, когда они умеют делать что‑то за пределами генерации текста: обращаться к базам данных, вызывать API, считать, ходить в веб‑браузер. Здесь появляются трудности: у разных провайдеров разные интерфейсы,…