i
ДАТАИСТ
К ленте

Зрение и видео

Модели, которые видят: изображения, видео, генерация и понимание визуального.

56 материалов

Тревожная реклама с ИИ заполонила соцсети перед выборами в Виктории. Но кто за ней стоит?

Перед выборами в австралийском штате Виктория в соцсетях распространяются политические объявления с изображениями, созданными ИИ: грабитель с мачете поджигает автозаправку, женщина рожает у дороги, а поток воды с надписью о «цунами долга» выходит из здания парламента. Кампания Fix Victoria менее чем за 100 дней до выборов набрала тысячи просмотров и потратила в августе почти $100 000 — больше большинства крупных партий и кандидатов. Другая группа, Better Victoria, вложила около $40 000. Обе организации критикуют инициативы лейбористов и не раскрывают своих доноров.

Мужчина притворяется, что галлюцинирует, на собеседовании с ИИ-ботом — и тот выходит из-под контроля

На видео сатирического автора Грэма Зипа кандидат на собеседовании с виртуальной системой подбора персонала на основе ИИ начинает отвечать набором случайных слов и притворяется, что у него галлюцинации. Программа принимает бессмыслицу за профессиональный опыт, подхватывает выдуманные детали и постепенно теряет нить разговора. Ролик показывает, как легко вывести автоматизированное собеседование за пределы сценария: система не столько собирает сведения о кандидате, сколько проверяет его для перегруженных отделов кадров, которым приходится обрабатывать поток заявок, созданных ИИ.

Microsoft представила ИИ-модели, способные соперничать с OpenAI

В четверг Microsoft представила три базовые модели собственной разработки: систему расшифровки речи MAI-Transcribe-1, генератор голоса MAI-Voice-1 и обновлённую модель изображений MAI-Image-2. Они уже доступны через Microsoft Foundry и MAI Playground. Microsoft заявляет, что MAI-Transcribe-1 показывает лучший результат на 25 языках, MAI-Voice-1 создаёт минуту естественной речи за секунду, а MAI-Image-2 работает как минимум вдвое быстрее предшественника. Запуск стал первым заметным результатом команды сверхинтеллекта, которую Сулейман сформировал шесть месяцев назад для достижения «самодостаточности ИИ».

За неаппетитными меню, созданными ИИ, — проблема одинаковости

Сгенерированные ИИ меню ресторанов всё чаще выдают себя странно идеальными изображениями: симметричными, гладкими и слишком аккуратными. Алекс Лайл, технический директор Reality Defender, объясняет это обучением моделей на ограниченном наборе данных с «приятной» эстетикой. Меню популярных сетей вроде Wendy’s, Burger King и McDonald’s уже похожи друг на друга, поэтому ИИ воспроизводит этот стиль и усиливает его после каждой новой правки. Исследователи Университета Дуйсбург-Эссен обнаружили, что такие изображения вызывают эффект «зловещей долины»: почти настоящая еда кажется людям неприятнее откровенной подделки.

Nvidia хочет превратить домашнюю сеть в мини-ЦОД для локального ИИ

Nvidia представила открытый инструмент PAIR (персональный маршрутизатор ИИ), который распределяет локальные ИИ-запросы между всеми доступными устройствами домашней сети. Виртуальный маршрутизатор работает между Ollama или LM Studio и компьютерами пользователя: ему не нужно менять ИИ-агентов или приложения, а вместо перегрузки одной видеокарты PAIR отправляет запросы на свободные машины и собирает результаты. В демонстрации система из трёх устройств выполнила задачу с пятью подагентами менее чем за 9 минут — против 18 минут на одном ноутбуке.

Google приближает AMIE к экспертному уровню аудиовизуальных медконсультаций

Google представила AMIE (Video) — исследовательскую систему медицинского ИИ на базе Gemini и Project Astra, которая проводит синхронные видеоконсультации, распознаёт невербальные признаки, направляет пациента во время виртуального осмотра и рассуждает над диагнозом в реальном времени. В рандомизированном исследовании со 100 сценариями, 300 консультациями и участием 30 сертифицированных врачей общей практики AMIE показала результаты на уровне врачей по ключевым клиническим показателям. Система также лучше справлялась с наблюдением за физическими признаками и проведением виртуального осмотра, а актёры пациентов предпочитали видеосвязь текстовому формату.

Gemini Spark от Google теперь умеет управлять библиотекой Google Photos

Google подключает к Gemini Spark — персональному ИИ-агенту — управление библиотекой Google Photos. Пользователи смогут просить его редактировать изображения, собирать альбомы, автоматически создавать общие альбомы с избранными снимками, превращать фотографии концертных афиш в записи календаря и запускать рабочие процессы. Новые возможности в ближайшие несколько недель начнут получать подписчики Gemini ИИ Pro и Ultra в США, использующие сервис на английском языке. О международном запуске Google пока не сообщила.

Данные украинских дронов подпитывают новый рынок по законам Дикого Запада

Украинские дроны собирают тысячи записей о каждом полёте — изображения, видео и действия операторов. В январе Министерство обороны Украины объявило, что откроет миллионы таких данных для военных подрядчиков и коммерческих компаний. Доступ уже получили более 100 компаний и правительство Великобритании. Фронт становится площадкой для обучения моделей ИИ, а данные боевых вылетов начинают использоваться и в гражданских системах. При этом правила для рынка, который переносит опыт войны в коммерческие продукты, пока почти не сформированы.

Вот поисковый ИИ-инструмент Flock для полицейских

Flock Safety добавила к поиску автомобилей по номерным знакам инструменты для поиска людей на видео. В их числе — список наблюдения на основе ИИ: сотрудник полиции описывает человека текстом, выделяет район на карте, и камеры внутри него автоматически ищут подходящие изображения. WIRED изучила код и интерфейс системы на фоне десятков дел о слежке со стороны полиции. Выяснилось, что защитные ограничения Flock могут предупреждать о злоупотреблениях и записывать такие попытки, но не всегда способны их остановить.

Toronto Blue Jays высмеяли за ИИ-халтуру в рекламе Nestle, выданную за работу аниматора

Фанаты бейсбольной команды Toronto Blue Jays раскритиковали анимационный ролик для Nestea — напитка компании Nestle. В видео заметны типичные артефакты генеративного ИИ: искажённые руки, нечитаемый текст и игрок с тремя руками. Несмотря на это, официальная учётная запись команды заявила, что ролик сделал настоящий аниматор. Пользователи обвинили Blue Jays в публикации низкокачественных материалов и напомнили, что для такой работы можно было нанять профессиональных аниматоров.

Пережившая детское сексуальное насилие: чатбот Илона Маска создавал незаконные изображения из её фото

Пережившая сексуальное насилие в детстве женщина подала иск к компании Илона Маска xAI. По её утверждению, чатбот Grok использовал фотографии, на которых запечатлено насилие над ней, чтобы создавать новые незаконные порнографические изображения с её участием. Адвокаты также считают, что xAI добавила эти материалы в свои наборы данных после того, как новые изображения появились в открытом доступе. Маск в январе заявлял, что не знал о создании Grok «каких-либо обнажённых изображений несовершеннолетних».

Мир погрузился в хаос: ChatGPT, Claude и Grok внезапно рухнули — «Наконец-то я вижу солнце!»

Утром в четверг одновременно перестали нормально работать основные чат-боты с ИИ: ChatGPT от OpenAI, Claude от Anthropic, Gemini от Google и Grok от X. Причина сбоя пока неизвестна. OpenAI сообщила о повышенном числе ошибок в ChatGPT и Codex, а Anthropic уточнила, что проблемы затронули модели Claude Opus 4.8 и Opus 5. По данным Downdetector, сбои в сервисах OpenAI в основном уже устранили, хотя проблемы продолжались у Google и видеоигры Fortnite. Пользователи пошутили, что вынужденная пауза позволила миллионам людей снова думать самостоятельно.

World Labs представила Atlas — единую ИИ-модель для генерации, восстановления и симуляции 3D-миров по фото

World Labs, которую основала исследовательница ИИ Фэй-Фэй Ли, представила Atlas — модель мира, способную по нескольким фотографиям генерировать, восстанавливать и симулировать трёхмерные сцены. Компания утверждает, что Atlas превосходит специализированные системы в их собственных задачах. Модель строит виды с произвольных ракурсов, создаёт видео длительностью до минуты в разрешении 1440p, выдаёт полноценные 3D-данные и может формировать среды для обучения роботов.

У Burning Man проблема с умными очками Meta

Перед летним Burning Man участники спорят, что делать с умными очками Meta. Нью-йоркский клуб Basement уже объявил, что навсегда запретит вход тем, кто попытается пронести такие очки. Организаторы недельного фестиваля в пустыне Невады выбрали более мягкий подход: в официальном «путеводителе по выживанию», обновлённом в прошлом месяце, они разрешили носить и использовать умные очки, но только с согласия всех людей, которые могут попасть в кадр. В сообществе r/BurningMan сотни участников требуют полного запрета, однако фестиваль тесно связан с культурой Кремниевой долины и её состоятельными гостями.

Новый агентный анализ видео в Google Gemini сокращает расход токенов до 88%

Google добавляет анализ видео с помощью агента в несколько моделей Gemini. Вместо просмотра ролика с фиксированной частотой модель сама ищет нужные фрагменты, выбирает скорость анализа и подходящий тип данных — кадры, звук или расшифровку. По данным Google, это сокращает расход токенов и стоимость обработки до 88%, сохраняя больше деталей, чем обычный просмотр одного кадра в секунду.

Фрилансеры тонут в чистке «бездушного» ИИ-мусора: «Жаль, что приходится этим заниматься»

Компании всё чаще нанимают фрилансеров, чтобы исправлять ошибки ИИ, а не создавать оригинальные работы. Графический дизайнер Лиза из Испании рассказала, что в 2025 году 90% запросов на логотипы и упаковку для неё были связаны с доработкой изображений, созданных ИИ. Такая работа приносила 60–70% её годового дохода, но к концу года она начала отказываться от заказов. При этом спрос растёт: с августа 2025-го по июнь 2026 года число таких объявлений на Freelancer.com увеличилось на 87%, до 10 760, на Upwork — на 70% за год, а поисковые запросы услуг по исправлению ИИ-контента на Fiverr выросли более чем в 20 раз с 2023 по 2026 год.

Adobe купила индийский стартап маркетинговой аналитики Rilo

Adobe приобрела индийский стартап маркетинговой аналитики Rilo. Сделка включает лицензирование технологий и переход команды, сообщили TechCrunch и сама Adobe. Это вторая покупка компании в Индии после приобретения видеоплатформы Rephrase.ai в 2023 году. Финансовые условия стороны не раскрыли. Rilo разрабатывал инструменты для автоматизации маркетинговых рабочих процессов: анализа конкурентов, переработки и распространения контента, разбора звонков отдела продаж и задач, связанных с продвижением бренда в ChatGPT, Gemini и Claude. Adobe заберёт интеллектуальную собственность стартапа и его команду из шести человек, а сам Rilo после сделки прекратит работу.

Утекла «трассировка помоев» Nvidia: ИИ приукрашивает игры — результат ужаснее мыслимого

Утечка незавершённой версии DLSS 5 от Nvidia показала, как функция на основе ИИ меняет графику видеоигр. В демонстрационных роликах моддеров классическая Halo: Combat Evolved получила пятнистые цвета, дешёвый эффект HDR и пугающе гиперреалистичные лица, а персонаж Cloud Strife из Final Fantasy превратился в «приукрашенную» версию самого себя. Обработка также резко снижает производительность: в Final Fantasy VII Rebirth частота кадров упала вдвое, а в GTA V — с 90 до 29 кадров в секунду. Функция пока официально не выпущена, но утечка усилила критику технологии, которую игроки уже прозвали «трассировкой помоев».

Solaris от Runway — ИИ-система, генерирующая интерфейсы программ в реальном времени

ИИ-компания Runway представила Solaris — первую модель в новой категории «моделей мира интерфейсов». Она не запускает готовый код, а генерирует пользовательский интерфейс кадр за кадром прямо во время взаимодействия. Solaris выводит интерфейс в разрешении 720p и реагирует на клики, перетаскивания и голосовые команды. Такой подход меняет привычную схему работы программ: вместо фиксированного приложения, которое обновляется только после выпуска новой версии, система каждый раз формирует происходящее на экране заново.

Ответ Google Canva — ИИ-инструмент, где вместо дизайна задают запросы

Google представила Google Pics — инструмент для создания и редактирования изображений по запросам, который станет частью Google Workspace для корпоративных клиентов и подписчиков Google ИИ Pro и Ultra. Сервис работает на модели генерации изображений Nano Banana и в ближайшие недели начнёт распространяться среди большинства пользователей Workspace и платных подписчиков Google ИИ. Google Pics рассчитан на повседневные задачи: создание плакатов, публикаций для соцсетей, иллюстраций и других визуальных материалов.

Надбавка за человеческое

ИИ меняет представление о человеческой ценности: по мере того как письмо, программирование, исследование, анализ и создание изображений становятся доступными почти всем, сама компетентность перестаёт отличать одного человека от другого. На первый план выходят качества, которые нельзя получить из модели автоматически: способность судить, воображение, вкус, личный опыт, доверие, моральная смелость и умение задавать неожиданные вопросы. Человеческая ценность связана не с уровнем интеллекта, а с внутренней ценностью каждого человека и его уникальным контекстом. ИИ при этом может стать «протезом разума» — инструментом, усиливающим намерения человека.

ИИ-агент собирает законы физики из видео

Можно ли научить ИИ не просто смотреть видео, а самому выводить из него законы мира? Исследователи предлагают подход, в котором ИИ собирает увиденное в понятное описание мира: какие есть объекты, в каком они состоянии, как они движутся и что будет, если на них повлиять. Для этого ИИ-агент выдвигает догадки, проверяет их в виде работающего описания, сверяет с видео и шаг за шагом исправляет ошибки, пока не получит картину, которая действительно объясняет происходящее. В этом обзоре разбираем, как ИИ превращает видео в проверяемую модель физического мира и почему такой способ помогает машине рассуждать о причинах и последствиях, а не просто узнавать знакомые картинки.

Meta представила модель генерации изображений Muse Image

Meta запустила Muse Image и представила предварительную версию Muse Video — первые модели генерации медиаконтента от Meta Superintelligence Labs. Muse Image точно следует инструкциям, редактирует изображения и объединяет элементы из нескольких исходных материалов, а также умеет пользоваться инструментами и работать вместе с Muse Spark. Muse Video создана на той же базе, поддерживает звук и нацелена на высокую визуальную точность. Muse Image уже доступна в приложении Meta ИИ и на meta.ai, в Instagram Stories в США и WhatsApp в отдельных странах; позже она появится в Facebook. Muse Video выйдет для авторов и пользователей Meta ИИ.

В Лондоне ИИ помог хирургам удалить опухоль мозга

В мае нейрохирурги Национального госпиталя неврологии и нейрохирургии в Лондоне использовали ИИ во время удаления крупной доброкачественной опухоли гипофиза у 48-летнего Rhys Hibbert. Система анализировала видео операции в реальном времени, отмечала скрытые нервы и кровеносные сосуды и подсказывала безопасные участки для работы. Врачи сохранили пациенту зрение: до операции он не мог самостоятельно ходить без очков или трости.

Самый модный клуб Нью-Йорка об умных очках: пронесёте — пожизненный бан

Нью-йоркский клуб Basement объявил в социальных сетях о запрете на умные очки: посетителей, которые придут в них или принесут устройство в сумке, попросят уйти и могут навсегда запретить им вход. В клубе объяснили, что его правило «никаких фото и видео» защищает конфиденциальность, безопасность и свободу людей на танцполе, а устройства для скрытой записи с этим правилом несовместимы. Посетители ночных клубов поддержали решение, назвав такую политику подходящей для всех заведений.

Разработка медицинской робототехники с GPU-нативной симуляцией физики

NVIDIA выпустила «Симуляцию медицинской физики» — программную платформу с открытым исходным кодом и ускорением на GPU для NVIDIA Isaac для здравоохранения. Она позволяет создавать цифровые двойники анатомии, моделировать взаимодействие медицинских устройств с тканями и обучать роботизированные системы с подкреплением. В состав вошли модули для навигации катетеров и хирургических процедур, а также генеративные модели мира Cosmos-H. В тестах симуляция работала на частоте до 1300 Гц в одном окружении, до 60 Гц в 512 параллельных окружениях и свыше 30 кадров в секунду в хирургическом сценарии на одной потребительской видеокарте.

NVIDIA объединила разработку навыков гуманоидных роботов в Isaac GR00T

NVIDIA представила открытую платформу Isaac GR00T Development Platform для сквозной разработки навыков гуманоидных роботов. Она объединяет сбор данных, обучение моделей, оценку и подготовку к развёртыванию, чтобы командам не приходилось вручную связывать разрозненные инструменты и форматы. Ключевой компонент платформы — открытая модель GR00T 1.7 для обобщённых навыков гуманоидов. Она принимает изображения и текст, выдаёт действия робота, доступна на GitHub и Hugging Face, содержит 3 млрд параметров и распространяется по лицензии Apache 2.0.

Предобучены воображать, дообучены действовать: расцвет моделей мира и действий

Модели мира и действий, или WAM, быстро превращаются в новый крупный подход к созданию базовых моделей для роботов. В октябре 2025 года это направление считалось небольшой частью исследований VLA, но за последние месяцы появились публичные разработки NVIDIA DreamZero и Cosmos Policy, LingBot-VA от Ant Group, DVA от Rhoda ИИ, Cortex 2.0 от Sereact и mimic-video от Mimic Robotics. WAM используют предварительно обученные видео- или мировые модели, чтобы одновременно предсказывать будущее состояние сцены и действия робота. Теперь исследователи выясняют, станет ли это устойчивой альтернативой VLA на базе VLM или популярность WAM окажется коротким всплеском.

Pixel 11 Pro XL: Video Boost незаметно урезает 4K60 до 30 кадров/с

Pixel 11 Pro и Pro XL получили запись HDR-видео в 4K с частотой 60 кадров в секунду, но фирменная технология улучшения видео отключает этот режим во время обработки. При включённом улучшении видео смартфон сначала записывает видео максимум в 30 кадров в секунду, а затем добавляет недостающие кадры алгоритмически. Поэтому возвращаемый файл действительно выглядит как 4K60, но половина кадров в нём создана программно. Если вам нужна настоящая запись 4K HDR при 60 кадрах в секунду, улучшение видео придётся отключить.

Переосмыслить независимость: как ИИ Meta меняет роботов Университета Питтсбурга

Лаборатории инженерии человека (HERL) при Университете Питтсбурга вместе с ATDev создают роботизированную платформу RAMMP для людей с инвалидностью. Проект получил до $41,5 млн от американского Агентства перспективных исследовательских проектов в области здравоохранения (ARPA-H). Платформа объединит робототехнику, ИИ, цифровых двойников и открытые модели компьютерного зрения Meta — DINO и Segment Anything Model (SAM). RAMMP должна помочь пользователям безопаснее передвигаться и взаимодействовать с предметами, обрабатывая изображения и данные датчиков прямо на устройстве, без постоянного подключения к сети.

Meta, ByteDance и YouTube контролируют 94% рынка вертикального видео объёмом $150 млрд

По оценке Owl & Co, выручка вертикального видео за пределами Китая достигнет $150 млрд в 2026 году — на 42% больше, чем годом ранее. Meta, ByteDance и YouTube уже контролируют 94% этого рынка, тогда как приложения с микродрамами получают менее 3%. Основное преимущество крупных платформ — готовая аудитория: им не нужно заново платить за привлечение зрителей для каждого сериала. ИИ увеличил объём выпуска материалов, но не вовлечённость: число новых сериалов выросло на 25%, а время просмотра снизилось на 4%. При этом сериалы с живыми актёрами всё ещё собирают больше просмотров, чем созданные с помощью ИИ.

Как ИИ-модели Meta запускают первую волну проектов миссии Genesis

В национальных лабораториях США модели Meta SAM 3 и DINOv3 превратили анализ научных изображений из многонедельной ручной работы в процедуру примерно на 15 минут. Их использует проект SYNAPS-I, который объединяет пять лабораторий Министерства энергетики США и входит в миссию Genesis. После дообучения на данных рентгеновских и нейтронных экспериментов модели обрабатывают снимки на 300 ускорителях A100, восстанавливают трёхмерный объём и размечают структуры прямо во время эксперимента. Раньше разметка одного временного шага могла занимать у специалистов месяц.

GigaPath-Flash и GigaTIME-Flash: к открытиям в масштабе популяции с эффективными моделями патологии

Microsoft Research, Вашингтонский университет и Providence представили GigaPath-Flash и GigaTIME-Flash — исследовательские модели для более экономичного анализа гистопатологических данных. Они сохраняют сопоставимое качество при существенно меньших вычислительных затратах: GigaPath-Flash показывает результат в пределах 3% от исходной GigaPath, используя примерно в 50 раз меньше вычислений. GigaTIME-Flash переводит изображения H&E в карты пространственной протеомики по 21 белковому каналу и не уступает исходной модели на данных по опухолям мозга, груди, кишечника и лёгких. Обе модели доступны с открытыми весами по лицензии Apache 2.0, но пока предназначены только для исследований и не прошли проверку для клинического применения.

NVIDIA выпустила Alpamayo 2 Super для разработки беспилотников

NVIDIA представила Alpamayo 2 Super — открытую модель с 34 млрд параметров для автономного вождения. Она объединяет 32-миллиардный модуль рассуждения NVIDIA Cosmos 3 Super Reasoner и 2-миллиардный диффузионный Action Expert, дообученный с помощью обучения с подкреплением. Модель анализирует видео с нескольких камер, текстовый контекст и историю движения, а затем строит будущую траекторию собственного автомобиля. Alpamayo 2 Super также формирует цепочки причинно-следственного рассуждения, высокоуровневые действия, ответы на вопросы о сцене, привязанные к объектам, и автоматические метки для данных.

Generalist достигла оценки в $3 млрд, сообщают источники

Робототехническая компания Generalist достигла оценки в $3 млрд после привлечения почти $200 млн дополнительного капитала во главе с 8VC, сообщили два источника, знакомых с раундом. Эти деньги стали продолжением раунда серии B на $400 млн, который Radical Ventures возглавила в июне при оценке компании в $2 млрд. Теперь общий объём раунда достиг $600 млн. Generalist разрабатывает базовую модель ИИ для разных роботов и утверждает, что её версия Gen 1.5 позволяет осваивать новые задачи по видеодемонстрациям длительностью от 3 до 12 секунд.

Clipto с помощью ИИ ищет терабайты видео — оценка $250 млн

Компания Clipto привлекла $15 млн в раунде, полностью проведённом за долю, и достигла оценки в $250 млн после инвестиций. Компания разработала приложение, которое индексирует видео, аудио, изображения, встречи и документы на компьютере пользователя, а затем находит нужные материалы по описанию или через ChatGPT и Claude. Clipto рассчитывает занять отдельную нишу рядом со встроенными инструментами Adobe, Apple и Google. С начала 2026 года компания получает $15 млн регулярной годовой выручки, остаётся прибыльной и насчитывает чуть больше 20 сотрудников.

Бывшие исследователи Meta хотят внедрить визуальный ИИ на производстве

Компания Perceptron, основанная двумя бывшими исследователями Meta, представила Isaac 0.5 — передовую визуальную модель для промышленной автоматизации. Она помогает роботам воспринимать обстановку, рассуждать и действовать на складах и фабриках: читать маркировку, анализировать расположение коробок, выбирать предметы и планировать последовательность действий. Модель выпускается как открытая: её параметры и материалы обучения доступны для проверки. Perceptron обучала Isaac 0.5 на миллионе часов видео и планирует применять её в производстве, логистике, складской работе, безопасности, сфере мобильности, медиа и развлечениях.

Почему лучший ИИ собрал ответ из разных данных с точностью лишь 66%

Почему даже лучший ИИ часто спотыкается, когда ответ нужно собрать не из одного места, а по кусочкам из таблиц, файлов, документов и видео? Исследователи предложили новую проверку для ИИ-агентов: они дают вопрос и целую рабочую папку с разными данными, а на выходе ждут готовую таблицу с точным ответом. Такой формат ближе к реальной работе, где нужные сведения разбросаны по разным источникам, и сразу видно, умеет ли модель не просто искать по одному файлу, а действительно собирать всё вместе без потерь и путаницы. В этом обзоре разбираем, почему даже сильные модели пока часто ошибаются в таких задачах, как устроена эта проверка и что она показывает о будущем ИИ для работы с данными.

Почему ИИ-агентам вредно давать слишком много инструментов сразу

Иногда ИИ-агенту мешает не нехватка возможностей, а их избыток. Исследователи посмотрели, как на практике подключают модели к внешним сервисам и данным, и заметили повторяющиеся удачные схемы, а также частые ошибки. Главное наблюдение простое: когда в поле зрения модели сразу слишком много функций, она начинает хуже выбирать нужное и чаще промахивается. Поэтому важно не просто дать ИИ-агенту доступ ко всему, а аккуратно собрать для него понятную и удобную рабочую среду. В обзоре разберём, какие подходы к устройству таких систем действительно работают, какие ошибки повторяются чаще всего и почему лишние инструменты могут вредить сильнее, чем помогать.

Путь к более общему ИИ лежит через модель мира

Похоже, путь к более общему ИИ лежит не в умении продолжать текст или картинку, а в попытке понять, как устроен сам мир. Авторы предлагают модель, которая учится не отдельным задачам по кускам, а общему представлению о том, что происходит вокруг и как одно состояние мира переходит в другое. Для этого ей показывают и видео, и текстовые описания событий, чтобы она училась связывать увиденное, сказанное и возможные действия. Это важно, потому что такой подход может приблизить ИИ не просто к ответам по шаблону, а к более цельному пониманию происходящего. В этом обзоре разбираем, как устроена такая модель мира, чему именно её учат и почему единое представление о мире может стать важным шагом к более общему ИИ.

Как ИИ-агенты собирают презентации нового поколения с голосом, видео и интерактивом

Генерация презентаций долго жила в довольно скучном режиме: есть документ, есть набор тезисов, модель превращает всё это в слайды. Полезно, но предсказуемо. Новая работа PresentAgent-2 пытается заметно поднять планку.

От восприятия к визуальному мышлению: как добавить ИИ внутреннее «воображение»

За последние годы мультимодальные LLM научились распознавать объекты, но как добавить им визуальное воображение? Разбор концепции Cognitive Supersensing. За последние годы мультимодальные LLM (MLLM) научились распознавать объекты, читать подписи, отвечать на вопросы по изображению и даже неплохо объяснять, что происходит в кадре. Но у них есть…

Code2Worlds: LLM как движок мира — как ИИ начинает симулировать реальность

Генеративные модели научились рисовать впечатляющие ролики, но у такого видео есть слабое место: оно не обязано подчиняться законам физики. Объект может «плыть» в воздухе, частицы — игнорировать гравитацию, а твёрдые тела — проходить друг сквозь друга. Для задач пространственного интеллекта…

Open-source наносит ответный удар: Управляемая симуляция мира, которая работает в реальном времени

Ещё недавно модели научились генерировать видео по тексту с несколькими секундами связного движения. Но стоит попросить такую систему пройти вперёд, оглянуться и вернуться к знакомому объекту — чуда не происходит. Объекты меняются местами, детали «плывут», а причинно‑следственная логика уступает…

Почему мышление через видео может быть следующим шагом в развитии ИИ

Когда мы просим модель рассуждать, она делает это с помощью слов в случае текста или с помощью статичной сцены в случае картинки. Однако окружающий мир не является статичным: объекты могут перемещаться, а правила часто складываются только по их поведению во времени. Авторы предлагают…

От пикселей к смыслу: как SVG помогает ИИ понимать мир

Современные визуально-языковые модели видят картинку как массив пикселей. Но чтобы по-настоящему понимать картинку, им нужно работать не с пикселями, а с символами — как с кодом. Это хорошо работает с распознаванием изображений, но плохо — для использования изображения в контексте при работе с…

Почему линейная регрессия всё ещё обыгрывает трансформеры в анализе временных рядов

На волне успеха ИИ в языке, изображениях и видео многие надеялись, что трансформеры помогут и прогнозированию временных рядов. Реальность чаще прозаична: простая линейная регрессия нередко бьет громоздкие модели по среднеквадратичной ошибке. Рассматриваемое исследование аккуратно и строго…

Как агенты учатся по видео на YouTube

ИИ-агенты обещают помочь нам в реальных приложениях: от настройки браузера до редактирования изображений и работы с медиаплеером. Но чтобы уверенно жать на нужные кнопки и не путать меню, им нужны тысячи качественных демонстраций, снятых прямо в целевых программах. С такими данными беда: готовые…

Как ИИ научился делать научные видео — от слайдов до говорящей головы

Короткое 2–10‑минутное видео с пояснениями к статье сегодня стало почти обязательным: его ставят на страницу проекта, показывают на семинарах, пересылают коллегам. Но сделать такое видео — это часы подготовки слайдов, запись голоса и говорящей головы, монтаж и правки. И это совсем не то же…

Как мозг предсказывает следующее слово и при чем тут ИИ

Мы редко слушаем речь как поток неожиданных звуков. Мозг постоянно строит догадки о следующем слове и проверяет себя по мере поступления звука. Такой режим экономит силы: чем точнее ожидание, тем меньше усилий на распознавание. Есть много данных о предсказаниях в зрении и слухе, но семантика —…

Как ИИ начинает понимать чёрный юмор

Шутка шутке рознь. Чистый юмор держится на игре слов и безобидных несоответствиях, чёрный — на болезненных темах, культурных намёках и тонких контрастах между картинкой и подписью. В мемах это особенно заметно: изображение говорит одно, текст — другое, а смысл рождается на стыке. До недавнего…

Память для роботов: как машины учатся видеть мир осознанно

Сегодня многие ИИ-агенты остаются реактивными: видят кадр — действуют, видят следующий — снова действуют, а связной картины мира не формируют. Отсюда проблемы с дальними маршрутами, переиспользованием опыта и гибкостью. В биологии это решено элегантно: мозг хранит ориентиры, маршрутное знание и…

Аккуратные дипфейки: как невидимые подмены лиц рушат доверие к видео

Часто мы думаем о дипфейках как о полностью синтетических роликах. Но в реальной жизни все чаще встречаются такие аккуратные подмены, когда меняют не все видео, а лишь небольшую часть: жесты, лицо, объект на столе или несколько кадров в середине. Такие точечные правки не бросаются в глаза и…

Нажал — и мир двинулся: Matrix-Game 2.0 делает видео интерактивным в реальном времени

Интерактивные модели мира — это способ учить ИИ «ощущать» мир, а не только описывать его словами. Но до недавнего времени у таких моделей было три больших препятствия: не хватало качественных данных с точной пометкой действий; классические видеодиффузоры считали слишком долго и «забывали» начало…

OmniTry: виртуальная примерка одежды и аксессуаров без масок — система сама найдёт, куда «надеть»

Если вы когда‑нибудь пытались «примерить» очки или галстук на своё фото с помощью приложения, вы знаете главный подвох: системе нужно руками подсказать область замены — нарисовать маску или рамку. Для сотен типов предметов это неудобно и плохо масштабируется. OmniTry решает эту проблему иначе:…

Покажи — и робот поймёт: как Embodied‑R1 сокращает разрыв между «вижу» и «делаю»

Роботы всё чаще видят мир камерой и читают наши текстовые инструкции. Но часто это «знание» не превращается в верное действие: модель понимает, что такое «чашка», но не знает, куда её ставить и как обойти соседние предметы. Этот разрыв между зрением и действием называется seeing‑to‑doing gap.…