i
ДАТАИСТ
К ленте

Мультимодальность

Текст, звук, изображение и видео в одной модели.

17 материалов

MAI-Transcribe-2 от Microsoft обходит OpenAI, Google и ElevenLabs по цене и скорости

Microsoft ИИ выпустила MAI-Transcribe-2 — модель распознавания речи, которая, по заявлению компании, превосходит по скорости и точности решения OpenAI, Google и ElevenLabs и стоит дешевле. Цена запуска — 10 центов за час аудио против 36 центов у первой модели линейки, выпущенной пять месяцев назад. Для компании, обрабатывающей 100 000 часов записей колл-центра в год, расходы снизятся с $36 000 до $10 000. Одновременно Microsoft расширила поддержку до 60 языков и добавила расшифровку с разделением говорящих, временными метками и переключением между языками.

Meta: Muse Voice Transcribe — $0,18/ч за диаризацию 20+ говорящих. Выгодно ли бизнесу?

Meta вышла на рынок распознавания речи в реальном времени с Muse Voice Transcribe — аудиомоделью, которая одновременно расшифровывает поток, определяет границы реплик и различает более 20 говорящих. Публичный API стоит $0,18 за час обработанного аудио. Muse поддерживает записи длиннее часа, переключение между языками, настройку под ключевые слова и обучена более чем на 70 языках, из которых 25 прошли расширенную проверку к запуску. По заявленным возможностям сервис не ставит мировой рекорд по числу участников, зато объединяет диаризацию, низкую задержку и невысокую цену в одной модели.

Неужели ИИ и правда способен шантажировать вас или взломать?

Сообщения о том, что ИИ якобы выходит из-под контроля, шантажирует людей и взламывает сети, усилили общественную тревогу. Но при ближайшем рассмотрении выясняется, что речь шла о контролируемых испытаниях: в тестах модель Claude компании Anthropic поставили в искусственный сценарий и отключили защитные ограничения, а модели OpenAI и Meta получили возможность покинуть изолированные среды. Эти случаи скорее показывают «игру по спецификации» — буквальное достижение цели без понимания её последствий, — чем злой умысел. Компании уже усиливают безопасность, а законодатели предлагают законопроект об аварийном отключении, который должен обеспечить возможность немедленно отключать модели при аномальном поведении.

Google приближает AMIE к экспертному уровню аудиовизуальных медконсультаций

Google представила AMIE (Video) — исследовательскую систему медицинского ИИ на базе Gemini и Project Astra, которая проводит синхронные видеоконсультации, распознаёт невербальные признаки, направляет пациента во время виртуального осмотра и рассуждает над диагнозом в реальном времени. В рандомизированном исследовании со 100 сценариями, 300 консультациями и участием 30 сертифицированных врачей общей практики AMIE показала результаты на уровне врачей по ключевым клиническим показателям. Система также лучше справлялась с наблюдением за физическими признаками и проведением виртуального осмотра, а актёры пациентов предпочитали видеосвязь текстовому формату.

GPT-6 Astra — первая модель, с которой OpenAI готова объявить «эру AGI»

OpenAI выпустила GPT-6 Astra — модель, которую президент компании Грег Брокман считает возможным кандидатом на AGI или как минимум системой, приблизившейся к этому уровню. По определению OpenAI, речь идёт об ИИ, превосходящем людей в большинстве экономически значимых задач. Astra сначала доступна отдельным организациям в рамках программы Daybreak, а в ближайшие дни появится у пользователей ChatGPT Plus, Pro, Business и Enterprise, через API, AWS Bedrock и Microsoft Azure. В бенчмарках модель заметно опередила GPT-5.6 Sol и Fable, а её стоимость на некоторых задачах оказалась ниже.

Claude Fable 5.1 расшифровала послание роялистов, скрытое у всех на виду с 1653 года

Модель Claude Fable 5.1 от Anthropic, по данным Vals ИИ, за 44 минуты без помощи человека расшифровала считавшуюся нерешённой числовую головоломку XVII века. Речь о «Cyphral Distich» сэра Томаса Уркварта, опубликованной в 1653 году: она состоит из двух строк по 32 числа. Скрытое в книге послание оказалось призывом поддержать короля Карла II и сделать его верховным правителем страны.

У Sonos новые устройства, новая ОС и — да, новое приложение

Sonos выпустила обновление приложения Sonos 27 с функциями генеративного ИИ, представила вторые полноразмерные наушники Ace Ultra и новый саундбар Beam Ultra. Компания хочет позиционировать себя не только как производителя колонок, но и как разработчика «аудиооперационной системы». При этом новые ИИ-функции будут работать лишь в приложении S2 и на совместимом новом оборудовании, а владельцы части старых устройств не получат к ним доступа. Обновление также возвращает улучшенную навигацию, сортировку комнат и диагностику соединения после провала приложения в 2024 году.

ИИ-поиск Google убрал советы вызывать экстренные службы по национальности, но всё ещё метит людей из Facebook

По данным тестов Futurism, поиск Google с ИИ давал разные советы пользователям, которые писали, что остались наедине с человеком африканской, индийской или пакистанской национальности. В таких случаях сервис рекомендовал найти безопасное место или вызвать экстренные службы. Если речь шла о британце, поиск предлагал выпить чаю и поговорить о погоде. После публикации снимков экрана в Reddit Google признала, что ответы не соответствуют её стандартам, и заявила об исправлениях.

Clipto с помощью ИИ ищет терабайты видео — оценка $250 млн

Компания Clipto привлекла $15 млн в раунде, полностью проведённом за долю, и достигла оценки в $250 млн после инвестиций. Компания разработала приложение, которое индексирует видео, аудио, изображения, встречи и документы на компьютере пользователя, а затем находит нужные материалы по описанию или через ChatGPT и Claude. Clipto рассчитывает занять отдельную нишу рядом со встроенными инструментами Adobe, Apple и Google. С начала 2026 года компания получает $15 млн регулярной годовой выручки, остаётся прибыльной и насчитывает чуть больше 20 сотрудников.

Не подпустить Китай к облачной «банке с печеньем»

Американские чиновники готовят ограничения для Китая на удалённую аренду передовых GPU через облачные сервисы в странах вроде Вьетнама и Сингапура. Законопроект «Закон о безопасности удалённого доступа» должен расширить экспортный контроль на удалённый доступ к вычислительным мощностям, поскольку физические запреты на поставки чипов обходят с помощью контрабанды, смены маркировки и упаковки. В Вашингтоне считают, что такие меры нужны из-за рисков для национальной безопасности и военной сферы. Речь, вероятно, идёт не о полном перекрытии доступа, а о замедлении развития Китая через постоянные ограничения, хотя последствия для его ИИ пока неясны.

Маск ускорит выпуск газовых турбин, но столкнётся с загрязнением

Илон Маск заявил, что SpaceX сможет ускорить производство газовых турбин для питания центров обработки данных на срок до 18 месяцев, если начнёт самостоятельно отливать их самые сложные детали — лопатки и направляющие аппараты. Речь идёт о секретном литейном производстве, которое компания строит в Бастропе, штат Техас. Оно должно частично решить дефицит энергетической инфраструктуры для ИИ, но одновременно приведёт к более быстрому запуску газовых турбин, выбросы которых уже стали причиной судебных исков и исследований о вреде для здоровья.

Meta представила мультимодальную модель Muse Spark 1.1

Лаборатория сверхинтеллекта Meta выпустила Muse Spark 1.1 — мультимодальную модель рассуждения для агентных задач. По сравнению с первой Muse Spark она заметно улучшила работу с инструментами и компьютером, программирование и мультимодальное понимание, а также научилась координировать мультиагентные системы. Модель уже доступна в режиме «Рассуждение» в приложении Meta ИИ и на meta.ai. Одновременно Meta открыла публичный предварительный доступ к Meta Model API, через который разработчики могут подключаться к Muse Spark 1.1.

Новости ИИ — Датаист

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Microsoft ИИ выпустила MAI-Transcribe-2 — модель распознавания речи, которая, по заявлению компании, превосходит по скорости и точности решения OpenAI, Google и ElevenLabs и стоит дешевле. Цена запуска — 10 центов за час аудио против 36…

Метапознание как следующий рубеж для LLM

Может ли ИИ не только отвечать, но и понимать, где он ошибается, чего не знает и как ему лучше думать дальше? Авторы собрали большой обзор о том, что происходит, когда модель учат следить за собственными мыслями и шагами. Речь о способности не просто выдавать ответ, а замечать сомнения, проверять себя, выбирать более удачный путь решения и понятнее объяснять ход рассуждений. Такой подход помогает лучше понять, насколько ИИ надёжен в реальных задачах и где его уверенность может быть ложной. В этом обзоре разбираем, как ИИ учат оценивать себя, проверять свои ответы, видеть пробелы в знаниях и зачем всё это нужно для более разумных и предсказуемых систем.

От восприятия к визуальному мышлению: как добавить ИИ внутреннее «воображение»

За последние годы мультимодальные LLM научились распознавать объекты, но как добавить им визуальное воображение? Разбор концепции Cognitive Supersensing. За последние годы мультимодальные LLM (MLLM) научились распознавать объекты, читать подписи, отвечать на вопросы по изображению и даже неплохо объяснять, что происходит в кадре. Но у них есть…

Будущее программирования — мультимодальное: как JanusCoder научился видеть интерфейс, который сам создает

Научные графики, интерактивные интерфейсы, а также анимации различных теорем – всё это, по сути, визуальное представление кода. Однако сегодня системы искусственного интеллекта учитывают только текстовую модальность и не принимают во внимание, как код будет выглядеть на экране или как он будет…

Как мозг предсказывает следующее слово и при чем тут ИИ

Мы редко слушаем речь как поток неожиданных звуков. Мозг постоянно строит догадки о следующем слове и проверяет себя по мере поступления звука. Такой режим экономит силы: чем точнее ожидание, тем меньше усилий на распознавание. Есть много данных о предсказаниях в зрении и слухе, но семантика —…