i
ДАТАИСТ
К ленте

Мультимодальность

Текст, звук, изображение и видео в одной модели.

4 материала

Метапознание как следующий рубеж для LLM

Может ли ИИ не только отвечать, но и понимать, где он ошибается, чего не знает и как ему лучше думать дальше? Авторы собрали большой обзор о том, что происходит, когда модель учат следить за собственными мыслями и шагами. Речь о способности не просто выдавать ответ, а замечать сомнения, проверять себя, выбирать более удачный путь решения и понятнее объяснять ход рассуждений. Такой подход помогает лучше понять, насколько ИИ надёжен в реальных задачах и где его уверенность может быть ложной. В этом обзоре разбираем, как ИИ учат оценивать себя, проверять свои ответы, видеть пробелы в знаниях и зачем всё это нужно для более разумных и предсказуемых систем.

От восприятия к визуальному мышлению: как добавить ИИ внутреннее «воображение»

За последние годы мультимодальные LLM научились распознавать объекты, но как добавить им визуальное воображение? Разбор концепции Cognitive Supersensing. За последние годы мультимодальные LLM (MLLM) научились распознавать объекты, читать подписи, отвечать на вопросы по изображению и даже неплохо объяснять, что происходит в кадре. Но у них есть…

Будущее программирования — мультимодальное: как JanusCoder научился видеть интерфейс, который сам создает

Научные графики, интерактивные интерфейсы, а также анимации различных теорем – всё это, по сути, визуальное представление кода. Однако сегодня системы искусственного интеллекта учитывают только текстовую модальность и не принимают во внимание, как код будет выглядеть на экране или как он будет…

Как мозг предсказывает следующее слово и при чем тут ИИ

Мы редко слушаем речь как поток неожиданных звуков. Мозг постоянно строит догадки о следующем слове и проверяет себя по мере поступления звука. Такой режим экономит силы: чем точнее ожидание, тем меньше усилий на распознавание. Есть много данных о предсказаниях в зрении и слухе, но семантика —…