Мобильные данные помогают ИИ лучше понимать места
Место — это не только текст
ИИ заметно продвинулся в понимании мира по тексту. Но для работы с физической средой моделям нужно учитывать больше, чем слова: они должны понимать, как объекты работают в реальности и меняются со временем. У каждого места есть две разные характеристики — его формальное описание и фактический ритм активности.
Обычно языковые модели создают представления точек интереса (POI) — компаний, парков, достопримечательностей и других объектов — в основном по статическим данным. Они анализируют адреса, категории бизнеса и текстовые описания. Даже такие модели, как Gemini, хорошо работающие с текстом, получают более полное географическое представление, если добавить динамику городской среды. Данные о перемещениях помогают уловить характерный для каждой точки интереса ритм активности в течение дня и недели.
Google Research представила ME-POIs — систему, которая улучшает текстовые представления мест, созданные языковыми моделями. Она использует открытые наборы данных для бенчмарков и добавляет агрегированные обезличенные сведения о времени прибытия, длительности пребывания и перемещениях вокруг объекта. Место здесь рассматривается не как застывший набор слов: самообучаемый подход объединяет текст с крупномасштабными обезличенными данными о мобильности, отражающими пространственную активность окружающей среды в течение дня.
В результате модель создаёт числовое представление — эмбеддинг, или математический «отпечаток», — в котором одновременно закодированы идентичность места и его функция. Интеграция ME-POIs с современными текстовыми моделями дала до 81,9% относительного прироста в предсказании намерения посетить место, улучшила классификацию ценового уровня на 75,1% и повысила точность оценки загруженности на 24,7% для ранее не встречавшихся мест.
Предварительно обогащённое представление упрощает для ИИ-моделей выводы о разных свойствах объекта — например, о часах работы, ценовом уровне и текущем статусе бизнеса. Модели не приходится каждый раз вычислять эти характеристики с нуля.
Чтобы глубже понимать места, нужно разделять их идентичность — название и категорию — и функцию, то есть агрегированный след посещений. В предыдущих географических исследованиях данные о мобильности почти всегда использовались для предсказания следующей точки интереса, которую посетит пользователь. ME-POIs переносит мобильность из результата предсказания во входной признак, который помогает определить само место.
Что такое ME-POIs
Преобразование исходных географических точек в понятный числовой эмбеддинг строится из трёх этапов: согласования посещений, пространственного распространения посещений на нескольких масштабах и объединения текста с данными о мобильности.
ME-POIs соединяет статические текстовые метаданные, описывающие идентичность точки интереса, с динамическими шаблонами посещений из открытых бенчмарков, отражающими её функцию.
Модель рассматривает совокупные посещения конкретного объекта как базовые данные. Она анализирует временные окна прибытия, тенденции ухода и типичную длительность пребывания. Вместо простого подсчёта средних значений временной кодировщик переводит эти последовательности в плотное векторное пространство. Так формируется «функциональный центр» — многомерный уникальный отпечаток агрегированных обезличенных перемещений, связанных с местом на протяжении годового цикла и в разные дни недели.
Схема, показывающая, как текстовые метаданные POI и обезличенные паттерны мобильности объединяются в эмбеддинг ME-POIs
Источник: research.google
Как система работает с нехваткой данных
В географических данных постоянно возникает проблема длинного хвоста. Известные достопримечательности, крупные торговые центры и популярные сетевые заведения получают много данных о посещениях. У большинства локальных компаний — небольших магазинов, специализированных мастерских и недавно открывшихся кафе — таких данных мало. Раньше модель могла принять место с небольшим числом записей или без них за объект с нулевой активностью, из-за чего предсказания становились неверными.
ME-POIs решает эту проблему с помощью пространственного распространения посещений на нескольких масштабах. Архитектура учитывает, что посещения обычно связаны с конкретным районом: небольшой бутик на дорогой торговой улице может иметь общие поведенческие признаки с соседними объектами. Система анализирует близлежащие места на уровне улицы, квартала и более широкого района.
Затем она статистически переносит агрегированные шаблоны посещений от загруженных соседей, по которым много данных, к расположенным рядом объектам с дефицитом информации. Изучив региональный «ритм» по активным местам, модель формирует географический априорный набор знаний и применяет его к небольшим магазинам, даже если те почти не представлены в данных или вовсе в них не встречаются.
ME-POIs не отбрасывает текстовые описания, а дополняет их. Высокоуровневые языковые эмбеддинги — стандартные векторные представления, которые получают современные модели вроде Gemini, — выравниваются с созданными векторами мобильности через максимизацию косинусного сходства. Сигнал мобильности добавляется непосредственно к языковому представлению, формируя более полное описание места или бизнеса.
Гибридный подход сохраняет смысловую структуру текста: модель понимает, например, что объект продаёт еду. Одновременно она получает операционный контекст из мобильного отпечатка — может отличить место для обеда от заведения, работающего допоздна.
Проверка на невиденных местах
Чтобы проверить, формирует ли ME-POIs обобщённое понимание физических мест, исследователи провели масштабные испытания в двух крупных и культурно разных агломерациях — Лос-Анджелесе и Хьюстоне.
Систему проверили на пяти задачах: часы работы, постоянное закрытие, намерение посетить место, пиковая загруженность и ценовой уровень. Для проверки обобщаемости модель обучали на уже известных объектах, а затем просили предсказывать свойства полностью новых мест.
В качестве исходной точки ME-POIs сравнили с обычными эмбеддингами, основанными только на тексте, например с эмбеддингами Gemini, существующими географическими моделями на основе траекторий, такими как TrajGPT, а также с гибридными вариантами. Это позволило отдельно оценить вклад данных о мобильности.
На невиденных тестовых местах добавление ME-POIs заметно повысило точность. Система стабильно опережала базовые варианты, использовавшие только текст или только мобильность, во всех проверенных задачах.
Две столбчатые диаграммы, демонстрирующие, что модель ME-POIs превосходит базовые модели в различных задачах прогнозирования
Источник: research.google
ME-POIs последовательно улучшал результаты по всем направлениям, особенно в предсказании намерения посетить место и классификации ценового уровня по сравнению с базовыми моделями.
Отдельный результат показало сравнение модели, обученной только на данных о мобильности, с моделями, которым были доступны только текстовые метаданные. В ряде случаев, например при классификации ценового уровня, вариант с одной мобильностью превзошёл текстовые языковые модели. Это показывает, что коллективное поведение людей в физическом месте иногда описывает его точнее, чем формальные слова на вывеске или в справочнике.
Вывод
ME-POIs позволяет ИИ-моделям выйти за пределы статичных цифровых ярлыков и описывать физический мир через совокупные поведенческие признаки. Система работает с объектами в целом: она показывает, как место посещают широкие группы людей в разные периоды времени, но не делает выводов об отдельных пользователях и не предназначена для персонализации.
Её задача — создавать насыщенные числовые отпечатки мест, чтобы последующим системам было проще и дешевле делать выводы о них. ME-POIs также стала частью более широкой инициативы Google Earth ИИ, направленной на создание географических моделей и наборов данных, которые превращают данные о планете в прикладные сведения.
В работе участвовали Neha Arora из Google Research, а также профессор Cyrus Shahabi и аспирант Shang Ling Hsu из Университета Южной Калифорнии (USC).
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram