Кто на самом деле рассказывает ИИ о вашем бренде
Когда вы спрашиваете LLM про компанию, модель редко отвечает «из головы». Она сначала подтягивает источники из сети, а потом собирает ответ. И тут начинается самое интересное: репутацию бренда для ИИ чаще формирует сайт не компании, а чужие площадки.
Новое исследование посвящено тому, на что именно модели ссылаются. Вместо вопроса «что ИИ сказал о бренде?» исследователь задаёт другой: «откуда ИИ это вообще взял?»
Для маркетинга, поиска и всего, что сейчас называют оптимизацией под генеративные системы, это важно. Если модель читает в основном ваш сайт — это одна стратегия. Если она читает Википедию, YouTube, карьерные порталы и деловые медиа — другая.
Вывод у статьи простой: ИИ строит представление о бренде в основном по внешнему вебу. И этот веб устроен неравномерно: есть несколько доменов, которые влияют очень сильно, а есть длинный хвост источников, которые почти незаметны.
Что именно изучали
Исследование собрано из трёх наборов данных Rankfor AI. В сумме это 128 брендов, 12 домашних рынков, 13 языков и 167 551 цитата с URL, то есть ссылки, где можно определить конкретный домен-источник.
Автора интересовали четыре вопроса:
🟠 сколько ссылок ведёт на собственные сайты брендов, а сколько — на сторонние ресурсы
🟣 насколько сконцентрирован пул источников
🟠 какие домены лидируют по языкам и рынкам
🟣 как по-разному ведут себя разные модели
Подход был достаточно прямой. Каждую ссылку приводили к домену, объединяли языковые поддомены Википедии в один `wikipedia.org`, а затем размечали тип источника: сайт компании, Википедия, новости, соцсети, государственный сайт и так далее.
Есть и важная техническая деталь. У Gemini часть ссылок шла через служебный перенаправитель Google. Если оставить всё как есть, получится ложная картина: будто главный источник — это служебный домен Google. Автор отдельно восстановил реальные домены из полей с заголовками ссылок. Без этой очистки результаты по моделям и языкам были бы неверными.
86% репутации для ИИ приходят извне
Самая заметная цифра в статье: 85,7% цитат ведут на сторонние сайты. На собственные домены брендов приходится только 14,3%.
Это значит, что когда ИИ отвечает на вопрос «кому доверять», «какой сервис выбрать» или «что известно об этой компании», он в основном опирается на то, что о бренде написали другие.
Даже у брендов, которые чаще других цитируются через собственные сайты, доля самоцитирования остаётся меньшинством. А у ряда компаний свои сайты вообще не появлялись среди источников.
Практический смысл тут жёсткий. Если вы хотите влиять на то, что ИИ говорит о вашей компании, одного хорошего корпоративного сайта мало. Нужны упоминания, обзоры, профили, статьи и карточки на площадках, которые модели реально читают.
Источники ИИ сильно сконцентрированы
Вторая находка: веб-источники распределены очень неравномерно.
🟣 80% всех цитат приходятся примерно на 18% доменов
🟠 половина всех цитат укладывается всего в несколько сотен хостов
🟣 оставшиеся тысячи доменов образуют длинный хвост с малой видимостью
Авторы дополнительно проверили распределение по закону Ципфа. Это классическая картина для многих информационных систем: несколько лидеров получают львиную долю внимания, дальше идёт быстрое убывание.
Почему это важно? Потому что борьба за видимость в ИИ-поиске — это борьба за попадание в небольшую группу доменов, которые модели читают чаще всего. Если ваш бренд заметен на этих площадках, шанс повлиять на ответы ИИ растёт непропорционально сильно.
В типах источников тоже есть понятный перекос. Самая большая категория — открытый сторонний веб: локальные медиа, отраслевые сайты, блоги, маркетплейсы, каталоги, всё, что не уложилось в аккуратные ярлыки. На неё приходится 77% URL-цитат. Википедия даёт около 4%, сайты компаний — около 16%, а все остальные типы по отдельности совсем малы.
Почти везде побеждает Википедия
Если смотреть на самые цитируемые домены по языкам, картина удивительно стабильна. Википедия — домен номер один в 11 из 12 языков.
Это один из самых прикладных результатов статьи. У Википедии нет «модной» ауры, но для LLM она остаётся базовым справочником. Если у бренда слабая статья, устаревшая статья или статьи нет, это напрямую влияет на то, из чего ИИ будет собирать ответ.
Исключение одно — литовский язык. Там Википедию обходит местное деловое издание `vz.lt`.
Это пример того, что общий слой у ИИ действительно глобальный, но на краях он меняется по рынкам. Модель почти всегда опирается на Википедию, но в конкретной языковой среде её могут подвинуть локальные деловые медиа, если они особенно заметны и релевантны.
Если смотреть на общий рейтинг доменов, верхушка выглядит так: Википедия, YouTube, Statista, дальше идут отдельные сайты брендов, Reddit, европейские государственные ресурсы и другие крупные площадки.
Из этого складывается ясная картина: ИИ собирает бренд не только из официальных корпоративных страниц, а из смеси энциклопедии, видео, статистических сайтов, форумов и локальных публикаций.
Польша выбивается: ИИ читает карьерные порталы
Самая интересная локальная аномалия в статье — польский рынок. Там у 46 национальных брендов самым цитируемым доменом оказался YouTube, а не Википедия.
Но ещё интереснее другое. Четыре польских кадровых и карьерных сайта вместе дали 637 цитат, тогда как польская Википедия — 297. То есть карьерные площадки обогнали энциклопедию более чем вдвое.
Что это значит на практике? Если вы работаете на рынке, где бренд активно обсуждают в контексте найма, условий труда, зарплат, вакансий и отзывов сотрудников, ИИ может собирать образ компании именно оттуда. Не из раздела «О нас», а из среды вокруг работодателя.
Для бизнеса это неприятный, но полезный сигнал. Репутация бренда в ИИ — это не только продукт, PR и новости. Это ещё и то, как вас описывает рынок труда.
Модели цитируют по-разному
Отдельный блок статьи посвящён различиям между моделями. Нет единого поведения «у ИИ» вообще. Разные системы читают и цитируют по-разному.
🟠 Perplexity цитирует больше всех
🟣 Perplexity охватывает самый широкий набор доменов
🟠 GPT ссылается на более узкий набор источников
🟣 Gemini без очистки перенаправителей даёт искажённую картину по собственным источникам
По данным работы, Perplexity дал 90 276 цитат из 131 514 в основной части корпуса и сослался почти на 16 тысяч доменов. Это заметно больше, чем у других моделей в выборке. У него же была и самая высокая доля ссылок на собственные сайты брендов.
Gemini показал другой тип проблемы: если не разбирать служебные ссылки, можно решить, что модель почти не ссылается на сайты компаний. После восстановления реальных доменов картина меняется.
Из этого следует правило для любых аудитов: если вы хотите понять, как ИИ видит ваш бренд, нельзя смотреть только одну модель и нельзя доверять сырым ссылкам без нормализации. Иначе вы измеряете артефакты дата-пайплайна, а не реальное поведение системы.
Почему это важно
За последние два года многие начали измерять видимость бренда в LLM по ответам: упомянули вас или нет, рекомендовали или нет, какой был тон. Эта статья показывает, что полезнее смотреть глубже — на слой источников.
Потому что ответ можно переформулировать. Источник — сложнее. Если модель раз за разом читает Википедию, YouTube, локальную прессу и карьерные порталы, именно там и формируется сырьё для будущих ответов.
Для компаний отсюда следуют несколько прямых выводов:
🟣 собственный сайт нужен, но он не главный источник для ИИ
🟠 работа с Википедией остаётся базовой задачей почти на всех рынках
🟣 локальные медиа и специализированные площадки могут быть важнее глобальных ресурсов
🟠 репутация работодателя влияет на то, что ИИ говорит о бренде
🟣 видимость нужно проверять по рынкам и по моделям, а не в одном усреднённом срезе
Есть и более широкий смысл. ИИ-поиск становится новым посредником между пользователем и вебом. А значит, вопрос «кто оказался в источниках» постепенно становится не менее важным, чем вопрос «кто оказался в топе обычного поиска».
Ограничения, о которых стоит помнить
У работы есть несколько аккуратно описанных ограничений.
Во-первых, три набора данных собирались не совсем одинаково. Это не единая идеально однородная таблица, а объединённый корпус с разной глубиной разметки.
Во-вторых, не все источники были доступны как чистые URL. Часть данных из Центральной и Восточной Европы размечалась по ключевым словам, а не по доменам, поэтому основной анализ фактически держится на двух крупных поднаборах.
В-третьих, эвристика «собственный сайт бренда» завязана на совпадение имени бренда в домене. Это разумно, но не идеально: какие-то случаи она может пропустить, а какие-то — посчитать спорно.
Наконец, исследование измеряет именно поведение моделей при цитировании, а не настоящую репутацию бренда в глазах людей. Это не одно и то же. Но в мире, где ответы ИИ всё чаще становятся первым касанием с брендом, такое измерение уже само по себе очень значимо.
Вывод
Если вы хотите влиять на то, что LLM говорят о компании, смотреть нужно не только на ответы, но и на источники под ними.
Статья показывает три устойчивые вещи. Первая: ИИ в основном читает сторонние сайты, а не сайты брендов. Вторая: влияние сосредоточено у небольшого числа доменов. Третья: глобальная картина почти везде строится вокруг Википедии, но локальные рынки могут резко менять баланс.
Отсюда следует практическая логика. Работать надо не только с собственным контентом, но и с внешним вебом: энциклопедиями, деловыми медиа, видеоплощадками, отраслевыми каталогами, карьерными ресурсами, локальными изданиями. Именно там LLM чаще всего «читают» бренд.
Видимость в ИИ-поиске всё меньше похожа на классическое продвижение сайта по одному домену. Это уже управление присутствием в сети источников, из которых модель собирает свою версию реальности.
ИИ-обзоры простыми словами
Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram