Як великі мовні моделі формують репутацію брендів на основі джерел різними мовами та на різних ринках

💡 Усі статті, обговорення, новини про AI — в одному місці. Приєднуйтесь до AI спільноти!

Великі мовні моделі дедалі частіше використовуються не лише як генератори тексту, а й як шар інформаційного пошуку (information retrieval). Такі системи, як ChatGPT, Gemini, Copilot і Perplexity, перед формуванням відповіді часто виконують пошук у вебі, поєднуючи пошук інформації та генерацію тексту. У результаті розуміння того, які саме документи потрапляють до процесу retrieval, стає не менш важливим, ніж розуміння самої моделі.

Нове дослідження команди Rankfor.ai аналізує цей рівень retrieval, дослідивши 167 551 URL-цитування, отриманих під час відповідей на запити про компанії. Аналіз охопив 128 брендів, 13 мов та 12 європейських ринків.

Замість оцінювання галюцинацій моделей або результатів бенчмарків дослідники поставили значно фундаментальніше запитання:

Які документи великі мовні моделі насправді використовують, коли їм потрібна інформація про компанію?

Відповідь виявилася напрочуд однозначною.

Більшість інформації надходить із зовнішніх джерел

У всіх проаналізованих моделях 85,7% цитувань припадало на сторонні домени, тоді як лише 14,3% посилалися на офіційний вебсайт компанії.

Це означає, що grounded LLM рідко розглядають корпоративний сайт як основне джерело знань. Натомість контекст, який потрапляє до моделі, переважно формується з документів, опублікованих на сторонніх ресурсах:

  • Wikipedia;
  • новинні сайти;
  • платформи з відгуками;
  • портали роботодавців;
  • галузеві видання;
  • бізнес-каталоги;
  • спільнотні вебресурси.

Іншими словами, retrieval-конвеєр значно більше покладається на інформацію з відкритого вебу, ніж на канонічне джерело, яке підтримує сама компанія.

Retrieval визначає генерацію

З точки зору Information Retrieval (IR), такий результат цілком очікуваний.

Більшість сучасних LLM-асистентів більше не покладаються виключно на параметричну пам’ять моделі. Спочатку вони виконують етап retrieval, ранжують знайдені документи, відбирають релевантні фрагменти для контексту, після чого лише генерують відповідь.

Концептуально цей процес виглядає так:

Запит користувача -> Розуміння запиту -> Пошук у вебі ->Ранжування документів -> Відбір контексту -> Генерація LLM -> Grounded-відповідь із цитуваннями

Якщо вебсайт компанії не потрапляє на етап retrieval, він практично не впливає на зміст згенерованої відповіді.

Це змінює саму постановку задачі: замість питання «Чи можуть користувачі знайти наш сайт?» дедалі актуальнішим стає питання «Чи може retrieval-система знайти потрібні документи?»

Retrieval має високу концентрацію

Одним із найцікавіших статистичних результатів стала концентрація джерел.

Граф цитувань демонструє класичний heavy-tail розподіл:

  • приблизно 80% усіх цитувань походять лише з 18% доменів;
  • 50% усіх цитувань забезпечують лише 547 хостів;
  • решта розподіляється між більш ніж 17 000 доменів.

Подібна структура характерна для багатьох вебмасштабних систем, у яких відносно невелика кількість вузлів домінує під час проходження графа.

Для практиків висновок очевидний.

Покращення AI-видимості полягає не стільки у створенні більшої кількості контенту, скільки в розумінні того, які вузли вебграфа регулярно проходять етап retrieval.

Різні моделі використовують різні графи retrieval

Ще одним цікавим результатом стали відмінності між моделями.

Perplexity генерував значно більше цитувань, ніж інші досліджені AI-асистенти, і використовував набагато ширший набір доменів.

Gemini, ChatGPT та інші системи демонстрували помітно різні розподіли джерел.

Це означає, що єдиного «індексу AI Search» не існує.

Кожна модель фактично формує власний retrieval-граф, використовуючи різні пошукові провайдери, алгоритми ранжування, стратегії grounding та політики цитування.

Тому оцінка видимості лише в одному AI-асистенті практично нічого не говорить про видимість в інших.

Аналіз цитувань складніший, ніж підрахунок посилань

У статті також описано важливу інженерну проблему.

Частина цитувань Gemini спочатку містила лише redirect-посилання Google або Vertex AI замість URL першоджерел.

Без реконструкції цих перенаправлень граф цитувань виявляється неповним.

Це важлива методологічна деталь.

Простого підрахунку видимих посилань недостатньо.

Повноцінна AI-спостережуваність (observability) вимагає реконструкції всього retrieval-ланцюга для визначення реального джерела інформації.

Від SEO до Retrieval Observability

Традиційні SEO-метрики відповідають на запитання:

  • Чи проіндексована сторінка?
  • Яку позицію вона займає?
  • Скільки кліків отримує?

Grounded AI додає новий клас інженерних запитань:

  • Які документи потрапили до retrieval-конвеєра?
  • Які документи пройшли ранжування?
  • Які фрагменти потрапили до контекстного вікна моделі?
  • Які джерела стали цитуваннями?
  • Які домени систематично впливають на згенеровані відповіді?

Усі ці параметри можна вимірювати, аналізувати та використовувати для побудови AI Observability у міру того, як LLM стають новим інтерфейсом доступу до інформації.

Вебграф поступово стає графом знань

Мабуть, найцікавіший висновок полягає не в самих відсотках.

Сучасні LLM дедалі частіше формують знання про компанії не з авторитетних першоджерел, а з розподіленого графа документів відкритого вебу.

На практиці це означає, що AI-репрезентація компанії формується документами, які retrieval-система регулярно відбирає, а не обов’язково тими матеріалами, які публікує сама компанія.

Для інженерів, які розробляють AI-продукти, retrieval-системи або інструменти AI Observability, це підтверджує фундаментальний принцип:

Якість генерації обмежується якістю retrieval.

Розуміння retrieval-графа стає таким самим важливим, як і розуміння самої мовної моделі.

Стаття: How Large Language Models Source Brand Reputation Across Languages and Markets (arXiv:2606.25787) arxiv.org/abs/2606.25787

👍ПодобаєтьсяСподобалось0
До обраногоВ обраному0
LinkedIn
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter
Дозволені теги: blockquote, a, pre, code, ul, ol, li, b, i, del.
Ctrl + Enter

Підписатись на коментарі