AI-поисковики10 мин

Как ChatGPT, Perplexity и Gemini выбирают какие сайты цитировать

Бесплатная проверка AI-готовности

Узнайте свой GEO-скор до прочтения

Мгновенный скор · Без email · Проверяет сигналы ChatGPT, Gemini, Grok

Разработка Causabi заставила меня реверс-инжинирить, как на самом деле каждый AI-движок выбирает свои источники. Я прочитал документацию API, прогнал сотни тестовых запросов и сравнил результаты. То, что я обнаружил, меня удивило — механизмы у ChatGPT, Perplexity и Gemini радикально разные.

Традиционное SEO — это про ранжирование в списке. GEO — это про то, чтобы быть выбранным в качестве источника. Это принципиально разные задачи — и у каждого AI-поисковика свой механизм выбора источников. Понимание технических деталей — первый шаг к тому, чтобы попасть в их ответы.

Три пайплайна

ChatGPT, Perplexity и Gemini — все они показывают веб-контент в AI-ответах, но путь от «твоего сайта» до «процитирован в AI-ответе» у каждого свой. Вот как на самом деле работает каждый из них.

ChatGPT: Responses API + web_search_preview

Когда ChatGPT отвечает на вопрос, требующий актуальной информации, он использует инструмент web_search_preview через OpenAI Responses API. Это отличается от Chat Completions API — именно Responses API реально загружает и цитирует URL.

Пайплайн работает так:

  1. Пользователь задаёт вопрос
  2. ChatGPT решает, нужен ли веб-поиск (информационный интент его запускает)
  3. Выполняется поиск в Bing с переформулированным запросом
  4. Топ-результаты загружаются и парсятся
  5. Контент передаётся в GPT-4o для синтеза
  6. Модель генерирует ответ, цитируя реально использованные источники как аннотации url_citation

Что это значит для оптимизации

  • Важен ранг в Bing. ChatGPT ищет через Bing. Если ты не ранжируешься в Bing, тебя не найдут.
  • Структурированные данные помогают. Bing сильно учитывает структурированные данные в сигналах ранжирования.
  • Скорость загрузки страницы важна. Медленные страницы могут быть пропущены на этапе загрузки.
  • Важны чёткие, цитируемые абзацы. GPT-4o предпочитает контент с отдельными, самодостаточными утверждениями, которые можно точно процитировать.

Perplexity: Sonar с прямыми цитированиями

Perplexity создан специально для веб-поиска — это самый «цитатный» из трёх движков. Sonar API (семейство моделей Perplexity) возвращает массив citations[] с каждым ответом: список URL, из которых модель реально черпала информацию для генерации ответа.

Пайплайн Perplexity:

  1. Запрос классифицируется и переформулируется
  2. Веб-поиск выполняется по нескольким индексам (Google, Bing, прямой краулинг)
  3. Топ-5-10 страниц загружаются и разбиваются на фрагменты
  4. Модель Sonar синтезирует ответ из фрагментов
  5. Ответ содержит пронумерованные цитаты, ссылающиеся на исходные URL

Механизм цитирования Perplexity уникален: он цитирует конкретные фрагменты, а не просто страницы. Это значит, что контент, чётко разбитый на разделы (заголовки, короткие абзацы, списки), с большей вероятностью будет процитирован дословно.

Что это значит для оптимизации

  • Сегментация контента. Используй заголовки H2/H3 для создания цитируемых разделов. Каждый раздел должен отвечать на один вопрос.
  • Свежесть. Perplexity сильно учитывает свежий контент. Регулярно обновляй ключевые страницы.
  • FAQ schema. Perplexity извлекает пары вопрос-ответ напрямую из FAQPage JSON-LD.
  • Авторитетность домена всё ещё важна. Домены с более высоким авторитетом получают больше веса на этапе первичного отбора.

Gemini: Google Search Grounding и AI Overviews

Gemini использует собственную поисковую инфраструктуру Google с функцией «grounding». Когда Gemini задают фактический вопрос, он вызывает инструмент google_search_retrieval, который ищет в Google и возвращает источники как grounding_chunks с веб-URI.

Эти grounding-источники — это то, что питает Google "AI Overviews" — сводку, которая появляется вверху результатов поиска Google. Здесь прямая связь: если ты появляешься в grounding-источниках Gemini, скорее всего, ты появишься и в AI Overviews.

Ключевое отличие от ChatGPT: Gemini ищет в Google, а значит применяется весь алгоритм ранжирования Google — PageRank, E-E-A-T, Core Web Vitals и все сигналы структурированных данных.

Что это значит для оптимизации

  • Google SEO остаётся фундаментом. Gemini/AI Overviews усиливают существующее ранжирование Google. Традиционное SEO всё ещё важно.
  • Сигналы E-E-A-T. Опыт, экспертиза, авторитетность, доверие — особенно важны для тем здоровья, финансов и технической сферы.
  • FAQPage schema напрямую питает AI Overviews. Это задокументировано Google — структурированные FAQ-данные являются одним из явных источников контента для AI Overview.
  • Core Web Vitals. Медленные, дёрганые страницы штрафуются в ранжировании Google и, соответственно, в цитированиях Gemini.

Yandex GPT: определение упоминаний по тексту

Yandex GPT (используется в голосовом помощнике «Алиса» и поиске Яндекса) применяет другой подход. В отличие от западных движков, он не раскрывает URL-цитирования — вместо этого он упоминает бренды и сайты прямо в тексте ответа. Мониторинг Яндекса требует проверки, появляется ли твой домен или название бренда в ответе.

Турбо-страницы Яндекса (аналог AMP) и структурированные данные через инструменты Яндекса (Яндекс.Вебмастер) — основные рычаги видимости в поиске Яндекса.

Общие сигналы для всех трёх

Несмотря на разную архитектуру, есть устойчивый набор сигналов, который повышает частоту цитирования во всех AI-поисковиках:

FAQPage JSON-LD
+41% частота цитирования
Работает в ChatGPT, Perplexity, Gemini
Доступ AI-ботов в robots.txt
Обязательный минимум
GPTBot, ClaudeBot, PerplexityBot не должны быть заблокированы
Schema.org Organization/Product
Идентификация сущности
Помогает AI понять, кто ты. Сама по себе разметка цитирований не даёт — решает контент
Глубина контента (800+ слов)
+12% частота цитирования
Тонкие страницы теряют приоритет во всех движках
Явные цены и конкретика
Порог цитирования (SIGIR 2026)
Хеджированный язык («возможно», «как правило») резко снижает шансы цитирования — исследование на 252 тыс. прогонов
Упоминания бренда + ссылки sameAs
+8% частота цитирования
LinkedIn, GitHub, Wikipedia — устанавливают авторитетность
Свежий контент
Сильный фильтр цитирования
Страницы без видимых дат обновления цитируются заметно реже во всех движках

Как мониторить частоту своих цитирований

Единственный способ узнать, реально ли цитируют тебя AI-движки, — это спросить их напрямую. Для каждого движка это означает:

  • ChatGPT: используй Responses API с инструментом web_search_preview и проверяй аннотации url_citation в выводе
  • Perplexity: используй Sonar API и проверяй массив citations[] в ответе
  • Gemini: используй grounding через google_search_retrieval и проверяй grounding_metadata.grounding_chunks[].web.uri
  • Яндекс: проверяй, появляется ли твой домен в тексте ответа

Именно это автоматизирует модуль мониторинга Causabi — еженедельно прогоняет твои целевые запросы через каждый движок и отслеживает частоту цитирования во времени.

Узнай свой текущий рейтинг цитирования

Causabi оценивает твой сайт по всем 5 измерениям GEO и точно показывает, что мешает тебе быть процитированным AI-поисковиками.

Проверить свой GEO-рейтинг →

Альтернативы для мониторинга цитирований

  • Ahrefs Site Audit — отлично подходит для технических SEO-сигналов, влияющих на индексируемость (не специфичен для AI-цитирования, но это фундамент)
  • Surfer SEO — оптимизация контента под поисковые сигналы; полезен для измерения глубины контента
  • Frase — брифы для контента и NLP-оптимизация; помогает с сущностными и семантическими сигналами
  • Ручной мониторинг — запускай свои целевые запросы напрямую в ChatGPT/Perplexity/Gemini еженедельно и отслеживай, появляется ли твой домен. Требует времени, но бесплатно.

Похожие GEO-гайды

Примените это к своему сайту — бесплатно, без регистрации

Проверьте, насколько ваш сайт цитируют AI

Мгновенный скор · Без email · Проверяет сигналы ChatGPT, Gemini, Grok

Как ChatGPT, Perplexity и Gemini выбирают какие сайты цитировать