GEO: как попасть в ответы искусственного интеллекта. Новая эпоха поиска, где бренды рекомендуют нейросети
GEO: как попасть в ответы искусственного интеллекта. Новая эпоха поиска, где бренды рекомендуют нейросети

Полная версия

GEO: как попасть в ответы искусственного интеллекта. Новая эпоха поиска, где бренды рекомендуют нейросети

Настройки чтения
Размер шрифта
Высота строк
Поля
На страницу:
3 из 3

Это создаёт эффект, частично похожий на ранние годы SEO: компании, которые раньше начали создавать качественный контент, экспертные публикации, внешние упоминания и устойчивый цифровой след, получили преимущество перед теми, кто пришёл позже.

Однако механизм отличается: речь идёт не только о позициях в выдаче, а о способности бренда быть распознанным как значимый источник внутри нового слоя поиска.

Сегодня рынок ещё находится на ранней стадии формирования стандартов GEO. Многие компании пока не измеряют собственную видимость в ИИ-ответах и не понимают, насколько часто их заменяют конкуренты в момент выбора пользователя.

Именно поэтому окно возможностей остаётся открытым: конкуренция за место в ответах ИИ только начинается.

Итог части I

Мы прошли путь от изменения самого интерфейса поиска (глава 1) через наведение порядка в терминах (глава 2) и разбор технической механики разных ИИ-платформ (глава 3) к экономическому обоснованию нового канала (глава 4).

Дальше книга переходит от вопроса «зачем это нужно» к вопросу «как это работает».

В части II разберём, какие именно сигналы определяют выбор источников ИИ-системами: качество контента, экспертность, цифровой след бренда, техническая доступность и внешние факторы доверия.

Часть III покажет, что конкретно делать компаниям: от архитектуры сайта и контент-стратегии до построения системного процесса GEO-оптимизации.


Источники данных главы:

Исследования рынка и аналитика: Adobe Digital Insights – исследования влияния генеративного ИИ на e-commerce traffic, conversions и consumer behavior (2024–2026).

Bain & Company – Goodbye Clicks, Hello AI (2025).

Conductor – исследования AI Search adoption и изменения поведения маркетологов.

Ahrefs – исследования AI Overviews, AI Search visibility и влияния ИИ на органический поиск.

Semrush – исследования AI Search, поискового поведения и изменения SERP.

Seer Interactive – анализ AI referral traffic и поведения пользователей.

BrightEdge – исследования влияния AI Search на органический трафик.

Similarweb – анализ трафика AI-платформ и изменения пользовательских сценариев.

Gartner – исследования внедрения генеративного ИИ в маркетинге и клиентском опыте.

Отраслевые отчёты:

AirOps – State of AI Search (как дополнительный источник отраслевых наблюдений).

Profound – исследования AI visibility и brand mentions в генеративных системах.

Глава 5. RAG, эмбеддинги и ранжирование источников – простыми словами, но без лжи

Почему эту главу нельзя пропустить

В большинстве книг и статей про GEO техническую механику либо вообще опускают («не нужно быть инженером, чтобы заниматься GEO»), либо, наоборот, топят читателя в терминах, не объясняя, зачем это практику. Я выбираю третий путь: разобрать механику ровно настолько глубоко, чтобы дальнейшие практические рекомендации в частях III и IV перестали быть «шаманством» и превратились в логичные следствия из того, как система устроена физически.

Обещание в подзаголовке – «без лжи» – принципиально: слишком много материалов на рынке округляют механику до уровня, на котором она перестаёт быть правдой. Здесь такого не будет.

Шаг первый: что такое эмбеддинг

Представьте, что любой текст – слово, предложение или целый абзац – можно превратить в точку на условной карте, где расстояние между точками отражает смысловую близость. Чем ближе расположены две точки, тем более похожими по смыслу система считает соответствующие тексты. Разумеется, никакой «карты» в буквальном смысле не существует – это лишь удобная метафора многомерного математического пространства, которое невозможно наглядно представить. Тексты про «регистрацию бизнеса в Дубае» и «открытие компании в ОАЭ» окажутся на этой карте рядом, даже если ни одно слово в них буквально не совпадает. А текст про «крем для лица» окажется далеко от обоих.

Именно для этого используются модели эмбеддингов (embedding models). Они преобразуют фрагмент текста в многомерный числовой вектор (embedding) – представление, которое позволяет сравнивать тексты по смысловой близости. Современные модели, например OpenAI text-embedding-3 или Gemini Embedding, обучаются на огромных массивах данных так, чтобы расстояние между такими векторами как можно лучше отражало смысловую, а не только лексическую близость текстов.

Практический вывод номер один, который стоит запомнить уже здесь: система не ищет по ключевым словам в привычном понимании SEO-специалиста десятилетней давности. Она ищет по смысловой близости. Текст, который отвечает на вопрос пользователя по существу, но без точного вхождения ключевой фразы, вполне может «победить» текст с идеальным вхождением ключевика, но размытым, обтекаемым содержанием.

Шаг второй: чанкинг – почему структура текста решает всё

В большинстве современных RAG-систем в эмбеддинг превращают не весь сайт и обычно даже не всю статью целиком. Длинный документ охватывает сразу несколько подтем, поэтому его единый вектор становится менее точным: смысл разных разделов смешивается. Поэтому контент обычно сначала разбивают на фрагменты – чанки (chunks), и уже каждый из них преобразуют в отдельный вектор.

Здесь есть развилка, критически важная для практика:

Слишком мелкие чанки теряют контекст: фрагмент формально совпадает по смыслу с запросом, но в нём не хватает деталей, которые нужны модели для полноценного ответа.

Слишком крупные чанки размывают сигнал: в одном векторе смешивается слишком много разных идей, и точность совпадения с конкретным запросом падает.

На практике многие современные системы используют чанки порядка нескольких сотен токенов – часто в диапазоне 300–800, – с небольшим перекрытием между соседними фрагментами. Конкретные параметры зависят от архитектуры системы и используемой модели эмбеддингов.

Отдельно стоит явление, получившее название late chunking («позднее разбиение на чанки»), оно было популяризирован исследователями Jina AI. Суть в следующем: вместо того, чтобы резать текст на куски до превращения в вектор, весь документ сначала пропускают целиком через модель с длинным контекстом, и лишь затем «схлопывают» токен-уровневые представления в отдельные чанки. Плюс такого подхода в том, что каждый фрагмент «помнит» контекст всего документа – например, если текст трижды упоминает «город» после того, как в первом абзаце был назван конкретный город, поздний чанкинг сохранит эту связь даже в чанке, где сам город по имени уже не упоминается.

Практический вывод для автора контента прост: хорошая структура документа – это не вопрос литературного стиля, а фактор, влияющий на работу RAG-систем. Подзаголовки, принцип «один раздел – одна законченная мысль», отсутствие смысловых «хвостов», когда новый абзац невозможно понять без нескольких предыдущих, – всё это помогает создавать более качественные векторные представления и облегчает системе извлечение нужного фрагмента при ответе на запрос пользователя.

Шаг третий: как ищутся кандидаты – от косинусного сходства до гибридного поиска

Когда пользователь задаёт вопрос, тот же процесс преобразования в вектор происходит и с самим запросом. Затем система ищет среди проиндексированных чанков те, чьи векторные представления наиболее близки к вектору запроса. Для этого часто используется математическая мера, называемая косинусным сходством (cosine similarity): она оценивает угол между двумя векторами в многомерном пространстве. Чем меньше этот угол (или, что эквивалентно, чем выше значение косинусного сходства), тем более близкими по смыслу система считает запрос и найденный фрагмент.

Однако на этом поиск обычно не заканчивается. На практике современные системы всё чаще используют гибридный поиск, который сочетает семантический поиск с классическим полнотекстовым поиском и последующим реранжированием результатов. Ниже разберём, зачем это нужно.

Именно здесь становится понятна реальная роль классического SEO. Авторитет сайта, ссылочный профиль и техническое качество продолжают влиять на вероятность того, что документ окажется в поисковом индексе и будет рассматриваться системой как потенциальный источник. Однако при выборе конкретных фрагментов для ответа всё большее значение приобретает смысловая релевантность самого текста. Когда же система выбирает конкретные фрагменты для ответа, решающее значение приобретает уже не авторитет домена сам по себе, а смысловая релевантность конкретного чанка запросу пользователя.

Практический вывод прост: сильное SEO по-прежнему остаётся фундаментом, но его уже недостаточно. Чтобы текст оказался в ответе ИИ-системы, мало быть хорошо проиндексированным – нужно, чтобы отдельные фрагменты страницы были настолько понятными, информативными и семантически точными, чтобы именно их система сочла лучшим ответом на запрос пользователя.

При этом чистый векторный поиск в 2026 году уже не считается универсальным решением. Во многих современных RAG-системах используется гибридный поиск (hybrid search): результаты векторного (семантического) поиска объединяются с результатами классического полнотекстового поиска, чаще всего на основе алгоритма BM25, который оценивает точные совпадения слов и их статистическую значимость в документе. После этого обычно выполняется дополнительный этап – реранжирование (re-ranking), при котором более точная, но вычислительно более затратная модель (например, cross-encoder) повторно оценивает относительно небольшой набор найденных кандидатов – условно несколько десятков или сотен документов – и определяет их окончательный порядок.

Причина такого подхода проста. Чисто семантический поиск отлично находит смысловые соответствия, но иногда уступает классическому поиску в случаях, когда критически важно буквальное совпадение: названия моделей, версии продуктов, артикулы, номера нормативных документов, юридические термины, имена компаний или другие уникальные идентификаторы. Полнотекстовый поиск компенсирует этот недостаток, а последующее реранжирование объединяет преимущества обоих подходов, позволяя системе выбрать наиболее релевантные источники.

Шаг четвёртый: финальное ранжирование – не только про смысл

После того как система отобрала наиболее подходящие фрагменты по смысловой и текстовой близости, начинается следующий этап – их дополнительная оценка и ранжирование. Конкретная реализация отличается у разных платформ, но в современных RAG-системах обычно учитывается сразу несколько групп сигналов:

Авторитетность (authority) – насколько источник заслуживает доверия с точки зрения модели и поисковой системы.

Качество (quality) – признаки экспертности, достоверности, структурированности материала и отсутствие явных признаков низкокачественного или автоматически сгенерированного контента.

Актуальность (recency) – насколько информация соответствует текущему состоянию предметной области, если запрос чувствителен ко времени.

Релевантность (relevance) – насколько конкретный фрагмент отвечает именно на данный запрос, а не лишь затрагивает смежную тему.

В коммерческих поисковых системах эти и другие сигналы объединяются с помощью моделей машинного обучения, формируя итоговую оценку кандидатов. Именно по ней система определяет, какие фрагменты попадут в контекст языковой модели и смогут повлиять на формирование окончательного ответа. Важно понимать: здесь уже нет универсальной формулы. ChatGPT Search, Perplexity, Google AI Overviews, Gemini и другие платформы используют разные алгоритмы, а их детали не раскрываются публично. Поэтому речь идёт не о точном воспроизведении внутренней логики конкретной системы, а о принципах, которые устойчиво подтверждаются исследованиями и практическими наблюдениями.



Источники и исследования, использованные при подготовке главы:

Atlan – What Are Embeddings in AI (2026)

XLR8 AI – How AI Search Works: LLM Retrieval Explained (2026)

ZipTie.dev – Optimizing for Vector Embeddings (2026)

Crosscheck – What Are Embeddings in LLMs (2026)

Stack AI – Best Embedding Models for RAG (2026)

Hashmeta AI – Chunk-Level Optimization (2026)

arXiv – Towards AI Search Paradigm (препринт 2506.17188)

Глава 6. Что такое «цитируемость» и как ИИ выбирает, кого упомянуть

Цитируемость – это не одно явление, а два разных

Первое, что важно понять перед разговором о «цитируемости» как цели GEO-стратегии: попадание в ответ ИИ-системы бывает как минимум двух принципиально разных типов. Путать их – значит неправильно ставить цели и неверно оценивать результат.

Исследование компании Machine Relations, основанное на анализе более 21 тысячи цитирований в 2026 году, предложило полезное разграничение:

Citation selection (выбор источника для цитирования). Ваш материал появляется среди источников ответа – в виде ссылки или списка использованных ресурсов. При этом сам ответ может быть сформирован преимущественно на основе нескольких источников, и вклад именно вашего материала окажется минимальным.

Citation absorption (усвоение содержания источника). Информация из вашего материала становится одной из основ ответа. Модель опирается на ваши факты, структуру объяснения, терминологию или выводы, даже если пересказывает их собственными словами и объединяет с данными из других источников.

Разница на практике огромна. Попасть в список источников ответа и реально повлиять на содержание ответа – абсолютно не одно и то же.

В первом случае пользователь видит ваш бренд среди процитированных ресурсов. Это уже ценный сигнал доверия и возможность получить переход. Во втором – информация из вашего материала становится частью самого ответа: система использует ваши данные, терминологию, классификации или объяснительную модель при формировании результата.

По данным того же исследования, материалы с высоким уровнем «поглощения» (absorption) чаще обладают несколькими общими характеристиками: они лучше структурированы, содержат законченные смысловые блоки и используют так называемые «доказательные жанры» (evidence genres) – чёткие определения, конкретные цифры, пошаговые инструкции и другие элементы, которые легко извлечь и проверить.

Атрибуционный разрыв: вас могут использовать чаще, чем цитировать

Конец ознакомительного фрагмента.

Текст предоставлен ООО «Литрес».

Прочитайте эту книгу целиком, купив полную легальную версию на Литрес.

Безопасно оплатить книгу можно банковской картой Visa, MasterCard, Maestro, со счета мобильного телефона, с платежного терминала, в салоне МТС или Связной, через PayPal, WebMoney, Яндекс.Деньги, QIWI Кошелек, бонусными картами или другим удобным Вам способом.

Конец ознакомительного фрагмента
Купить и скачать всю книгу
На страницу:
3 из 3