В прошлой статье я разбирал, как боты нейросетей — GPTBot, PerplexityBot, YandexBot и остальные — приходят на сайт и как настроить им доступ через robots.txt. Логика там простая: открыл доступ — бот зашёл, скачал страницу, ушёл. На этом у большинства владельцев сайтов понимание и заканчивается. А зря. Потому что дальше происходит самое интересное: скачанная страница никому не нужна целиком.
Нейросеть не читает вашу статью, как человек. Она режет её на фрагменты по 200–500 слов — так называемые чанки — и ищет по ним ответ на вопрос пользователя. Из десятка тысяч символов вашего текста в ответ попадает один абзац. Или ни одного. Вопрос только в том, сделали ли вы этот абзац самодостаточным.
За три года работы с GEO я видел десятки сайтов, где контент отличный, факты проверенные, тексты длинные — а в ответах нейросетей их нет. Причина почти всегда одна: страница не структурирована под извлечение. ИИ не смог вытащить из неё чистый фрагмент. Сегодня разберём, как работает эта механика и как писать так, чтобы именно ваш абзац попадал в ответ.
Как устроен RAG: короткая экскурсия для тех, кто никогда не строил нейросеть
RAG — Retrieval-Augmented Generation, «генерация с дополнением через поиск». Звучит страшно, на деле это простая конвейерная схема, по которой сейчас работают ChatGPT с поиском, Perplexity, Google AI Overviews и нейроответы Яндекса.
Представьте библиотеку без каталога. Модель не может прочитать все книги подряд — на это уйдёт вечность. Вместо этого библиотекарь (это и есть RAG-пайплайн) заранее разрезал каждую книгу на короткие карточки, разложил их по смыслу и при вопросе читателя достаёт несколько карточек, которые ближе всего к запросу. Из них и собирается ответ.
Вот этапы, через которые проходит ваш контент:
| Этап | Что происходит | Что это значит для сайта |
|---|---|---|
| Обход | AI-краулер скачивает страницу | Доступ должен быть открыт в robots.txt, иначе дальше ничего не будет |
| Чанкинг | Страница режется на фрагменты по границам абзацев, заголовков, таблиц | Ваши абзацы должны быть самодостаточными: каждый отвечает на один вопрос |
| Эмбеддинги | Каждый фрагмент превращается в вектор чисел — «смысловую координату» | Формулировки должны совпадать с тем, как спрашивают пользователи |
| Поиск | По запросу ищутся ближайшие по смыслу фрагменты | Выигрывает фрагмент с прямым ответом в начале |
| Реранкинг | Найденные куски переоцениваются, отбирается 3–5 лучших | Побеждает плотность фактов и структура |
| Генерация | Из отобранных фрагментов собирается ответ с цитатами | В ответ попадают куски, которые «выжили» на всех этапах |
Ключевая мысль, которую нужно вынести отсюда: в ответ нейросети попадает не страница, а фрагмент. Исследование Princeton по GEO (2024) это подтверждает: модели цитируют не документ целиком, а конкретные проходы текста, и качество этих фрагментов напрямую влияет на видимость. «Страница в индексе» и «страница в ответе ИИ» — два разных состояния, и между ними стоят чанкинг и эмбеддинги.
Чанкинг: как ваш текст режут на куски
Чанкинг — это разбиение документа на фрагменты, минимальные единицы знания для RAG. От того, как система нарежет ваш текст, зависит, найдёт ли она нужный кусок и что именно процитирует.
Способов нарезки несколько, и для автора важны два:
Фиксированный чанкинг — текст режется по количеству токенов, например по 500. Просто и дёшево, но граница может пройти посреди мысли. Ваш лучший абзац разрежут пополам, и ни одна половина не будет отвечать на вопрос целиком. Это худший сценарий для контента.
Семантический и структурный чанкинг — система ставит границы там, где меняется тема: по заголовкам H2/H3, по границам абзацев, по элементам таблиц и списков. Такой подход используют современные пайплайны Perplexity, Anthropic (их исследование про contextual retrieval 2024 года — обязательное чтение) и большинство AI-поисковиков.
Что это значит на практике? Границы ваших абзацев и заголовков — это и есть границы будущих чанков. Вы не управляете алгоритмом нарезки, но вы управляете материалом, который он режет. Если ваша статья — сплошная «простыня» текста без подзаголовков, система нарежет её как попало. Если каждый абзац — законченная мысль под понятным заголовком — нарезка получится ровно такой, какой вы её задумали.
Правило, которое я вбиваю в голову всем, кто пишет контент под GEO: абзац должен быть читаемым, даже если его вырвали из статьи и показали в одиночестве. Люди так не пишут — и это нормально, потому что раньше никто не вырывал абзацы. Теперь вырывают. Постоянно.
Эмбеддинги: почему нейросеть «понимает» не слова, а смысл
После нарезки каждый чанк превращается в эмбеддинг — вектор из сотен чисел, который кодирует смысл фрагмента. Фразы «недорогой ремонт квартир» и «бюджетный ремонт в Москве» окажутся рядом в этом векторном пространстве, хотя ни одного общего слова в них нет. Именно так нейросеть находит ответ на вопрос, сформулированный не так, как написано у вас.
Отсюда следует важный практический вывод: писать «как в словаре синонимов» больше не нужно, а вот писать «как говорят люди» — критично. Эмбеддинги отлично ловят смысл, но плохо — размытые формулировки. Если в вашей нише спрашивают «сколько стоит замена масла», а у вас в тексте только «стоимость технического обслуживания двигателя», шанс, что фрагмент найдётся, падает: вектор «замены масла» не совпадает с вектором «ТО двигателя» настолько, насколько хотелось бы.
Поэтому в контенте под GEO я советую:
- Использовать формулировки реальных пользовательских запросов — из Wordstat, из подсказок, из вопросов в поддержке. Их же потом вплетать в заголовки абзацев.
- Начинать абзац с прямого ответа на вопрос, который вынесен в его заголовок. Первые 50–100 слов чанка — самые важные: и для поиска, и для реранкинга.
- Называть вещи своими именами: если вы продаёте «ремонт ванной под ключ» — так и писать, а не «комплексное обновление санитарных зон».
- Не бояться синонимов и естественного языка — эмбеддинги это любят, в отличие от старых SEO-алгоритмов.
Как это связано со структурой текста в целом — я подробно разбирал в статье про идеальный GEO-текст: там про ответ в первых ста словах, цифры, факты и логические связи. Чанкинг — это техническая обвязка тех же принципов.
Почему цитируют один абзац, а не другой: реранкинг и плотность ответа
Допустим, по запросу нашлись двадцать фрагментов из десяти сайтов. Модель не может вставить все — контекстное окно не резиновое. Срабатывает реранкинг: фрагменты ранжируются по релевантности, и в ответ попадают 3–5 лучших.
Что поднимает фрагмент в этом ранжировании:
- Прямой ответ в начале абзаца. Абзац, который начинается с «Ремонт ванной под ключ в Москве стоит от 45 000 рублей», выигрывает у абзаца, где эта же мысль появляется на третьей строчке.
- Числа и конкретика. «От 45 000 рублей, срок — 7 дней» — это извлекаемый факт. «Цена зависит от сложности работ» — это вода, которую модель не процитирует, потому что цитировать нечего.
- Самодостаточность. Фрагмент, где «это» и «выше мы говорили» — мусор для извлечения. Фрагмент, где всё сказано внутри, — кандидат в ответ.
- Структурные элементы. Таблицы, списки, определения, FAQ-блоки система извлекает охотнее, чем прозу. Маркированный список «что входит в ремонт» процитируют с большей вероятностью, чем тот же перечень, спрятанный в тексте.
- Разметка. Schema.org — и особенно FAQPage — помогает системе понять, что перед ней вопрос и ответ. Про то, какие типы разметки ставить первыми, я писал в статье про микроразметку Schema.org и JSON-LD, а как собрать всё это в один чек-лист — в материале «7 шагов для попадания в ответы нейросетей за 30 минут».
Отдельно про длину. Исследования и практика сходятся: оптимальный чанк — 200–500 слов, и это ровно размер 2–4 коротких абзацев. Абзацы по 150–190 слов с одним вопросом внутри — золотой стандарт. Гигантские абзацы на 500+ слов режутся по-своему, и лучшая мысль может остаться за границей чанка.
Как проверить, какие фрагменты вашего сайта реально извлекаются
Всё вышеописанное легко проверить самому, без разработчика и без специальных инструментов. Я на аудитах делаю так.
Шаг 1. Спросите нейросети так, как спрашивают клиенты. Откройте ChatGPT, Perplexity, YandexGPT и задайте 5–10 вопросов из вашей ниши. Посмотрите, какие фрагменты цитируются и откуда. Если вашего сайта нет в ответах, а контент при этом хороший — проблема скорее всего в извлечении.
Шаг 2. Сравните формулировки. Возьмите абзац, который вы хотите видеть в ответе, и задайте вопрос словами пользователя. Не совпало — переформулируйте заголовок абзаца и первые предложения под реальные запросы.
Шаг 3. Проверьте логи. Визиты AI-краулеров — это ранний сигнал, что система доходит до вашего контента. Про то, как искать ботов в логах и что означают их заходы, я писал в статье про AI-краулеры и robots.txt. Если боты ходят, а цитат нет — копайте в сторону чанкинга и формулировок.
Шаг 4. Следите за выходящими упоминаниями. Извлечение — это вход, цитирование — выход. Система мониторинга упоминаний бренда в нейросетях закроет вторую половину задачи — я разбирал инструменты и метрики мониторинга отдельно.
Шпаргалка: как писать контент, который выживает при извлечении
Соберу всё в один чек-лист — его можно вешать над столом копирайтеру:
- Один абзац — один вопрос. Если в абзаце две темы, режьте на два.
- Прямой ответ — в первых двух предложениях абзаца. Дальше — обоснование.
- Абзацы по 100–190 слов. Длиннее — риск, что разрежут.
- Заголовки H2/H3 — это имена будущих чанков. Они должны содержать ключевой вопрос, а не «Раздел 3».
- Числа, цены, сроки, проценты — в каждом смысловом блоке.
- Списки и таблицы — для перечней, а не проза.
- Формулировки — как у пользователей, а не «по-научному».
- Каждый фрагмент читается отдельно от статьи.
- Контент регулярно обновляется — про то, как часто это делать, я писал отдельно: свежесть влияет на цитируемость напрямую.
И предостережение. Не пытайтесь «накормить» нейросеть мусором: спрятанные тексты, переоптимизированные абзацы и фрагменты, напичканные ключами, — это уже территория токсичной GEO-оптимизации, о которой я писал в расследовании. Модели и RAG-пайплайны становятся умнее в отсеве манипуляций, а вот пять базовых ошибок, из-за которых контент не цитируют, встречаются до сих пор — начните с их проверки.
Часто задаваемые вопросы
Чем чанкинг отличается от обычного разбиения на абзацы?
Чанкинг — это то, что делает система: она режет скачанную страницу на фрагменты, которые потом ищет по смыслу. Ваши абзацы — это материал, который она режет. Если абзацы самодостаточны и каждый отвечает на один вопрос, чанкинг получается «правильным»: границы фрагментов совпадают с границами мыслей. Если текст — сплошная простыня без структуры, система нарежет её произвольно, и лучшие мысли окажутся разрезанными пополам.
Какой длины должны быть абзацы, чтобы попасть в ответ нейросети?
Практика и исследования сходятся на 100–190 словах — это 2–4 предложения, которые помещаются в один смысловой фрагмент. Оптимальный чанк для RAG — 200–500 слов, и абзацы такой длины формируют его естественно. Абзацы длиннее 300 слов — зона риска: их могут разрезать, и ни одна половина не будет отвечать на вопрос целиком.
Нейросеть цитирует мою страницу или отдельный фрагмент?
Отдельный фрагмент. В ответ попадает конкретный проход текста — обычно один абзац или блок, — а не вся страница целиком. Это принципиально меняет подход к GEO: вы оптимизируете не «страницу под запрос», а каждый смысловой блок под свой вопрос. «Страница в индексе» — это только вход; дальше решает качество отдельных фрагментов.
Влияет ли микроразметка на то, какой фрагмент извлекут?
Влияет, но косвенно. Разметка типа FAQPage, Speakable и HowTo помогает системе понять структуру страницы и быстрее найти блок «вопрос — ответ». Она не заменяет качество текста, но повышает вероятность, что правильный фрагмент будет найден и извлечён. Разметка — это упаковка: без хорошего содержимого внутри она не спасает, но с хорошим содержимым заметно ускоряет процесс.
Можно ли «заставить» нейросеть выбрать нужный фрагмент?
Напрямую — нет, вы не управляете алгоритмом. Но вы управляете вероятностью: прямой ответ в начале абзаца, цифры, самодостаточность, совпадение формулировок с запросами пользователей — всё это поднимает фрагмент в реранкинге. Честная работа с вероятностью — это и есть GEO. А попытки «заставить» через скрытые тексты и манипуляции — путь к токсичным методам, которые рано или поздно перестают работать.
Как проверить, какие фрагменты моего сайта попадают в RAG-выборку?
Три шага: задать в нейросетях вопросы из вашей ниши и посмотреть, что цитируется; сравнить формулировки своих абзацев с реальными запросами пользователей (Wordstat, подсказки, вопросы в поддержке); проверить логи сервера — если AI-краулеры ходят, а цитат нет, проблема в извлечении. Дополнительно настройте мониторинг упоминаний бренда — он покажет, как меняется цитируемость после правок контента.
Мой вывод
Разбор RAG-механики заканчивается простой истиной: GEO — это не про то, чтобы попасть в индекс. Это про то, чтобы выжить при извлечении. Бот пришёл, скачал, нарезал, поискал — и взял ваш абзац или не взял. Всё решают структура, формулировки и самодостаточность фрагментов.
Практический совет, с которого стоит начать уже сегодня: возьмите три самые важные страницы сайта и проверьте, можно ли вырвать из них любой абзац и понять, о чём он, без остальной статьи. Если нет — переписывайте. Это займёт пару часов, а эффект почувствуете, когда нейросети начнут цитировать именно ваши формулировки.
Техническую базу — доступ для краулеров, robots.txt, разметку — держите в порядке, но помните: она лишь открывает дверь. Внутри дверь решает контент, нарезанный так, чтобы его было удобно вынимать.