Если один технический документ опубликован в HTML и PDF с одинаковым или очень близким основным содержанием, предложите Google считать HTML основной версией. Для этого добавьте в HTTP-ответ PDF заголовок Link с rel="canonical" на абсолютный URL HTML. На HTML-странице задайте canonical на саму себя, включите этот же адрес в sitemap и используйте его в обычных внутренних ссылках. PDF оставьте доступным по отдельной ссылке скачивания.
Ниже — инструкция для одной пары публичных HTML/PDF-адресов одного сайта: от проверки дублирования до проверки выбранной Google версии. Canonical — сигнал предпочтения, а не гарантия: окончательный выбор делает Google. Документация Google о каноникализации.
1. Убедитесь, что HTML и PDF действительно дублируют друг друга
Google описывает canonical как способ объединения дублирующихся и очень похожих страниц. Поэтому сначала сравните основное содержание двух документов. Документация Google.
Для практической проверки удобно сопоставить:
- название, версию и дату документа;
- основные разделы;
- технические характеристики, таблицы и выводы;
- существенные сведения, которые могут присутствовать только в одной версии.
Это рабочий список для сравнения, а не формальный тест Google. Оценивайте прежде всего основное содержание, а не различия в навигации, оформлении или колонтитулах.
Не канонизируйте полный PDF-отчёт на краткий HTML-анонс. Страница с описанием отчёта и кнопкой скачивания не является его равноценной HTML-версией. Описанная ниже настройка предназначена для дубликатов или документов с очень близким основным содержанием.
2. Добавьте canonical в HTTP-ответ PDF
Для PDF canonical передают через HTTP-заголовок ответа, а не через HTML-тег. Google поддерживает заголовок Link с rel="canonical" для не-HTML-документов, включая PDF, и рекомендует использовать абсолютные URL. Документация Google.
Задание разработчику или администратору сервера:
При отдаче рассматриваемого PDF добавлять в HTTP-ответ заголовок
Link, указывающий на выбранный абсолютный URL HTML-версии. PDF должен оставаться доступным для чтения и скачивания.
Шаблон заголовка:
Link: <АБСОЛЮТНЫЙ_URL_HTML>; rel="canonical"Замените АБСОЛЮТНЫЙ_URL_HTML полным адресом HTML-страницы, включая протокол, домен и путь. Угловые скобки вокруг адреса входят в синтаксис заголовка.
Способ настройки зависит от того, что отдаёт файл: веб-сервер, приложение, файловое хранилище или CDN. В качестве проверки внедрения проверьте конечный публичный ответ PDF, а не только конфигурацию на исходном сервере.
Для этого можно открыть PDF с включённой вкладкой Network в инструментах разработчика браузера. В заголовках ответа запроса самого PDF проверьте:
- присутствует
Linkсrel="canonical"; - адрес назначения — выбранная HTML-страница;
- нет другого canonical, указывающего на иной адрес.
3. Добавьте self-canonical в HTML
В секции head HTML-страницы укажите canonical на её собственный выбранный URL:
<link rel="canonical" href="АБСОЛЮТНЫЙ_URL_HTML">Здесь также нужен полный абсолютный адрес. В этой паре адрес в HTML-теге и адрес в HTTP-заголовке PDF должны совпадать. Google учитывает rel="canonical" в head HTML-страницы и рекомендует избегать противоречащих друг другу указаний canonical. Документация Google.
Практическая проверка: убедитесь, что тег действительно присутствует в head отдаваемой HTML-страницы, а не только в настройках CMS. Проверьте, не добавляет ли шаблон или SEO-модуль второй canonical с другим адресом.
4. Согласуйте sitemap и внутренние ссылки для этой пары
В sitemap укажите выбранный HTML-URL как каноническую версию документа. В обычных внутренних ссылках — например, в каталоге документации и связанных материалах — ведите на тот же HTML-адрес. Google рекомендует указывать канонические URL в sitemap и ссылаться внутри сайта на каноническую версию. Эти сигналы должны согласовываться с canonical. Документация Google.
Отдельную ссылку на PDF сохраните. Практическая рекомендация — подписать её «Скачать PDF», чтобы отличить файл от основной страницы чтения. Задача не в том, чтобы скрыть файл, а в том, чтобы обозначить предпочтительную версию документа.
Не используйте для каноникализации запрет в robots.txt или noindex. Google не рекомендует эти способы для выбора основной версии: robots.txt блокирует обход, а noindex предназначен для исключения URL из поиска. Документация Google.
Чек-лист технического задания
- Основное содержание HTML и PDF одинаковое или очень близкое.
- В публичном HTTP-ответе PDF есть
Linkсrel="canonical"на абсолютный URL HTML. - В
headHTML стоит canonical на тот же HTML-URL. - В sitemap указан выбранный HTML-URL, а не PDF как основная версия.
- Обычные внутренние ссылки на документ ведут на HTML.
- Отдельная ссылка скачивания PDF сохранена.
- Для каноникализации не добавлены
noindexили запрет обхода.
5. Проверьте выбор Google в Search Console
В принадлежащем вам ресурсе Search Console по очереди проверьте оба адреса через URL Inspection. Для проверки canonical нужны данные индекса, то есть сведения о версии URL, которую Google уже обработал, а не только live test текущей страницы. Справка URL Inspection.
Для каждого URL запишите:
| Что проверить | Зачем |
|---|---|
User-declared canonical — канонический URL, указанный пользователем | Проверить, какое предпочтение Google обнаружил при обработке URL |
Google-selected canonical — канонический URL, выбранный Google | Установить фактический выбор Google |
| Дату последнего обхода | Понять, мог ли обход уже учитывать новые настройки |
Названия полей могут отличаться в зависимости от языка интерфейса; доступность сведений зависит от данных о проверяемом URL. Справка URL Inspection.
Как трактовать результат
Результат подтверждён, если данные индекса для рассматриваемой пары показывают выбранный HTML-адрес в Google-selected canonical. Запись только в User-declared canonical подтверждает обнаруженное предпочтение сайта, но не выбор Google.
Результат ещё не подтверждён, если данных о выбранной версии нет. Данные индекса могут отставать от текущего состояния, доступного в live test. Если последний обход был до внедрения, отчёт может отражать прежнюю настройку — его нельзя считать подтверждением обработки новых сигналов.
Если Google выбрал PDF или другой URL, проверьте совпадение основного содержания, фактический HTTP-заголовок PDF, canonical в HTML и согласованность ссылок и sitemap. Корректная настройка остаётся сигналом предпочтения и не гарантирует выбор предложенного адреса. Документация о каноникализации.
При необходимости запросите индексирование изменённой HTML-страницы через URL Inspection. После обработки изменений повторите проверку обоих URL и снова сверьте дату последнего обхода. Запрос индексирования не гарантирует включение в индекс. Справка URL Inspection.
Успешный live test не подтверждает выбор canonical: он проверяет текущий URL, но не предсказывает, какую каноническую версию Google выберет. Проверять результат нужно по полю Google-selected canonical в данных индекса. Справка URL Inspection.
Примечание об AI Overviews и AI Mode
Выбор HTML как canonical не доказывает использование или цитирование документа в AI-ответе. Для участия страницы в качестве supporting link в Google AI Overviews и AI Mode необходимы индексирование и допуск к показу в Google Search со сниппетом; выполнение этих требований не гарантирует появление. Документация Google об AI-функциях.