Google не сканує сайт цілком і одразу. У кожного ресурсу є свій темп обходу: скільки сторінок робот готовий завантажити за добу й наскільки часто повертається. Цей темп і називають краулінговим бюджетом.
Для більшості сайтів це нецікава технічна деталь. Але для каталогу на кілька тисяч адрес вона перетворюється на пряму причину, чому половина товарів не зʼявляється в пошуку місяцями.
Від чого залежить темп обходу
Спрощено — від двох речей. Перша: скільки сайт витримує. Якщо сервер відповідає повільно або віддає помилки, робот знижує навантаження, щоб не покласти ресурс. Швидкий сервер отримує більший темп — це один із небагатьох випадків, коли швидкість впливає на пошук прямо, а не через поведінку людей.
Друга: наскільки сайт цікавий пошуку. Ресурс, куди ведуть посилання, де контент оновлюється й куди приходять люди, обходять частіше. Молодий сайт без історії — рідше, і з цим нічого не вдієш, крім часу й ваги.
Керувати можна не самим бюджетом, а тим, на що він витрачається. І ось тут у більшості сайтів величезний запас.
Куди бюджет тече даремно
Головний пожирач — комбінації фільтрів у каталозі. Кожне поєднання параметрів створює окрему адресу, і при чотирьох фільтрах їх десятки тисяч на кілька сотень реальних товарів. Робот сумлінно ходить по цих майже однакових сторінках замість карток. Як розводити те, що має бути сторінкою, і те, що має лишатися фільтром, ми розбирали в матеріалі про пошук і фільтри в інтернет-магазині.
Друге джерело — внутрішній пошук, відкритий для індексації: він генерує нескінченні адреси під будь-який набраний рядок. Третє — сортування й параметри відстеження, які створюють дублі однієї сторінки. Четверте — сторінки, які віддають помилки або нескінченні ланцюжки переадресацій: кожен зайвий крок теж витрачає запит робота.
Окремий випадок — величезні розділи, які ніхто не читає: старі акції, порожні категорії, картки товарів, знятих з продажу назавжди. Вони не шкодять напряму, але забирають увагу робота в тих сторінок, які приносять гроші.
Що з цим робити
Порядок дій майже завжди однаковий. Спочатку — заборонити обхід того, що не має бути в пошуку в принципі: службові адреси, результати внутрішнього пошуку, кошик, порівняння, особистий кабінет. Це робиться файлом керування обходом, і важливо не переплутати його з забороною індексації: різницю ми детально розводили в матеріалі про robots.txt і sitemap.
Далі — дублі. Сторінки з параметрами, сортуваннями й мітками мають вказувати на основну версію, інакше пошук вважає їх окремими сторінками й ділить між ними вагу. Той самий механізм рятує пагінацію: як її оформляти, щоб не втратити товари з глибоких сторінок, ми описали в розборі пагінації каталогу.
Третій крок — прибрати технічний сміттєвий трафік робота: ланцюжки переадресацій, посилання на неіснуючі сторінки, важкі відповіді сервера. Кожна помилка — це витрачений запит, який міг піти на картку товару.
І останнє, найнедооціненіше: внутрішні посилання. Робот ходить по посиланнях, тому сторінка, на яку не веде жодне посилання зсередини сайту, обходиться рідко навіть за наявності в карті сайту. Про це — у матеріалі про внутрішню перелінковку.
Коли справа не в бюджеті
Найчастіша помилка — пояснювати бюджетом те, що ним не пояснюється. Сайт на сотню сторінок Google обходить повністю. Якщо там щось не в індексі, причина інша: заборона, залишена з часів розробки, дубль основної версії, тонкий контент або просто те, що сторінка не варта показу.
Перевіряти треба по симптомах, а не за відчуттям. Типові причини відсутності в пошуку зібрані в розборі чому сайту немає в Google, а звіт про сканування в консолі показує, куди робот справді ходить: якщо основна маса запитів — це адреси з параметрами, а картки обходяться раз на місяць, діагноз підтверджено. Як користуватися самою консоллю, ми описали в матеріалі про Google Search Console для початківців.
Для великих каталогів це не разова робота, а гігієна: коли магазин росте, кількість технічних адрес росте швидше за кількість товарів. Саме тому в проєкті інтернет-магазину з нуля структуру каталогу й правила фільтрів краще закладати на старті — переробляти потім дорожче, ніж зробити відразу.
Коротко
Краулінговий бюджет — це темп, з яким пошуковий робот обходить сайт: скільки сторінок за добу й наскільки часто повертається. Залежить він від швидкості сервера й від загальної цінності ресурсу для пошуку. Проблемою стає приблизно від кількох тисяч адрес, і майже завжди в каталогах, а не на сайтах послуг. Головні пожирачі — комбінації фільтрів, індексований внутрішній пошук, сортування й мітки, ланцюжки переадресацій і помилок. Лікування: закрити від обходу службові адреси, звести дублі до основної версії, прибрати технічне сміття й дати важливим сторінкам внутрішні посилання. Карта сайту при цьому лише підказує адреси, а не змушує їх сканувати. І головне — не списувати на бюджет те, що ним не пояснюється: на сайті в сотню сторінок причина відсутності в індексі майже завжди інша.
Ми в Obliko розробляємо сайти та інтернет-магазини під ключ і закладаємо правила обходу ще на етапі структури каталогу, щоб робот витрачав час на товари, а не на комбінації фільтрів. Якщо частина вашого каталогу роками не потрапляє в пошук — напишіть, подивимося, куди насправді ходить робот.
З якого розміру сайту краулінговий бюджет стає реальною проблемою?
Приблизно від кількох тисяч сторінок, і майже завжди це інтернет-магазин з фільтрами, а не сайт послуг. Сайт на 30-200 сторінок Google обходить повністю й регулярно — якщо там щось не в індексі, причина не в бюджеті, а в якості сторінки або в технічних заборонах. Плутати ці два діагнози шкідливо: люди починають «економити бюджет» на маленькому сайті й закривають від сканування те, що мало б ранжуватися.
Що найбільше зʼїдає бюджет сканування в інтернет-магазині?
Комбінації фільтрів. Кожне поєднання «колір + розмір + ціна + сортування» — це окрема адреса, і на середньому каталозі таких адрес легко набирається десятки тисяч при кількох сотнях реальних товарів. Робот ходить по них замість карток товару. Друге за шкідливістю — внутрішній пошук, відкритий для індексації: він генерує нескінченну кількість адрес під будь-який набраний рядок.
Чи прискорює карта сайту сканування?
Вона допомагає роботу знайти сторінки, але не змушує їх сканувати частіше й не гарантує індексації. Карта — це підказка, а не команда. Реальний вплив на частоту обходу дають інші речі: швидкість відповіді сервера, кількість і якість внутрішніх посилань на сторінку, оновлюваність контенту й загальна довіра до сайту.
Як зрозуміти, що робот ходить не туди?
У звіті про сканування в Search Console видно, скільки запитів на день робот робить і за якими типами адрес. Якщо основна маса запитів припадає на сторінки з параметрами, сортуваннями чи пошуком, а картки товарів обходяться раз на місяць — це і є той випадок. Другий симптом: сторінки місяцями висять у статусі «виявлена, не проіндексована».
Потрібен сайт або застосунок?
Розробляємо під ключ — від дизайну до запуску. Порахуємо ваш проєкт безкоштовно.