ERP · WEB · MOBILE · SOFTWARE

000
Усі статті
SEO та маркетинг4 хв читання
O
Команда Obliko
Розробка сайтів, застосунків та автоматизація

Краулінговий бюджет: чому Google сканує не весь сайт і як цим керувати

Що таке бюджет сканування, коли він справді стає проблемою, які сторінки зʼїдають його даремно і що робити, якщо частина сайту місяцями не потрапляє в індекс.

#індексація#seo#технічне seo#google#сканування

Google не сканує сайт цілком і одразу. У кожного ресурсу є свій темп обходу: скільки сторінок робот готовий завантажити за добу й наскільки часто повертається. Цей темп і називають краулінговим бюджетом.

Для більшості сайтів це нецікава технічна деталь. Але для каталогу на кілька тисяч адрес вона перетворюється на пряму причину, чому половина товарів не зʼявляється в пошуку місяцями.

Від чого залежить темп обходу

Спрощено — від двох речей. Перша: скільки сайт витримує. Якщо сервер відповідає повільно або віддає помилки, робот знижує навантаження, щоб не покласти ресурс. Швидкий сервер отримує більший темп — це один із небагатьох випадків, коли швидкість впливає на пошук прямо, а не через поведінку людей.

Друга: наскільки сайт цікавий пошуку. Ресурс, куди ведуть посилання, де контент оновлюється й куди приходять люди, обходять частіше. Молодий сайт без історії — рідше, і з цим нічого не вдієш, крім часу й ваги.

Керувати можна не самим бюджетом, а тим, на що він витрачається. І ось тут у більшості сайтів величезний запас.

Куди бюджет тече даремно

Головний пожирач — комбінації фільтрів у каталозі. Кожне поєднання параметрів створює окрему адресу, і при чотирьох фільтрах їх десятки тисяч на кілька сотень реальних товарів. Робот сумлінно ходить по цих майже однакових сторінках замість карток. Як розводити те, що має бути сторінкою, і те, що має лишатися фільтром, ми розбирали в матеріалі про пошук і фільтри в інтернет-магазині.

Друге джерело — внутрішній пошук, відкритий для індексації: він генерує нескінченні адреси під будь-який набраний рядок. Третє — сортування й параметри відстеження, які створюють дублі однієї сторінки. Четверте — сторінки, які віддають помилки або нескінченні ланцюжки переадресацій: кожен зайвий крок теж витрачає запит робота.

Окремий випадок — величезні розділи, які ніхто не читає: старі акції, порожні категорії, картки товарів, знятих з продажу назавжди. Вони не шкодять напряму, але забирають увагу робота в тих сторінок, які приносять гроші.

Що з цим робити

Порядок дій майже завжди однаковий. Спочатку — заборонити обхід того, що не має бути в пошуку в принципі: службові адреси, результати внутрішнього пошуку, кошик, порівняння, особистий кабінет. Це робиться файлом керування обходом, і важливо не переплутати його з забороною індексації: різницю ми детально розводили в матеріалі про robots.txt і sitemap.

Далі — дублі. Сторінки з параметрами, сортуваннями й мітками мають вказувати на основну версію, інакше пошук вважає їх окремими сторінками й ділить між ними вагу. Той самий механізм рятує пагінацію: як її оформляти, щоб не втратити товари з глибоких сторінок, ми описали в розборі пагінації каталогу.

Третій крок — прибрати технічний сміттєвий трафік робота: ланцюжки переадресацій, посилання на неіснуючі сторінки, важкі відповіді сервера. Кожна помилка — це витрачений запит, який міг піти на картку товару.

І останнє, найнедооціненіше: внутрішні посилання. Робот ходить по посиланнях, тому сторінка, на яку не веде жодне посилання зсередини сайту, обходиться рідко навіть за наявності в карті сайту. Про це — у матеріалі про внутрішню перелінковку.

Коли справа не в бюджеті

Найчастіша помилка — пояснювати бюджетом те, що ним не пояснюється. Сайт на сотню сторінок Google обходить повністю. Якщо там щось не в індексі, причина інша: заборона, залишена з часів розробки, дубль основної версії, тонкий контент або просто те, що сторінка не варта показу.

Перевіряти треба по симптомах, а не за відчуттям. Типові причини відсутності в пошуку зібрані в розборі чому сайту немає в Google, а звіт про сканування в консолі показує, куди робот справді ходить: якщо основна маса запитів — це адреси з параметрами, а картки обходяться раз на місяць, діагноз підтверджено. Як користуватися самою консоллю, ми описали в матеріалі про Google Search Console для початківців.

Для великих каталогів це не разова робота, а гігієна: коли магазин росте, кількість технічних адрес росте швидше за кількість товарів. Саме тому в проєкті інтернет-магазину з нуля структуру каталогу й правила фільтрів краще закладати на старті — переробляти потім дорожче, ніж зробити відразу.

Коротко

Краулінговий бюджет — це темп, з яким пошуковий робот обходить сайт: скільки сторінок за добу й наскільки часто повертається. Залежить він від швидкості сервера й від загальної цінності ресурсу для пошуку. Проблемою стає приблизно від кількох тисяч адрес, і майже завжди в каталогах, а не на сайтах послуг. Головні пожирачі — комбінації фільтрів, індексований внутрішній пошук, сортування й мітки, ланцюжки переадресацій і помилок. Лікування: закрити від обходу службові адреси, звести дублі до основної версії, прибрати технічне сміття й дати важливим сторінкам внутрішні посилання. Карта сайту при цьому лише підказує адреси, а не змушує їх сканувати. І головне — не списувати на бюджет те, що ним не пояснюється: на сайті в сотню сторінок причина відсутності в індексі майже завжди інша.

Ми в Obliko розробляємо сайти та інтернет-магазини під ключ і закладаємо правила обходу ще на етапі структури каталогу, щоб робот витрачав час на товари, а не на комбінації фільтрів. Якщо частина вашого каталогу роками не потрапляє в пошук — напишіть, подивимося, куди насправді ходить робот.

Часті запитання
З якого розміру сайту краулінговий бюджет стає реальною проблемою?

Приблизно від кількох тисяч сторінок, і майже завжди це інтернет-магазин з фільтрами, а не сайт послуг. Сайт на 30-200 сторінок Google обходить повністю й регулярно — якщо там щось не в індексі, причина не в бюджеті, а в якості сторінки або в технічних заборонах. Плутати ці два діагнози шкідливо: люди починають «економити бюджет» на маленькому сайті й закривають від сканування те, що мало б ранжуватися.

Що найбільше зʼїдає бюджет сканування в інтернет-магазині?

Комбінації фільтрів. Кожне поєднання «колір + розмір + ціна + сортування» — це окрема адреса, і на середньому каталозі таких адрес легко набирається десятки тисяч при кількох сотнях реальних товарів. Робот ходить по них замість карток товару. Друге за шкідливістю — внутрішній пошук, відкритий для індексації: він генерує нескінченну кількість адрес під будь-який набраний рядок.

Чи прискорює карта сайту сканування?

Вона допомагає роботу знайти сторінки, але не змушує їх сканувати частіше й не гарантує індексації. Карта — це підказка, а не команда. Реальний вплив на частоту обходу дають інші речі: швидкість відповіді сервера, кількість і якість внутрішніх посилань на сторінку, оновлюваність контенту й загальна довіра до сайту.

Як зрозуміти, що робот ходить не туди?

У звіті про сканування в Search Console видно, скільки запитів на день робот робить і за якими типами адрес. Якщо основна маса запитів припадає на сторінки з параметрами, сортуваннями чи пошуком, а картки товарів обходяться раз на місяць — це і є той випадок. Другий симптом: сторінки місяцями висять у статусі «виявлена, не проіндексована».

Потрібен сайт або застосунок?

Розробляємо під ключ — від дизайну до запуску. Порахуємо ваш проєкт безкоштовно.

Читати далі
Чому сайту немає в Google: 10 причин і як перевірити за 15 хвилин
Сайт готовий, а в пошуку його не видно. Розбираємо реальні причини — від noindex і закритого robots.txt до відсутності контенту під запит — і даємо покрокову перевірку, яку власник бізнесу може зробити сам.
Google Search Console з нуля: як читати звіти й не панікувати
Практичний розбір Google Search Console для власника сайту: як підтвердити ресурс, подати карту сайту, читати звіт індексації та ефективності й на що реально дивитися.
Зовнішні посилання та лінкбілдинг: що реально працює, а що шкодить сайту
Навіщо Google посилання з інших сайтів, чому куплені посилання — це ризик, які способи отримати згадки працюють для малого бізнесу в Україні, і як не потрапити під санкції за спробу зрости швидше.