Indexace a crawl budget: jak zajistit, aby vás Google našel

 ·  10 min čtení

Indexace a crawl budget: jak zajistit, aby vás Google našel

Napsali jste článek. Přidali produkt. Spustili novou kategorii. A po týdnech se stránka pořád neobjevuje ve vyhledávání, i když existuje a funguje.

Většina lidí v tu chvíli začne ladit texty a klíčová slova. Jenže problém je jinde. Stránka, kterou Google nemá v indexu, nemůže rankovat na nic. Je jedno, jak dobrý má obsah. Ve vyhledávání prostě není.

Indexace je vstupenka do hry. Bez ní se o pozice nemá cenu bavit. A u větších webů se k tomu přidává druhá vrstva: crawl budget, tedy kolik stránek vám Google reálně stihne projít.

Tenhle článek spojuje obě témata prakticky. Ukážu vám, jak v Search Console zjistit, co Google skutečně indexuje, co znamenají jednotlivé stavy, kdy crawl budget řešit a kdy je to ztráta času, a jak stránku do indexu dostat nebo z něj naopak vyhodit.

Crawling, indexace a ranking nejsou totéž

Tři pojmy, které se pletou nejčastěji. A dokud je nerozlišíte, budete opravovat špatnou věc.

Crawling je návštěva. Googlebot přijde na URL a stáhne její obsah. Nic víc. To, že robot stránku prošel, neznamená, že se objeví ve vyhledávání.

Indexace je zařazení. Google stažený obsah zpracuje, vyhodnotí a uloží do indexu, což je databáze, ze které vybírá výsledky. Až stránka, která je v indexu, může vyjít ve vyhledávání.

Ranking je pořadí. Ze všech zaindexovaných stránek Google při každém dotazu vybere ty nejrelevantnější a seřadí je. Tady teprve hrají roli klíčová slova, obsah, odkazy a autorita.

Pořadí je pevné. Nejdřív crawling, pak indexace, nakonec ranking. Když stránka není v indexu, ladit ranking nemá smysl. Řešíte krok, ke kterému jste se ještě nedostali.

Crawling je návštěva, indexace je zařazení do databáze, ranking je pořadí ve výsledcích. Neřešte pozice u stránky, která ještě není v indexu.

Jak zjistit, co Google reálně indexuje

Nehádejte. Změřte. Máte dva nástroje a oba jsou zdarma.

Report Indexování stránek v Search Console

Přesná data najdete v Google Search Console v sekci Indexování stránek. Report rozdělí všechny známé URL do dvou skupin: Zaindexováno a Nezaindexováno. U nezaindexovaných navíc uvidíte konkrétní důvod, proč stránka v indexu není.

Tohle je nejcennější indexační report, jaký máte. Neukazuje domněnky, ale reálný stav z pohledu Googlu. Když počet zaindexovaných stránek klesá, nebo v nezaindexovaných najdete URL, které tam být nemají, máte první stopu.

Pro jednu konkrétní stránku použijte nástroj Kontrola URL. Zadáte adresu a Google řekne, zda je v indexu, kdy ji naposledy prošel a jestli nenarazil na překážku.

Operátor site:

Rychlý odhad získáte přímo ve vyhledávání. Do Googlu zadejte site:vasedomena.cz a dostanete přibližný počet zaindexovaných stránek z vaší domény.

Číslo berte orientačně, není přesné. Ale je užitečné pro rychlou kontrolu řádu. Když má web 300 reálných stránek a site: ukáže 40, něco brání indexaci. Když ukáže 5 000, do indexu se dostal balast, nejspíš filtrované nebo parametrické URL.

Report Indexování stránek ukáže přesný stav a důvody, operátor site: slouží k rychlé kontrole řádu. Rozpor mezi počtem reálných a zaindexovaných stránek je vždy signál k prošetření.

Časté stavy v Search Console a co znamenají

V reportu Indexování stránek narazíte na řadu stavů. Dva z nich matou nejvíc, protože znějí skoro stejně, a přitom znamenají něco úplně jiného.

Objeveno - momentálně neindexováno znamená, že Google o URL ví, ale ještě ji neprošel. Zná adresu ze sitemapy nebo z odkazu, ale zatím ji nestáhl. Často jde o signál crawl budgetu: robot se ke stránce prostě nedostal. U velkých webů je to varování, že Google nestíhá.

Prošeno - momentálně neindexováno znamená, že Google stránku navštívil, ale rozhodl se ji nezařadit do indexu. To je vážnější signál a skoro vždy jde o kvalitu. Tenký obsah, duplicita, stránka, která nepřináší nic navíc. Robot ji viděl a řekl si, že za index nestojí.

Rozdíl je zásadní. První stav řešíte crawlingem a interním prolinkováním. Druhý řešíte obsahem. Zaměnit je znamená opravovat špatnou věc.

Zbytek běžných stavů shrnuje tabulka.

Stav v Search ConsoleCo znamenáCo s tím
Objeveno - momentálně neindexovánoGoogle zná URL, ale zatím neprošelZlepšit prolinkování, zkontrolovat crawl budget
Prošeno - momentálně neindexovánoGoogle prošel, ale nezařadilZlepšit kvalitu a jedinečnost obsahu
Duplicitní stránka, Google zvolil jiný kanonickýObsah je duplicitní, Google preferuje jinou URLSjednotit obsah, ověřit kanonické tagy
Vyloučeno pomocí značky noindexStránka má meta tag noindexPokud má být v indexu, noindex odstranit
Zablokováno souborem robots.txtRobot na stránku nesmíUvolnit v robots.txt, pokud má být indexovaná
Stránka s přesměrovánímURL přesměrovává jinamV pořádku, do indexu patří cílová stránka
Nenalezeno (404)Stránka neexistujeOpravit odkaz, nebo přesměrovat na relevantní obsah
"Objeveno" znamená problém s procházením, "Prošeno" znamená problém s kvalitou. Každý stav v reportu má jinou příčinu i jiné řešení, proto ho nejdřív správně přečtěte.

Co je crawl budget a kdo ho musí řešit

Crawl budget je počet stránek, které Googlebot na vašem webu projde za dané období. Google nemá nekonečné zdroje a každému webu přiděluje jen část pozornosti. Čím líp ji využijete, tím rychleji se důležité stránky dostanou do indexu.

Skládá se ze dvou věcí. Jak často je Google ochotný na web chodit, a jak velkou zátěž váš server unese. Pomalý server nebo časté chyby crawl budget snižují.

Teď to důležité: většina webů crawl budget řešit nemusí. Pokud máte web do pár tisíc URL, Google ho v pohodě projde celý a řešení crawl budgetu je ztráta času. Zaměříte se na něj místo na věci, které vám reálně pomůžou.

Crawl budget je téma pro velké weby. E-shopy s desítkami tisíc produktů, portály, weby s filtrováním a parametry, které generují nekonečné množství URL. Tam se rozhoduje, zda se robot dostane k tomu podstatnému, nebo utopí návštěvy v balastu.

Jednoduché vodítko: menší web řeší, zda se stránky vůbec indexují. Velký web řeší, které stránky Google indexuje přednostně. Detailnější kontext k tomu, proč vás Google nenachází, najdete v článku Proč vás zákazníci na Googlu nenajdou.

Crawl budget je pozornost, kterou vám Google věnuje. Malý web ho neřeší, u velkého webu rozhoduje, jestli se robot dostane k důležitým stránkám dřív, než se vyčerpá.

Co crawl budget žere a jak ho šetřit

Rozpočet ujídají stránky, na kterých vám vůbec nezáleží. Každá zbytečná návštěva je návštěva, kterou Googlebot neutratil za produkt nebo článek, který chcete mít ve vyhledávání.

Největší žrouti

Parametry a filtry. Facetová navigace v e-shopu je největší množitel URL vůbec. Kombinace velikost, barva, značka a cena z jedné kategorie snadno vygeneruje tisíce adres se skoro stejným obsahem. Google je klidně prochází všechny, dokud mu neřeknete, že nemá.

Řetězy přesměrování. Když URL A míří na B, B na C a C na D, každý skok stojí robota čas a zdroje. Místo jedné stránky projde čtyři adresy, aby se dostal na finální cíl.

Duplicitní obsah. Stejná stránka dostupná na více URL, verze s parametry, řazení, session ID. Google prochází kopie a plýtvá rozpočtem na obsah, který už zná.

Mrtvé odkazy a chyby serveru. Odkazy na 404 a opakované chyby 500 posílají robota do slepých uliček a snižují frekvenci procházení.

Jak rozpočet ušetřit

Postupy shrnuje tabulka.

ProblémŘešení
Parametrické a filtrační URLZablokovat v robots.txt, nasadit noindex, nebo filtrovat přes JavaScript bez změny URL
Duplicitní variantyKanonický tag na základní verzi stránky
Řetězy přesměrováníZkrátit na jeden skok, stará URL míří rovnou na finální cíl
Odkazy na 404Opravit, nebo přesměrovat na relevantní obsah
Balast v sitemapěNechat v ní jen indexovatelné URL se stavem 200

Pozor na jeden háček. Robots.txt řídí procházení, ne indexaci. Když parametrickou URL zablokujete v robots.txt, ušetříte crawl budget, ale pokud na ni vedou odkazy, Google ji může zaindexovat i tak, jen bez obsahu. Technické souvislosti rozebírám podrobněji v článku technické SEO.

Jak stránku dostat do indexu a jak ji vyhodit

Nejdřív směr do indexu. Máte novou stránku a chcete ji tam co nejdřív.

Dostat stránku do indexu

Základ je, aby o URL Google vůbec věděl. Přidejte ji do sitemapy a sitemapu nahrajte do Search Console. Odkažte na novou stránku z existujících, už zaindexovaných stránek. Interní odkaz je pro robota cesta, jak se ke stránce dostane.

Pak použijte nástroj Kontrola URL a klikněte na Požádat o indexování. Ve většině případů Google začne stránku procházet během několika hodin. Pokud nenarazí na problém, sám ji pak zaindexuje.

Když se stránka pořád neindexuje, projděte překážky. Nemá noindex? Není blokovaná v robots.txt? Ukazuje kanonický tag sama na sebe? A hlavně: má obsah, který stojí za zařazení? U stavu "Prošeno - neindexováno" žádné tlačítko nepomůže, dokud stránku neuděláte hodnotnější.

Vyhodit stránku z indexu

Tady dělá většina lidí stejnou chybu: zablokují stránku v robots.txt a čekají, že zmizí z vyhledávání. Nezmizí.

Robots.txt neslouží k deindexaci. Zablokovaná stránka může v indexu zůstat dál, jen bez popisku. Google k jejímu obsahu nemá přístup, ale URL zná z odkazů, takže ji ve výsledcích nechá.

Ke správnému odstranění slouží meta tag noindex v hlavičce stránky, nebo hlavička HTTP X-Robots-Tag. A tady je klíčová podmínka: aby Google noindex viděl, stránka nesmí být zároveň blokovaná v robots.txt. Zablokovanou stránku robot neprojde, takže noindex nikdy nepřečte a stránka v indexu zůstane.

Postup je tedy jednoznačný. Nasaďte noindex, nechte robots.txt otevřený, počkejte, až Google stránku znovu projde a vyřadí. Teprve potom ji můžete klidně zablokovat i v robots.txt.

Do indexu stránku dostanete prolinkováním, sitemapou a tlačítkem Požádat o indexování. Ven ji dostanete přes noindex, nikdy ne přes robots.txt, jinak zůstane v indexu bez popisu.

Tip od SEO specialisty

Nejdřív si udělejte inventuru, kolik stránek vlastně chcete mít v indexu. Zní to banálně, ale skoro nikdo to neudělá.

Vezměte reálný počet stránek, které mají generovat návštěvnost. Produkty, kategorie, články, klíčové stránky služeb. To je vaše cílové číslo. Pak ho porovnejte s tím, co ukazuje report Indexování stránek a operátor site:.

Když je v indexu výrazně méně, řešíte, proč se stránky nedostávají dovnitř. Když je v indexu výrazně víc, máte tam balast, který vám žere crawl budget a ředí obraz webu v očích Googlu. Obě situace vyžadují jiný zásah, ale poznáte je jen tehdy, když znáte cílové číslo.

Druhý tip: v reportu si vždy přečtěte konkrétní stav, ne jen souhrn. "Objeveno" a "Prošeno" vypadají skoro stejně a znamenají opačný problém. Kdo je nerozliší, opravuje crawling tam, kde je špatný obsah, nebo obsah tam, kde je problém s procházením.

Nechte si prověřit indexaci v SEO analýze

Často kladené otázky (FAQ)

Jak dlouho trvá, než Google zaindexuje novou stránku?
Od několika hodin po několik týdnů. U zavedeného webu s dobrým prolinkováním jde o hodiny až dny. U nového webu bez odkazů a bez sitemapy to může trvat týdny. Proces urychlíte tlačítkem Požádat o indexování v nástroji Kontrola URL.
Proč se moje stránka neindexuje, i když existuje?
Nejčastější příčiny jsou meta tag noindex, blokace v robots.txt, kanonický tag ukazující jinam, nebo příliš tenký obsah. Přesný důvod ukáže report Indexování stránek a nástroj Kontrola URL v Search Console.
Co znamená "Objeveno - momentálně neindexováno"?
Google o adrese ví, ale zatím ji neprošel. Typicky ji zná ze sitemapy nebo z odkazu, ale nedostal se k ní. Často jde o signál crawl budgetu. Pomůže lepší interní prolinkování a odstranění balastních URL.
Musím řešit crawl budget?
Pokud máte web do pár tisíc stránek, ne. Google ho projde celý a řešení crawl budgetu by byla ztráta času. Crawl budget je téma pro velké e-shopy a portály s desítkami tisíc URL, kde robot nestíhá projít vše.
K čemu slouží operátor site:?
Zadáte site:vasedomena.cz do Googlu a dostanete přibližný počet zaindexovaných stránek. Číslo je orientační, ale dobře poslouží k rychlé kontrole. Velký rozpor mezi reálným a zaindexovaným počtem stránek je vždy signál k prošetření.
Odstraní robots.txt stránku z Googlu?
Ne. Robots.txt řídí procházení, ne indexaci. Zablokovaná stránka může v indexu zůstat bez popisu. K odstranění slouží meta tag noindex, přičemž stránka nesmí být zároveň blokovaná v robots.txt, jinak Google noindex neuvidí.