Indexace a crawl budget: jak zajistit, aby vás Google našel
· 10 min čtení
Napsali jste článek. Přidali produkt. Spustili novou kategorii. A po týdnech se stránka pořád neobjevuje ve vyhledávání, i když existuje a funguje.
Většina lidí v tu chvíli začne ladit texty a klíčová slova. Jenže problém je jinde. Stránka, kterou Google nemá v indexu, nemůže rankovat na nic. Je jedno, jak dobrý má obsah. Ve vyhledávání prostě není.
Indexace je vstupenka do hry. Bez ní se o pozice nemá cenu bavit. A u větších webů se k tomu přidává druhá vrstva: crawl budget, tedy kolik stránek vám Google reálně stihne projít.
Tenhle článek spojuje obě témata prakticky. Ukážu vám, jak v Search Console zjistit, co Google skutečně indexuje, co znamenají jednotlivé stavy, kdy crawl budget řešit a kdy je to ztráta času, a jak stránku do indexu dostat nebo z něj naopak vyhodit.
Crawling, indexace a ranking nejsou totéž
Tři pojmy, které se pletou nejčastěji. A dokud je nerozlišíte, budete opravovat špatnou věc.
Crawling je návštěva. Googlebot přijde na URL a stáhne její obsah. Nic víc. To, že robot stránku prošel, neznamená, že se objeví ve vyhledávání.
Indexace je zařazení. Google stažený obsah zpracuje, vyhodnotí a uloží do indexu, což je databáze, ze které vybírá výsledky. Až stránka, která je v indexu, může vyjít ve vyhledávání.
Ranking je pořadí. Ze všech zaindexovaných stránek Google při každém dotazu vybere ty nejrelevantnější a seřadí je. Tady teprve hrají roli klíčová slova, obsah, odkazy a autorita.
Pořadí je pevné. Nejdřív crawling, pak indexace, nakonec ranking. Když stránka není v indexu, ladit ranking nemá smysl. Řešíte krok, ke kterému jste se ještě nedostali.
Jak zjistit, co Google reálně indexuje
Nehádejte. Změřte. Máte dva nástroje a oba jsou zdarma.
Report Indexování stránek v Search Console
Přesná data najdete v Google Search Console v sekci Indexování stránek. Report rozdělí všechny známé URL do dvou skupin: Zaindexováno a Nezaindexováno. U nezaindexovaných navíc uvidíte konkrétní důvod, proč stránka v indexu není.
Tohle je nejcennější indexační report, jaký máte. Neukazuje domněnky, ale reálný stav z pohledu Googlu. Když počet zaindexovaných stránek klesá, nebo v nezaindexovaných najdete URL, které tam být nemají, máte první stopu.
Pro jednu konkrétní stránku použijte nástroj Kontrola URL. Zadáte adresu a Google řekne, zda je v indexu, kdy ji naposledy prošel a jestli nenarazil na překážku.
Operátor site:
Rychlý odhad získáte přímo ve vyhledávání. Do Googlu zadejte site:vasedomena.cz a dostanete přibližný počet zaindexovaných stránek z vaší domény.
Číslo berte orientačně, není přesné. Ale je užitečné pro rychlou kontrolu řádu. Když má web 300 reálných stránek a site: ukáže 40, něco brání indexaci. Když ukáže 5 000, do indexu se dostal balast, nejspíš filtrované nebo parametrické URL.
site: slouží k rychlé kontrole řádu. Rozpor mezi počtem reálných a zaindexovaných stránek je vždy signál k prošetření.Časté stavy v Search Console a co znamenají
V reportu Indexování stránek narazíte na řadu stavů. Dva z nich matou nejvíc, protože znějí skoro stejně, a přitom znamenají něco úplně jiného.
Objeveno - momentálně neindexováno znamená, že Google o URL ví, ale ještě ji neprošel. Zná adresu ze sitemapy nebo z odkazu, ale zatím ji nestáhl. Často jde o signál crawl budgetu: robot se ke stránce prostě nedostal. U velkých webů je to varování, že Google nestíhá.
Prošeno - momentálně neindexováno znamená, že Google stránku navštívil, ale rozhodl se ji nezařadit do indexu. To je vážnější signál a skoro vždy jde o kvalitu. Tenký obsah, duplicita, stránka, která nepřináší nic navíc. Robot ji viděl a řekl si, že za index nestojí.
Rozdíl je zásadní. První stav řešíte crawlingem a interním prolinkováním. Druhý řešíte obsahem. Zaměnit je znamená opravovat špatnou věc.
Zbytek běžných stavů shrnuje tabulka.
| Stav v Search Console | Co znamená | Co s tím |
|---|---|---|
| Objeveno - momentálně neindexováno | Google zná URL, ale zatím neprošel | Zlepšit prolinkování, zkontrolovat crawl budget |
| Prošeno - momentálně neindexováno | Google prošel, ale nezařadil | Zlepšit kvalitu a jedinečnost obsahu |
| Duplicitní stránka, Google zvolil jiný kanonický | Obsah je duplicitní, Google preferuje jinou URL | Sjednotit obsah, ověřit kanonické tagy |
| Vyloučeno pomocí značky noindex | Stránka má meta tag noindex | Pokud má být v indexu, noindex odstranit |
| Zablokováno souborem robots.txt | Robot na stránku nesmí | Uvolnit v robots.txt, pokud má být indexovaná |
| Stránka s přesměrováním | URL přesměrovává jinam | V pořádku, do indexu patří cílová stránka |
| Nenalezeno (404) | Stránka neexistuje | Opravit odkaz, nebo přesměrovat na relevantní obsah |
Co je crawl budget a kdo ho musí řešit
Crawl budget je počet stránek, které Googlebot na vašem webu projde za dané období. Google nemá nekonečné zdroje a každému webu přiděluje jen část pozornosti. Čím líp ji využijete, tím rychleji se důležité stránky dostanou do indexu.
Skládá se ze dvou věcí. Jak často je Google ochotný na web chodit, a jak velkou zátěž váš server unese. Pomalý server nebo časté chyby crawl budget snižují.
Teď to důležité: většina webů crawl budget řešit nemusí. Pokud máte web do pár tisíc URL, Google ho v pohodě projde celý a řešení crawl budgetu je ztráta času. Zaměříte se na něj místo na věci, které vám reálně pomůžou.
Crawl budget je téma pro velké weby. E-shopy s desítkami tisíc produktů, portály, weby s filtrováním a parametry, které generují nekonečné množství URL. Tam se rozhoduje, zda se robot dostane k tomu podstatnému, nebo utopí návštěvy v balastu.
Jednoduché vodítko: menší web řeší, zda se stránky vůbec indexují. Velký web řeší, které stránky Google indexuje přednostně. Detailnější kontext k tomu, proč vás Google nenachází, najdete v článku Proč vás zákazníci na Googlu nenajdou.
Co crawl budget žere a jak ho šetřit
Rozpočet ujídají stránky, na kterých vám vůbec nezáleží. Každá zbytečná návštěva je návštěva, kterou Googlebot neutratil za produkt nebo článek, který chcete mít ve vyhledávání.
Největší žrouti
Parametry a filtry. Facetová navigace v e-shopu je největší množitel URL vůbec. Kombinace velikost, barva, značka a cena z jedné kategorie snadno vygeneruje tisíce adres se skoro stejným obsahem. Google je klidně prochází všechny, dokud mu neřeknete, že nemá.
Řetězy přesměrování. Když URL A míří na B, B na C a C na D, každý skok stojí robota čas a zdroje. Místo jedné stránky projde čtyři adresy, aby se dostal na finální cíl.
Duplicitní obsah. Stejná stránka dostupná na více URL, verze s parametry, řazení, session ID. Google prochází kopie a plýtvá rozpočtem na obsah, který už zná.
Mrtvé odkazy a chyby serveru. Odkazy na 404 a opakované chyby 500 posílají robota do slepých uliček a snižují frekvenci procházení.
Jak rozpočet ušetřit
Postupy shrnuje tabulka.
| Problém | Řešení |
|---|---|
| Parametrické a filtrační URL | Zablokovat v robots.txt, nasadit noindex, nebo filtrovat přes JavaScript bez změny URL |
| Duplicitní varianty | Kanonický tag na základní verzi stránky |
| Řetězy přesměrování | Zkrátit na jeden skok, stará URL míří rovnou na finální cíl |
| Odkazy na 404 | Opravit, nebo přesměrovat na relevantní obsah |
| Balast v sitemapě | Nechat v ní jen indexovatelné URL se stavem 200 |
Pozor na jeden háček. Robots.txt řídí procházení, ne indexaci. Když parametrickou URL zablokujete v robots.txt, ušetříte crawl budget, ale pokud na ni vedou odkazy, Google ji může zaindexovat i tak, jen bez obsahu. Technické souvislosti rozebírám podrobněji v článku technické SEO.
Jak stránku dostat do indexu a jak ji vyhodit
Nejdřív směr do indexu. Máte novou stránku a chcete ji tam co nejdřív.
Dostat stránku do indexu
Základ je, aby o URL Google vůbec věděl. Přidejte ji do sitemapy a sitemapu nahrajte do Search Console. Odkažte na novou stránku z existujících, už zaindexovaných stránek. Interní odkaz je pro robota cesta, jak se ke stránce dostane.
Pak použijte nástroj Kontrola URL a klikněte na Požádat o indexování. Ve většině případů Google začne stránku procházet během několika hodin. Pokud nenarazí na problém, sám ji pak zaindexuje.
Když se stránka pořád neindexuje, projděte překážky. Nemá noindex? Není blokovaná v robots.txt? Ukazuje kanonický tag sama na sebe? A hlavně: má obsah, který stojí za zařazení? U stavu "Prošeno - neindexováno" žádné tlačítko nepomůže, dokud stránku neuděláte hodnotnější.
Vyhodit stránku z indexu
Tady dělá většina lidí stejnou chybu: zablokují stránku v robots.txt a čekají, že zmizí z vyhledávání. Nezmizí.
Robots.txt neslouží k deindexaci. Zablokovaná stránka může v indexu zůstat dál, jen bez popisku. Google k jejímu obsahu nemá přístup, ale URL zná z odkazů, takže ji ve výsledcích nechá.
Ke správnému odstranění slouží meta tag noindex v hlavičce stránky, nebo hlavička HTTP X-Robots-Tag. A tady je klíčová podmínka: aby Google noindex viděl, stránka nesmí být zároveň blokovaná v robots.txt. Zablokovanou stránku robot neprojde, takže noindex nikdy nepřečte a stránka v indexu zůstane.
Postup je tedy jednoznačný. Nasaďte noindex, nechte robots.txt otevřený, počkejte, až Google stránku znovu projde a vyřadí. Teprve potom ji můžete klidně zablokovat i v robots.txt.
Tip od SEO specialisty
Nejdřív si udělejte inventuru, kolik stránek vlastně chcete mít v indexu. Zní to banálně, ale skoro nikdo to neudělá.
Vezměte reálný počet stránek, které mají generovat návštěvnost. Produkty, kategorie, články, klíčové stránky služeb. To je vaše cílové číslo. Pak ho porovnejte s tím, co ukazuje report Indexování stránek a operátor site:.
Když je v indexu výrazně méně, řešíte, proč se stránky nedostávají dovnitř. Když je v indexu výrazně víc, máte tam balast, který vám žere crawl budget a ředí obraz webu v očích Googlu. Obě situace vyžadují jiný zásah, ale poznáte je jen tehdy, když znáte cílové číslo.
Druhý tip: v reportu si vždy přečtěte konkrétní stav, ne jen souhrn. "Objeveno" a "Prošeno" vypadají skoro stejně a znamenají opačný problém. Kdo je nerozliší, opravuje crawling tam, kde je špatný obsah, nebo obsah tam, kde je problém s procházením.
Nechte si prověřit indexaci v SEO analýzeČasto kladené otázky (FAQ)
site:vasedomena.cz do Googlu a dostanete přibližný počet zaindexovaných stránek. Číslo je orientační, ale dobře poslouží k rychlé kontrole. Velký rozpor mezi reálným a zaindexovaným počtem stránek je vždy signál k prošetření.