Co znamená Robots.txt?

Popis:
Robots.txt je textový soubor umístěný v kořenovém adresáři webu (např. anycoders.cz/robots.txt), který dává vyhledávacím robotům instrukce, které části webu mají nebo nemají procházet (crawlovat). Nejde o zabezpečení ani o způsob, jak stránku schovat před uživateli – je to jen doporučení pro roboty, které se slušně chovající vyhledávače (jako Googlebot) snaží respektovat.
Soubor se používá typicky k tomu, aby se zbytečně neplýtvalo tzv. crawl budgetem na nedůležité části webu – administrační sekce, interní vyhledávání, filtry v e-shopu nebo duplicitní stránky. Špatně nastavený robots.txt ale může web i poškodit, pokud omylem zablokuje crawlování důležitých stránek, které by se jinak měly objevit na SERP.
Jak robots.txt souvisí s indexací
Je důležité rozlišovat crawlování a indexaci – robots.txt řídí, jestli robot stránku vůbec navštíví, ale sám o sobě nezaručuje, že stránka nebude indexovaná (k tomu slouží spíš meta tag noindex). Pokud je stránka blokovaná v robots.txt, ale zároveň na ni vedou backlinky, Google ji může i tak zařadit do výsledků, jen bez náhledu obsahu. Robots.txt bývá jedním z prvních míst, které se kontrolují při technickém SEO auditu, spolu s nastavením canonical URL a strukturou webu.
Související pojmy: SEO, Canonical URL, SERP (Search Engine Results Page), Backlink (Zpětný odkaz), Ecommerce (E-commerce).
Související: Vývoj e-shopů.
Obrázek: AI

Zajímá vás k tomu více?
Napište. Ozveme se, i když to není poptávka.