Zum Inhalt springen

robots.txt

Was ist die robots.txt?

Die robots.txt ist eine einfache Textdatei im Stammverzeichnis einer Website, die Suchmaschinen-Crawlern mitteilt, welche Bereiche sie aufrufen dürfen und welche nicht. Sie ist eine der ältesten Konventionen im Web und dient als erste Anlaufstelle für Bots, bevor diese eine Seite durchsuchen. Die robots.txt steuert also den Zugriff — nicht die Indexierung im engeren Sinne.

Aufbau und Funktionsweise

Die Datei besteht aus einfachen Regeln: „User-agent" bestimmt, für welchen Crawler eine Anweisung gilt, „Disallow" und „Allow" legen fest, welche Pfade gesperrt oder freigegeben sind. Üblicherweise wird auch auf die XML-Sitemap verwiesen. Crawler lesen die Datei vor dem Besuch und richten sich in der Regel danach — verbindlich erzwingbar ist die Einhaltung allerdings nicht. Da die robots.txt öffentlich abrufbar ist, gehören vertrauliche Pfade ausdrücklich nicht hinein, da sie sonst für jeden einsehbar wären.

Abgrenzung zu noindex

Ein häufiges Missverständnis: Die robots.txt verhindert das Crawlen, nicht zwingend das Erscheinen in der Suche. Eine gesperrte, aber anderweitig verlinkte Seite kann trotzdem indexiert werden. Wer eine Seite zuverlässig aus dem Index halten will, nutzt dafür noindex oder den X-Robots-Tag. Als KI-Pendant für Sprachmodelle entsteht parallel die llms.txt.