Was ist die robots.txt?
Die robots.txt ist eine einfache Textdatei im Stammverzeichnis einer Website, die Suchmaschinen-Crawlern mitteilt, welche Bereiche sie aufrufen dürfen und welche nicht. Sie ist eine der ältesten Konventionen im Web und dient als
erste Anlaufstelle für Bots, bevor diese eine Seite durchsuchen. Die robots.txt steuert also den Zugriff — nicht die Indexierung im engeren Sinne.
Aufbau und Funktionsweise
Die Datei besteht aus einfachen Regeln: „User-agent" bestimmt, für welchen Crawler eine Anweisung gilt, „Disallow" und „Allow" legen fest, welche Pfade gesperrt oder freigegeben sind. Üblicherweise wird auch auf die
XML-Sitemap verwiesen. Crawler lesen die Datei vor dem Besuch und richten sich in der Regel danach — verbindlich erzwingbar ist die Einhaltung allerdings nicht. Da die robots.txt öffentlich abrufbar ist, gehören vertrauliche Pfade ausdrücklich nicht hinein, da sie sonst für jeden einsehbar wären.
Abgrenzung zu noindex
Ein häufiges Missverständnis: Die robots.txt verhindert das
Crawlen, nicht zwingend das Erscheinen in der Suche. Eine gesperrte, aber anderweitig verlinkte Seite kann trotzdem indexiert werden. Wer eine Seite zuverlässig aus dem Index halten will, nutzt dafür
noindex oder den
X-Robots-Tag. Als KI-Pendant für Sprachmodelle entsteht parallel die
llms.txt.