robots.txt-Regeln erstellen und prüfen.
Robots-Regeln steuern das Crawling, entfernen Seiten aber nicht zuverlässig aus Suchergebnissen. Nutze die passende Crawler-Syntax und verwende robots.txt niemals zum Schutz vertraulicher Daten.
Passe den Ablauf an deine Aufgabe an.
Lege fest, welche Crawlergruppe und welche Pfade die Regeln betreffen. Entwirf die Datei innerhalb dieser Grenzen und teste repräsentative erlaubte und gesperrte URLs, bevor du sie auf dem vorgesehenen Host einsetzt.
- Was du bereitstellst
- Ausdrückliche Anforderungen an Crawler und Pfade.
- Was du erhältst
- Robots-Regeln mit erklärenden Beispielen.
Sieh dir Eingabe und Ergebnis an.
Beispielhafte Ein- und Ausgabe · ein Lehrbeispiel, kein tatsächlicher WebAct-Durchlauf
Beispiel Eingabe
Allow public pages; ask crawlers not to crawl /internal-preview/.
Vollständiges Beispiel
User-agent: * Disallow: /internal-preview/ Confirm that private resources also require access control.
Lade diese Eingabe in den Prompt und kopiere ihn zum Ausprobieren nach WebAct. Dein Ergebnis kann vom Beispiel abweichen.
Entscheidungen und Fehlerbehebung.
Kann robots.txt private Seiten vertraulich halten?
Nein. Crawling-Anweisungen sind keine Zugriffskontrolle. Private Inhalte benötigen geeignete Authentifizierung oder eine andere tatsächliche Zugriffsbeschränkung.
Warum erscheint eine gesperrte URL weiterhin in der Suche?
Eine Crawl-Beschränkung ist kein zuverlässiger Mechanismus zur Entfernung aus dem Index. Prüfe die vorgesehenen Indexierungsmaßnahmen gesondert und stelle sicher, dass sie gefunden werden können.
Quelle für diesen Arbeitsablauf.
Probiere es mit deiner eigenen Quelle.
Ersetze das Beispiel im Aufgaben-Prompt durch dein Material. Behalte nötige Anforderungen bei und kopiere die Aufgabe nach WebAct.
Aufgabe anpassen und kopieren ↑