robots.txt-regels opstellen en controleren.
Robotsregels sturen het crawlen, maar verwijderen resultaten niet betrouwbaar uit zoekmachines. Gebruik de juiste crawlersyntaxis en bescherm vertrouwelijke gegevens nooit met robots.txt.
Stem de werkwijze af op je taak.
Bepaal voor welke crawlergroep en paden de regels gelden. Schrijf het bestand binnen die grenzen en test representatieve toegestane en geblokkeerde URL's voordat je het op de bedoelde host toepast.
- Wat je aanlevert
- Expliciete vereisten voor crawlers en paden.
- Wat je krijgt
- Robotsregels met toegelichte voorbeelden.
Bekijk de invoer en het resultaat.
Illustratieve invoer en uitvoer · een leervoorbeeld, geen live uitvoering van WebAct
Voorbeeld invoerveld
Allow public pages; ask crawlers not to crawl /internal-preview/.
Uitgewerkt voorbeeld
User-agent: * Disallow: /internal-preview/ Confirm that private resources also require access control.
Laad deze invoer in de prompt en kopieer deze naar WebAct om de taak te proberen. Je resultaat kan afwijken van het voorbeeld.
Keuzes en probleemoplossing.
Kan robots.txt privépagina's vertrouwelijk houden?
Nee. Crawlinstructies zijn geen toegangscontrole. Privécontent vereist passende authenticatie of een andere daadwerkelijke toegangsbeperking.
Waarom verschijnt een geblokkeerde URL nog in de zoekresultaten?
Een crawlbeperking is geen betrouwbare manier om iets uit de index te verwijderen. Controleer de beoogde indexeringsmaatregelen afzonderlijk en zorg dat crawlers ze kunnen vinden.
Bron voor deze werkwijze.
Probeer het met je eigen bron.
Vervang het voorbeeld door je eigen materiaal in de taakprompt. Behoud de eisen die je nodig hebt en kopieer de taak naar WebAct.
De taak aanpassen en kopiëren ↑