Générer et vérifier les règles d'un fichier robots.txt.
Les règles robots contrôlent l'exploration, sans retirer de manière fiable les pages des résultats de recherche. Respectez la syntaxe du robot visé et n'utilisez jamais robots.txt pour protéger des données confidentielles.
Adaptez le processus à votre tâche.
Précisez le groupe de robots et les chemins concernés. Rédigez le fichier dans ce périmètre, puis testez des URL représentatives autorisées et interdites avant de l'appliquer à l'hôte prévu.
- Ce que vous fournissez
- Exigences explicites concernant robots d'exploration et chemins.
- Ce que vous obtenez
- Règles robots avec exemples explicatifs.
Consultez les données et le résultat.
Entrée et sortie illustratives · exemple pédagogique, pas une exécution WebAct en direct
Exemple champ
Allow public pages; ask crawlers not to crawl /internal-preview/.
Exemple complet
User-agent: * Disallow: /internal-preview/ Confirm that private resources also require access control.
Chargez ces données dans le prompt, puis copiez-le dans WebAct pour essayer la tâche. Votre résultat peut différer de l'illustration.
Décisions et dépannage.
robots.txt peut-il garantir la confidentialité de pages privées ?
Non. Les instructions d'exploration ne sont pas un contrôle d'accès. Un contenu privé exige une authentification appropriée ou une autre véritable restriction d'accès.
Pourquoi une URL bloquée apparaît-elle encore dans la recherche ?
Une restriction d'exploration n'est pas un mécanisme fiable de désindexation. Examinez séparément les contrôles d'indexation prévus et assurez-vous qu'ils sont accessibles aux robots.
Référence pour ce processus.
Essayez avec votre propre source.
Remplacez l'exemple par vos données dans le prompt. Gardez les exigences nécessaires, puis copiez la tâche dans WebAct.
Personnaliser et copier la tâche ↑