Cómo generar y comprobar reglas de robots.txt.
Las reglas de robots controlan el rastreo, pero no eliminan de forma fiable resultados de búsqueda. Usa la sintaxis correcta del rastreador y nunca protejas datos confidenciales con robots.txt.
Adapta el flujo de trabajo a tu tarea.
Especifica el grupo de rastreadores y las rutas que deben cubrir las reglas. Redacta el archivo con esos límites y prueba URL representativas permitidas y bloqueadas antes de aplicarlo al host previsto.
- Qué aportas
- Requisitos explícitos sobre rastreadores y rutas.
- Qué obtienes
- Reglas de robots con ejemplos explicativos.
Mira la entrada y el resultado.
Entrada y salida ilustrativas · ejemplo didáctico, no una ejecución de WebAct en directo
Ejemplo campo
Allow public pages; ask crawlers not to crawl /internal-preview/.
Ejemplo completo
User-agent: * Disallow: /internal-preview/ Confirm that private resources also require access control.
Carga esta entrada en el prompt y cópialo en WebAct para probar la tarea. Tu resultado puede diferir del ejemplo.
Decisiones y solución de problemas.
¿Puede robots.txt mantener confidenciales las páginas privadas?
No. Las instrucciones de rastreo no controlan el acceso. El contenido privado necesita autenticación adecuada u otra restricción real de acceso.
¿Por qué una URL bloqueada sigue apareciendo en búsquedas?
Una restricción de rastreo no es un mecanismo fiable para eliminar de un índice. Revisa por separado los controles de indexación previstos y asegúrate de que puedan descubrirse.
Referencia para este flujo de trabajo.
Pruébalo con tu propia fuente.
Sustituye el ejemplo por tu material en el prompt. Conserva los requisitos que necesites y copia la tarea en WebAct.
Personalizar y copiar la tarea ↑