如何生成并检查 robots.txt 规则。
robots 规则控制抓取,不能可靠地将页面从搜索结果中移除。使用目标爬虫支持的正确语法,绝不要用 robots.txt 保护机密数据。
按任务需求调整流程。
指定规则涉及的爬虫组和路径。按这些边界起草文件,在应用到目标主机前测试有代表性的允许与禁止 URL。
- 你需要提供什么
- 明确的爬虫和路径要求。
- 你会得到什么
- 附带解释示例的 robots 规则。
查看输入和结果。
演示用输入和输出 · 教学示例,并非 WebAct 实时运行结果
示例 个输入项
Allow public pages; ask crawlers not to crawl /internal-preview/.
完整示例
User-agent: * Disallow: /internal-preview/ Confirm that private resources also require access control.
将这份输入载入提示词,再复制到 WebAct 中尝试任务。实际结果可能与示例不同。
决策与问题排查。
robots.txt 能让私密页面保密吗?
不能。抓取指令不是访问控制。私密内容需要适当的身份验证或其他实际访问限制。
为什么被禁止抓取的 URL 仍出现在搜索中?
抓取限制不是可靠的索引移除机制。应单独审查预期的索引控制,并确保爬虫能够发现这些指令。
此工作流程的参考资料。
使用自己的资料试一试。
将任务提示词中的示例换成你的材料。保留所需条件,再把任务复制到 WebAct。
自定义并复制任务 ↑