robots.txtのルールを作成して確認する方法。
robotsルールはクロールを制御しますが、検索結果からの確実な削除はできません。対象クローラーに合う構文を使い、機密データの保護にはrobots.txtを使わないでください。
作業手順をタスクに合わせましょう。
ルールの対象となるクローラーグループとパスを指定します。その範囲でファイルを作り、対象ホストに適用する前に、代表的な許可URLと禁止URLをテストしてください。
- 用意するもの
- クローラーとパスについての明確な要件。
- 得られるもの
- 説明用の例を含むrobotsルール。
入力と結果を確認しましょう。
説明用の入力と出力 · 実際の WebAct 実行ではない学習用サンプル
入力項目サンプル個
Allow public pages; ask crawlers not to crawl /internal-preview/.
完成例
User-agent: * Disallow: /internal-preview/ Confirm that private resources also require access control.
この入力をプロンプトに読み込み、WebAct にコピーして試してください。結果は掲載例と異なる場合があります。
判断のポイントとトラブル対処。
robots.txtで非公開ページの機密性を守れますか?
いいえ。クロール指示はアクセス制御ではありません。非公開コンテンツには適切な認証など、実際のアクセス制限が必要です。
ブロックしたURLが検索結果に残るのはなぜですか?
クロール制限は、確実なインデックス削除手段ではありません。意図するインデックス制御を別途確認し、クローラーがその指示を発見できるようにしてください。
このワークフローの参考資料。
自分の資料で試しましょう。
タスクのプロンプト内の例を自分の資料に置き換えてください。必要な要件を残し、タスクを WebAct にコピーします。
タスクを調整してコピー ↑