HTML を読みやすいプレーンテキストに変換する方法。
プレーンテキストの抽出では、見出し、リストの意味、役立つリンク先を保持する必要があります。無関係な語句をつなげたり、スクリプトの内容を露出させたりせずにマークアップを取り除いてください。
作業手順をタスクに合わせましょう。
文書順に読み取れる内容を抽出し、見出し、段落、リストの境界を保ってください。リンク先や画像の代替テキストを残すか決めます。スクリプトとスタイルの内容は除外し、プレーンテキストで関係性が失われやすい表を確認してください。
- 用意するもの
- HTML フラグメント。
- 得られるもの
- 意味のある構造を保った読みやすいテキスト。
入力と結果を確認しましょう。
説明用の入力と出力 · 実際の WebAct 実行ではない学習用サンプル
入力項目サンプル個
HTML fragment: <h2>Setup</h2><p>Open the app.</p>
完成例
Setup Open the app.
この入力をプロンプトに読み込み、WebAct にコピーして試してください。結果は掲載例と異なる場合があります。
判断のポイントとトラブル対処。
プレーンテキストにはリンクの文言とリンク先の両方を含めるべきですか?
読者がリンクを開いたり検証したりする必要がある場合はリンク先を含めます。それ以外は指定された形式に従い、読めるラベルを残してください。
HTML タグを削除したら二つの段落がつながったのはなぜですか?
タグの削除だけではブロックの境界を保てません。構造要素を変換する際に適切な区切りを挿入してください。
自分の資料で試しましょう。
タスクのプロンプト内の例を自分の資料に置き換えてください。必要な要件を残し、タスクを WebAct にコピーします。
タスクを調整してコピー ↑