画像に忠実なキャプションの書き方。
画像のキャプションは、見えている内容を周囲の記事と結び付ける必要があります。名前、日付、場所は提供されている場合だけ追加し、解釈を観察された事実として扱わないでください。
作業手順をタスクに合わせましょう。
見えている対象や動作を説明し、提供された記事の文脈と結び付けます。名前、場所、日付は確認された場合だけ追加します。解釈と観察を分け、掲載先に合った長さを選びます。
- 用意するもの
- ユーザーが提供した画像と掲載の文脈。
- 得られるもの
- 観察と推測を区別した正確なキャプション。
入力と結果を確認しましょう。
説明用の入力と出力 · 実際の WebAct 実行ではない学習用サンプル
入力項目サンプル個
Photo shows three people planting a sapling; no names or location are provided.
完成例
Three people plant a sapling together. If the caption needs an event name or location, request those details rather than inferring them from the image.
この入力をプロンプトに読み込み、WebAct にコピーして試してください。結果は掲載例と異なる場合があります。
判断のポイントとトラブル対処。
外見から人物の身元や場所を推測してキャプションに書くべきですか?
画像から推測するのではなく、提供され確認された文脈を使ってください。
キャプションが隣の見出しを繰り返すだけで情報を加えないのはなぜですか?
画像固有の役割を捉えていない可能性があります。読者が見落としそうな関連する視覚的特徴や確認済みの文脈を説明してください。
自分の資料で試しましょう。
タスクのプロンプト内の例を自分の資料に置き換えてください。必要な要件を残し、タスクを WebAct にコピーします。
タスクを調整してコピー ↑