本当に必要な表から始める

仕入先一覧、価格比較、調査候補のリスト。役立つ情報は、Web ページの表から始まることがよくあります。コピーする前に、出力に必要な行と列を決めましょう。きれいなエクスポートの第一歩は、範囲を明確にすることです。

ページに CSV やスプレッドシートのダウンロード機能があるか確認してください。特にページ分割や非表示の列がある表では、標準のエクスポートが全データを得る最短の方法であることが多いです。機能がなければ、小さな表は表示中のセルをコピーする方法でも十分な場合があります。

見えている情報がデータ全体とは限りません。スクロール時に追加の行を読み込むページや、結果の1ページだけを表示するページもあります。後で確認できるよう、元の URL と取得した表の範囲を記録しましょう。

WebAct で表を抽出する

無料の Web サイト表抽出ツールには、CSV の例とコピーして使えるタスクがあります。WebAct をインストールしてアカウントを認証し、ChatGPT のブラウザー接続を選んでください。元のタブで拡張機能を有効にし、表を文脈として選択します。

タスクモードに切り替え、抽出タスクを貼り付けてください。元の見出しと値、ソース URL の列、正確な出力行数を求める内容になっています。読み込み済みの行が25行以下の小さな表から始めましょう。提案された操作を確認して実行し、インポート前にファイルをチェックしてください。

出力された行数を、取得したい行数と比べてください。最初と最後の行、カンマや引用符を含む行を確認しましょう。欠けた内容や読めない内容は報告し、推測で埋めてはいけません。

表計算ソフトでファイルを確認する

郵便番号、商品コード、長い数字の ID がある場合は、表計算ソフトのインポート機能を使ってください。先頭のゼロや長い識別子を保つため、該当列を文字列として扱います。CSV は値と区切り文字を保持しますが、表計算の書式や列の型は保存しません。

抽出タスクでは、表計算の数式と解釈される可能性のあるセルを無効化し、変更した値を報告するよう WebAct に指示します。ファイルを開く前に、その値を確認してください。CSV には書式や信頼できる型情報がありません。

次のアプリに JSON が必要なら、求められる正確な項目名と値の型を指定してください。結果を使う前に、1件のレコード全体を確認しましょう。

コピーそのものが仕事になったら

一度だけ必要な表なら、サイト標準のダウンロードで十分かもしれません。繰り返し抽出するなら、必要な列と出力形式を指定した WebAct タスクを保存しましょう。

ページで WebAct を有効にし、対象領域を選んで、次のように頼んでください: 「表示されている名前、会社、役職を CSV に抽出してください。見出しを含め、表示されている全行がそろっているか確認してください。」 結果を元データと照合し、再利用したい場合はタスクを保存してください。

「表示中」の範囲を明確にしましょう。非表示の行、別のページ、ブラウザーが読み込んでいない内容まで含まれると思ってはいけません。役立つ自動化は、確認できる結果と対象範囲の明確な説明を返します。

このガイドに役立つツール

無料の Web サイト表抽出ツールを見る →。WebAct の拡張機能とアカウントが必要です。Free には毎月25回の自動化タスクが含まれ、提供元の制限が適用されます。

WebAct チーム執筆。製品の動作は現在の実装に基づきます。ブラウザー提供元の利用制限やサイト側の制約は引き続き適用されます。