从真正需要的表格开始

供应商名录、价格对比、调研候选清单——有用的信息往往最初藏在网页表格里。复制前,先决定输出需要哪些行和列。干净的导出始于清晰的范围。

检查页面是否自带 CSV 或电子表格下载功能。原生导出通常是获取完整数据最快的方式,尤其是表格有分页或隐藏列时。若没有,小表格也可以直接复制可见单元格。

不要假定眼前的信息就是完整数据集。页面可能在滚动时加载更多行,也可能只显示一页结果。记录来源 URL 和已提取的表格范围,方便日后回查。

使用 WebAct 提取表格

免费网页表格提取工具提供示例 CSV 和可直接复制的任务。安装 WebAct、验证账号并选择 ChatGPT 浏览器连接。在来源标签页启用扩展程序,将表格选为上下文。

切换到任务模式并粘贴提取任务。它要求保留原始表头和值、添加来源 URL 列,并明确报告导出的行数。先从最多 25 个已加载行的小表格开始。检查建议的操作,执行任务,并在导入前检查文件。

将导出行数与计划提取的行数比较。检查首行、末行,以及含逗号或引号的行。缺失或不可读的内容应明确报告,绝不能靠猜测补齐。

在电子表格中检查文件

数据含邮政编码、产品代码或较长的数字 ID 时,请使用电子表格的导入流程。将这些列按文本处理,保留前导零和较长标识符。CSV 保存值和分隔符,但不保留电子表格格式或列类型。

提取任务会要求 WebAct 对可能被解释为电子表格公式的单元格进行安全处理,并报告更改的值。打开文件前请检查这些值。CSV 不包含格式或可靠的类型信息。

若下一个应用需要 JSON,请明确指定它要求的字段名和值类型。使用结果前,检查一条完整记录。

当复制本身成了工作

只需导出一次的表格,原生下载功能可能就够了。需要重复提取时,可保存指定列和输出格式的 WebAct 任务。

在页面上启用 WebAct 后,选择相关区域并提出请求: “将可见的姓名、公司和职位提取为 CSV。包含表头,并检查所有可见行是否齐全。” 对照来源检查结果,如需复用则保存任务。

请明确“可见”的范围。绝不能假定隐藏行、其他页面及浏览器尚未加载的内容已被包含。实用的自动化应给出可核查的结果,并清楚说明覆盖范围。

配合本指南的小工具

了解免费网页表格提取工具 →。需要 WebAct 扩展程序和账号。Free 每月包含 25 次自动化任务;受提供商限制约束。

由 WebAct 团队撰写。产品行为以当前实现为准;浏览器提供商的限制及网站限制仍然适用。