如何将 HTML 转换为可读纯文本。
提取纯文本时应保留标题、列表含义和有用的链接目标。去除标记时,不要把无关词语连接起来,也不要输出脚本内容。
按任务需求调整流程。
按文档顺序提取可读内容,保留标题、段落及列表边界。决定是否保留链接目标和图片替代文本。排除脚本与样式内容,再检查那些转为纯文本后可能失去关联的表格。
- 你需要提供什么
- HTML 片段。
- 你会得到什么
- 保留有意义结构的可读文本。
查看输入和结果。
演示用输入和输出 · 教学示例,并非 WebAct 实时运行结果
示例 个输入项
HTML fragment: <h2>Setup</h2><p>Open the app.</p>
完整示例
Setup Open the app.
将这份输入载入提示词,再复制到 WebAct 中尝试任务。实际结果可能与示例不同。
决策与问题排查。
纯文本中应该同时显示链接文本和目标地址吗?
当读者需要访问或核实链接时,包含目标地址;否则按所需格式保留可读的标签。
为什么去掉 HTML 标签后,两个段落连在了一起?
仅去除标签并不能保留块边界。转换结构元素时,应插入合适的分隔符。
使用自己的资料试一试。
将任务提示词中的示例换成你的材料。保留所需条件,再把任务复制到 WebAct。
自定义并复制任务 ↑