Как преобразовать HTML в читаемый обычный текст.
Извлечение обычного текста должно сохранять заголовки, смысл списков и полезные адреса ссылок. Удаляйте разметку, не склеивая несвязанные слова и не выводя содержимое скриптов.
Адаптируйте процесс под свою задачу.
Извлекайте читаемое содержимое в порядке документа, сохраняя границы заголовков, абзацев и списков. Решите, нужны ли адреса ссылок и текстовые альтернативы изображений. Исключите содержимое скриптов и стилей, затем проверьте таблицы, где обычный текст может потерять связи.
- Что вы предоставляете
- Фрагмент HTML.
- Что вы получите
- Читаемый текст с сохранением значимой структуры.
Посмотрите входные данные и результат.
Иллюстративные входные и выходные данные · учебный пример, а не реальный запуск WebAct
Полей ввода: Пример
HTML fragment: <h2>Setup</h2><p>Open the app.</p>
Готовый пример
Setup Open the app.
Добавьте эти данные в промпт и скопируйте его в WebAct, чтобы попробовать задачу. Ваш результат может отличаться от примера.
Решения и устранение проблем.
Должны ли в обычном тексте присутствовать и подписи, и адреса ссылок?
Включайте адреса, если читателям нужно переходить по ним или проверять их; иначе сохраняйте читаемые подписи согласно нужному формату.
Почему удаление HTML-тегов склеило два абзаца?
Одно лишь удаление тегов не сохраняет границы блоков. При преобразовании структурных элементов вставляйте подходящие разделители.
Попробуйте на собственном источнике.
Замените пример своим материалом в промпте. Сохраните нужные требования и скопируйте задачу в WebAct.
Настроить и скопировать задачу ↑