Как извлечь семантическую структуру заголовков.
Структура должна сохранять иерархию и точные подписи страницы. Не считайте крупный текст заголовком только по размеру, не отметив различие.
Адаптируйте процесс под свою задачу.
Соберите настоящие элементы заголовков в порядке документа, сохраняя их уровни и точный текст. Покажите иерархию и отметьте пропущенные уровни для проверки, не меняя номера молча. Укажите, вошли ли скрытые разделы, диалоги или незагруженное содержимое.
- Что вы предоставляете
- Читаемая статья или страница.
- Что вы получите
- Удобная для навигации структура заголовков с сохранением иерархии.
Посмотрите входные данные и результат.
Иллюстративные входные и выходные данные · учебный пример, а не реальный запуск WebAct
Полей ввода: Пример
Page has H1 Reports, H2 Create, H2 Export and H3 CSV.
Готовый пример
Reports → Create; Reports → Export → CSV.
Добавьте эти данные в промпт и скопируйте его в WebAct, чтобы попробовать задачу. Ваш результат может отличаться от примера.
Решения и устранение проблем.
Нужно ли включать крупный жирный текст в семантическую структуру?
Только если это элемент заголовка или он отдельно отмечен как визуальный заголовок.
Почему раздел отсутствует в структуре, хотя его название видно?
Возможно, название оформлено обычным текстом вместо разметки заголовка. Проверьте элемент и сообщите об этом различии.
Попробуйте на собственном источнике.
Замените пример своим материалом в промпте. Сохраните нужные требования и скопируйте задачу в WebAct.
Настроить и скопировать задачу ↑