Comment convertir du HTML en texte brut lisible.
L'extraction de texte brut doit garder les titres, le sens des listes et les destinations utiles des liens. Retirez le balisage sans joindre des mots sans rapport ni exposer le contenu des scripts.
Adaptez le processus à votre tâche.
Extrayez le contenu lisible dans l'ordre du document en gardant les limites des titres, paragraphes et listes. Décidez de conserver ou non les destinations des liens et les alternatives textuelles des images. Excluez le contenu des scripts et des styles, puis vérifiez les tableaux dont les relations peuvent disparaître en texte brut.
- Ce que vous fournissez
- Fragment HTML.
- Ce que vous obtenez
- Texte lisible conservant la structure utile.
Consultez les données et le résultat.
Entrée et sortie illustratives · exemple pédagogique, pas une exécution WebAct en direct
Exemple champ
HTML fragment: <h2>Setup</h2><p>Open the app.</p>
Exemple complet
Setup Open the app.
Chargez ces données dans le prompt, puis copiez-le dans WebAct pour essayer la tâche. Votre résultat peut différer de l'illustration.
Décisions et dépannage.
Le texte et la destination des liens doivent-ils tous deux apparaître en texte brut ?
Incluez les destinations si les lecteurs doivent les suivre ou les vérifier ; sinon, gardez des libellés lisibles selon le format demandé.
Pourquoi deux paragraphes ont-ils fusionné après la suppression des balises HTML ?
La suppression des balises seule ne conserve pas les limites des blocs. Insérez des séparateurs adaptés lors de la conversion des éléments structurels.
Essayez avec votre propre source.
Remplacez l'exemple par vos données dans le prompt. Gardez les exigences nécessaires, puis copiez la tâche dans WebAct.
Personnaliser et copier la tâche ↑