Cómo convertir HTML a texto plano legible.
La extracción de texto plano debe conservar los encabezados, el sentido de las listas y los destinos útiles de los enlaces. Elimina el marcado sin unir palabras que no correspondan ni mostrar contenido de scripts.
Adapta el flujo de trabajo a tu tarea.
Extrae el contenido legible en el orden del documento, manteniendo los límites de encabezados, párrafos y listas. Decide si conservar los destinos de enlaces y las alternativas de texto de las imágenes. Excluye el contenido de scripts y estilos y revisa las tablas, cuyas relaciones pueden perderse en texto plano.
- Qué aportas
- Fragmento HTML.
- Qué obtienes
- Texto legible que conserva la estructura significativa.
Mira la entrada y el resultado.
Entrada y salida ilustrativas · ejemplo didáctico, no una ejecución de WebAct en directo
Ejemplo campo
HTML fragment: <h2>Setup</h2><p>Open the app.</p>
Ejemplo completo
Setup Open the app.
Carga esta entrada en el prompt y cópialo en WebAct para probar la tarea. Tu resultado puede diferir del ejemplo.
Decisiones y solución de problemas.
¿Deben aparecer tanto el texto como el destino de los enlaces en el texto plano?
Incluye los destinos cuando el lector necesite abrirlos o verificarlos; en caso contrario, conserva etiquetas legibles según el formato solicitado.
¿Por qué se han unido dos párrafos al eliminar las etiquetas HTML?
Eliminar etiquetas no conserva por sí solo los límites de bloque. Inserta separadores adecuados al convertir elementos estructurales.
Pruébalo con tu propia fuente.
Sustituye el ejemplo por tu material en el prompt. Conserva los requisitos que necesites y copia la tarea en WebAct.
Personalizar y copiar la tarea ↑