So untersuchst du Unicode-Zeichen und verborgene Unterschiede.
Prüfe Codepunkte, wenn Text gleich aussieht, sich aber unterschiedlich verhält. Normalisiere nur, wenn die Regeln des Ziels es erlauben.
Passe den Ablauf an deine Aufgabe an.
Untersuche die tatsächlichen Zeichen und liste Codepunkte sowie Positionen auf, statt dich auf das Aussehen zu verlassen. Erkenne kombinierende Zeichen, ähnlich aussehende Symbole und unsichtbare Zeichen. Vergleiche normalisierte Formen nur nach einer vereinbarten Regel und erhalte Originale, wenn exakte Kennungen oder Bytes wichtig sind.
- Was du bereitstellst
- Text mit unerwarteten Zeichen.
- Was du erhältst
- Codepunkte, unsichtbare Zeichen und Normalisierungsvorschläge.
Sieh dir Eingabe und Ergebnis an.
Beispielhafte Ein- und Ausgabe · ein Lehrbeispiel, kein tatsächlicher WebAct-Durchlauf
Beispiel Eingabe
Inspect these two strings: café and café. Compare their code points and their NFC-normalized values.
Vollständiges Beispiel
café: U+0063 U+0061 U+0066 U+00E9 (4 code points). café: U+0063 U+0061 U+0066 U+0065 U+0301 (5 code points). Both normalize to café under NFC. Their original sequences differ; preserve originals when exact byte identity matters.
Lade diese Eingabe in den Prompt und kopiere ihn zum Ausprobieren nach WebAct. Dein Ergebnis kann vom Beispiel abweichen.
Entscheidungen und Fehlerbehebung.
Können optisch identische Unicode-Zeichenfolgen unterschiedlich lang sein?
Ja. Ein sichtbares Zeichen kann durch einen oder mehrere Codepunkte dargestellt werden; die Bytelänge ist ein weiteres eigenes Maß.
Warum hat die Normalisierung zwei ähnlich aussehende Buchstaben nicht gleich gemacht?
Es können unterschiedliche Zeichen aus verschiedenen Schriftsystemen sein und keine alternativen Darstellungen desselben Zeichens. Prüfe ihre Codepunkte.
Quelle für diesen Arbeitsablauf.
Probiere es mit deiner eigenen Quelle.
Ersetze das Beispiel im Aufgaben-Prompt durch dein Material. Behalte nötige Anforderungen bei und kopiere die Aufgabe nach WebAct.
Aufgabe anpassen und kopieren ↑