Zo onderzoek je Unicode-tekens en verborgen verschillen.
Inspecteer codepunten wanneer tekst er hetzelfde uitziet maar zich anders gedraagt. Normaliseer alleen als de regels van de bestemming dat toestaan.
Stem de werkwijze af op je taak.
Inspecteer de werkelijke tekens en vermeld codepunten en posities in plaats van op het uiterlijk te vertrouwen. Herken combinerende tekens, gelijkende symbolen en onzichtbare tekens. Vergelijk genormaliseerde vormen alleen volgens een afgesproken regel en bewaar originelen wanneer exacte identificaties of bytes belangrijk zijn.
- Wat je aanlevert
- Tekst met onverwachte tekens.
- Wat je krijgt
- Codepunten, onzichtbare tekens en normalisatievoorstellen.
Bekijk de invoer en het resultaat.
Illustratieve invoer en uitvoer · een leervoorbeeld, geen live uitvoering van WebAct
Voorbeeld invoerveld
Inspect these two strings: café and café. Compare their code points and their NFC-normalized values.
Uitgewerkt voorbeeld
café: U+0063 U+0061 U+0066 U+00E9 (4 code points). café: U+0063 U+0061 U+0066 U+0065 U+0301 (5 code points). Both normalize to café under NFC. Their original sequences differ; preserve originals when exact byte identity matters.
Laad deze invoer in de prompt en kopieer deze naar WebAct om de taak te proberen. Je resultaat kan afwijken van het voorbeeld.
Keuzes en probleemoplossing.
Kunnen visueel identieke Unicode-strings verschillende lengtes hebben?
Ja. Een zichtbaar teken kan worden weergegeven door één of meerdere codepunten en de bytelengte is weer een aparte maat.
Waarom maakte normalisatie twee gelijkende letters niet gelijk?
Het kunnen verschillende tekens uit verschillende schriften zijn in plaats van alternatieve weergaven van hetzelfde teken. Inspecteer hun codepunten.
Bron voor deze werkwijze.
Probeer het met je eigen bron.
Vervang het voorbeeld door je eigen materiaal in de taakprompt. Behoud de eisen die je nodig hebt en kopieer de taak naar WebAct.
De taak aanpassen en kopiëren ↑