Unicode 文字と隠れた違いを調べる方法。
見た目が同じテキストなのに挙動が異なる場合は、コードポイントを確認してください。出力先の規則が許す場合にだけ正規化します。
作業手順をタスクに合わせましょう。
見た目に頼らず、コードポイントと位置を一覧にして実際の文字を調べてください。結合文字、似た記号、不可視文字を特定します。合意した規則の下でのみ正規化形を比較し、正確な識別子やバイトが重要な場合は原文を保持してください。
- 用意するもの
- 予期しない文字を含むテキスト。
- 得られるもの
- コードポイント、不可視文字、正規化の提案。
入力と結果を確認しましょう。
説明用の入力と出力 · 実際の WebAct 実行ではない学習用サンプル
入力項目サンプル個
Inspect these two strings: café and café. Compare their code points and their NFC-normalized values.
完成例
café: U+0063 U+0061 U+0066 U+00E9 (4 code points). café: U+0063 U+0061 U+0066 U+0065 U+0301 (5 code points). Both normalize to café under NFC. Their original sequences differ; preserve originals when exact byte identity matters.
この入力をプロンプトに読み込み、WebAct にコピーして試してください。結果は掲載例と異なる場合があります。
判断のポイントとトラブル対処。
見た目が同じ Unicode 文字列でも長さが異なることはありますか?
はい。見える一文字が一つまたは複数のコードポイントで表されることがあり、バイト長はさらに別の尺度です。
正規化しても似た二つの文字が等しくならないのはなぜですか?
同じ文字の別表現ではなく、異なる文字体系の別の文字かもしれません。コードポイントを確認してください。
このワークフローの参考資料。
自分の資料で試しましょう。
タスクのプロンプト内の例を自分の資料に置き換えてください。必要な要件を残し、タスクを WebAct にコピーします。
タスクを調整してコピー ↑