如何检查 Unicode 字符及隐藏差异。
当文本看起来相同却表现不同时,应检查码点。只有在目标规则允许时才进行规范化。
按任务需求调整流程。
检查实际字符,列出码点和位置,不要仅凭外观判断。识别组合附加符号、形似字符及不可见字符。仅按约定规则比较规范化形式;若精确标识或字节很重要,应保留原文。
- 你需要提供什么
- 含有意外字符的文本。
- 你会得到什么
- 码点、不可见字符及规范化建议。
查看输入和结果。
演示用输入和输出 · 教学示例,并非 WebAct 实时运行结果
示例 个输入项
Inspect these two strings: café and café. Compare their code points and their NFC-normalized values.
完整示例
café: U+0063 U+0061 U+0066 U+00E9 (4 code points). café: U+0063 U+0061 U+0066 U+0065 U+0301 (5 code points). Both normalize to café under NFC. Their original sequences differ; preserve originals when exact byte identity matters.
将这份输入载入提示词,再复制到 WebAct 中尝试任务。实际结果可能与示例不同。
决策与问题排查。
视觉上相同的 Unicode 字符串可能长度不同吗?
可以。一个可见字符可能由一个或多个码点表示,而字节长度又是另一种不同的度量。
为什么规范化没能让两个形似字母变得相等?
它们可能来自不同文字系统,是不同字符,而不是同一字符的不同表示。应检查各自的码点。
此工作流程的参考资料。
使用自己的资料试一试。
将任务提示词中的示例换成你的材料。保留所需条件,再把任务复制到 WebAct。
自定义并复制任务 ↑