Как проверять символы Unicode и скрытые различия.
Проверяйте кодовые точки, если текст выглядит одинаково, но ведёт себя по-разному. Нормализуйте только тогда, когда правила целевой системы это позволяют.
Адаптируйте процесс под свою задачу.
Исследуйте реальные символы, перечисляя кодовые точки и позиции, а не полагаясь на внешний вид. Выявляйте комбинируемые знаки, похожие символы и невидимые символы. Сравнивайте нормализованные формы только по согласованному правилу и сохраняйте оригиналы, если важны точные идентификаторы или байты.
- Что вы предоставляете
- Текст с неожиданными символами.
- Что вы получите
- Кодовые точки, невидимые символы и рекомендации по нормализации.
Посмотрите входные данные и результат.
Иллюстративные входные и выходные данные · учебный пример, а не реальный запуск WebAct
Полей ввода: Пример
Inspect these two strings: café and café. Compare their code points and their NFC-normalized values.
Готовый пример
café: U+0063 U+0061 U+0066 U+00E9 (4 code points). café: U+0063 U+0061 U+0066 U+0065 U+0301 (5 code points). Both normalize to café under NFC. Their original sequences differ; preserve originals when exact byte identity matters.
Добавьте эти данные в промпт и скопируйте его в WebAct, чтобы попробовать задачу. Ваш результат может отличаться от примера.
Решения и устранение проблем.
Могут ли визуально одинаковые строки Unicode иметь разную длину?
Да. Видимый символ может состоять из одной или нескольких кодовых точек, а длина в байтах — ещё одна отдельная мера.
Почему нормализация не сделала две похожие буквы одинаковыми?
Это могут быть разные символы из разных письменностей, а не альтернативные представления одного символа. Проверьте их кодовые точки.
Источник для этого сценария.
Попробуйте на собственном источнике.
Замените пример своим материалом в промпте. Сохраните нужные требования и скопируйте задачу в WebAct.
Настроить и скопировать задачу ↑