文字编码和不可见差异

文本通过 TextEncoder 变成 UTF-8,中文、扩展字符与 Emoji 可以参与计算。前后空白与换行都会保留,空文本也会得到合法摘要。某些文字肉眼一样却采用不同 Unicode 组合形式,字节仍可能不同,本页不自动规范化。输出前可以用 Unicode 工具查看码点,用文本对比核对具体内容。Hash 比较的是输入字节,不是视觉图形或人类认为文字意义是否相同。

相关问题