UTF-8 字节查看器

查看文本的 UTF-8 十六进制字节,每个字符标注 Unicode 码点与对应字节。

什么是 UTF-8 编码?

UTF-8 是当前互联网上使用最广泛的字符编码,它把 Unicode 字符集中的每个字符编码为 1 到 4 个字节:ASCII 字符占 1 字节,拉丁扩展字符占 2 字节,常用汉字占 3 字节,emoji 等补充平面字符占 4 字节。这种变长设计既兼容了 ASCII,又覆盖了全部 Unicode 字符,因此 HTML、JSON、数据库和网络协议普遍采用 UTF-8。

每个字符除了有 UTF-8 字节表示,还有一个抽象的「码点」(U+ 开头的十六进制编号)。本工具对输入文本逐字符分析:先取出字符的 Unicode 码点,再调用浏览器内置的 TextEncoder 将该字符编码为 UTF-8 字节并以十六进制显示,两者对照输出,便于理解「字符 → 码点 → 字节」三层关系,也是排查乱码问题最直接的参考。

使用步骤

  1. 在上方输入框中粘贴或输入任意文本,支持中文、英文、emoji 混排;
  2. 点击「查看 UTF-8 字节」,结果区按字符逐行显示:字符、U+ 码点、十六进制字节;
  3. 超过 0xFFFF 的字符(如 emoji)会标注为代理对,占用 4 个字节;
  4. 点击结果区的「复制」按钮,可将完整对照结果复制到剪贴板。

常见问题

为什么一个汉字有 3 个字节?
UTF-8 是变长编码:ASCII 字符占 1 字节,拉丁扩展字符占 2 字节,常用汉字位于 U+0800-U+FFFF 区间占 3 字节,emoji 等补充平面字符占 4 字节。这是 UTF-8 的设计特性,属正常现象。
U+4F60 和 E4 BD A0 是什么关系?
U+4F60 是字符「你」的 Unicode 码点(抽象编号),E4 BD A0 是它在 UTF-8 编码下的三个十六进制字节(具体存储值),两者描述的是同一个字符的不同层面。
为什么 emoji 显示 4 个字节?
emoji 的码点通常在 U+10000 以上(补充平面),UTF-8 用 4 个字节编码这类字符,所以 emoji 的字节数比普通汉字多。
查看字节有什么实际用途?
排查乱码问题、理解编码差异、调试网络协议、计算存储占用等场景都需要查看文本的真实字节内容,本工具按字符逐行对照显示,方便定位。