切换工具

Unicode 转义

在文本与 \uXXXX、ES6 码点、&#x;、&#; 等 Unicode 转义之间互转,支持代理对与码点。

风格
文本输入
0 chars · 1 lines
转义输出
0 chars · 1 lines

使用说明

用途

Unicode 在线转换工具,把任意字符(中文、Emoji、特殊符号)转换为 Unicode 码点(U+XXXX)、JavaScript 转义序列(\uXXXX)、HTML 实体(&#xXXXX;)、UTF-8 字节、UTF-16 字节。反向把 \u4e2d\u6587 这种转义还原成可读中文。常用于排查中文编码乱码、生成 Emoji 的 Unicode 码、JavaScript 字符串字面量编码、HTML 文档兼容性处理。所有转换在浏览器本地完成。

操作步骤

  1. 左侧粘贴或输入字符串(含中文 / Emoji / 任意字符)
  2. 右侧切换显示格式:Unicode 码点(U+4E2D)/ JS 转义(\u4e2d)/ HTML 实体(中)/ UTF-8 hex / UTF-16 hex
  3. 反向:粘贴 \u4e2d\u6587 自动解码为"中文"
  4. Emoji 模式:支持代理对(surrogate pair)正确处理(🎉 = \uD83C\uDF89)
  5. 十进制 / 十六进制切换显示
  6. 大小写:U+4E2D(大写默认)或 u+4e2d(小写)
  7. 批量处理:每行一个字符串

常见问题

为什么 Emoji 在 JS 字符串里要写两个 \u 转义?
BMP(基本多语言平面)之外的字符(Emoji 大部分、生僻汉字、扩展拉丁)码点超过 0xFFFF,UTF-16 必须用两个 16 位码元表示(代理对)。例如 🎉(U+1F389)= \uD83C\uDF89。**现代 JS 推荐用 \u{1F389} 语法**(ES2015+)或直接写字面 Emoji(最清晰)。
Unicode 和 UTF-8 是一回事吗?
不是。**Unicode 是字符集**(给每个字符分配唯一码点 U+XXXX),**UTF-8 是编码方式**(把码点转成字节序列)。同一个"中"字 Unicode 码点是 U+4E2D,但 UTF-8 编码后是 3 字节 E4 B8 AD,UTF-16 编码后是 2 字节 4E 2D。
为什么我的 JSON 里中文都变成 \u 转义了?
Python json.dumps 默认 ensure_ascii=True 会把非 ASCII 全部 \u 转义。Java 的 ObjectMapper、Go 的 json.Marshal 默认也类似。这种 ASCII-only JSON 文件传输更安全(避免编码协商),但人类阅读差。**用本工具反向解码就能恢复成可读中文**。
HTML 里要不要写 中 这种实体?
大部分场景**不需要**。现代 HTML5 标准用 UTF-8 编码,直接写"中"即可。**需要实体的场景**:1) 老的 HTML 文档 charset=GBK / ISO-8859-1;2) 邮件 HTML(部分客户端编码协商弱);3) 想强制显式表示某个不可见字符(如零宽空格)。
生僻字 / 古汉字打不出来怎么处理?
部分生僻字在 Unicode 扩展 B / C / D 区(U+20000 以上),系统字体可能不支持。本工具的 Unicode 码点查询可以输出码点,再去字体支持情况查询网站确认。常见做法:替换为图片、用 SVG 字形、或确保用户安装含扩展区的字体(如 Source Han Sans / 思源宋体)。

应用场景

  • 排查 JSON 中文乱码:把 \u 转义还原看真实内容
  • 生成 JS 字符串:含 Emoji 或特殊字符的字面量编码确保跨环境兼容
  • HTML 邮件兼容:把中文转 HTML 实体避免老客户端乱码
  • Unicode 字符查询:拿到 Emoji 反查 U+XXXX 码点
  • 老系统对接:GBK / GB2312 编码的字符串和 Unicode 互转

适用场景

JSON 中文转义还原、JS 含 Emoji 的字面量、HTML 邮件兼容、Emoji 码点查询、GBK 老系统对接。前端、后端、邮件营销、本地化工程师常用。Surrogate pair 正确处理、UTF-8/UTF-16 字节展示、多格式互转是关键差异点。