无需登录 数据私有 本地保存

Unicode编码转换工具 - 字符与码点互转

100
0
0
0

Unicode

Unicode是一种国际通用的字符编码标准,旨在为世界上所有书写系统中的每个字符提供唯一的数字标识。Unicode由Unicode联盟维护,目前最新版本包含了超过14万个字符,覆盖了150多种文字和符号集。Unicode使用码点(Code Point)来标识每个字符,码点范围从U+0000到U+10FFFF。

码点(Code Point)

码点是Unicode为每个字符分配的唯一数字标识符。码点的表示方式通常以「U+」开头,后跟四到六位十六进制数字,例如U+0041表示拉丁字母A,U+4E2D表示中文字符「中」。码点是字符编码的核心概念,所有的字符编码方案都是基于码点进行的。

UTF-8

UTF-8是一种可变长度的Unicode编码方案,由Ken Thompson于1992年设计。它使用1到4个字节来编码一个Unicode码点:ASCII字符(U+0000到U+007F)使用1个字节,拉丁扩展字符使用2个字节,中日韩字符使用3个字节,辅助平面字符(如Emoji)使用4个字节。UTF-8是目前互联网上使用最广泛的编码格式。

UTF-16

UTF-16是一种使用固定长度代码单元的编码方案。对于基本多语言平面(BMP)中的字符(U+0000到U+FFFF),UTF-16使用2个字节(一个代码单元)表示;对于辅助平面中的字符(U+10000到U+10FFFF),使用4个字节(两个代码单元,即代理对)表示。UTF-16是Windows系统和Java等编程语言中常用的内部编码。

代理对(Surrogate Pair)

代理对是UTF-16编码中用于表示辅助平面字符(U+10000到U+10FFFF)的机制。它使用两个16位代码单元来编码一个码点:高代理项范围为U+D800到U+DBFF,低代理项范围为U+DC00到U+DFFF。例如,笑脸Emoji😀(U+1F600)在UTF-16中编码为代理对\uD83D\uDE00。

基本多语言平面(BMP)

BMP是Unicode码点空间的第一个平面,范围为U+0000到U+FFFF,包含65536个码点。BMP涵盖了世界上大多数常用字符,包括拉丁字母、希腊字母、阿拉伯字母、中日韩统一表意文字(CJK)以及各种标点符号和制表符等。

HTML实体编码

HTML实体编码是将特殊字符转换为HTML安全表示格式的方式。它有两种形式:命名实体(如&lt;表示小于号)和数字实体(如<或<表示小于号)。Unicode字符的HTML实体编码使用数字实体形式,&#DDDD;为十进制格式,&#xXXXX;为十六进制格式,确保字符在HTML文档中能正确显示。

UTF-8字节

UTF-8字节是指一个字符在UTF-8编码下所占用的字节数组。由于UTF-8是变长编码,不同字符占用的字节数不同。了解字符的UTF-8字节对于网络传输优化、存储空间计算以及底层编码调试非常重要。