字符集(Character Set)和字符编码(Character Encoding)是处理文本数据的核心概念,字符集是字符的集合,定义了包含哪些文字符号;字符编码是字符的存储与传输规则,定义了如何将字符集中的字符映射为二进制数据。汉字由于数量庞大、字形复杂,其编码方案的演进尤为复杂,也是中文信息处理的关键。
一、核心概念区分
-
字符集(Character Set / Charset)
是一组字符的集合,每个字符有唯一的“字符编号”(Code Point,码点),但不规定这个编号如何转换成二进制。
例:ASCII字符集包含英文字母、数字、标点等共128个字符;GB2312字符集包含常用汉字和符号。 -
字符编码(Character Encoding)
是字符码点到二进制字节的映射规则,解决“如何存储和传输字符”的问题。
例:ASCII字符集对应的编码就是ASCII编码,将0-127的码点直接用1个字节表示;UTF-8是Unicode字符集的一种变长编码方式。
关键关系:一种字符集可以对应多种编码方式(如Unicode对应UTF-8、UTF-16、UTF-32);一种编码方式通常只对应一种字符集(如GBK编码只对应GBK字符集)。
二、字符集的演进(含汉字相关)
字符集的发展是从“单字节、小字符集”到“多字节、全球统一字符集”的过程,汉字的纳入是重要推动因素。
1. 早期单字节字符集(无汉字)
- ASCII(American Standard Code for Information Interchange)



被折叠的 条评论
为什么被折叠?



