当前位置: 首页 > news >正文

理清文件编码,告别中文乱码

理清文件编码,告别中文乱码

image

在工作中少不了碰到文件乱码的问题,面对这么多的中文汉字编码,真不知该选哪个好,不如彻底搞清楚,让乱码灰飞烟灭;以下介绍文本编码中常用到的几种:iso8859-1、GDK/GB2312、ANSI、unicode 以及UTF ;

iso8859-1

iso8859-1 通常叫做Latin-1,属于单字节编码,最多能表示的字符范围是0-255,应用于英文系列。比如,字母a的编码为0x61=97。 很明显,iso8859-1编码表示的字符范围很窄,无法表示中文字符。但是,由于是单字节编码,和计算机最基础的表示单位一致,所以很多时候,仍旧使用iso8859-1编码来表示。而且在很多协议上,默认使用该编码。比如,虽然"中文"两个字不存在iso8859-1编码,以gb2312编码为例,应该是"d6d0 cec4"两个字符,使用iso8859-1编码的时候则将它拆开为4个字节来表示:"d6 d0 ce c4"(事实上,在进行存储的时候,也是以字节为单位处理的)。

GDK/GB2312

GB2312是汉字的国标码,是简体中文的字符集编码;专门用来表示汉字,是双字节编码,而英文字母和iso8859-1一致(兼容iso8859-1编码)。
苹果OS以GB2312为基本汉字编码;
GBK 是 GB2312的扩展,除了兼容GB2312外,它还能显示繁体中文,还有日文的假名;
Windows 95/98以GBK为基本汉字编码、但兼容支持GB2312。

ANSI

不同的国家和地区制定了不同的标准,由此产生了 GB2312, BIG5, JIS 等各自的编码标准。这些使用 2 个字节来代表一个字符的各种汉字延伸编码方式,称为 ANSI 编码。在简体中文操作系统下,ANSI 编码代表 GB2312 编码,在日文操作系统下,ANSI 编码代表 JIS 编码。(BIG5:台湾标准)
不同 ANSI 编码之间互不兼容,当信息在国际间交流时,无法将属于两种语言的文字,存储在同一段 ANSI 编码的文本中。
ANSI编码表示英文字符时用一个字节,表示中文用两个字节,而unicode不管表示英文字符还是中文都是用两个字节来表示。

unicode

Unicode(统一码、万国码、单一码、标准万国码)是业界的一种标准,它可以使电脑得以呈现世界上数十种文字的系统。

大概来说,Unicode 编码系统可分为编码方式实现方式两个层次。
Unicode 的编码方式与 ISO 10646 的通用字符集(Universal Character Set,UCS)概念相对应,目前实际应用的 Unicode 版本对应于 UCS-2,使用16位的编码空间。也就是每个字符占用2个字节。这样理论上一共最多可以表示 2 即 65536 个字符。基本满足各种语言的使用。实际上目前版本的 Unicode 尚未填充满这16位编码,保留了大量空间作为特殊使用或将来扩展。

Unicode 的实现方式不同于编码方式。一个字符的 Unicode 编码是确定的。但是在实际传输过程中,由于不同系统平台的设计不一定一致,以及出于节省空间的目的,对 Unicode 编码的实现方式有所不同。Unicode 的实现方式称为Unicode转换格式(Unicode Translation Format,简称为 UTF)。

目前通用的实现方式是 UTF-16小尾序(BOM)、UTF-16大尾序(BOM)和 UTF-8。在微软公司Windows XP操作系统附带的记事本中,“另存为”对话框可以选择的四种编码方式除去非 Unicode 编码的 ANSI 外,其余三种“Unicode”、“Unicode big endian”和“UTF-8”即分别对应这三种实现方式。

注:通常我们看到的编码选项中,和UTF-8放在一块的“Unicode编码”指的是UTF-16 小端编码;

UTF-8

UTF-8是UNICODE的一种变长字符编码,由Ken Thompson于1992年创建。
UTF-8, 8bit编码, ASCII不作变换, 其他字符做变长编码, 每个字符1-3 byte(英文字母用一个字节,汉字使用3个字节),有以下优点:

  • 与CPU字节顺序无关, 可以在不同平台之间交流
  • 容错能力高, 任何一个字节损坏后, 最多只会导致一个编码码位损失, 不会链锁错误(如GB码错一个字节就会整行乱码)
    UTF-16, 16bit编码, 是变长码, 大致相当于20位编码, 值在0到0x10FFFF之间, 基本上就是unicode编码的实现. 它是变长码, 与CPU字序有关, 但因为最省空间, 常作为网络传输的外码.

UTF-8与UTF-16的区别

UTF8 和 UTF16 都是变长表示的,欧美程序员会觉得太浪费,因为欧美字符 0x0000 - 0x00FF 就搞定了,UTF8 最小变长是 1 个字节,而 UTF16 变长是 2 个字节,
utf-8 与 uft-16 表示 'a' a的ascii是0X61
utf-8为[0X61]
uft-16 [0x00,0X61]

注意,虽然说utf-8是为了使用更少的空间而使用的,但那只是相对于utf-16编码来说,如果已经知道是汉字,则使用GB2312/GBK无疑是最节省的。

 

查看文件编码

windows系统下将文件用记事本打开,然后文件--另存为 在对话框最下面的编码那一栏就有文件对应的编码。

source insight中的中文编码问题

代码开发经常用到source insight,这个软件的注释是支持ANSI的代码编写、但是如果是UTF-8的中文(在Linux下默认的生成文件,编码都是UTF-8编码的),在source insight下显示的就是乱码文件;
解决的方法详见附录参考文章;

附录:参考链接

1.关于编码ansi、GB2312、unicode与utf-8的区别
http://blog.csdn.net/chruan/article/details/8812110

2.source insight中文注释乱码问题的解决方案
http://blog.csdn.net/ccf19881030/article/details/8987759

3.Source Insight完美转换UTF-8 到 GB2312
http://blog.csdn.net/e0sys1/article/details/4670188

4.UNICODE wiki

http://www.baike.com/wiki/Unicode

 

Posted by: 大CC | 31JUL,2014
博客:blog.me115.com [订阅]
微博:新浪微博

相关文章:

  • sublime text3简体中文版汉化教程
  • CAS(客户端)程序获取安全证书
  • FZU OJ 1056 :扫雷游戏
  • C++矢量图形库系列(1)——矢量图形库乱谈(转)
  • 关于引入文件名字问题
  • Nagios常见问题记录(1)
  • CSS3窗帘式4格焦点图代码
  • 谁是“少数幸福的人”?
  • 肝病案
  • C++函数的重载
  • 初步探讨WPF的ListView控件(涉及模板、查找子控件)
  • 对称加密算法 非对称加密算法
  • Android系统默认Home应用程序(Launcher)的启动过程源码分析
  • JDBC(二)驱动程序类型发展历程
  • 【JavaScript】n++ VS ++n
  • IE9 : DOM Exception: INVALID_CHARACTER_ERR (5)
  • [case10]使用RSQL实现端到端的动态查询
  • 2019.2.20 c++ 知识梳理
  • Angular Elements 及其运作原理
  • CSS3 聊天气泡框以及 inherit、currentColor 关键字
  • CSS相对定位
  • JavaScript 一些 DOM 的知识点
  • magento 货币换算
  • REST架构的思考
  • Spring Cloud中负载均衡器概览
  • SSH 免密登录
  • Web标准制定过程
  • 从零到一:用Phaser.js写意地开发小游戏(Chapter 3 - 加载游戏资源)
  • 关于springcloud Gateway中的限流
  • 回顾2016
  • 前端面试总结(at, md)
  • 容器化应用: 在阿里云搭建多节点 Openshift 集群
  • 实现菜单下拉伸展折叠效果demo
  • Linux权限管理(week1_day5)--技术流ken
  • ​LeetCode解法汇总2696. 删除子串后的字符串最小长度
  • ​力扣解法汇总1802. 有界数组中指定下标处的最大值
  • $.ajax,axios,fetch三种ajax请求的区别
  • $.extend({},旧的,新的);合并对象,后面的覆盖前面的
  • $.type 怎么精确判断对象类型的 --(源码学习2)
  • (01)ORB-SLAM2源码无死角解析-(56) 闭环线程→计算Sim3:理论推导(1)求解s,t
  • (03)光刻——半导体电路的绘制
  • (2)MFC+openGL单文档框架glFrame
  • (6)【Python/机器学习/深度学习】Machine-Learning模型与算法应用—使用Adaboost建模及工作环境下的数据分析整理
  • (C)一些题4
  • (Demo分享)利用原生JavaScript-随机数-实现做一个烟花案例
  • (附源码)springboot太原学院贫困生申请管理系统 毕业设计 101517
  • (六)库存超卖案例实战——使用mysql分布式锁解决“超卖”问题
  • (三)uboot源码分析
  • (十二)springboot实战——SSE服务推送事件案例实现
  • (一)Spring Cloud 直击微服务作用、架构应用、hystrix降级
  • (原創) 物件導向與老子思想 (OO)
  • (转)AS3正则:元子符,元序列,标志,数量表达符
  • (转)Unity3DUnity3D在android下调试
  • (转)总结使用Unity 3D优化游戏运行性能的经验
  • (转载)跟我一起学习VIM - The Life Changing Editor