边肖将和大家分享如何在Linux下处理mysql字符集。相信大部分人还不太了解,所以分享这篇文章给大家参考。希望你看完这篇文章会有很多收获。我们一起来看看吧!
4.1之前的MySQL不支持多种语言,所以它会把你给它的数据“原封不动”保存下来,然后“原封不动”读取。4.1及更高版本开始支持多种语言。这种所谓的多语言,就是在你输入输出的时候,MySQL会为你做编码转换。这个转换规则是由客户端编码和服务器端编码决定的。代码转换的规则是输入数据时将代码从“客户端代码”转换为“服务器代码”,输出数据时将数据从“服务器代码”转换为“客户端代码”。
MySQL 4.1.x开始支持以下内容
使用多个字符集来存储字符。
使用各种排序规则比较字符串。
使用不同的字符集或校对规则在同一个服务器、同一个数据库甚至同一个表中混合字符串。
允许定义任何级别的字符集和校对规则。
MySQL及以上版本中的字符集支持有两个方面:字符集和排序规则。字符集和校对规则有四个级别的默认设置:服务器、数据库、表和连接。
MySQL字符集
character_set_server:默认的内部操作字符集
character_set_database:当前选中数据库的默认字符集
Vi /etc/my.cnf -全球选项
[mysqld]
默认字符集=utf8
只能更改存储层(服务器、数据库、表、列、系统)的设置,对客户端和服务器之间的通信层没有影响。
character_set_client:客户端来源数据使用的字符集
character_set_connection:连接层字符集
character_set_results:查询结果字符集
Vi /etc/my.cnf -全球选项
[mysql]
默认字符集=utf8
修改当前session值:
SET NAMES 'x'语句与这三个语句等价:
mysql> SET character_set_client = x;
mysql> SET character_set_results = x;
mysql> SET character_set_connection = x;
character_set_system:系统元数据(字段名等)字符集
还有以collation_开头的同上面对应的变量,用来描述字符序。
或者:
CREATE DATABASE db_name DEFAULT CHARACTER SET charset_name;
ALTER DATABASE db_nameDEFAULT CHARACTER SET charset_name;
MySQL中的字符集转换过程
1. MySQL Server收到请求时将请求数据从character_set_client转换为character_set_connection;
2. 进行内部操作前将请求数据从character_set_connection转换为内部操作字符集,其确定方法如下:
使用每个数据字段的CHARACTER SET设定值;
若上述值不存在,则使用对应数据表的DEFAULT CHARACTER SET设定值(MySQL扩展,非SQL标准);
若上述值不存在,则使用对应数据库的DEFAULT CHARACTER SET设定值;
若上述值不存在,则使用character_set_server设定值。
3. 将操作结果从内部操作字符集转换为character_set_results。
检测字符集问题的一些手段
SHOW CHARACTER SET;
SHOW COLLATION;
SHOW VARIABLES LIKE ‘character%’;
SHOW VARIABLES LIKE ‘collation%’;
SQL函数HEX、LENGTH、CHAR_LENGTH
SQL函数CHARSET、COLLATION
STATUS;
常见问题解析
向默认字符集为utf8的数据表插入utf8编码的数据前没有设置连接字符集,查询时设置连接字符集为utf8
– 插入时根据MySQL服务器的默认设置,character_set_client、character_set_connection和character_set_results均为latin1;
– 插入操作的数据将经过latin1=>latin1=>utf8的字符集转换过程,这一过程中每个插入的汉字都会从原始的3个字节变成6个字节保存;
– 查询时的结果将经过utf8=>utf8的字符集转换过程,将保存的6个字节原封不动返回,产生乱码……
向默认字符集为latin1的数据表插入utf8编码的数据前设置了连接字符集为utf8
– 插入时根据连接字符集设置,character_set_client、character_set_connection和character_set_results均为utf8;
– 插入数据将经过utf8=>utf8=>latin1的字符集转换,若原始数据中含有u0000~u00ff范围以外的Unicode字 符,会因为无法在latin1字符集中表示而被转换为“?”(0×3F)符号,以后查询时不管连接字符集设置如何都无法恢复其内容了。
本次两次测试内容:
环境ed Hat Enterprise Linux Server release 5.5 (Tikanga)LANG=zh_CN.UTF-8
mysql5.0.77
测试一:
Vi/etc/my.cnf
[mysqld]
default-character-set=utf8
mysql> show variables like 'char%';
+--------------------------+----------------------------+
| Variable_name | Value |
+--------------------------+----------------------------+
| character_set_client | lantin1 |
| character_set_connection | lantin1 |
| character_set_database | utf8 |
| character_set_filesystem | binary |
| character_set_results | lantin1 |
| character_set_server | utf8 |
| character_set_system | utf8 |
| character_sets_dir | /usr/share/mysql/charsets/
结果:服务器端正常,
在客户端访问WindowXp EMS SQL Manager for my sql是乱码:
测试二:
set names utf8;
mysql> show variables like 'char%';
+--------------------------+----------------------------+
| Variable_name | Value |
+--------------------------+----------------------------+
| character_set_client | utf8 |
| character_set_connection | utf8 |
| character_set_database | utf8 |
| character_set_filesystem | binary |
| character_set_results | utf8 |
| character_set_server | utf8 |
| character_set_system | utf8 |
| character_sets_dir | /usr/share/mysql/charsets/
测试一中的数据变为乱码,测试二中的数据正常显示。
测试二的数据在客户端数据也正常显示。
如果从客户端插入数据:测试三
在服务器则显示乱码:
测试三:
set names utf8;
set character_set_results=gb2312
insert into test values('测试');
客户端正常,服务器乱码
客户端:
处理乱码的思路:
让服务器端和客户端的字符集保持一致。
服务器端的编码是由字符集(Character Set)和校对规则(Collation)决定的。
上面提到,MySQL 中是根据下面几个变量确定服务器端和客户端用的什么字符集:
character_set_client 客户端字符集
character_set_connection 客户端与服务器端连接采用的字符集
character_set_results SELECT查询返回数据的字符集
character_set_database 数据库采用的字符集
也就是说,只要保证这几个变量采用一致的字符集,就不会出现乱码问题了。
很多情况下,这样设置了之后就能把乱码问题解决了。但是还是不能完全避免出现乱码的可能,为什么呢? 因为character_set_client ,character_set_connection 这两个变量仅用于保证与 character_set_database 编码的一致,而 character_set_results 则用于保证 SELECT 返回的结果与程序的编码一致。例如,你的数据库(character_set_database)用的是 utf8 的字符集,那么你就要保证 character_set_client ,character_set_connection 也是utf8的字符集。而你的程序也许采用的并不是utf8 ,比如你的程序用的是gbk ,那么你若把 character_set_results 也设置为 utf8 的话就会出现乱码问题。此时你应该把 character_set_results 设置为gbk。这样就能保证数据库返回的结果与你的程序的编码一致。
备注:
1、要保证数据库中存的数据与数据库编码一致,即数据编码与character_set_database一致;
2、要保证通讯的字符集与数据库的字符集一致,即character_set_client, character_set_connection与character_set_database一致;
3、要保证SELECT的返回与程序的编码一致,即character_set_results与程序编码一致;
4、要保证程序编码与浏览器编码一致,即程序编码与"/>一致。
更改设定值的一个方法是通过重新编译。如果希望在从源程序构建时更改默认服务器字符集和校对规则,使用:--with-charset和--with-collation作为configure的参量。例如:
shell> ./configure --with-charset=latin1
以上是“Linux下mysql字符集问题如何处理”这篇文章的所有内容,感谢各位的阅读!相信大家都有了一定的了解,希望分享的内容对大家有所帮助,如果还想学习更多知识,欢迎关注行业资讯频道!
内容来源网络,如有侵权,联系删除,本文地址:https://www.230890.com/zhan/73045.html