- 在线时间
- 0 小时
- 最后登录
- 2005-9-21
- 注册时间
- 2004-4-27
- 听众数
- 1
- 收听数
- 0
- 能力
- 0 分
- 体力
- 1027 点
- 威望
- 0 点
- 阅读权限
- 40
- 积分
- 385
- 相册
- 0
- 日志
- 0
- 记录
- 0
- 帖子
- 153
- 主题
- 43
- 精华
- 0
- 分享
- 0
- 好友
- 0
升级   28.33% 该用户从未签到
国际赛参赛者
 |
< ><FONT face=宋体>这是一个许多人(包括我自己)曾经或至今仍疑惑的问题(这里我们只讨论UTF-16,即双字节版本)。, D' ?" r4 y( z* R( y- T- i* S
, J3 s% w/ V* Y5 P9 D4 q, w1.关于UNICODE4 N+ d9 [3 s. l( v( e+ c! l
首先,UNICODE主要使用的字符类型是WCHAR,定义是unsigned short。从定义我们可以看出这是一个双字节的类型,就是每一个字符占2个字节。这样的话,可以表示的字符类型就可以多达6万多。所有之前的ASCII码分布在0x0000-0x00ff之间,而汉字(包括big5)分布在0x4e00到0x9fff之间。整个unicode包含了几乎世界上所有的文字。关于UNICODE的细节,可以参看以下网页
& U0 V% T; A9 B+ {/ k) u6 @9 y<a href="http://www.unicode.org/unicode/standard/translations/s-chinese.html" target="_blank" >http://www.unicode.org/unicode/standard/translations/s-chinese.html</A><a href="http://www.unicode.org/unicode/standard/translations/s-chinese.html" target="_blank" ><FONT color=#000020></FONT></A>+ e. R* I7 l$ H4 [" x' l8 s( M
4 w# T$ a. @0 X( {3 R" h, d' o
2.为什么要使用UNICODE
! ^' J0 I( g# d/ a, B 1) COM:在COM规范中,明确指定了必须使用UNICODE类型,这正是微软充分考虑了跨平台的结果。这也是为什么经常在COM中可以看到BSTR(WCHAR*)类型# o! s, m0 o; x- L' w( K
1 @9 G6 i8 m9 d& ?2 m* v 2)WIN2000和WINNT:在这两个平台中,默认的字符处理方式是UNICODE。即使你写了一个非UNICODE(multibyte)的程序,系统在执行的时候仍然会对你的字符进行一次转换,这样无疑浪费了CPU时间,使用UNICODE可以有效的提高程序的运行效率(仅使用于这两个平台)。当然将来的XP也会如此。5 ~) @$ n8 I) r) O T
, D6 J, H2 y' s: J0 ]
3)通用性:使用UNICODE可以使我们不在为汉字和英文字符的判断而烦恼(都是2个字节)。! W1 q% T2 D' b
, p# I! `& Z' B+ y3.如何使用UNICODE 4 z8 [8 K: d. [, [) {- E- {
1)首先推荐的类型是TCHAR(通用字符类型)。当你定义了_UNICODE宏的时候,TCHAR就是WCHAR,当你没有定义这个宏的时候,TCHAR就是char,很不可思议吧,我们可以来看一下TCHAR的定义:
$ L0 Y( _# O* F0 W" [8 K$ L$ z: j6 z F0 q. k& a
#ifdef UNICODE // r_winnt
, K5 @- c: L$ \- B) F( itypedef WCHAR TCHAR, *PTCHAR;7 a+ K3 A- u, \# s
#else /* UNICODE */ // r_winnt
) w6 ?$ c2 ?% ?* ]" W" z( itypedef char TCHAR, *PTCHAR;
6 |! B1 u. v3 S) ]: p#endif /* !_TCHAR_DEFINED */; Y* X+ }$ ]5 ?9 c+ t( \+ X
# `& ~% B9 d$ c, d+ N
上面的代码来自WINNT.H,我剔除了一些无关的部分。4 X( Q( ]/ g- ]# L9 w: C
现在一切都显而易见了。
$ L7 {3 l" b5 E5 X; d通过TCHAR,我们只需要这样一段代码:% W# z" ?% c0 D1 K7 a
TCHAR tStr[] = _T("t code");4 Z+ O9 \ I7 q$ J# A- q; w
MessageBox(tStr);( Q% |# L% x3 t' s7 z
就可以支持UNICODE和MULTIBYTE两种版本。_T宏的作用就是转换成TCHAR。
( c. [( ~9 B( k$ b4 p( G
9 q% l% e3 F l+ X2)关于其他的处理4 z1 W+ y2 b) S, O. m
首先是常用的CString,它本身就支持UNICODE。下面的例子说明了用法:) E8 e {' g. ]/ n: h% d4 D
% R7 t: B% o5 n: Y
CString *pFileName = new CString("c:\\tmpfile.txt");
8 l+ }- ?+ {3 @9 _7 b7 P, x) Q* g2 D5 C6 F7 g* o
#ifdef _UNICODE/ Y3 W, P. s1 D; M
% ^! d/ @" f, W) xm_hFile = CreateFile(pFileName->AllocSysString(),
- [9 w2 C! ~- ?* QGENERIC_READ | GENERIC_WRITE,
+ G8 l; F0 `! Z, o# |FILE_SHARE_READ,
, Q2 m8 [1 e$ W8 W: A+ _NULL,
/ {0 }# D9 S9 n; i, wOPEN_EXISTING,3 U! E/ j) M# @% f. s: J
FILE_ATTRIBUTE_NORMAL,
7 q% L% e* j1 i# T% eNULL);8 C3 Z3 l* _# |" X( I3 _' B5 B
#else: X) y* p9 m/ _# N9 H4 M' b
m_hFile = CreateFile(pFileName->GetBuffer(pFileName->GetLength()), : Q& M7 c& Q9 R$ ?
GENERIC_READ | GENERIC_WRITE,
$ D+ v# }8 s1 uFILE_SHARE_READ,2 B v0 Z6 Q& \- R0 f( E
NULL,
/ L0 R: _% d4 o" Y+ ^OPEN_EXISTING,
! p' e3 k6 w/ b ^+ H* {FILE_ATTRIBUTE_NORMAL,
4 Q* W& G$ x! t o; U# b- P- oNULL);, j( S8 a5 _/ b( v, x
#endif
( J3 G7 z4 Q$ v K( d7 P4 S% z' S+ G4 U$ K: ?& _* n
3) 当我们在UNICODE方式中需要为一个字串常量赋值时可以使用L宏,如:* v( C9 l# Z8 @; s H
BSTR wcsStr = L"unicode";
" k0 L; [1 b5 B$ {+ L 这样的附值很简便,但是,经过L宏处理后的字串一定是UNICODE,如果你把它赋给一个MULTIBYTE的字串,字符将可能会被截断。
3 N& }% w* l2 q8 ^2 v" E& f) N) N/ `& Y- b0 j
另外,VC还提供了一些函数如WideCharToMultiByte和MultiByteToWideChar还有另外的一些宏来支持转换。大家可以看MSDN。
' p8 m" t. J7 Y# \9 F/ z' l. q6 c1 |0 Q/ P( s5 I
6 a1 |& z0 D6 m; G$ h! E) t& H3.编译器的设置:+ L2 \% W) n, p1 m4 J4 B
首先我们需要在project->settings->C/C++的属性页中的Preprocessor中写入_UNICODE,然后在link属性页中Category中选择output,在Entry-Point symbol 中添加wWinMainCRTStartup,这样,我们的UNICODE工程便大功告成。</FONT></P> |
zan
|