- 在线时间
- 0 小时
- 最后登录
- 2005-9-21
- 注册时间
- 2004-4-27
- 听众数
- 1
- 收听数
- 0
- 能力
- 0 分
- 体力
- 1027 点
- 威望
- 0 点
- 阅读权限
- 40
- 积分
- 385
- 相册
- 0
- 日志
- 0
- 记录
- 0
- 帖子
- 153
- 主题
- 43
- 精华
- 0
- 分享
- 0
- 好友
- 0
升级   28.33% 该用户从未签到
国际赛参赛者
 |
< ><FONT face=宋体>这是一个许多人(包括我自己)曾经或至今仍疑惑的问题(这里我们只讨论UTF-16,即双字节版本)。- j0 u0 U* |1 I' \' `+ ?
8 G' @* q5 ?% |% k6 t K1.关于UNICODE
; x+ u+ d8 U9 K/ B2 h 首先,UNICODE主要使用的字符类型是WCHAR,定义是unsigned short。从定义我们可以看出这是一个双字节的类型,就是每一个字符占2个字节。这样的话,可以表示的字符类型就可以多达6万多。所有之前的ASCII码分布在0x0000-0x00ff之间,而汉字(包括big5)分布在0x4e00到0x9fff之间。整个unicode包含了几乎世界上所有的文字。关于UNICODE的细节,可以参看以下网页/ F/ s; v6 Q1 d2 c- R3 ?4 Z
<a href="http://www.unicode.org/unicode/standard/translations/s-chinese.html" target="_blank" >http://www.unicode.org/unicode/standard/translations/s-chinese.html</A><a href="http://www.unicode.org/unicode/standard/translations/s-chinese.html" target="_blank" ><FONT color=#000020></FONT></A>
, ~* [$ \6 j% C! L! Q+ y8 ^% E* ?" F& n' L- ]/ g
2.为什么要使用UNICODE
/ ~) Q7 ]: v- m- f W% `: y$ c 1) COM:在COM规范中,明确指定了必须使用UNICODE类型,这正是微软充分考虑了跨平台的结果。这也是为什么经常在COM中可以看到BSTR(WCHAR*)类型& Q, N. H! P& ?0 t% P% d) x
B" j* W8 @7 ~1 t4 r/ e+ f8 ?! Z
2)WIN2000和WINNT:在这两个平台中,默认的字符处理方式是UNICODE。即使你写了一个非UNICODE(multibyte)的程序,系统在执行的时候仍然会对你的字符进行一次转换,这样无疑浪费了CPU时间,使用UNICODE可以有效的提高程序的运行效率(仅使用于这两个平台)。当然将来的XP也会如此。# h, V9 U6 P7 p; g
- d$ `% P0 {* k. A6 L 3)通用性:使用UNICODE可以使我们不在为汉字和英文字符的判断而烦恼(都是2个字节)。
4 {2 S; \8 S5 r! C, L. T& P+ W4 u1 K& ]5 d9 Q0 T8 O9 K
3.如何使用UNICODE 2 O7 E2 V) @: Q _2 s
1)首先推荐的类型是TCHAR(通用字符类型)。当你定义了_UNICODE宏的时候,TCHAR就是WCHAR,当你没有定义这个宏的时候,TCHAR就是char,很不可思议吧,我们可以来看一下TCHAR的定义:
7 u. L7 a/ p& d5 w$ ]1 d7 H8 u2 U1 D8 R$ k0 R
#ifdef UNICODE // r_winnt, t" k# n6 h: ]& }
typedef WCHAR TCHAR, *PTCHAR;- G& _; F5 P0 B7 Z" h3 j: C
#else /* UNICODE */ // r_winnt$ w" ^* }! P: A* }- ]
typedef char TCHAR, *PTCHAR;
6 m. x, W& l9 i8 J% @) g$ ~#endif /* !_TCHAR_DEFINED */. I. g- V" o" S& T
+ k' q6 m! C7 h& u9 z y% K/ {9 g/ c: y上面的代码来自WINNT.H,我剔除了一些无关的部分。
& N* j, _. a, Z* w8 d现在一切都显而易见了。
6 t% q7 D" J' X- m0 Z2 R; |4 `通过TCHAR,我们只需要这样一段代码:) a8 {& M9 }5 j0 a% [8 W& w4 B2 L
TCHAR tStr[] = _T("t code");
- R3 X8 ~% L2 ?9 E, zMessageBox(tStr);3 F. Z' _. l6 x1 @- w. ]; Y
就可以支持UNICODE和MULTIBYTE两种版本。_T宏的作用就是转换成TCHAR。
- p' W4 W6 _9 F
% o$ R& F+ o/ B; t* L2)关于其他的处理$ Q' Q9 {8 s0 C. ^4 w
首先是常用的CString,它本身就支持UNICODE。下面的例子说明了用法:
! k* C2 s9 _5 Z
1 S p4 K, G u% D0 ^( H' iCString *pFileName = new CString("c:\\tmpfile.txt");
8 c4 ^) R# `5 a+ Q1 c: }# H m6 Y
& z- U, h4 ^; I' G0 w8 g5 h#ifdef _UNICODE
% Z6 o' S- a# b( ^% ?
8 t' |& t+ `3 U; |& V8 Km_hFile = CreateFile(pFileName->AllocSysString(),
. Q3 O* x, Y HGENERIC_READ | GENERIC_WRITE, * x* ]9 @3 I5 E. L& K
FILE_SHARE_READ,% ^( [6 [0 E. M, a) m
NULL,7 c! _- g2 A+ B+ h- ?6 [# _2 q
OPEN_EXISTING,
& j* q8 e# I' \" m+ |, C$ lFILE_ATTRIBUTE_NORMAL, , ^) m) k3 I# q/ p, r7 n( B
NULL);
4 N# t1 {4 @/ a1 Z+ q' J0 x#else
2 b+ Z% r5 [7 {: w) V/ @1 om_hFile = CreateFile(pFileName->GetBuffer(pFileName->GetLength()),
! f9 D* z X. _- Q9 r$ s& t4 rGENERIC_READ | GENERIC_WRITE, 4 m% e" W6 m( [; @: o
FILE_SHARE_READ,4 U$ j8 }8 J( N) t9 Q; Q
NULL,; R% j5 O* ]$ h/ c. T* ]
OPEN_EXISTING,
" l: U9 V" q5 i( G2 t7 LFILE_ATTRIBUTE_NORMAL, & k1 _, M- x, G1 \2 L
NULL);+ u/ h7 @" z: W( G9 R R# w; w
#endif( g, m6 j1 u0 _) {- |- Z. g
# W' G9 V: n2 v; z9 e3) 当我们在UNICODE方式中需要为一个字串常量赋值时可以使用L宏,如:0 g$ d9 r# K- f
BSTR wcsStr = L"unicode";
x% c* L' p5 z( N 这样的附值很简便,但是,经过L宏处理后的字串一定是UNICODE,如果你把它赋给一个MULTIBYTE的字串,字符将可能会被截断。
* E: H1 r( @8 h" I' V7 p/ V& x5 [8 Q) @
另外,VC还提供了一些函数如WideCharToMultiByte和MultiByteToWideChar还有另外的一些宏来支持转换。大家可以看MSDN。 , f) g5 S3 L: v+ ^0 ? b( B
* [! |% h1 W. t3 @3 N& m, z! ^) G
N+ |/ b* P# Y- l3.编译器的设置:9 o( C) a5 h7 V) |# t9 T7 h5 }, I3 M
首先我们需要在project->settings->C/C++的属性页中的Preprocessor中写入_UNICODE,然后在link属性页中Category中选择output,在Entry-Point symbol 中添加wWinMainCRTStartup,这样,我们的UNICODE工程便大功告成。</FONT></P> |
zan
|