- 在线时间
- 0 小时
- 最后登录
- 2005-9-21
- 注册时间
- 2004-4-27
- 听众数
- 1
- 收听数
- 0
- 能力
- 0 分
- 体力
- 1027 点
- 威望
- 0 点
- 阅读权限
- 40
- 积分
- 385
- 相册
- 0
- 日志
- 0
- 记录
- 0
- 帖子
- 153
- 主题
- 43
- 精华
- 0
- 分享
- 0
- 好友
- 0
升级   28.33% 该用户从未签到
国际赛参赛者
 |
< ><FONT face=宋体>这是一个许多人(包括我自己)曾经或至今仍疑惑的问题(这里我们只讨论UTF-16,即双字节版本)。& b0 C# n* n6 B+ t. C9 f9 n
5 F: ~; C; i" Y/ g& O1.关于UNICODE
0 w6 l; ~6 G9 o) B7 Y% M 首先,UNICODE主要使用的字符类型是WCHAR,定义是unsigned short。从定义我们可以看出这是一个双字节的类型,就是每一个字符占2个字节。这样的话,可以表示的字符类型就可以多达6万多。所有之前的ASCII码分布在0x0000-0x00ff之间,而汉字(包括big5)分布在0x4e00到0x9fff之间。整个unicode包含了几乎世界上所有的文字。关于UNICODE的细节,可以参看以下网页
( q" g U# K# N- ]<a href="http://www.unicode.org/unicode/standard/translations/s-chinese.html" target="_blank" >http://www.unicode.org/unicode/standard/translations/s-chinese.html</A><a href="http://www.unicode.org/unicode/standard/translations/s-chinese.html" target="_blank" ><FONT color=#000020></FONT></A>3 k- l y' K0 q% @! V4 ] y% e
9 H, i1 b6 p8 @# s# J3 {% p
2.为什么要使用UNICODE
1 N N+ p6 H, S% a7 @+ K 1) COM:在COM规范中,明确指定了必须使用UNICODE类型,这正是微软充分考虑了跨平台的结果。这也是为什么经常在COM中可以看到BSTR(WCHAR*)类型) S/ l& P3 I7 C( d; i
4 y% V* Q% u( l. b) m' D 2)WIN2000和WINNT:在这两个平台中,默认的字符处理方式是UNICODE。即使你写了一个非UNICODE(multibyte)的程序,系统在执行的时候仍然会对你的字符进行一次转换,这样无疑浪费了CPU时间,使用UNICODE可以有效的提高程序的运行效率(仅使用于这两个平台)。当然将来的XP也会如此。
! k" U N. M8 p1 z3 a- C z) y1 ]1 C, o1 g3 d2 i* ]3 t- J4 x
3)通用性:使用UNICODE可以使我们不在为汉字和英文字符的判断而烦恼(都是2个字节)。' O7 w) [! A; @, |9 W
1 y, e" |) r7 _" b' z: W: M! G
3.如何使用UNICODE * {( h! z# k& e% Y- L
1)首先推荐的类型是TCHAR(通用字符类型)。当你定义了_UNICODE宏的时候,TCHAR就是WCHAR,当你没有定义这个宏的时候,TCHAR就是char,很不可思议吧,我们可以来看一下TCHAR的定义:
: e6 q3 ^" k4 Z( S/ N5 f7 u8 N) F5 Q! ?3 [" e
#ifdef UNICODE // r_winnt
! s% l8 A$ }) O6 D, l6 R# ntypedef WCHAR TCHAR, *PTCHAR;
1 U; w; V3 I. _+ c( c#else /* UNICODE */ // r_winnt
1 s; T. i' c. _: f# z* htypedef char TCHAR, *PTCHAR;
4 M( q* Q9 L; K- q, P#endif /* !_TCHAR_DEFINED */- K9 b- h) c) H$ f
6 \' N0 c( q/ ?6 o: k& h
上面的代码来自WINNT.H,我剔除了一些无关的部分。& m& i, O( j9 `6 \/ R
现在一切都显而易见了。
5 E$ y1 ? _' l& l通过TCHAR,我们只需要这样一段代码:
1 y9 {% t5 Y' JTCHAR tStr[] = _T("t code");5 [5 v8 G+ P0 e; F }7 H
MessageBox(tStr);8 E# {0 ]- i6 A* i6 m2 m' s! q& V
就可以支持UNICODE和MULTIBYTE两种版本。_T宏的作用就是转换成TCHAR。
" w. z6 b6 n0 A6 o
5 } u5 o6 V G% G2)关于其他的处理
+ t0 H9 C4 m# U( I( B, U首先是常用的CString,它本身就支持UNICODE。下面的例子说明了用法:
* S) K# a3 W! `. D' i+ W' P9 k& r' ?0 g: [, w. Y
CString *pFileName = new CString("c:\\tmpfile.txt");) U0 G* }+ r, r4 i8 j6 g; A
6 u7 I( w% |" J* L
#ifdef _UNICODE" e# l/ |6 O" `: ~* T; G, t6 D- ~
1 p- `1 s1 {5 j! r4 j
m_hFile = CreateFile(pFileName->AllocSysString(),
" P* P+ P: \7 s: ?* AGENERIC_READ | GENERIC_WRITE, 9 u$ \% K% `6 c# _$ _# L
FILE_SHARE_READ, ] V1 S5 @& n
NULL,' F& u% s K2 S9 T
OPEN_EXISTING,
* U* z! t; ~$ C+ QFILE_ATTRIBUTE_NORMAL, ) _1 P- y. p5 K# {& C
NULL);
! x" q/ F5 f) X: F- }* O#else
. E7 {$ _+ v: o: ~+ T0 Cm_hFile = CreateFile(pFileName->GetBuffer(pFileName->GetLength()),
0 t3 W2 ` |* E6 l" CGENERIC_READ | GENERIC_WRITE,
% p) G! R, o% V$ S7 Z& a4 o% Q vFILE_SHARE_READ,1 p7 _% g6 S- z) b K9 E
NULL,
% `& ^, E% E% _. X- ^% t6 HOPEN_EXISTING,
" {% H& q) V) `5 B1 V) K0 XFILE_ATTRIBUTE_NORMAL,
8 `8 I% W$ I( ~NULL);
6 |/ I$ L$ n$ d; s$ e, A; n$ k#endif
4 x4 `0 h/ X. O. O* V; J
; m0 Z( D! v9 w, w7 |) y2 ~3) 当我们在UNICODE方式中需要为一个字串常量赋值时可以使用L宏,如:/ }5 u) h: ?( W" ?# h/ s
BSTR wcsStr = L"unicode";4 w+ [. k, v4 L$ O# o0 D
这样的附值很简便,但是,经过L宏处理后的字串一定是UNICODE,如果你把它赋给一个MULTIBYTE的字串,字符将可能会被截断。
- z1 L. q) `2 u& m* k* r5 O* K5 S$ o% n/ L7 S
另外,VC还提供了一些函数如WideCharToMultiByte和MultiByteToWideChar还有另外的一些宏来支持转换。大家可以看MSDN。
; H$ Z s6 @; B, X$ ~
# T+ ]3 L3 B% U8 o7 z0 N2 y+ G5 ~2 u3 g% s: B( X& ?5 B0 A" p. M
3.编译器的设置:
8 E4 S7 k: Q9 f3 i8 t; x 首先我们需要在project->settings->C/C++的属性页中的Preprocessor中写入_UNICODE,然后在link属性页中Category中选择output,在Entry-Point symbol 中添加wWinMainCRTStartup,这样,我们的UNICODE工程便大功告成。</FONT></P> |
zan
|