- 在线时间
- 538 小时
- 最后登录
- 2023-6-27
- 注册时间
- 2015-11-2
- 听众数
- 29
- 收听数
- 1
- 能力
- 0 分
- 体力
- 21682 点
- 威望
- 0 点
- 阅读权限
- 60
- 积分
- 6880
- 相册
- 0
- 日志
- 0
- 记录
- 0
- 帖子
- 749
- 主题
- 600
- 精华
- 0
- 分享
- 0
- 好友
- 10
TA的每日心情 | 奋斗 2023-5-24 09:14 |
|---|
签到天数: 119 天 [LV.6]常住居民II
 群组: 2018高中组美赛 课堂 群组: 2018国赛冲刺 群组: 2018 夏令营面授课堂 群组: 2016美赛交流群组 |
机器学习算法——信息熵信息熵(Entropy)2 [& }5 G E" d/ N! a
信息是个很抽象的概念。我们常常说信息很多,或者信息较少,但却很难说清楚信息到底有多少。比如一本书中到底有多少信息量。直到 1948 年,香农(C. E. Shannon)提出了“信息熵”(shāng) 的概念,才解决了对信息的量化度量问题。熵的概念发展成为信息论、数据压缩等学科的基础,在很多科学研究的领域尤其是计算机科学中有着广泛的应用。
9 }7 P8 L Y& K 实际上,一条信息的信息量大小和它的不确定性或存在概率有直接的关系。比如说,我们要搞清楚一件非常非常不确定的事,或是我们一无所知的事情,就需要了解大量的信息。相反,如果我们对某件事已经有了较多的了解,我们不需要太多的信息就能把它搞清楚。所以,从这个角度,我们可以认为,信息量的度量就等于不确定性的多少。一个系统越是有序,信息熵就越低;反之,一个系统越是混乱,信息熵就越高。因此可以认为信息熵是系统有序化程度的一个度量。 Shannon 借鉴了热力学的概念,把信息与其存在概率关联起来并称之为“信息熵”,并给出了计算信息熵的数学表达式: H = - ∑ Pi * log2 Pi
* g& S2 s* m% J; H0 A# q$ [9 v3 o, `) h% K+ d, N% v
假设有一个字符串要求它的信息熵,其中Pi是字符i出现的概率(该字符出现次数/所有字符数),然后将所有的Pi乘上取对数后的值log2 Pi后累加,最后取负,得到字符串的信息熵。
5 `4 g! B2 `" L ]5 c9 B& \本题要求计算给定字符串按照每个字符统计的信息熵。
6 U4 x1 m# _" b3 D. E# s9 `8 a4 \输入:一个字符串,请忽略所有非字母的字符(即只关注a-z, A-Z),且不区分字母的大小写。
1 Y! Y* u! V ~* h提示:可以用StdIn.readAll()读入字符串的所有内容7 {/ S7 }6 }. J0 S, M5 b* h9 g2 E
输出:对应字符串的熵值,输出请用格式化输出("%4.2f\n")
9 j+ R7 D/ D+ w1 b' j$ e, P样例输入:To be or not To be,↵
+ @2 Z J$ G0 {+ pthat is the question↵: Y. z5 C; x# z' s& w
样例输出:7 x g! Z: x9 c4 ^( v4 R* d0 L
- x; l0 p/ S0 b/ b9 a1 I
6 p! ?, q0 f, }( d/ X9 F; @: c7 h" C5 Z0 P, s
t4 g1 G9 i4 U- w$ x# Z! U0 y N) K! q; t! n; r2 U
) R1 y+ K: a1 T1 O. q" [
. s" h; ]1 i: t- J# j* N2 v) i; m+ q* I# C( y
3 {" ?4 C7 j/ ^ s ?5 O! H% |4 y |
zan
|