数学建模社区-数学中国

标题: 求c语言数据挖掘算法 [打印本页]

作者: wangzheng3056    时间: 2013-8-21 11:57
标题: 求c语言数据挖掘算法
       老师最近给我们发了一个文档,txt格式的。大小有2GB。
6 y& S  ?4 S2 e5 F# p# W8 |; W       要求使用C++配合hadoop,用最快的速度统计出文档中出现频率最高的10个词。
6 N% H/ P; R0 z       what can I do? can you give some ideas?
作者: 我爱照镜子    时间: 2013-8-21 14:28
楼主应该把所有单词放到链表中,并且建立一个链表的索引。字典序排列每一个单词,重复出现在链表中计数。, M; P$ Z- i5 I, M' S2 k! D

4 I7 N; N* {& M- Q" [
7 [- g5 D$ I; g. A# b4 e5 y- vhadoop是什么啊?
作者: wangzheng3056    时间: 2013-8-21 16:22
我爱照镜子 发表于 2013-8-21 14:28 $ |8 B0 K, I. Y+ T6 r6 _
楼主应该把所有单词放到链表中,并且建立一个链表的索引。字典序排列每一个单词,重复出现在链表中计数。" j' a7 {; |* r- }
...
7 u  y* [" T0 I* S% e9 C+ |) X  m/ T; n
我也不太清楚,好像和云计算有点关系
作者: wangzheng3056    时间: 2013-8-21 16:22
我爱照镜子 发表于 2013-8-21 14:28
5 |4 `4 [* I" S% [- i8 H8 g) X$ V- g* M: E楼主应该把所有单词放到链表中,并且建立一个链表的索引。字典序排列每一个单词,重复出现在链表中计数。- J' Z9 `+ H1 w; J: Q' r3 b
...

% H0 x/ ?  ]* O: x2 }7 a) i谢谢你的回答,只能这样做了
作者: math~a    时间: 2013-8-21 22:15
学到了!. D! u4 o3 V% M" u( @6 z7 t8 V

作者: wangzheng3056    时间: 2013-8-22 09:00
math~a 发表于 2013-8-21 22:15
/ [2 d% ?! |9 F! g/ j0 {学到了!
2 V  j( P: n$ l3 G1 p' q3 K& _( W$ f
您有什么好的想法吗?
作者: math~a    时间: 2013-8-22 14:21
只看到2L的思路,学到了他的方法,自己的还没出来!!
作者: 海阔天空521    时间: 2013-8-22 17:39
不错 不错 谢谢啦!
作者: topershbby    时间: 2013-10-8 09:38
hadoop中不是有自带的wordcount的例子么,LZ可以去试一试




欢迎光临 数学建模社区-数学中国 (http://www.madio.net/) Powered by Discuz! X2.5