4 e! H2 F G0 Q# ~. G 我相信每个学过数据挖掘这门课的人都知道沃尔玛里啤酒和尿布的故事,对,这个故事出现在很多年前,当初同样是为了描述一个令人激动的未来——人类居然可以通过计算机挖掘出那些我们平时根本无法察觉到的、事物之间隐藏的联系。欢欣鼓舞的计算机学家们纷纷将自己的精力投入到这个神奇的领域,但是丝毫没有发现,其实他们只是在重复着所有学者们无数年来在做的事情——寻找这个世界的真实。 % L2 p l6 q8 C 5 k. g! H$ X: `( i+ O3 ]
没错,为了寻找这个世界的真实,哲学家们冥思苦想,物理学家们建造了有毁灭世界之虞的对撞机,化学家们深入原子内部苦苦探究,但谁也没有数学家们走的更远,更接近成功。概率论比所有人都更早一步的找到了数据与数据之间的相关性,于是我们在高中的时候就能够了解线性相关和数据拟合的意义。而随着技术的发展,概率模型下的NLP技术在上个世纪90年代以后全面战胜了规则模型,我们不需要去理解自然语言的语义、语法,让处理器的摩尔法则和指数级叠加的文本互相厮杀,只要有足够数量的样本集——Bingo!一切都搞定了。于是随着Google在各种翻译大赛上的一枝独秀,人们乐观的觉得只要有了足够大的语料库,似乎再也没有什么能够难到他们。于是正向书中所说的那样,人们开始不再关心数据之间的因果联系,不再关心那些细微的错误,而开始疯狂的追求数据的规模。沾沾自喜的人们以为这就是世界的真理,忽视了近十年概率模型应用的规模一再扩大,准确率却停滞不前。即使是文本的二元情感分类如此简单的任务,无监督的学习器也很难拿出一个看得过去的成绩,更不用说机器翻译这样近十年来都没有巨大突破的领域了。就目前人类的技术水平而言,我们很难能够乐观的估计概率模型能够在我们有生之年将机器翻译技术推到“信达雅”的地步,概率模型和大数据的发展过程恰似一个对数函数,经过了最初的高速发展之后就放缓了自己的脚步。 + T1 ~( V. d1 z& R& I0 w
/ E, J) @# _9 j/ [$ o& | 所以我是不认可大数据的概念的。数据规模到达一定程度之后,继续扩充的意义已经不大,更遑论所有大数据的应用都极大的依赖于其选取的数学处理模型。而经济发展的不均衡决定了所谓的样本=总体永远不可能出现——全世界有十几亿人还处日生活开销不足2美元的贫困线以下,连登录网络的条件都不具备,我们怎么能够奢望我们收集到的数据就会是总体?而所谓“知其然”可以替代“知其所以然”的概念更像是一个悖论,或许在应用层面上而言,这种说法有其合理之处,但对我们如何更好的了解这个世界的真相,却毫无用处。 : A" }" }' |0 d% x! m' b# o