8 l% _" G) ~3 H% w通常,只需在通用文本编辑器中打开文件并重新保存即可轻松解决该问题。如果文件特别大,你可能需要考虑使用命令行工具或向程序员寻求帮助。' m1 w6 `. m9 }; X5 ~* k# I' a
, H6 R8 k3 P* F' C PDF 中的数据2 w. b, Z: F, n
大量的数据——尤其是政府数据——只能以 PDF 格式提供。如果你在 PDF 中有真实的文本数据,那么可以通过几种方式来提取它们。Tabula 是一个优秀的免费工具。如果你订阅了 Adobe Creative Cloud,那么可以使用 Acrobat Pro,它提供了将 PDF 表格导出到 Excel 的功能。 4 B4 x0 q/ K8 E( o$ C- r0 \ W( u9 z' L- P& y. Z- I 数据太细. m% l( \' k2 ?! Z
这与数据太粗糙刚好相反。在这种情况下,你有县的数据,但你想要州或有几个月的数据。所幸的是,这通常很简单。 1 g1 n% f- e" D: l 7 V& O! ^0 e6 @% A: l+ C可以使用 Excel 或谷歌文档的数据透视表(Pivot Table)功能来汇总数据。透视表是每个记者都应该学习的神奇工具,但它们也有其局限性。对于非常大的数据集,你应该向程序员求助,他们可以制定一个更容易验证和重用的解决方案。 : c- @3 c" |* c+ R% d1 \: k: v8 j$ Z8 b 手动输入的数据6 }/ s# ^9 k+ q$ \: W
手动数据输入是一个常见问题,至少在这里描述的其他问题中有 10 个与它相关。没有比让一个人输入数据却没有对其进行验证更糟糕的方式来搞砸数据了。例如,我曾经拿到伊利诺伊州库克县完整的养狗许可数据库。系统创建者让狗的主人通过一个文本框输入狗的品质,而不是提供一个狗的品质列表给他们选择。结果这个数据库出现了至少 250 个不同的吉娃娃品种。" [5 l. L9 w2 y+ s
4 V2 {, N+ v. `+ c0 J" y+ r, N 数据与格式和注释混杂在一起3 I, b) z, @+ o8 {) K6 P2 X3 ] X" \
HTML 和 XML 复杂的数据表示在数据和格式之间有清晰的分隔,但对于电子表格的数据表示来说并非如此。电子表格数据的一个常见问题是,前几行数据实际上是关于数据的描述或备注,而不是列标题或数据本身。数据字典也会被放在电子表格的中,标题行可能会重复,或者在同一张表格中包含多个表(可能有不同的列标题),而不是分成不同的表格存放。% d' _9 @- W8 m) M( e
4 [* c. i- I3 K e3 ^5 k- ^很明显,试图对具有这些问题的电子表格进行分析都会失败。所以,在首次查看新数据时,请确保数据中不包含额外的标题行或其他格式化字符。" [& P& F: J9 M7 ]; ^6 n( K
5 O) U S8 Q8 t$ B 基于缺失值进行聚合6 j& w4 e* x* q4 i2 U$ z
设想一个数据集有 100 行数据,其中有一列叫作 cost。在其中的 50 行中,cost 列是空白的。那么该列的平均值是多少?是 sum_of_cost/50 还是 sum_of_cost/100?没有一个明确的答案。一般情况下,如果要在缺失值的列上进行聚合,可以先安全地过滤掉带有缺失值的行。在某些情况下,缺失的值也可能被设置为 0。如果你不确定,请向专家咨询,或者不要做聚合计算。 " T2 X% W, {7 s W! O( d5 [6 O$ Q 4 E, Y# v' ^- v* `% z5 q 误差幅度过大( S3 \ W6 e% t
没有什么能够比使用误差幅度很大的数据得出的报告包含更多的错误。而不是具有非常大的错误余量的数字的非反应性使用。误差幅度通常与问卷调查数据有关。投票数据或美国人口普查局的美国社区调查数据是最有可能出现误差幅度的。误差幅度一般用于衡量真值的范围。它可以表示为一个数字(400 +/- 80)或百分比(400 +/- 20%)。相关人口越少,误差幅度就越大。例如,根据 2014 年 5 年的 ACS 估计,居住在纽约的亚裔人数为 1,106,989 +/- 3,526(0.3%)。菲律宾人的数量是 71,969 +/- 3,088(4.3%)。萨摩亚人的数量是 203 +/- 144(71%)。前两个数字是安全可信的,但第三个数字不应该用于已发布的报告。关于什么样的数字不能够使用并不存在规则,但经验告诉我们,应该谨慎使用误差幅度超过 10%的数字。5 L9 @: M5 d. F' D$ e. V
; _0 O" R, K- j+ s' |, A K 误差幅度未知 5 Y. J Z1 z9 y" C: F有时候,问题不在于误差幅度过大,而在于没有人想过要弄清楚它究竟是什么。这是一个不科学的民意调查问题。如果不计算误差幅度,就不可能知道结果的准确程度。作为一般规则,只要你有问卷调查数据,就应该询弄误差幅度是什么。如果数据来源无法提供这一信息,那么这些数据可能不值得用在分析上。 * l" f- P1 \# V: D/ T( E) x1 E; }7 L v6 p+ V( [4 X* S, ^+ W 数据样本有偏见+ }# u% |) d9 W& ^' g+ y
有偏见的样本是由不谨慎的抽样导致的,或者有人故意扭曲。样本可能包含偏见,因为它是从互联网上收集的,而穷人不像富人那样可以频繁使用互联网。问卷调查必须仔细加以权衡,以确保它们覆盖所有的人口比例,避免出现扭曲。要完美做到这一点几乎是不可能的,所以人们经常会做错。 / w+ h; r: q" ^4 e' }* _/ q6 g" ?. A5 f2 J0 F1 j4 F9 z7 d 数据被手动编辑过 . y9 n. H7 l4 w$ s- I; X/ n! z手动编辑存在的问题几乎与人类输入数据的问题相同,只不过它是在后面才发生。事实上,手动编辑数据通常是为了修复人类最初输入的数据。当编辑人员不完全了解原始数据时,就会出现问题。我曾经看到有人自发地进行“修正”,将数据集中的 Smit 改为 Smith。那个人的名字真的是 Smith 吗?我不知道,我只知道现在值出现了问题。 ! b' q% V m$ r5 j; R" L2 C& v+ t; r# [: u6 W& k1 x: ` 通货膨胀歪曲了数据 8 X- W4 E, m) L' w. w6 r: U. p通货通胀表示货币的价值随着时间的流逝而发生变化。我们没有办法通过观察数字来判断数字是否已经出现了“膨胀调整”。如果你在获得数据后不知道它们是否已经被调整过,请检查你的数据来源。如果他们没有进行过调整,你可能会想要自己进行调整,可以借助这个工具 http://inflation-adjust.herokuapp.com 进行数据调整。 7 L' N4 k" }2 \0 u+ m( k; |( ] O! o4 ?1 i+ p) E+ ~ 自然 / 季节变化歪曲了数据 7 ~+ _* o" |6 F* Z/ Q6 w1 i. t由于某些潜在的原因,很多类型的数据会发生自然波动。最著名的例子就是随季节而变化的就业形式。经济学家已经开发出各种补偿这种变化的方法。这些方法的细节并不重要,重要的是要知道你使用的数据是否已经经过“季节性调整”。如果他们没有,并且你想比较每月的就业情况,你可能需要向数据来源所要调整过的数据(自己调整它们要比膨胀调整要困难得多)。 # E s5 O" j; {* v [4 U/ c / `* ]* m/ G8 e% Z* N7 `需要由第三方专家帮你解决的问题 + B# J+ ?& D- v7 I - y9 [; `% ?5 g1 @$ U/ [4 N作者不可信 g7 }1 @8 w6 E, M6 _) i0 z; _
有时候,你拥有的唯一数据是来自你不想依赖的来源。在某些情况下,这很好。只有枪械制造商才知道他们究竟生产了多少把枪。但是,如果你的数据来自可疑制造商,那么请务必与其他专家核对,最好与两三个专家一起检查。除非你有确凿的证据,否则不要发布来自包含偏见的来源的数据。* L. A, v% V0 n9 r& g, R1 s