如何合理选择抽样样本数: q I0 W, ]8 u
作者:徐晟韬 , [- V" z- a ~8 |- c* ^ + b3 \" B9 L' W& f5 r
一、 研究介绍:9 k9 [, \) P7 c+ {! L# l8 q2 V
+ C. T' s# z: H/ N( ?研究背景:众所周知,抽样样本数的大小对调查结果的准确度有很大的影响,从统计上可以计算出每个抽样样 % M6 H- G2 ~5 |, C本数所对应的抽样误差有多少。但大多数客户对抽样误差缺乏直观的感觉,无法清晰了解应该选择多大的抽样误差才能满足自己的实际需求,因此也就无从有效控制成本。另外,对于定性研究来说,也需要采用另外的指标来衡量多大的样本量才能满足定性研究的需求。因此,达闻通用的研究人员计划通过对现有数据的分析来帮助解决这两个问题。 9 e* J4 F) G' D# s5 I% g * j& T& u2 d9 W3 M( i
研究课题:1. 定性研究应该采用多大的样本量才能有效解决问题?3 y. y: e* C3 a9 A$ W& F+ E
2. 定量研究中,采用不同数量的抽样样本,可达到怎样的研究效果? ! S5 d1 }( `7 f7 v2 B1 g7 X U
9 w- } f$ ^3 m8 H
研究方法:我们以过往某个调查项目的总样本数(4450样本)为母体样本,从中分别随机抽取5样本,10样本, ; }0 V7 Q# F5 {1 e0 p8 |20样本,30样本,50样本,80样本,100样本,200样本,300样本来比较其结果,为了充分了解每种样本量的抽样结果,每种样本量重复抽取30次。对比的问题指标为:不提示品牌知名度。 1 Z$ N6 U! d, d+ L' j9 G5 o 1 Z4 S# R& \9 `" G# U二、 研究的主要结论:* r" Z5 T' d! m$ b& B' F& R! J
' d1 j8 P' l; G2 W- i样本量 特点 z3 l4 b; W7 P" Y% }; x5 只能获得一半的答案。 v3 L( b" G% F/ S- Y5 K 保证得到前2个主要的答案。 1 C& J+ D% {" B- F. F10 答案获得率达到70%。 # u' T% U& g! N5 v: X+ r 保证得到前5个主要的答案。 / D( @, l+ `4 R& O- h# w15 答案获得率达到80%。 1 D, x* h& C4 ?( s0 Y4 O 保证得到前8个主要的答案。% C; Z) e4 _( |- a" ] F
建议作为定性研究的最低样本量。0 k }+ ]0 A. L- G
20 答案获得率达到85%。) C$ R* @! Y0 O! Z( H
保证获得前10个主要的答案。# d! S. J( k1 e/ C+ A9 z
30 答案获得率达到90%。 9 p. c+ O& F8 Y' k( l, c 保证获得前12个主要的答案。 0 \& S/ U7 y, @' k5 S( H 可粗略量化分辨出高、中、低结果 ; f$ A! g4 i* I+ W 建议作为定量研究中一个细分配额的最低样本数。6 }# q2 v0 L) \0 S6 H2 f. u
50 答案获得率,精确度比30样本量要高一些。 - B5 u# O6 m+ N) C0 |0 b. `100 答案获得率接近100%。5 N0 J" L1 g$ W/ o/ T' f* f
抽样误差约为+10%,调查结果可以反映市场的大体情况,但数据排名仍然有一定的误差。 4 c4 n% E2 Y) Y1 z 建议用于项目中各分城市的最低样本数。 7 q! o F( V" c- c7 S: o150 抽样误差比100样本量略佳,调查结果更接近现实,不过差别不会太大 , j+ T2 S& L3 r( \, w & g( y: a% h4 N) v( e( T, X200 答案获得率稳定为100%。 % }( F Q: ~' y& h! C M2 l; Q 抽样误差缩小至约为+7%,结果很接近真实值,但多次抽样结果仍然有结果不稳定的情况。" I; d& S" Q# k: |0 q' g6 K9 M
建议用于市场描述性或问题诊断性研究项目,但不适合用于连续跟踪性的研究! G0 m1 s; [; ` \# M; |/ x5 X
300 抽样误差为+5.4%,调查结果基本上与现实一致,数据准确度和稳定性都很好。 7 U1 @& ~% x! _* x- y 建议作为U&A研究和各类跟踪性研究的基础样本。 * {' X: Q' c- [; G6 n0 x2 [. i0 p " Y& b7 v- K5 M) T1 {4 i三、 详细研究分析# B! s7 l6 p1 I
$ g- u. o2 W: O
(一)定性样本需求分析$ p& G" e, m6 I8 Z
/ I+ C6 R$ [' h3 B
1、答案获得率分析 5 z" ^4 a6 C6 |' u) D - t: Y$ }) q0 U H
概念:答案获得率是指在调查中的答案个数与实际总体答案个数的比例。 : Y y" W0 W0 N5 w# C % |: m& n' Z9 w
定性研究是属于探测性研究,因此不太在乎量化的数据,而会更关注能否获得足够的答案数以供进一步的定量研究,也就是说答案获得率是否足够。 7 i+ ^3 ^* \# n& B- X9 x% z 8 T* i4 o: A4 ]5 m* N! H
在本次研究中,采用的4450个母体样本中,果汁品牌共有17个,也就是说实际总体答案个数就是17个。因此,我们只需要对比每种抽样样本量下的平均答案个数,就可以知道该抽样样本量的答案获得率。 1 ]# \- v5 x" a; y0 j & O, A8 b( y1 D/ n
统计结果如下表: # z* D7 K! @" {+ i) l$ q ; N; l1 g6 ^) K5 \$ J6 E
1 J" d! p8 F! G R" d$ |' Z; T ; b) U0 D6 I9 c7 M
! }1 X, M9 s6 X
+ {6 z" \* B7 S' z |
% |6 W1 s) }8 x& J! X# B
从上面图表可得出,5样本的调查仅能拿到一半的答案,10样本获得七成的答案,15样本可得到80%的答案,而30样本是拐点,再得到90%的答案后,再增加样本量对答案获得率的帮助不大。9 X }- d. k( j! {$ X# v
1 j, `) q4 @4 R4 R
& p/ b2 _2 g. A) M2 k$ Y! g2、主要答案获得率 - \2 Z4 p( u7 J 7 [( n2 x( z5 J2 `& L 进一步分析,我们需要了解各种抽样样本是否能得到主要的答案。下面是17个果汁品牌的不提示知名度,不提示知名度的高低代表了这个品牌的广泛性。 6 B/ W. e6 Z, G- X" ]' q 以下是每种样本量下的各答案获得率。从图中可以看到,5样本量只能保证获得知名度最高的两个品牌,而10样本量可以保证获得不提示知名度在20%以上的5个品牌,而15样本量及30样本量可以保证获得不提示知名度在10%以上的品牌。 1 o* s7 u1 B9 n , t. P3 t2 k. y$ X/ D: K
& e2 j7 T) V0 ~$ ~ b s: Y ' i6 w$ C1 w' {( B, P9 r. |* J
3、小结 / d5 [! d# |/ Z 3 Q* c8 w& Q! `% s, G1 S2 T综合前面两点分析,我们可得出结论:定性研究最低需要15样本或2组座谈会的量,才能获得大部分的答案并覆盖到主要的答案。如果需要对比研究细分群体,则每个细分群体也应该最少是2组座谈会放可保证效果。 % k+ ], Z3 S) ], T+ B" m * n( x" `1 ]& n. e* Y
, T3 A( S6 f! z5 G/ ^(二)定量样本需求分析 2 O" C/ d& L, e" p- Q6 i 1 _! H* m5 o- Z4 S, [7 M(1)抽样误差分析 * X' z _. H) | 9 c) }0 P/ D; v J1 e/ ?8 f
抽样误差是评估样本量的一个常用指标,我们的研究人员计算出了在95%的置信程度下各样本量的抽样误差,具体结果如下图:$ q y- j2 @, ?3 w0 W2 [" u
! m! J' Z, g$ M; R! R. Z
: j* Z" B9 i H9 z0 T