- 在线时间
- 10 小时
- 最后登录
- 2012-5-29
- 注册时间
- 2010-3-8
- 听众数
- 3
- 收听数
- 0
- 能力
- 0 分
- 体力
- 165 点
- 威望
- 0 点
- 阅读权限
- 20
- 积分
- 83
- 相册
- 0
- 日志
- 0
- 记录
- 0
- 帖子
- 65
- 主题
- 16
- 精华
- 0
- 分享
- 0
- 好友
- 2
升级   82.11% 该用户从未签到
- 自我介绍
- 学习哦,加泡妞
 |
实际问题是这样的:6 Q" d7 R. T% W1 m) |
在实际基因组测序过程中,我们想从测序的reads的数据情况中了解生物的基因组的大小(未知)?
3 M8 O9 C; Y! s, L* o$ D+ }* r+ G) g6 s7 Z; l% T
概念解释:
! c% G9 P) R+ s/ E, b d% ~reads:为了知道生物基因组的DNA序列情况,把生物基因组的DNA打断为小的片段,测定每个片段的DNA序列情况,每次测定反应得到的数据叫:reads
4 M3 U9 W' W; `* H6 F7 Q测序深度:测序的reads的总大小 /基因组大小,叫测序深度' |8 I, W, ?; t; n. F9 \
+ Q6 h2 I {; |/ p, Z. p之前,生物信息估计基因组大小的方法; P& B; F8 G6 H& n1 i% f B( E
我的实验过程是这样的
5 i: | Z r/ D8 ]7 W: r6 X1 P! Y1 r1 G: A; O$ o8 U7 y
1、在一个长度为G的大小的字符串中(DNA序列),从头至尾按一定长度去字符串(叫做K-mer)。例如:ATCT,取3-kmer为:ATC,TCT' L" e( I, H- W {- T* G" o" M1 K
2、统计相同K-mer出现的次数(叫K-mer的深度)
! {9 G9 F8 T2 v# w' V8 G$ V3、统计相同深度出现的次数(叫深度的频数)
/ `* T) t* x0 t8 x; y. B; @4、作深度与深度的频数的图
) R# Z) g4 L/ @! _0 z) I2 n t8 V% }. n, }0 d" D& {" s/ L
假设:K-mer的深度与深度的频数图服从泊松分布,可以得到:位置基因组大小=K-mer的个数/K-mer的期望深度(叫peak值)
. h- K: O$ b0 |7 U
) `6 V( A+ B7 L6 o我的问题:9 ~) \: [+ k+ k) Z, Z) }" t- {
在一个基因组中存在相同的区域,按照上面的做法得到的深度与深度的频数的图,会出现两个峰,其深度关系成2倍关系。, s( t) }4 g0 k
那么,8 Q% k Q" x+ z, ~0 u2 S
1、这样的图是符合什么数学公式了?
! I: s0 l. W5 v1 n2、能否区分出基因组中重复的区域?
# _' ?8 P# J$ k- X; W
- ?/ A" d. F- I另一个问题,在基因组测序中,由于样品不纯存在污染(混合有其他生物的基因组),做深度与深度的频数的图,也会出现两个峰。, f3 d- Q; @0 X2 @; p3 C }% A
那么,
! S0 l( x% @0 y j4 w3 B& h4 D% E0 p1、这个可以用数学公式表示吗?
3 [* x2 }% Y+ i$ C4 f2、能否区分出污染的数据?
, k' K" R0 S/ P% t2 \4 e m$ g' M4 Z
第三个问题,泊松公式能否像三角函数一样,成叠加的性质,(sinx+cosx)* F+ Y1 c Y1 W% {: s
G: K6 o9 q0 l" |, N h. R
" V5 [& j/ t1 y2 l2 v' `自我介绍( E9 h3 s. Q; R8 Y' ^7 ~
我是学生物的,现在做基因组测序工作,在我们的实际工作中,我们经常要计算位置基因组大小,但是我们做的图都不是标准的泊松分布图,所以按照上面公式估计出的大小有很多偏差;而且在实际工作中,经常会遇到杂合和污染的情况;对我们的估计影响也很大。所以希望从数据上得到一些处理。9 q) O3 F O# h0 r. ^4 Q: ?- A7 z
" Y" z, ^( D6 L. V
希望得到数学同志们的帮助,
/ n! t; l3 n6 c我的邮箱是:jingyc01@163.com,qq是51178182
7 y& s" N; b; E2 }- r; Q1 o1 B
) o( k) q% [9 X% V% l5 J0 `7 N9 M8 P, I6 }- x3 ]6 Y- t4 G0 x/ K2 N
7 i" s- S2 M) f/ h |
zan
|