- 在线时间
- 10 小时
- 最后登录
- 2012-5-29
- 注册时间
- 2010-3-8
- 听众数
- 3
- 收听数
- 0
- 能力
- 0 分
- 体力
- 165 点
- 威望
- 0 点
- 阅读权限
- 20
- 积分
- 83
- 相册
- 0
- 日志
- 0
- 记录
- 0
- 帖子
- 65
- 主题
- 16
- 精华
- 0
- 分享
- 0
- 好友
- 2
升级   82.11% 该用户从未签到
- 自我介绍
- 学习哦,加泡妞
 |
实际问题是这样的:
8 g# x" Z: H8 a6 r$ E& d在实际基因组测序过程中,我们想从测序的reads的数据情况中了解生物的基因组的大小(未知)?
2 w7 a1 `, S2 Y, z+ I2 |& I i9 @- C, x( d
0 r7 w" R; |9 W% f, C概念解释:5 W1 g" ]" |5 ^3 M/ A8 p
reads:为了知道生物基因组的DNA序列情况,把生物基因组的DNA打断为小的片段,测定每个片段的DNA序列情况,每次测定反应得到的数据叫:reads
. t5 |% I$ J0 L5 F8 |5 s4 P8 K测序深度:测序的reads的总大小 /基因组大小,叫测序深度0 @% n. C$ L$ i' C' t" i
$ @ j0 e7 Z F# d: z0 A之前,生物信息估计基因组大小的方法 D* X. r, y! j' R0 X
我的实验过程是这样的- H- k' Y8 U- \! m& {6 A
9 K9 ], F! s( S' T6 l" u0 ~
1、在一个长度为G的大小的字符串中(DNA序列),从头至尾按一定长度去字符串(叫做K-mer)。例如:ATCT,取3-kmer为:ATC,TCT
7 x! z4 e; T$ L/ C: J4 q2、统计相同K-mer出现的次数(叫K-mer的深度)
/ j% L, |, r8 r* X/ l. `3、统计相同深度出现的次数(叫深度的频数)
: i7 C: b1 u8 C9 M! J0 I4、作深度与深度的频数的图4 C; L1 U! x. B2 J+ f
9 u- Y# r. S2 m1 W3 L4 G, D! r, g假设:K-mer的深度与深度的频数图服从泊松分布,可以得到:位置基因组大小=K-mer的个数/K-mer的期望深度(叫peak值)
9 E4 T# @" f" u/ j+ d' C7 c5 |# T1 H. \7 i2 ^" Z. e
我的问题:
* j$ m: q1 e2 ^. V& ^) z在一个基因组中存在相同的区域,按照上面的做法得到的深度与深度的频数的图,会出现两个峰,其深度关系成2倍关系。
' |9 x$ @, D, J那么,
7 a( u5 u1 V( U% g& i _1、这样的图是符合什么数学公式了?
& h% s1 g2 g0 O: T& x+ b2、能否区分出基因组中重复的区域?+ E4 e' n4 u' Q* j
, a% B( f4 j% k$ p8 S Q0 P# h
另一个问题,在基因组测序中,由于样品不纯存在污染(混合有其他生物的基因组),做深度与深度的频数的图,也会出现两个峰。9 C9 z. k$ ~: L5 {- s2 y4 S7 C5 g
那么,
[! p ], s& t( f* k) Q1、这个可以用数学公式表示吗?
: N3 W! _: d! J. [& ?1 M2、能否区分出污染的数据?
0 i( U, J1 |8 s |! a7 E2 L; Y% t* K
第三个问题,泊松公式能否像三角函数一样,成叠加的性质,(sinx+cosx)
0 |5 R3 { ? R. u# f# e* u% q) V4 Y, r% V# g- P
/ P! B. j5 o/ G# g2 m' [自我介绍% `) E7 A& x( M7 o" U1 c8 i2 Z7 V0 S% u
我是学生物的,现在做基因组测序工作,在我们的实际工作中,我们经常要计算位置基因组大小,但是我们做的图都不是标准的泊松分布图,所以按照上面公式估计出的大小有很多偏差;而且在实际工作中,经常会遇到杂合和污染的情况;对我们的估计影响也很大。所以希望从数据上得到一些处理。3 _, p! S2 }# N3 D2 T6 z6 [
* { R+ f. h! U+ H
希望得到数学同志们的帮助,; n) q* K. R# g3 c& i
我的邮箱是:jingyc01@163.com,qq是51178182- a( S' f5 p B2 v+ f4 H0 I
& _' t8 O) {$ [- i: Q
! Q+ L) D5 A* L7 Q
2 ]% \' ?+ J: x2 J3 [: r# ]9 I |
zan
|