- 在线时间
- 10 小时
- 最后登录
- 2012-5-29
- 注册时间
- 2010-3-8
- 听众数
- 3
- 收听数
- 0
- 能力
- 0 分
- 体力
- 165 点
- 威望
- 0 点
- 阅读权限
- 20
- 积分
- 83
- 相册
- 0
- 日志
- 0
- 记录
- 0
- 帖子
- 65
- 主题
- 16
- 精华
- 0
- 分享
- 0
- 好友
- 2
升级   82.11% 该用户从未签到
- 自我介绍
- 学习哦,加泡妞
 |
实际问题是这样的:
3 y/ _) s4 e' X$ T3 y w在实际基因组测序过程中,我们想从测序的reads的数据情况中了解生物的基因组的大小(未知)?
! R" M- l6 z3 L- v+ w# Y9 K
! h$ i* O2 s( H: E4 {+ t, A概念解释:
$ b; P O* k$ g5 jreads:为了知道生物基因组的DNA序列情况,把生物基因组的DNA打断为小的片段,测定每个片段的DNA序列情况,每次测定反应得到的数据叫:reads6 b* C1 I1 U$ J/ c Y
测序深度:测序的reads的总大小 /基因组大小,叫测序深度- | i0 z. Y( O+ \8 q# G
8 D) D6 O' A* ?1 F! Z6 Q之前,生物信息估计基因组大小的方法
; t5 k8 N8 i( a8 m3 [) P我的实验过程是这样的/ M( O" d1 B5 v( E# ?
( |2 F+ H7 f8 k7 c7 v& E$ G: o1、在一个长度为G的大小的字符串中(DNA序列),从头至尾按一定长度去字符串(叫做K-mer)。例如:ATCT,取3-kmer为:ATC,TCT: J4 Q- {- _) |
2、统计相同K-mer出现的次数(叫K-mer的深度)) k7 D, w- K# h9 f
3、统计相同深度出现的次数(叫深度的频数)' H1 v7 p4 k; o- V# a: D/ R
4、作深度与深度的频数的图; Q9 \& f& \, g$ S" o9 |" A
N5 ~- [, w+ E. T$ Z
假设:K-mer的深度与深度的频数图服从泊松分布,可以得到:位置基因组大小=K-mer的个数/K-mer的期望深度(叫peak值)
6 f; p2 N, @! o, n+ @5 y$ h! G+ H" X7 a/ Y/ ?, V
我的问题:
8 s+ M( B% J+ @- D在一个基因组中存在相同的区域,按照上面的做法得到的深度与深度的频数的图,会出现两个峰,其深度关系成2倍关系。
) C6 s% v! Q5 w( U那么,
* s& m% c9 J+ |/ }) C1、这样的图是符合什么数学公式了?
! J$ I5 M) B& [- Z, L( @2、能否区分出基因组中重复的区域?
3 ~% |; R* v* b+ ^+ Q( n" J1 y6 A. X
另一个问题,在基因组测序中,由于样品不纯存在污染(混合有其他生物的基因组),做深度与深度的频数的图,也会出现两个峰。
3 s* r# j6 H; M0 A" o1 }那么,
7 t! s6 `/ L1 j( [1、这个可以用数学公式表示吗?
0 G( M; H7 v0 o/ M( d2、能否区分出污染的数据?3 ^: y$ C, }, H
$ I6 {8 _% _# W J4 E
第三个问题,泊松公式能否像三角函数一样,成叠加的性质,(sinx+cosx)
+ z4 |) l2 T w" p5 A6 x* y
; d1 J3 T- E Q) m# j5 O5 I$ N- M* g: F2 p3 l$ z
自我介绍
# ~: Q$ x+ ]; q: u我是学生物的,现在做基因组测序工作,在我们的实际工作中,我们经常要计算位置基因组大小,但是我们做的图都不是标准的泊松分布图,所以按照上面公式估计出的大小有很多偏差;而且在实际工作中,经常会遇到杂合和污染的情况;对我们的估计影响也很大。所以希望从数据上得到一些处理。
1 R% y( ~- O. f' h2 L
5 _" B% s! A% ?8 L. E希望得到数学同志们的帮助,
- U7 I& R1 N7 l6 u$ ]. j' x我的邮箱是:jingyc01@163.com,qq是51178182
/ ]5 @2 J5 C: H3 y5 B
0 W/ l- v5 s" I' }$ g8 v7 k0 T- k F
! X2 N5 V4 X ]' s9 k
2 s* z% m _( F! T |
zan
|