- 在线时间
- 10 小时
- 最后登录
- 2012-5-29
- 注册时间
- 2010-3-8
- 听众数
- 3
- 收听数
- 0
- 能力
- 0 分
- 体力
- 165 点
- 威望
- 0 点
- 阅读权限
- 20
- 积分
- 83
- 相册
- 0
- 日志
- 0
- 记录
- 0
- 帖子
- 65
- 主题
- 16
- 精华
- 0
- 分享
- 0
- 好友
- 2
升级   82.11% 该用户从未签到
- 自我介绍
- 学习哦,加泡妞
 |
实际问题是这样的:! Y. X0 E% G C6 w. H
在实际基因组测序过程中,我们想从测序的reads的数据情况中了解生物的基因组的大小(未知)?
$ u$ Q: j" j3 `$ i" p+ r
4 T, f$ v z' w5 ]% m+ j概念解释:
1 c5 E' g' U. x$ ]reads:为了知道生物基因组的DNA序列情况,把生物基因组的DNA打断为小的片段,测定每个片段的DNA序列情况,每次测定反应得到的数据叫:reads, x6 J3 b1 G: R
测序深度:测序的reads的总大小 /基因组大小,叫测序深度6 c% T6 |6 V2 ]$ T; L# c% W9 t+ m
4 `9 Z. E! b! O$ a( [, ^+ l: Q- ~
之前,生物信息估计基因组大小的方法
\9 q% a: k+ R" x: M+ ?我的实验过程是这样的+ [$ w2 a, E: E& Y; g
4 N/ O2 W/ x `/ v! b4 R% S* D8 |6 e
1、在一个长度为G的大小的字符串中(DNA序列),从头至尾按一定长度去字符串(叫做K-mer)。例如:ATCT,取3-kmer为:ATC,TCT
! G5 C# |# T" U0 E' y- G2、统计相同K-mer出现的次数(叫K-mer的深度)
; w& [1 o+ t9 p% G3、统计相同深度出现的次数(叫深度的频数)/ f0 ~1 D P6 z( S$ Z+ f. w: i
4、作深度与深度的频数的图
! ~* }6 e2 @8 z0 J- G; d+ N( s1 ~9 Y: ^) H* v ^+ r
假设:K-mer的深度与深度的频数图服从泊松分布,可以得到:位置基因组大小=K-mer的个数/K-mer的期望深度(叫peak值)
9 u( H' L# o5 e Y: [* A B; o3 W
9 z" i$ V @1 J我的问题:# L4 P6 I) }( p, A' i7 \: a' x
在一个基因组中存在相同的区域,按照上面的做法得到的深度与深度的频数的图,会出现两个峰,其深度关系成2倍关系。1 t6 R5 [ w9 o
那么,
/ D7 N4 U3 b2 Q4 `1、这样的图是符合什么数学公式了?
# t- V" ]2 k( u7 [/ H F2、能否区分出基因组中重复的区域?6 ?* @5 _: A1 U: N/ }
' ^1 z) u7 P2 M }- @
另一个问题,在基因组测序中,由于样品不纯存在污染(混合有其他生物的基因组),做深度与深度的频数的图,也会出现两个峰。
' b# T6 P4 i# v1 S( Q0 d那么,4 F4 } Z. g' z% U2 d0 x1 o
1、这个可以用数学公式表示吗?6 r" R i& k1 L" z8 B
2、能否区分出污染的数据?
. } t3 a8 f2 T, L, C: `- H* k) N
4 H2 u+ f+ S& V' n4 q第三个问题,泊松公式能否像三角函数一样,成叠加的性质,(sinx+cosx)
4 G: C _# [5 I6 i3 l' m; y$ t( w+ I) i$ D$ Y
1 m! R O2 o, r2 J自我介绍
& _* o8 ~/ ?4 V4 ?. U我是学生物的,现在做基因组测序工作,在我们的实际工作中,我们经常要计算位置基因组大小,但是我们做的图都不是标准的泊松分布图,所以按照上面公式估计出的大小有很多偏差;而且在实际工作中,经常会遇到杂合和污染的情况;对我们的估计影响也很大。所以希望从数据上得到一些处理。( [4 P& `0 i; h# u
2 c' B& B( R% l y- A* a1 \! x3 `
希望得到数学同志们的帮助," |+ w6 N2 ?3 C7 z4 X
我的邮箱是:jingyc01@163.com,qq是511781827 F) f5 q. w. P8 j* m
, r1 y3 P8 u. Z/ }. Q0 [3 O# r9 i! R1 j% u
: U4 ? U4 a( ]% g |
zan
|