- 在线时间
- 10 小时
- 最后登录
- 2012-5-29
- 注册时间
- 2010-3-8
- 听众数
- 3
- 收听数
- 0
- 能力
- 0 分
- 体力
- 165 点
- 威望
- 0 点
- 阅读权限
- 20
- 积分
- 83
- 相册
- 0
- 日志
- 0
- 记录
- 0
- 帖子
- 65
- 主题
- 16
- 精华
- 0
- 分享
- 0
- 好友
- 2
升级   82.11% 该用户从未签到
- 自我介绍
- 学习哦,加泡妞
 |
实际问题是这样的:, x/ b# @" N1 H s2 v; Q
在实际基因组测序过程中,我们想从测序的reads的数据情况中了解生物的基因组的大小(未知)?
8 m `$ P: Y$ \" R$ V4 W; P7 n* z7 B( u" k0 R( a% x3 @
概念解释:, I8 D% Y/ A M
reads:为了知道生物基因组的DNA序列情况,把生物基因组的DNA打断为小的片段,测定每个片段的DNA序列情况,每次测定反应得到的数据叫:reads
1 V/ {' T$ E! p' H0 f测序深度:测序的reads的总大小 /基因组大小,叫测序深度, E p* m% W0 B# \$ o: c
% q% E4 u2 q, a& E3 F
之前,生物信息估计基因组大小的方法
( }* M7 k6 C- Y我的实验过程是这样的+ Q; ?& c! B! m& v7 C% {
/ _" v7 `' d; F- N$ N( r1 B1、在一个长度为G的大小的字符串中(DNA序列),从头至尾按一定长度去字符串(叫做K-mer)。例如:ATCT,取3-kmer为:ATC,TCT; S/ Y, L4 i8 ~( q
2、统计相同K-mer出现的次数(叫K-mer的深度)
3 W* Z+ n( T u0 J9 D" }6 t& \3、统计相同深度出现的次数(叫深度的频数)
. ]/ u# a7 `0 O( z4、作深度与深度的频数的图 ~# Q( q" h9 Z) s/ n7 \9 s+ [ E
9 L, u$ d+ p+ d P B8 K) W假设:K-mer的深度与深度的频数图服从泊松分布,可以得到:位置基因组大小=K-mer的个数/K-mer的期望深度(叫peak值)
0 r& H: B5 e6 C" S! W/ P% G1 Y F0 F" Z. g4 D* e: m" B& z
我的问题:5 d; B6 b$ B6 K* F
在一个基因组中存在相同的区域,按照上面的做法得到的深度与深度的频数的图,会出现两个峰,其深度关系成2倍关系。
, d, [" e+ i J5 }7 T) M那么,
2 o4 k5 b7 Y: G1、这样的图是符合什么数学公式了?
- z" @' T5 n! o' ~$ ]2、能否区分出基因组中重复的区域?
! S9 ^1 d! F, t! k
* t7 N$ \% U- e! R另一个问题,在基因组测序中,由于样品不纯存在污染(混合有其他生物的基因组),做深度与深度的频数的图,也会出现两个峰。
# |4 P" |3 O7 L3 m6 y那么,' j2 O$ n* S, F* Q7 ~0 ?. w
1、这个可以用数学公式表示吗?
, _- m" G; n$ _+ [/ }6 A: E r+ L2、能否区分出污染的数据?) t5 A1 T9 L4 A- n4 G
# E8 c7 A0 t/ a$ Z5 c第三个问题,泊松公式能否像三角函数一样,成叠加的性质,(sinx+cosx)
) L1 W ^2 ]; j5 u, u
: I ~, I0 Z2 ~0 \, U
2 i8 @* I" @ s4 I" u自我介绍7 Y- I, V1 _+ j
我是学生物的,现在做基因组测序工作,在我们的实际工作中,我们经常要计算位置基因组大小,但是我们做的图都不是标准的泊松分布图,所以按照上面公式估计出的大小有很多偏差;而且在实际工作中,经常会遇到杂合和污染的情况;对我们的估计影响也很大。所以希望从数据上得到一些处理。5 ~. f, b9 k3 z2 P
, i2 I9 s2 y% X |- f
希望得到数学同志们的帮助,
3 g4 p0 ^, i! r- f我的邮箱是:jingyc01@163.com,qq是51178182& Y* |! G) `4 L8 ^. e, G# ` S9 x
0 p* _0 K2 I& B8 E! ~
* Z6 ~6 G0 V7 S3 D, G; K: t1 T5 l, D5 J7 N( w5 o. x+ O
|
zan
|