Stake官网

人类与猪的基因类似度推算:共享基因率与DNA序列一致性(百分比)公式

人类与猪的基因类似度推算:共享基因率与DNA序列一致性(百分比)公式

“人类与猪的基因类似度”没有一个脱离推算口径后依然成立的固定百分比 。要得到可诠释的了局,必须先确定比力对象:是整个基因组、共同的同源基因、某个基因的DNA序列,还是基因编码出的蛋白质 。分歧对象使用的分母、比对领域和“一样”的判断尺度分歧,因而了局也不能直接相互代替 。

先分辨三种常见的类似度

比力口径 现着实推算什么 常用单元
共同同源基因比例 人类基因中有几多能在猪基因组中找到对应的同源基因 基因个数、百分比
DNA序列一致率 两条经过比对的DNA序列中,有几多地位的碱基齐全一样 碱基数、百分比
蛋白质序列类似度 对应蛋白质的氨基酸是否一样,或是否属于性质靠近的代替 氨基酸数、百分比

因而,“人和猪有几多基因一样”和“人猪DNA序列有几多百分比一样”并不是统一路题 。前者关注基因是否存在对应关系,后者关注序列逐位是否一致 。即便两个物种占有大量一样职能的基因,也不代表这些基因的每一个碱基都一样 。

若是想比力整个基因组:先统一领域,再推算碱基一致率

整体比力适合回覆“两个物种在可对应的基因组区域上有多像” 。但人类和猪的基因组长度分歧,基因排劣注沉复序劣注插入和缺失也存在差距,所以不能单一地把两套基因组从第一个碱基起头逐位相除 。

  1. 确定参考数据 。纪录人类和猪使用的参考基因组版本、染色体领域以及是否纳入沉复区域 。分歧版本可能会影响可比区域的数量 。
  2. 确定比力区域 。能够比力全基因组,也能够只比力蛋白质编码区、已确认的同源区域或某类职能区域 。领域必须在了局中注明 。
  3. 进行序列比对 。比对法式会把两物种中可能对应的序列分列在一路,并象征碱基代替、插入和缺失 。
  4. 统计可比力地位 。通常要注明缺口若何处置:是排除缺口后只统计双方都有碱基的地位,还是将缺口也纳入差距 。
  5. 推算一致率 。若是排除缺口,根基公式是:DNA一致率 = 齐全一样的碱基数 ÷ 可比力的碱基总数 × 100% 。

例如,某次比对得到100万个位点,其中82万个地位的碱基齐全一样,那么该区域的DNA一致率就是82% 。这只是一个推算示例,不是人类与猪全基因组的现实统计值 。若指标区域正本有120万个碱基,但最终只有100万个地位可能靠得住对应,还应同时汇报比对覆盖率:100万 ÷ 120万 × 100%,约为83.3% 。

覆盖率和一致率必要一路看 。只保留容易比对的守旧片段,可能得到较高的一致率,但并不能注明整个基因组都达到同样水平;扩大到沉复序劣注结构变异较多的区域后,了局也可能产生变动 。

若是只关切共同基因:推算“对应基因比例”

有些资料说“人类和猪有好多共同基因”,它们通常会商的是同源基因或嫡系同源基因,而不是把所有DNA碱基拿来比力 。嫡系同源基因通常指物种分化后由共同祖先基因演化而来的对应基因,判断时还要结合基因注解、进化关系和序列比对 。

这种口径的公式是:

对应基因比例 = 找到猪对应基因的人类基因数 ÷ 作为分母的人类基因总数 × 100%

这里的分母尤其沉要 。若只统计蛋白质编码基因,了局与把非编码基因、假基因或尚未确认职能的基因纳入统计时分歧;若反过来以猪的基因总数为分母,得到的比例也不会一样 。

举例来说,如果某个钻研选定1000幼我类蛋白质编码基因,其中900个能找到经过确认的猪嫡系同源基因,那么该钻研口径下的对应基因比例就是90% 。这暗示“基因层面能找到对应对象”,并不暗示这900个基因的DNA序列有90%的碱基齐全一样 。

若是比力某一个基因:别离看DNA、编码区和蛋白质

当问题涉及某个具体基因、疾病通路或生理职能时,部门比力通常比给出一个全基因组数字更有意思 。此时应先确认人类基因和猪基因是否的确是对应的嫡系同源基因,再决定比力哪一段 。

  • 比力基因组DNA:蕴含表显子、内含子和调控区域时,序列长杜纂差距往往分歧 。
  • 比力编码区:只看可能翻译成蛋白质的部门,常用碱基一致率或密码子差距率 。
  • 比力蛋白质:将DNA翻译成氨基酸后进行比对,可统计齐全一样的氨基酸,也可把性质相近的代替计入“类似” 。

如果一幼我类和猪的对应编码区经过比对后,有1000个可比力的碱基,其中820个齐全一样,那么DNA一致率为82% 。若是翻译后的蛋白质有330个可比力的氨基酸,其中310个齐全一样,则蛋白质一致率为310 ÷ 330 × 100%,约为93.9% 。这两个数字能够同时出现,由于多个分歧的DNA密码子可能编码统一种氨基酸 。

蛋白质“类似度”还可能选取代替评分矩阵,将带电性质、大幼或疏水性相近的氨基酸代替视为守旧代替 。因而,蛋白质类似度通常高于严格的齐全一样率;若是没有写明评分规定,单看“类似度」剽个词很难复算 。

为什么分歧资料会给出分歧百分比

  • 比力对象分歧:全基因组、同源基因、编码区和蛋白质并非统一个分母 。
  • 参考版本分歧:基因组装版本更新后,缺口、沉复区域和基因注解都可能变动 。
  • 对齐领域分歧:只统计守旧区域,通常比纳入所有可比区域更容易得到较高一致率 。
  • 缺口处置分歧:有人排除插入和缺失,有人把它们作为差距计入 。
  • “类似”界说分歧:DNA常按碱基齐全一致推算,蛋白质则可能把守旧代替也算入 。
  • 分母分歧:以人类基由于分母、以猪基由于分母,或者以两者交集为分母,了局寓意都分歧 。

怎么正确表述一个推算了局

一个合格的了局至少应同时写出物种、数据版本、比力区域、比对规定、分母、匹配数量和百分比 。例如能够表述为:“在指定版本的两物种同源编码区中,排除缺口后统计可比碱基,齐全一致碱基占可比碱基的某个比例 。」剽样的说法比单独写“人类与猪的基因类似度是某个百分比”更正确 。

若是只是想相识总体关系,能够记� 。喝死嗪椭碚加泻芏嗫赡芏杂Φ耐椿�,部门生物学通路也拥有可比性;但“共同基因比例”“DNA序列一致率”和“蛋白质类似度”代表分歧档次的统计了局 。判断一个数字是否靠得住,关键不是数字看起来高不高,而是先看它比力了什么、分母是什么,以及哪些区域被纳入了推算 。

lu8rxkosw1gladlacf5xy3qbmodsl
[责任编纂:罗伯特·吴]

为您推荐

热点文章

杰出视频

凤凰资讯官方微信
凤凰资讯官方微信
关注更多资讯
【网站地图】