2000--A 题 DNA 序列分类

由天下分享时间：2025/3/15 12:49:02 加入收藏我要投稿点赞

2000 年赛题

A 题 DNA 序列分类

2000 年6 月，人类基因组计划中DNA 全序列草图完成，预计2001 年可以完成精确的全序列图，此后人类将拥有一本记录着自身生老病死及遗传进化的全部信息的“天书”。这本大自然写成的“天书”是由4 个字符A，T，C，G 按一定顺序排成的长约30 亿的序列，其中没有“断句”也没有标点符号，除了这4 个字符表示4 种碱基以外，人们对它包含的“内容”知之甚少，难以读懂。破译这部世界上最巨量信息的“天书”是二十一世纪最重要的任务之一。在这个目标中，研究DNA 全序列具有什么结构，由这4 个字符排成的看似随机的序列中隐藏着什么规律，又是解读这部天书的基础，是生物信息学（Bioinformatics）最重要的课题之一。虽然人类对这部“天书”知之甚少，但也发现了DNA 序列中的一些规律性和结构。例如，在全序列中有一些是用于编码蛋白质的序列片段，即由这4 个字符组成的64 种不同的3 字符串，其中大多数用于编码构成蛋白质的20 种氨基酸。又例如，在不用于编码蛋白质的序列片段中，A和T 的含量特别多些，于是以某些碱基特别丰富作为特征去研究DNA 序列的结构也取得了一些结果。此外，利用统计的方法还发现序列的某些片段之间具有相关性，等等。这些发现让人们相信，DNA 序列中存在着局部的和全局性的结构，充分发掘序列的结构对理解DNA 全序列是十分有意义的。目前在这项研究中最普通的思想是省略序列的某些细节，突出特征，然后将其表示成适当的数学对象。这种被称为粗粒化和模型化的方法往往有助于研究规律性和结构。

作为研究DNA 序列的结构的尝试，提出以下对序列集合进行分类的问题：

1）下面有20 个已知类别的人工制造的序列，其中序列标号1—10 为A 类，11-20 为B 类。请从中提取特征，构造分类方法，并用这些已知类别的序列，衡量你的方法是否足够好。然后用你认为满意的方法，对另外20 个未标明类别的人工序列（标号21—40）进行分类，把结果用序号（按从小到大的顺序）标明它们的类别（无法分类的不写入）： A 类； B 类。

请详细描述你的方法，给出计算程序。如果你部分地使用了现成的分类方法，也要将方法名称准确注明。

这40 个序列放在如下地址的网页上，用数据文件Art-model-data 标识，供下载：网易网址：www.163.com 教育频道在线试题；教育网： www.cbi.pku.edu.cn News mcm2000 教育网： www.csiam.edu.cn/mcm

[注] 目前这些网站上不一定还保存有该文件，这里将该文件的内容附于本题后。

2）在同样网址的数据文件Nat-model-data 中给出了182 个自然DNA 序列，它们都较长。用你的分类方法对它们进行分类，像1）一样地给出分类结果。

提示：衡量分类方法优劣的标准是分类的正确率，构造分类方法有许多途径，例如提取序列的某些特征，给出它们的数学表示：几何空间或向量空间的元素等，然后再选择或构造适合这

种数学表示的分类方法；又例如构造概率统计模型，然后用统计方法分类等。（北京工业大学孟大志提供）

[附]数据文件Art-model-data 的内容如下：

附录1：已知类别的序列（用于提取特征及检验方法） A 类10 个序列：

>aggcacggaaaaacgggaataacggaggaggacttggcacggcattacacggaggacgaggtaaaggaggcttgtctac ggccggaagtgaagggggatatgaccgcttggaattgtctg

>cggaggacaaacgggatggcggtattggaggtggcggactgttcggggaattattcggtttaaacgggacaaggaaggc ggctggaacaaccggacggtggcagcaaaggaacggacacg

>gggacggatacggattctggccacggacggaaaggaggacacggcggacatacacggcggcaacggacggaacggagga aggagggcggcaatcggtacggaggcggcggacggacggag

>atggataacggaaacaaaccagacaaacttcggtagaaatacagaagcttagatgcatatgttttttaaataaaatttg tattattatggtatcataaaaaaaggttgcgagataacata

>cggctggcggacaacggactggcggattccaaaaacggaggaggcggacggaggctacaccaccgtttcggcggaaagg cggagggctggcaggaggctcattacggggagcggaggcgg

>atggaaaattttcggaaaggcggcaggcaggaggcaaaggcggaaaggaaggaaacggcggatatttcggaagtggata ttaggagggcggaataaaggaacggcggcacaaaggaggcg

>atgggattattgaatggcggaggaagatccggaataaaatatggcggaaagaacttgttttcggaaatggaaaaaggac taggaatcggcggcaggaaggatatggaggcggaaggacgg

>atggccgatcggcttaggctggaaggaacaaataggcggaattaaggaaggcgttctcgcttttcgacaaggaggcgga ccataggaggcggattaggaacggttatgaggaggactcgg

>atggcggaaaaaggaaatgtttggcatcggcgggctccggcaactggaggttcggccatggaggcgaaaatcgtgggcg gcggcagcgctggccggagtttgaggagcgcggcacaatgt

>tggccgcggaggggcccgtcgggcgcggatttctacaagggcttcctgttaaggaggtggcatccaggcgtcgcacgct cggcgcggcaggaggcacgcgggaaaaaacggggaggcggt B 类10 个序列：

>gttagatttaacgttttttatggaatttatggaattataaatttaaaaatttatattttttaggtaagtaatccaacgt ttttattactttttaaaattaaatatttatttaaaatccag

>gtttaattactttatcatttaatttaggttttaattttaaatttaatttaggtaagatgaatttggttttttttaaggt agttatttaattatcgttaaggaaagttaaaatctaagatt

>gtattacaggcagaccttatttaggttattattattatttggattttttttttttttttttttaagttaaccgaattat tttctttaaagacgttacttaatgtcaatgctttatgcagg

>gttagtcttttttagattaaattattagattatgcagtttttttacataagaaaatttttttttcggagttcatattct aatctgtctttattaaatcttagagatattatccgttaatt

>gtattatatttttttatttttattattttagaatataatttgaggtatgtgtttaaaaaaaattttttttttttttttt ttttttttttttttaaaatttataaatttaaattttaaact

>gttatttttaaatttaattttaattttaaaatacaaaatttttactttctaaaattggtctctggatcgataatgtaaa cttattgaatctatagaattacattattgattttttccaga

>gtatgtctatttcacggaagaatgcaccactatatgatttgaaattatctatggctaaaaaccctcagtaaaatcaatc cctaaacccttaaaaaacggcggcctatcccgtcagtcgag

>gttaattatttattccttacgggcaattaattatttattacggttttatttacaattttttttttttgtcctatagaga aattacttacaaaacgttattttacatacttattttttgtc

>gttacattatttattattatccgttatcgataattttttacctcttttttcgctgagtttttattcttactttttttct tctttatataggatctcatttaatatcttaatttttcttag

>gtatttaactctctttactttttttttcactctctacattttcatcttctaaaactgtttgatttaaacttttgtttct ttaaggattttttttacttatcctctgttatgtttatttag 附录2：测试集（人工制造） 1:

tttagctcagtccagctagctagtttacaatttcgacaccagtttcgcaccatcttaaatttcgatccgtaccgtaatttagcttagatttggatttaaaggatttagattgacc 2:

tttagtacagtagctcagtccaagaacgatgtttaccgtaacdgtqacgtaccgtacgctaccgttaccggattccggaaagccgattaaggaccgatcgaaaggga 3:

cgggcggatttaggccgacggggacccgggattcgggacccgaggaaattcccggattaaggtttagcttcccgggatttagggcccggatggctgggacccgc 4:

tttagctagctactttagctatttttagtagctagccagcctttaaggctagctttagctagcattgttctttattgggacccaagttcgacttttacgatttagttttgaccgta 5:

gaccaaaggtgggctttagggacccgatgctttagtcgcagctggaccagttccccagggtattaggcaaaagctgacgggcaattgcaatttaggcttaggccag 6:

gatttactttagcatttttagctgacgttagcaagcattagctttagccaatttcgcatttgccagtttcgcagctcagttttaacgcgggatctttagcttcaagctttttacg 7:

ggattcggatttacccggggattggcggaacgggacctttaggtcgggacccattaggagtaaatgccaaaggacgctggtttagccagtccg5ttaaggcttagg 8:

tccttagatttcagttactatatttgacttacagtctttgagatttcccttacgattttgacttaaaatttagacgttagggcttatcagttatggattaatttagcttattttcgaga 9:

ggccaattccggtaggaaggtgatggcccgggggttcccgggaggatttaggctgacgggccggccatttcggtttagggagggccgggacgcgttagggacg 10:

cgctaagcagctcaagctcagtcagtcacgtttgccaagtcagtaatttgccaaagttaaccgttagctgacgctgaacgctaaacagtattagctgatgactcgtacg 11:

ttaaggacttaggctttagcagttactttagtttagttccaagctacgtttacgggaccagatgctagctagcaatttattatccgtattaggcttaccgtaggtttagcggt 12:

tgctaccgggcagtctttaacgtagctaccgtttagtttgggcccagccttgcggtgtttcggattaaattcgttgtcagtcgctctrtgggtttagtcattcccaaaaggt 13:

cagttagctgaatcgtttagccatttgacgtaaacatgattttacgtacgtaaattttagccctgacgtttagctaggaatttatgctgacgtagcgatcgactttagcacc 14:

cggttagggcaaaggttggatttcgacccagggggaaagcccgggacccgaacccagggctttagcgtaggctgacgctaggcttaggttggaacccggaaag 15:

gcggaagggcgtaggttthgggatgcttagccgtaggctagctttcgacacgatcgattcgcaccacaggataaaagttaagggaccggtaagtcgcggtagccg 16:

ctagctacgaacgctttaggcgcccccgggagtagtcgttaccgttagtatagcagtcgcagtcgcaattcgcaaaagtccccagctttagccccagagtcgacgct

2000--A 题 DNA 序列分类

2000年赛题A题DNA序列分类2000年6月，人类基因组计划中DNA全序列草图完成，预计2001年可以完成精确的全序列图，此后人类将拥有一本记录着自身生老病死及遗传进化的全部信息的“天书”。这本大自然写成的“天书”是由4个字符A，T，C，G按一定顺序排成的长约30亿的序列，其中没有“断句”也没有标点符号，除了这4个字符表示4种碱基以

推荐度：

点击下载文档文档为doc格式

2000--A 题 DNA 序列分类

2000--A 题 DNA 序列分类

相关推荐文档

精选图文

热门排序

推荐文章

热门标签

相关文章列表