点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:生物信息“数据孤岛”是如何打破的
首页> 光明科普云> 科普资讯 > 正文

生物信息“数据孤岛”是如何打破的

来源:中国科学报2022-03-17 09:34

调查问题加载中,请稍候。
若长时间无响应,请刷新本页面

  ■记者 冯丽妃

  今年1月,依托中国科学院北京基因组研究所(国家生物信息中心)(以下简称基因组所)的国家基因组科学数据中心(NGDC)一批成果集中亮相:10篇论文相继刊发于国际生物数据库期刊《核酸研究》。对于一本顶级期刊来说,这种情况并不多见。

  一个刚成立6年的数据中心何以取得这样的成绩?近日,《中国科学报》走进基因组所,了解NGDC成长背后的秘密。

  面向国家需要,追赶国际步伐

  NGDC可追溯至2016年2月基因组所成立的生命与健康大数据中心。它的成立既是对接国家需求,也是研究所自身发展的需要。

  长期以来,全世界科学家产生的组学数据都要提交给三大数据库——美国国立生物技术信息中心(NCBI)、欧洲生物信息学研究所(EBI)、日本核酸数据库(DDBJ)。这3家于上世纪八九十年代成立的机构在2005年建立了国际核酸序列共享联盟(INSDC),形成领域内数据存储和共享使用的标准。

  我国科学家需要在发表论文时通过互联网将数据提交到这些数据库,而做科研时则需要将数据从这些数据库下载下来,科研效率经常遭遇国际带宽瓶颈的约束。同时,我国科学基金项目和重点研发计划产生的大量基因组科学数据,分散在不同研究单位和实验室,成为无法共享和进一步挖掘利用的“数据孤岛”。

  “对标国际三大数据库,建成一个永续性的生物信息存储机构,曾是我们几代生命科学研究者30年的企盼。”在1月中旬基因组所举行的NGDC年会上,中国科学院院士陈润生说。

  解决这些问题既是我国几代生命科学家的呼唤,也是年轻的基因组所内在发展的需求。

  “人类基因组计划之后,研究所作为战略科技力量,想要进一步担当国家使命,需要转型发展。”基因组所所长薛勇彪向《中国科学报》表示,当时的挑战是“没人没钱缺机制”,优势是“船小好调头”。

  为调整航向,基因组所进行了一系列学科布局与运行机制优化调整。

  例如,在学科发展上,该所将表观基因组和生物信息研究“干湿结合”,进一步布局了大数据中心;运行机制上,打破传统PI(课题组组长)模式,将分属科研和工程系列的3个团队整合到一个大数据中心,实现从“单兵作战”到“集团军作战”的转变;资源配置以任务导向为主,研究所“自带干粮”投入经费支持;考评机制上,对数据中心的工作人员打破“唯论文”考评,让更多人看到职业发展的希望。

  在此基础上,2016年2月,该所生命与健康大数据中心应运而生,并构建了组学原始数据存储归档系统(GSA)。其目标是立足中国,服务全球。

  “大数据中心从一开始就对标INSDC,并邀请该联盟专家担任国际顾问,以增加他们对大数据中心的了解和支持。”NGDC副主任、基因组所研究员章张说,在同年10月召开的全国生物信息学与系统生物学大会上,由该大数据中心发起的中国基因组学数据共享联盟得到了国内与会科学家的一致支持。

  2017年,鲍一明的加入让大数据中心团队有了学术带头人。

  “一个人单枪匹马的努力起不到多大作用,团队非常重要。”NGDC主任、基因组所研究员鲍一明对《中国科学报》说。他曾在NCBI工作16年,其间多次帮助紧急递交论文的中国科学家解决技术问题,选择回国是希望发挥更大的作用。

  “这支团队年轻、有活力,踏踏实实做事情,而且非常团结。”他说,最关键的是,大家有着共同的目标——实现中国生物信息数据存管用的自立自强。

  围绕共同的愿景,他们凝心聚力,“撸起袖子加油干”。

  在团队成员的努力下,GSA先后被爱思唯尔、威利、细胞、施普林格·自然等全球主要出版集团认可。2017年起,他们还受到INSDC邀请,作为该联盟之外的唯一一家机构参加INSDC年会并在会上作报告。

  2019年6月,我国生物学家终于迎来了企盼已久的时刻:NGDC作为首批20个国家科学数据中心之一获批成立。该中心由基因组所作为依托单位,联合中国科学院生物物理研究所和上海营养与健康研究所共同建设,旨在成为支撑我国生命科学发展、国际知名的基因组科学数据中心。

  同年11月,中央编办批复基因组所加挂“国家生物信息中心”牌子,承担国家生物信息大数据统一汇交、集中存储、安全管理与开放共享,以及前沿交叉研究和转化应用等工作。

  “能够为创新驱动和国家战略发展服务,这是一件非常值得庆祝的事情。”NGDC顾问、北京大学教授罗静初说。但他同时表示,“这并不是‘肥肉’,而是‘苦差事’”。

  主动攻关,获国内外认可

  “打着两块‘国字头’的招牌,一定要做出一点事!”鲍一明等人心里憋着一股劲儿,摩拳擦掌准备开发并启动多个前沿数据库。

  然而,新冠疫情突发而至。在研究所的部署下,该团队紧急开发新冠病毒信息库。2020年1月22日,距离春节前3天,2019新冠病毒信息库正式发布。

  该信息库整合了全球相关机构和数据库公开发布的冠状病毒基因组序列数据、元信息、学术文献等,并对不同冠状病毒株的基因组序列做了变异分析与展示。这为此后开展病毒分子溯源、追踪病毒株变异路径、制定疫情防控策略等提供了数据基础与决策支持。

  例如,2020年1月,首次收录发布由中国医学科学院病原生物学研究所提交的国内5条新冠病毒基因组序列,并与NCBI实现数据同步共享;6月,北京新发地疫情,通过基因组比对分析确定问题出现在冷链三文鱼,首次发现冷链货物污染可能是造成局部疫情暴发的病毒源头,为优化疫情常态化防控策略、实行“人物并重”的新型防控措施提供了科学依据;7月和次年1月,该中心专家全程参与世界卫生组织来华开展的新冠病毒溯源联合研究,提供了有力的数据支撑,受到国内外专家组成员的好评……

  “那段时间确实比较辛苦,经常连夜加班分析数据、整理材料、撰写报告。不过,作为‘国家队’一员,我们有责任和义务出一份力。”NGDC副主任、基因组所正高级工程师赵文明说。

  据介绍,该信息库被多家国际机构推荐使用,收到了来自国内多个机构以及美国、英国、意大利等10余个国家研究者的积极反馈。他们来信感谢:“NGDC在极短的时间内建立了一个十分优秀、令人印象深刻的信息库”“愿意与NGDC共享数据分析结果”。

  据介绍,目前新冠病毒信息库仍在保持全球最新、最完整的相关基因组数据动态更新,为国内外科学研究和合作提供有力支撑。

  汗水浇灌出荣誉。去年,研究团队的成果入选国家“十三五”科技创新成就展,并被科技部授予“全国科技系统抗击新冠肺炎疫情先进集体”称号。

  不只是在新冠病毒信息库建设方面,NGDC的科学家还“双线作战”,不断提升在国际上的可见度。

  “作为数据产出和使用大国,我国生物信息数量和用户占INSDC相关比重的20%左右,是占比最多的国家之一。这意味着中国有能力成为该联盟的一员。”鲍一明说。

  但作为后来者,加入INSDC并不容易。在鲍一明和同事的努力下,目前新冠数据资源方面,双方已在标注NGDC编号的条件下实现共享。去年,INSDC主动提出如果成为合作伙伴,希望中国科学家在数据共享和存储方面作出贡献。

  NGDC还在“一带一路”国际科学组织联盟(ANSO)的支持下,建立了以我国为主的国际生物多样性和健康大数据共享联盟(BHDB),当前已与12个国家的28个机构建立了数据共享和科研合作关系。

  务实发展,把好数据质量关

  6年来,NGDC不断夯实自身建设,已经建立了包含九大数据类型的63个数据库,形成“数据—信息—知识”一体化数据资源体系。

  鲍一明介绍,该资源体系可实现我国生物数据的安全汇交管理,同时开发了由数据可视化、序列比对、基因表达、表观遗传、基因组构成和新冠序列分析6个专题构成的生物信息在线分析平台(BIT),为我国生物数据的挖掘利用提供了重要支撑。

  例如,GSA已汇交科技项目4700个,来自近500家单位2300个用户递交的数据量超12PB,为290种国内外期刊的940篇文章提供了相关数据支撑;新冠病毒信息库目前已收录新冠病毒序列900余万条,为全球179个国家和地区150多万名访客提供数据服务,被下载数据超26亿条。

  在回顾成绩的时候,鲍一明和同事清醒地认识到,当前NGDC尚处于初级阶段,综合能力与国际一流机构仍有比较明显的差距。

  “比如数据整合和具有国际影响力的特色数据库资源有待进一步发展,大数据挖掘分析技术和能力也待加强。”鲍一明说,科技部、财政部已经给予NGDC大力资助,但与国际同类机构相比,NGDC还面临存储计算设施、人才队伍以及经费支持等方面的问题。

  尽管还存在许多限制与挑战,作为一名“后起之秀”,NGDC已连续5年被《核酸研究》评价为与NCBI、EBI并列的全球主要生物数据中心。

  “下一步,我们要坚持务实发展,在确保数据安全的前提下,弥补在数据处理、存储和检索等核心技术方面的短板,研发生物信息大数据关键核心算法和软件,增强服务能力和国际影响力。”鲍一明说。

  《中国科学报》 (2022-03-17 第1版 要闻)

[ 责编:武玥彤 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 习近平同巴西总统卢拉共同签署联合声明

  • 习近平同巴西总统卢拉共见记者

独家策划

推荐阅读
记者20日从中国航天科技集团一院获悉,该院抓总研制的长征十号系列火箭近日成功完成整流罩分离试验,标志着该系列火箭初样研制又迈出了坚实一步。
2024-11-21 09:14
作为战略性新兴产业,低空经济产业链条长,涵盖航空器研发与制造、低空飞行基础设施建设与运营、飞行服务与保障等产业,对构建现代产业体系具有重要作用。
2024-11-21 09:12
工业革命改变了世界面貌,为人类生产生活带来深远影响。当今世界,人工智能迅猛发展,推动人类社会深度变革。在此过程中,电力行业也在逐步向数字化和智能化转型。
2024-11-21 09:10
数据显示,2023年我国低空经济规模超5000亿元,增速超过33%,2030年有望达到2万亿元。2024年以来,全国已有超过26个省(区、市)将低空经济写进政府工作报告。
2024-11-21 09:09
日前,国际学术期刊《自然·通讯》在线刊发江西省农业科学院原院长颜龙安院士团队联合河北大学杜会龙教授团队的研究成果:首个稻属最全超级泛基因组图谱绘制成功。
2024-11-21 09:09
全海深光电缆绞车系统“海威GD11000”,日前随广州海洋地质调查局“海洋地质二号”船在我国南海完成了首个航次的深海调查任务。
2024-11-20 09:21
近日,中国科学院兰州化学物理研究所研究员何林团队与武汉大学教授雷爱文团队合作,在催化羰基化领域取得重要进展——成功利用一氧化碳或二氧化碳替代剧毒光气,高效合成含氮羰基化合物非对称脲。。
2024-11-20 09:24
这种菌能够迅速分解番茄、辣椒、娃娃菜等多种蔬菜尾菜,并具有促进作物生长、拮抗土传病原菌等功能特性。在此基础上,课题组进一步研发了“蔬菜尾菜+快速腐解菌+有机肥+功能菌”四位一体的原位还田技术。
2024-11-20 09:20
11月18日,在沪渝蓉高铁全线控制性咽喉工程崇太长江隧道内,我国盾构隧道智能建造V2.0技术体系正式在“领航号”盾构机成功应用
2024-11-20 09:19
19日,四川、重庆、贵州三省市同步首发动力型锂电池试运专列,这是我国铁路首次大规模试运输动力锂电池,将助力国产动力锂电池产品的全球流通。
2024-11-20 09:13
近年来,北京市延庆区大力发展低空经济,2023年相关产业产值达23.3亿元。天气渐冷,北京八达岭长城脚下,中关村延庆园内的低空经济产业园依旧热火朝天,一派繁忙景象。
2024-11-19 09:50
据最新一期《自然·化学》杂志报道,美国加州大学圣迭戈分校团队在最新研究中给出了一个涉及两种简单分子间反应的精妙解释。
2024-11-19 09:47
利用样地观测数据、空间分析和树线模型模拟,中国科学院青藏高原研究所研究员梁尔源等人系统分析了尼泊尔珠峰国家公园和安纳普纳保护区混交林树线,揭示了糙皮桦和喜马拉雅冷杉的种群更新动态和树线位置变化。
2024-11-19 09:46
机器人服务员、咖啡师、宠物……各种机器人让人目不暇接。自动载人飞行器,无人机、无人车、无人船……智能驾驶技术遍布“海陆空”。11月14日至16日,第二十六届中国国际高新技术成果交易会在广东深圳举行。
2024-11-19 04:55
近日,记者从湖北省神农架林区林业管理局野保科开展的陆生野生脊椎类动物普查中获悉,神农架现有陆生野生脊椎类动物710种,比原来的493种增加217种。
2024-11-19 05:00
北京时间11月15日23时13分,天舟八号货运飞船在文昌航天发射场由长征七号遥九运载火箭成功发射。自中国空间站建造以来,空间应用系统已在轨开展了百余项科学实验和应用试验,阶段性研究成果持续产出。
2024-11-18 10:27
中国科学院生物物理研究所王晓群研究员课题组、广东省智能科学与技术研究院张旭院士课题组和北京师范大学吴倩教授课题组合作,深入解析了人类背根神经节(DRG)发育过程中调控多种感觉神经元分化的多层级信号通路,并成功构建了人类DRG类器官(hDRGOs)模型。通过比较人类和小鼠的感觉神经元发育,研究人员发现两者在发育进程、基因表达谱和细胞亚型上存在差异。
2024-11-18 10:24
党的二十届三中全会提出,发展通用航空和低空经济。航空航天民航高校应发挥特色优势,形成“航空+”的多元化低空经济专业型人才培养模式,促进低空经济科技链、人才链、产业链的有机衔接。
2024-11-18 10:21
中北大学极端环境特种传感与测试创新研究团队成员正在围绕近期发射任务进行产品研发。日前,第28届“中国青年五四奖章”评选揭晓,中北大学极端环境特种传感与测试创新研究团队获“中国青年五四奖章集体”荣誉称号。
2024-11-18 10:16
据中国载人航天工程办公室消息,天舟七号货运飞船已于11月17日21时25分受控再入大气层。 天舟七号货运飞船于2024年1月17日在文昌航天发射场发射入轨,装载了航天员在轨驻留消耗品、推进剂、应用实(试)验装置等物资。
2024-11-18 10:14
加载更多