点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:算法自动“划重点”AI学会“抱佛脚”
首页> 科普频道> 科普头条 > 正文

算法自动“划重点”AI学会“抱佛脚”

来源:中国科学报2021-11-24 08:59

调查问题加载中,请稍候。
若长时间无响应,请刷新本页面

  预训练模型的兴起给自然语言处理(NLP)带来了“新面貌”。

  近年来,Google、Facebook、OpenAI、微软、百度等人工智能“头部玩家”推出多个颇具影响的预训练模型,并反复迭代出十多个版本。无论学术界还是业界,人们对大规模预训练模型“热情高涨”。

  日前,来自清华大学的一支研究团队提出一种简单高效的NLP学习框架。不同于当下NLP社区主流的“大规模预训练+下游任务微调”的范式,这一框架无需进行大规模预训练,同时将训练效率提升两个数量级,并在多个NLP任务上,实现了比肩甚至超出预训练模型的性能。近日,相关研究以预印本形式,在arXiv上发表。

  预训练模型的“内功”

  预训练模型在自然语言处理领域蓬勃发展,近年来在多个子方向取得了颠覆性的成果。

  “自然语言处理的‘预训练’过程,就像武侠小说中,练武之人的‘修炼内功’。”上海对外经贸大学副研究员邵浩说,“一个人要成为武林高手,需要有扎实的“内功”,内功修炼好之后,再去学各种招式就非常容易上手,并能发挥其最大效用。”

  随着深度学习的发展,模型参数显著增长,从而需要越来越大的数据集,用于充分训练模型参数。然而,因大部分NLP任务的标注成本极为高昂,尤其是句法和语义相关的任务,构建大规模标注数据集尤为困难。

  相比较而言,大规模无标注数据集相对易于构建。为更好地利用海量无标签文本数据,常规的做法是首先从这些数据中学到较好的文本表示,然后再将其用于其他任务。许多研究表明,在大规模无标注语料中训练的预训练语言模型,可以使多方面NLP任务获得显著的性能提升。

  通过海量无标注语料来预训练神经网络模型,可以让人工智能更利于下游NLP任务的完成。预训练模型的作者已经设计出了基准模型,这样,使用者就可以在自己的NLP数据集上应用该模型,而无需从头开始构建模型来解决类似的问题。尽管后续过程需要进行一些微调,但这为人们节省了大量的时间和计算资源。

  2018年,无监督的双向预训练语言模型ELMo被提出,这种上下文相关的文本表示方法在多个典型任务上表现惊艳,能有效处理一词多义问题。紧随其后,GPT,BERT等预训练语言模型相继被提出,预训练模型技术开始在NLP领域大放异彩,并在各种下游任务中遍地开花。

  任务驱动模型出场

  “预训练语言模型因其强大的性能被广泛关注,基于‘预训练—微调’的范式也成为许多NLP任务的标准方法。”清华大学交叉信息研究院助理教授、RecurrentAI联合创始人杨植麟对《中国科学报》说,“然而,当前通用语言模型的预训练成本极其高昂,这使得只有少数资源充足的研究机构或组织能够对其展开探索。”

  为解决上述问题,杨植麟团队提出的一种完全不需要预训练语言模型的高效学习框架。这一框架从通用语料中筛选出与下游任务相关的子集,并将语言建模任务与下游任务进行联合训练。

  该论文第一作者、清华大学计算机科学实验班(姚班)大四本科生姚星丞介绍说,提出任务驱动的语言模型的想法源于一个基本的观察:人类可以通过对关键信息的学习,在有限的时间和精力投入情况下,快速掌握某一任务技能。例如,在临近考试时,学生仅根据考纲复习浏览若干相关章节的要点即可应对考试,而不必学习所有可能的知识点。与之类似,预训练语言模型在某一下游任务上的优良表现,“很有可能因为来自于语料中与下游任务相关的数据”。

  基于这一判断,该团队提出任务驱动的语言模型(TLM),它仅利用从大规模通用语料中提取的少量与下游任务相关的数据,就可以取得与全量数据类似的结果。

  “相较于传统的预训练模型RoBERTa(基于BERT的改进模型,使用更大的批次和更多的数据对模型进行更长的训练),TLM仅需要约1%的训练时间与1%的语料,即可在众多NLP任务上,表现出比肩甚至超出预训练模型的性能。”姚星丞说,“我们目前也正在尝试将任务驱动的方法推广到更大规模的模型上,如GPT-3或T5。”

  跳出预训练范式

  为了从大规模通用语料中抽取关键数据,TLM以任务数据作为查询对象,用基于稀疏特征的BM25算法作为召回算法,对通用语料库进行相似数据的召回。

  “除已有的下游任务数据以外,其余的语料均通过BM25算法进行相似性匹配而自动筛选,不需要人工做额外的选择与标记。”姚星丞说。“TLM基于任务数据和召回数据,同时优化任务目标和语言建模目标,从零开始进行联合训练。”

  为了测试TLM的性能,研究人员在8项NLP分类任务上,从三个不同规模展开了对比实验。这8项任务涵盖了计算机科学、生物医药、新闻、评论等4个领域,包括了训练样本数量小于5000的低资源任务和训练样本数量大于20000的高资源任务,任务类型覆盖了话题分类,情感分类,实体关系抽取等。

  测试结果显示,和对应“预训练—微调”基准相比,TLM实现了相当甚至更优的性能。平均而言,TLM减少了两个数量级规模的训练计算量以及训练语料的规模。整体来说,预训练模型以极高的成本学习尽可能多的,和任务无关的知识,而TLM以非常低的成本,针对每个任务学习相关知识。

  “当我们有少数特定目标的任务需要解决的时候(例如希望对少量几个数据集进行研究),TLM会是非常高效的。”姚星丞说,“而需要一次性解决大量任务时(例如工业界构建一个NLP平台为多方提供相似的服务),预训练模型仍然具有优势。”

  此外,TLM是任务驱动的,所以可以给研究人员更大的自由度,从而自定义策略进行标记、序列长度、数据表示、超参数的调整等等,从而达到提高性能和效率的目的。

  “TLM的提出,让NLP研究跳脱出‘预训练—微调’范式成为可能,这有利于推动NLP研究公平化。”杨植麟解释说,预训练本身严重依赖大量的计算资源,这一限制使大多数NLP研究者只能专注于对微调算法的研究。然而微调算法的性能上限,很大程度上受预训练模型性能的约束。而TLM可以让大多数研究人员可以以较低的代价和较高的效率,基于最先进的解决方案对模型架构、损失函数、算法等方面进一步自由探索。

  杨植麟认为,未来会有更多有趣的研究可以在TLM的基础上展开。例如,如何经济地达到更大规模预训练模型的表现效果;如何提升TLM的通用性与可迁移性;可否利用TLM进行小样本或零样本学习等。此外,还可以将预训练模型和TLM结合,从而在通用性和效率之间实现更好的权衡。(张双虎)

  相关论文信息:https://arxiv.org/pdf/2111.04130.pdf

  项目地址:https://github.com/yaoxingcheng/TLM

[ 责编:赵清建 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 福建长汀中复村:红色热土绘新卷

  • “大美中国·西部如歌”国际音乐故事会在重庆举行

独家策划

推荐阅读
刘文郡:中国启动“人工智能+”行动,通过协同推进传统产业改造升级、新兴产业培育壮大与未来产业前瞻布局,让人工智能深度赋能千行百业。中国相继提出《全球人工智能治理倡议》《“人工智能+”国际合作倡议》,发布《人工智能能力建设普惠计划》《人工智能合作发展行动计划》,倡议成立世界人工智能合作组织。
2026-07-27 09:31
7月26日18时,水利部和中国气象局联合发布红色山洪灾害气象预警,江西南部、广东中北部局地发生山洪灾害可能性很大(红色预警)。涂勇介绍,主汛期山区降雨突发性强、峡谷汇水迅猛,进山务必提前关注山洪、暴雨预警,收到预警应立即取消行程。
2026-07-27 09:29
7月26日凌晨,今年第12号台风“红霞”在广东惠州市惠东县平海镇沿海登陆。”  针对台风远距离水汽输送导致的暴雨预报难题,气象部门采用集合预报方法,通过多个模式、多个初始场的集成分析,量化预报的不确定性。
2026-07-27 09:28
眼下正是小龙虾上市的季节,走进安徽省滁州市全椒县十字镇陈浅村潘氏龙虾万亩养殖基地,养殖户们正下田捕捞小龙虾。当前,全椒县稻虾综合种养面积36.5万亩,小龙虾年产量5.5万吨,稻虾全产业链综合产值34亿元、从业人数4万多人,小龙虾成了乡村振兴的主导产业之一。
2026-07-27 09:28
光明日报武汉7月26日电 记者王建宏、张锐从华中农业大学获悉,该校熊立仲教授团队近日鉴定出一个名为“ROAD1”的稻属特异抗旱孤儿基因,并发现携带这个功能等位基因的水稻在田间干旱条件下产量较对照显著提高。
2026-07-27 09:27
光明日报北京7月26日电 记者张胜从自然资源部获悉,每年的7月26日是联合国教科文组织确立的“世界红树林日”。自然资源部数据显示,自《红树林保护修复专项行动计划(2020—2025年)》印发实施以来,我国完成新营造红树林约1.16万公顷(17.4万亩),是全球少数红树林面积持续增加的国家之一。
2026-07-27 09:27
国家药监局近日批准全球首个选择性食欲素2型受体激动剂上市,用于治疗16岁及以上青少年和成人1型发作性睡病。该药为原创靶点、新机制罕见病治疗药物,在中国、美国、日本、欧盟同步申报,我国率先完成审批,实现全球“首报首发”的历史性突破。
2026-07-24 08:55
记者从市场监管总局了解到,国际电工委员会智能制造系统委员会近日发布IEC SRD 63459:2026《智能制造用例模板》国际标准。为此,国际电工委员会智能制造系统委员会于2019年成立首个工作组,组织各国专家制定国际统一的智能制造用例模板,以统一的方式描述、存储和使用用例。
2026-07-24 08:51
23日20时,我国在西昌卫星发射中心使用长征三号乙运载火箭,成功将天链二号06星发射升空,卫星顺利进入预定轨道,发射任务取得圆满成功。
2026-07-24 08:50
王虹、邓煜与其他两位数学家共同获得菲尔兹奖,这是令国人振奋的消息,也是中国数学家感到自豪的时刻。邓煜的另一项研究,是与合作者成功建立了三维波动方程吉布斯测度的不变性,将概率论方法系统性地引入波动方程研究。
2026-07-24 08:49
记者从北京大学获悉,2026年国际数学家大会23日在美国费城开幕。王虹,本科就读于北京大学数学科学学院,获理学学士学位;2014年相继取得巴黎综合理工学院工程师学位与巴黎-萨克雷大学硕士学位;后于麻省理工学院完成博士学位。
2026-07-24 08:48
7月22日,美国佛蒙特大学研究团队在《自然》杂志发表论文称,他们在北美鲶鱼体内发现一种可传染的黑色素瘤。换言之,肿瘤细胞本身就是“感染因子”,如同寄生虫一般,从一条鱼传到另一条鱼。这些带病的鲶鱼,正为科学界提供一个观察癌症演化的难得机会。
2026-07-23 09:57
《自然》杂志22日发表了一项天文学研究,可能揭示了人类对首个已知的系外卫星(exosatellite)的观测。在三层等级系统中,一颗恒星周围有一颗伴星,如行星或褐矮星,而第三个天体围绕伴星,这第三个天体可称为系外卫星。
2026-07-23 09:57
生物腐烂是生态系统养分循环的关键过程,但腐烂区域同时也是病原微生物高度活跃、可能对活体植物造成侵害的“危险区”。
2026-07-23 09:49
习近平总书记在国家科学技术奖励大会、两院院士大会、中国科协第十一次全国代表大会上的讲话中指出,“科学的未来在青年”,强调“要把青年科技人才队伍建设作为一项战略工程,全方位做好培养、引进、使用工作”。
2026-07-23 09:49
黄瓜是受到全球广泛喜爱的蔬菜,它源自喜马拉雅山脉南麓,由其野生祖先驯化而来,历经2000余年的传播扩散,遍布世界。中国科学院院士、崖州湾国家实验室副主任钱前评价,该研究为黄瓜分子设计育种提供了坚实支撑,兼具重要基础科学价值与育种应用前景。
2026-07-23 09:48
中国水稻研究所研究员王克剑团队近日在杂交水稻育种领域取得重要进展——成功研发出克隆效率稳定超过99%、结实完全正常的一系法杂交水稻,团队将其命名为“一系1号”。图为团队创制的无融合生殖株系在试验田大群体种植下表现出的克隆效率与结实率情况。
2026-07-22 09:35
今年新增农业机器人、盐碱地科学与工程、智慧渔业三大新农科专业,分别由江苏大学、山东农业大学、宁波大学首批开设,为涉农人才培养开辟了新跑道。
2026-07-22 09:31
这场举世瞩目的盛会,凝聚共识,密集发布国际合作倡议与行动计划,为促进全球人工智能朝着向上向善、造福人类的方向发展注入了更多新动能。
2026-07-22 09:29
虽然现阶段机器人能做的事还很有限,但这种“人机搭档”的新模式,让我们的生活服务向高品质、多样化和便利化发展。我想,这就是科技落地的意义吧。
2026-07-22 09:28
加载更多