点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:算法自动“划重点”AI学会“抱佛脚”
首页> 科普频道> 科普头条 > 正文

算法自动“划重点”AI学会“抱佛脚”

来源:中国科学报2021-11-24 08:59

调查问题加载中,请稍候。
若长时间无响应,请刷新本页面

  预训练模型的兴起给自然语言处理(NLP)带来了“新面貌”。

  近年来,Google、Facebook、OpenAI、微软、百度等人工智能“头部玩家”推出多个颇具影响的预训练模型,并反复迭代出十多个版本。无论学术界还是业界,人们对大规模预训练模型“热情高涨”。

  日前,来自清华大学的一支研究团队提出一种简单高效的NLP学习框架。不同于当下NLP社区主流的“大规模预训练+下游任务微调”的范式,这一框架无需进行大规模预训练,同时将训练效率提升两个数量级,并在多个NLP任务上,实现了比肩甚至超出预训练模型的性能。近日,相关研究以预印本形式,在arXiv上发表。

  预训练模型的“内功”

  预训练模型在自然语言处理领域蓬勃发展,近年来在多个子方向取得了颠覆性的成果。

  “自然语言处理的‘预训练’过程,就像武侠小说中,练武之人的‘修炼内功’。”上海对外经贸大学副研究员邵浩说,“一个人要成为武林高手,需要有扎实的“内功”,内功修炼好之后,再去学各种招式就非常容易上手,并能发挥其最大效用。”

  随着深度学习的发展,模型参数显著增长,从而需要越来越大的数据集,用于充分训练模型参数。然而,因大部分NLP任务的标注成本极为高昂,尤其是句法和语义相关的任务,构建大规模标注数据集尤为困难。

  相比较而言,大规模无标注数据集相对易于构建。为更好地利用海量无标签文本数据,常规的做法是首先从这些数据中学到较好的文本表示,然后再将其用于其他任务。许多研究表明,在大规模无标注语料中训练的预训练语言模型,可以使多方面NLP任务获得显著的性能提升。

  通过海量无标注语料来预训练神经网络模型,可以让人工智能更利于下游NLP任务的完成。预训练模型的作者已经设计出了基准模型,这样,使用者就可以在自己的NLP数据集上应用该模型,而无需从头开始构建模型来解决类似的问题。尽管后续过程需要进行一些微调,但这为人们节省了大量的时间和计算资源。

  2018年,无监督的双向预训练语言模型ELMo被提出,这种上下文相关的文本表示方法在多个典型任务上表现惊艳,能有效处理一词多义问题。紧随其后,GPT,BERT等预训练语言模型相继被提出,预训练模型技术开始在NLP领域大放异彩,并在各种下游任务中遍地开花。

  任务驱动模型出场

  “预训练语言模型因其强大的性能被广泛关注,基于‘预训练—微调’的范式也成为许多NLP任务的标准方法。”清华大学交叉信息研究院助理教授、RecurrentAI联合创始人杨植麟对《中国科学报》说,“然而,当前通用语言模型的预训练成本极其高昂,这使得只有少数资源充足的研究机构或组织能够对其展开探索。”

  为解决上述问题,杨植麟团队提出的一种完全不需要预训练语言模型的高效学习框架。这一框架从通用语料中筛选出与下游任务相关的子集,并将语言建模任务与下游任务进行联合训练。

  该论文第一作者、清华大学计算机科学实验班(姚班)大四本科生姚星丞介绍说,提出任务驱动的语言模型的想法源于一个基本的观察:人类可以通过对关键信息的学习,在有限的时间和精力投入情况下,快速掌握某一任务技能。例如,在临近考试时,学生仅根据考纲复习浏览若干相关章节的要点即可应对考试,而不必学习所有可能的知识点。与之类似,预训练语言模型在某一下游任务上的优良表现,“很有可能因为来自于语料中与下游任务相关的数据”。

  基于这一判断,该团队提出任务驱动的语言模型(TLM),它仅利用从大规模通用语料中提取的少量与下游任务相关的数据,就可以取得与全量数据类似的结果。

  “相较于传统的预训练模型RoBERTa(基于BERT的改进模型,使用更大的批次和更多的数据对模型进行更长的训练),TLM仅需要约1%的训练时间与1%的语料,即可在众多NLP任务上,表现出比肩甚至超出预训练模型的性能。”姚星丞说,“我们目前也正在尝试将任务驱动的方法推广到更大规模的模型上,如GPT-3或T5。”

  跳出预训练范式

  为了从大规模通用语料中抽取关键数据,TLM以任务数据作为查询对象,用基于稀疏特征的BM25算法作为召回算法,对通用语料库进行相似数据的召回。

  “除已有的下游任务数据以外,其余的语料均通过BM25算法进行相似性匹配而自动筛选,不需要人工做额外的选择与标记。”姚星丞说。“TLM基于任务数据和召回数据,同时优化任务目标和语言建模目标,从零开始进行联合训练。”

  为了测试TLM的性能,研究人员在8项NLP分类任务上,从三个不同规模展开了对比实验。这8项任务涵盖了计算机科学、生物医药、新闻、评论等4个领域,包括了训练样本数量小于5000的低资源任务和训练样本数量大于20000的高资源任务,任务类型覆盖了话题分类,情感分类,实体关系抽取等。

  测试结果显示,和对应“预训练—微调”基准相比,TLM实现了相当甚至更优的性能。平均而言,TLM减少了两个数量级规模的训练计算量以及训练语料的规模。整体来说,预训练模型以极高的成本学习尽可能多的,和任务无关的知识,而TLM以非常低的成本,针对每个任务学习相关知识。

  “当我们有少数特定目标的任务需要解决的时候(例如希望对少量几个数据集进行研究),TLM会是非常高效的。”姚星丞说,“而需要一次性解决大量任务时(例如工业界构建一个NLP平台为多方提供相似的服务),预训练模型仍然具有优势。”

  此外,TLM是任务驱动的,所以可以给研究人员更大的自由度,从而自定义策略进行标记、序列长度、数据表示、超参数的调整等等,从而达到提高性能和效率的目的。

  “TLM的提出,让NLP研究跳脱出‘预训练—微调’范式成为可能,这有利于推动NLP研究公平化。”杨植麟解释说,预训练本身严重依赖大量的计算资源,这一限制使大多数NLP研究者只能专注于对微调算法的研究。然而微调算法的性能上限,很大程度上受预训练模型性能的约束。而TLM可以让大多数研究人员可以以较低的代价和较高的效率,基于最先进的解决方案对模型架构、损失函数、算法等方面进一步自由探索。

  杨植麟认为,未来会有更多有趣的研究可以在TLM的基础上展开。例如,如何经济地达到更大规模预训练模型的表现效果;如何提升TLM的通用性与可迁移性;可否利用TLM进行小样本或零样本学习等。此外,还可以将预训练模型和TLM结合,从而在通用性和效率之间实现更好的权衡。(张双虎)

  相关论文信息:https://arxiv.org/pdf/2111.04130.pdf

  项目地址:https://github.com/yaoxingcheng/TLM

[ 责编:赵清建 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 2026世界人形机器人运动会赛况

  • 第二十一届中国长春电影节开幕

独家策划

推荐阅读
8月22日,第二届世界人形机器人运动会在国家速滑馆开幕,16个国家的666支赛队、2056台机器人参与竞逐。与此同时,2026世界机器人大会正在北京亦庄举办,汇聚全球前沿技术与产业成果,全面展现机器人走向千行百业的发展新趋势。
2026-08-24 10:17
六氟化硫是高压电力设备不可或缺的绝缘、灭弧介质,可它偏偏是一种强温室气体。更棘手的是,现阶段又很难找到一种合适的气体完全替代它。如何尽可能不让它进入大气?这是我们一直想解决的难题。
2026-08-24 10:16
所谓数字孪生,就是把一个物理实体在虚拟世界1∶1复刻——可以是一条产线、一个车间,甚至一座工厂。在胡少雄看来,数字孪生的高阶形态,是会“自感知、自决策、自执行”的智能体,这离不开传感器、人工智能算法、通信技术协同进化。
2026-08-24 10:12
中国科学院院士、华中农业大学教授、湖北洪山实验室主任张启发提出“双水双绿”理念,用一块田既种“绿色水稻”,又养“绿色水产”,发展水稻、水产“双水”产业,做优绿色稻米、绿色小龙虾等“双绿”产品。
2026-08-24 09:56
当厘清科研人员转化风险责任边界,构建专业化技术转移制度,明确技术转移机构设立条件及主要职责,通过完善相关制度,着力解决“不愿转”“不敢转”和“不会转”的问题,充分保护科研人员投身成果转化的积极性与主动性。
2026-08-24 09:48
2013年,东正光学的创始团队在广东深圳租下第一间厂房。4年后,当工业光学与电影影像的积累具备向更广泛创作者群体转化的条件时,东正光学重返消费市场,推出Thypoch(叙)品牌。
2026-08-21 07:20
7月17日,习近平主席在2026世界人工智能大会暨人工智能全球治理高级别会议开幕式上发表题为《携手构建公正合理的全球人工智能治理体系》的主旨讲话。
2026-08-21 02:00
近期,因冬季寒区试车而闻名的边疆小城——黑龙江黑河迎来了反季节试车热潮。在试运行的全球规模最大四季低温汽车试验场内,零下30摄氏度的室内一片冰天雪地,来自多个车企与零部件厂商的测试车辆正自如驰骋,借助静态低温舱、冰雪圆环、多角度对开坡道等专业场景展开性能测试。
2026-08-21 03:40
最新统计数据显示,截至2026年7月底,江苏省光伏发电累计装机容量突破1亿千瓦,占全省电力总装机的比重超38%,成为全省第一大电源。图为8月19日,在扬州市邗江区公道镇,电力运维工人在检查渔光互补发电设备运行情况。
2026-08-21 03:40
近期,南华大学核科学技术学院韦悦周教授团队从稀土矿渣中直接分离得到高纯度的阿尔法核素铅-212及其前体核素钍-228,并成功实现了单批次从公斤级稀土矿渣中分离提取158微居里的铅-212/铋-212。
2026-08-21 03:50
近日,中国科学院海洋研究所联合美国加州大学圣巴巴拉分校等机构,在南极冰盖近期质量变化的气候驱动机制研究方面取得重要进展。研究发现,2021—2023年热带暖池持续增暖激发向南极传播的罗斯贝波列,形成东南极南北向偶极环流,重组水汽输送并增强区域降雪,从而暂时减缓了南极冰盖质量损失。
2026-08-21 03:50
习近平总书记在国家科学技术奖励大会、两院院士大会、中国科协第十一次全国代表大会上的讲话中指出,我国正从全球科技参与者、贡献者向开拓者、引领者加速转变,成为创新力上升最快的国家之一。
2026-08-20 02:10
中国信息通信研究院18日发布的《具身智能训练场研究报告(2026年)》显示,随着各部门密集部署人形机器人中试基地和训练场建设,我国具身智能训练场已经成为关键基础设施,形成规模化集群化布局。
2026-08-20 02:10
19日,朱雀三号遥二运载火箭在东风商业航天创新试验区发射升空。火箭一子级按预定程序成功软着陆于甘肃省民勤县朱雀三号着陆场坪,二子级将搭载的鸿鹄03星顺利送入预定轨道,飞行试验任务取得圆满成功,为后续开展回收箭体检修维护、复用飞行和商业化应用奠定基础。本次任务是继7月10日长征十号乙运载火箭一子级海上网系成功回收后,我国首次成功实施重复使用运载火箭一子级着陆腿方式陆地可控回收,标志着我国重复使用火箭技术取得重大突破。
2026-08-20 04:00
19日从中国科学技术协会了解到,为大力弘扬科学精神,营造风清气正的学术生态,加快建设世界一流科技期刊,中国科技期刊卓越行动计划(以下简称“卓越计划”)入选期刊及集群共同倡议“恪守科研诚信和学术道德”。
2026-08-20 04:00
近几个月来,北京大模型捷报频传:Kimi K3发布当前最大开源模型,综合智能水平直逼国际两大尖端闭源模型;小米MiMo-V2.5在通用图形处理器上实现推理速度大幅突破,并登顶全球多模型聚合平台公布的大模型调用量榜首;字节跳动发布新一代视频生成模型Seedance 2.5,在生成时长、多模态理解、编辑精度等维度实现全面升级。
2026-08-20 04:00
“或为近150年最强”“或为自1951年以来最强气候事件”……最近,关于2026年形成超强厄尔尼诺的新闻很受关注。预计赤道中东太平洋海表温度将继续维持波动上升态势,于今年11月至12月前后达到本次事件峰值。
2026-08-19 09:51
宁夏平原,黄河水沿着叶脉般的渠道淌进田间。”  青铜峡灌区是全国6个特大型灌区之一,是世界灌溉工程遗产宁夏引黄古灌区的重要组成部分。”  完成全域一体的信息化建设,这是青铜峡灌区从“治水”走向“智水”的关键一步。
2026-08-19 09:46
直面现实困境,1989年青海省委作出“绿化南北两山,改善西宁生态环境”的战略决策,西宁市积极响应。18年间,他在山上劳动超3000天,带领群众栽种树木近3000万株,让3.75万亩荒山披绿,筑起守护西宁的生态屏障。
2026-08-19 09:45
主刊收到投稿400余篇,已出版60篇,其中包括多个我国科研团队的最新重要原创成果……在日前举行的Vita期刊首期发布暨生命科学开放联盟一周年交流会上,Vita(《生命》)系列期刊正式亮相。
2026-08-19 09:45
加载更多