点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:“看图作文”,机器也能做到
首页> 科普频道> 科普头条 > 正文

“看图作文”,机器也能做到

来源:《中国科学报》2021-01-21 10:09

调查问题加载中,请稍候。
若长时间无响应,请刷新本页面

  向电脑机器里上传一幅“有一只小熊玩偶和一堆积木”的图画,询问机器:“积木在小熊的哪边?”机器快速做出回答:“积木在小熊的左边。”——这是预训练模型“文汇”的典型应用案例。

  近日,北京智源人工智能研究院(以下简称智源研究院)发布面向认知的超大规模新型预训练模型“文汇”,旨在探索解决当前大规模自监督预训练模型不具有认知能力的问题。这一项目由智源研究院发起的“悟道”攻关团队完成,团队成员包括来自智源研究院、阿里巴巴、清华大学、中国人民大学、中国科学院、搜狗、智谱·AI、循环智能等单位的科研骨干。

  “‘文汇’模型有针对性地设计了多任务预训练的方法,可以同时学习‘文到文、图到文以及图文到文’等多项任务,实现对多个不同模态的概念理解。”智源研究院院长、北京大学信息技术学院教授黄铁军介绍说。

  让机器理解自然语言

  OpenAI是由美国硅谷诸多科技公司负责人联合建立的人工智能非营利组织,其主要目标包括制造“通用”机器人和使用自然语言的聊天机器人等。

  在现实世界里,人与人之间交流用的是自然语言。所谓自然语言,通常是指一种自然地随文化演化的语言,例如汉语、英语、日语等。

  自然语言是人类智慧的结晶,也是人类交流和思维的主要工具。但要让机器也像人一样自由地用自然语言交流,却是非常困难的事。这要求机器像人类一样认识现实世界,像人类一样学会思考。但是,显然目前的机器还无法做到。

  人工智能在发展进程中,正好遇到自然语言处理这只“拦路虎”。可以说,自然语言处理是人工智能中最为困难的问题之一。

  人类的知识学习与积累是一个复杂且长期的过程。青少年时期,人们不仅主动语文、数学、物理等知识,还通过游戏、生活等经历在大脑中不断积攒知识。长大后,人类操作计算机时,会利用此前的知识背景,同时融合新的知识体系。而一个毫无知识储备的人,则很难理解这一切。

  受此启发,研究人员为人工智能建立“预训练模型”,模仿人类学习积累的过程。当自然语言处理的知识储备逐渐增多,人工智能也随之更加智能,帮助科学家更好地开展任务处理。

  2020年5月,OpenAI发布了迄今为止全球规模最大的预训练模型GPT-3。从此,超大规模预训练模型就成为人工智能领域研究的热点。今年1月初,OpenAI又发布了DALL·E和CLIP两个大规模预训练模型,用于文本与图像链接处理。

  据智源研究院学术副院长、清华大学计算机系教授唐杰介绍,此次发布的“文汇”模型,与DALL·E和CLIP这两个预训练模型类似,参数规模达113亿,仅次于DALL·E模型的120亿参数量,是目前我国规模最大的预训练模型,且已实现与国际领先预训练技术的并跑。

  破解机器常识认知难题

  近年来,OpenAI、谷歌、脸书等国际IT公司,都在持续推动大规模预训练模型的快速发展。

  但唐杰指出,虽然GPT-3模型在多项任务中表现出色,却存在没有常识、不具有认知能力等问题。例如,如果向GPT-3模型提问:“长颈鹿有几只眼睛?”它的答案是:“两只眼睛。”此时,如果再继续提问:“我的脚有几只眼睛?”GPT-3的回答恐怕就不那么尽如人意,因为答案依然是“两只眼睛”。

  “这就不符合人类常识。”唐杰表示,GPT-3等超大型预训练模型在处理复杂的认知推理任务时,例如开放对话、基于知识的问答、可控文本生成等,结果仍然与人类智能有较大差距。

  为推动研发我国自主的大规模预训练模型,解决目前国际主流模型存在的问题,2020年10月,智源研究院启动了新型超大规模预训练模型研发项目“悟道”。

  黄铁军介绍说,智源研究院是北京市成立的一个新型研发机构,旨在支持科学家勇闯人工智能科技前沿“无人区”,挑战最基础的问题和最关键的难题,推动人工智能理论、方法、工具、系统和应用取得变革性、颠覆性突破。

  此次发布的面向认知的超大规模新型预训练模型“文汇”,是“悟道”项目的一期研发成果,用于自动生成图片、文字以及视频,具有初级认知能力。同时,“文汇”模型有针对性地设计了多任务预训练的方法,可以同时学习“文到文、图到文以及图文到文”等多项任务,实现对多个不同模态的概念理解。

  “经过预训练的‘文汇’模型,不需要进行微调就可以完成‘用图生文’等任务;对模型进行微调则可以灵活地接入视觉问答、视觉推理等任务。”黄铁军解释说。

  唐杰也表示,“文汇”模型不仅使用数据驱动的方法来建构预训练模型,还将用户行为、常识及认知联系起来,主动“学习”与创造。本次发布的“文汇”模型可以完成“用图生文”等任务,具有一定的认知能力。

  据介绍,目前OpenAI也在研发更大规模的预训练模型GPT-4参数。唐杰认为,未来,GPT-4参数又会增大至少10倍,而且处理的数据将会更加多模态,能够处理文字、图像、视觉、声音等。

  可完成多种图文生成任务

  据介绍,“文汇”作为面向认知的大规模预训练模型,研究人员在研发过程中,提出了针对多模态认知生成的大规模预训练的架构。

  对于上传图像的处理,研究人员进行了切块并对块提取特征的处理。这些特征以及对应的位置编码,可以让图像和文本组合在一起送入模型,从而实现对图像的理解。这让“文汇”模型能够完成多种图文生成任务。

  打个比方,如果研究人员将一张身着旗袍女子的照片上传给“文汇”,在商场场景下,“文汇”微调参数后模型将给出如下描述:“旗袍是一种古典的服饰,它能够彰显出女性的优雅、知性和美丽。这款旗袍采用了经典的圆领设计,穿着舒适自在;精致的刺绣工艺,展现出华贵和大气……”而如果上传一张建筑图像,同时配上提示“走进平定县宋家庄村,映入眼帘的是”,“文汇”模型将给出相应描述:“一座座古色古香的明清建筑,这里有着深厚的历史文化底蕴和独特的民俗风情。走进村子,就像走进了一个童话故事里的世外桃源……”

  “文汇”可谓“望图生义”,这显示了“文汇”模型在常识认知和“用图生文”方面的强大功能。

  不仅如此,目前,“文汇”模型已有四个样例应用可用于展示模型效果,包括基于上传图片的开放域问答、用语言操作数据可视化、基于预训练语言模型的诗词创作应用、可控人设的开放域问答等。

  唐杰表示,现在“悟道”项目研究团队正在视觉等更广泛的范围内,对大规模自监督预训练方法开展探索研究,已经启动了四类大规模预训练模型研制,包括“文源”(以中文为核心的超大规模预训练语言模型)、“文汇”(面向认知的超大规模新型预训练模型)、“文澜”(超大规模多模态预训练模型)和“文溯”(超大规模蛋白质序列预训练模型)。

  而在2020年11月14日,智源研究院已发布了“文源”(以中文为核心的超大规模预训练语言模型)第一阶段26亿参数规模的中文语言模型。

  黄铁军表示,下一步智源研究院将联合优势单位加快四类大规模预训练模型的研发进度,特别是“文汇”模型,未来将着力在多语言、多模态条件下,提升完成开放对话、基于知识的问答、可控文本生成等复杂认知推理任务的能力,使其更加接近人类水平。(郑金武)

[ 责编:张梦凡 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 海南白沙:兰花产业助力乡村振兴

  • 对口援疆助力戈壁兴建智慧农业植物工厂

独家策划

推荐阅读
据中国载人航天工程办公室消息,根据计划安排,神舟二十号航天员乘组将于近日择机实施第二次出舱活动。目前,空间站组合体运行稳定,神舟二十号航天员乘组在轨工作已满两个月,身心状态良好,已做好出舱活动各项准备工作。
2025-06-26 09:48
6600万年前,希克苏鲁伯小行星撞击地球导致非鸟类恐龙灭绝,而就在撞击点附近,一种神秘的夜蜥蜴可能是唯一幸存下来的陆生脊椎动物。白垩纪末期,一颗巨型小行星撞击了墨西哥尤卡坦半岛附近的区域,形成了一个直径超过150公里的陨石坑,导致全球大多数动植物物种灭绝。
2025-06-26 09:47
在全球面临日益严峻的生态危机之际,中国科学院院士、中国科学院生态环境研究中心研究员傅伯杰等提出了一个衡量人与自然共同繁荣程度的全球框架。论文合作作者、联合国开发计划署人类发展报告办公室主任Pedro Conceicao表示,面对当今严峻的地球系统变化,我们必须把人与自然健康、互惠的关系纳入发展愿景。
2025-06-26 09:46
黑土地被誉为“耕地中的大熊猫”,是世界上最肥沃的土壤。这项调查系统查清了我国东北典型黑土区地表基质资源“家底”,实现了东北黑土地地表基质层的首次系统调查与深度解剖。
2025-06-26 09:41
记者邱玥25日从中国海油获悉,我国首个自营超深水大气田“深海一号”二期项目全面投产。 目前,“深海一号”大气田已经达到最高产能设计状态,年产气量有望超过45亿立方米。
2025-06-26 09:40
由美国国家科学基金会和能源部支持的薇拉·C·鲁宾天文台,首次捕捉到的太空景象呈现出一场由恒星“托儿所”及邻近星系的密集星团构成的粉蓝视觉盛宴。鲁宾天文台的科学团队还开发了面向公众的工具“天空查看器”,用户可通过平移和缩放功能探索这些超高分辨率图像中的恒星和星系。
2025-06-25 09:46
中国海油25日宣布,公司在南海水域的“深海一号”大气田二期项目全面投产,标志着我国最大海上气田建成。“深海一号”大气田分一期和二期开发建设(一期于2021年6月投产),探明天然气地质储量超1500亿立方米,最大作业水深超1500米,最大井深达5000米以上,是我国迄今为止自主开发建设的作业水深最深、地层温压最高、勘探开发难度最大的深水气田。
2025-06-25 09:33
2017年启动的第二次青藏高原综合科学考察,为新一代草地植被图的绘制提供了新的契机。“我们共识别出65种主要草地类型,其中高山嵩草草甸、紫花针茅草原、矮生嵩草草甸、垂穗披碱草草甸和线叶嵩草草甸这5个群系分布最广。
2025-06-25 09:30
6月24日,“应急使命·2025”极端灾害事故场景新质救援能力检验性演习在黑龙江省东宁市、河南省濮阳市等地举行。“源网荷储”应急供电中,国家电网运用新技术、设备,实现小型水电站“黑启动”“光伏+储能”协同供电,保障重点区域电力供应。
2025-06-25 09:24
研究团队通过发育表达分析、原位杂交和免疫组化技术,在甜菜孢囊线虫早期寄生阶段鉴定出两个关键分泌效应蛋白——Hs28B03和Hs8H07。该研究首次发现,植物寄生线虫会“劫持”植物细胞的“垃圾处理系统”——泛素化系统来摧毁免疫。
2025-06-25 09:23
24日,记者从中国农业科学院棉花研究所获悉,中国农业科学院棉花研究所、西部农业研究中心棉花分子遗传改良创新团队杨作仁研究员与中国农业科学院生物技术研究所柳小庆研究员,合作创制了可生产虾青素的工程棉花。
2025-06-25 09:22
“智慧光源大脑”是国内首个同步辐射人工智能数据解析平台,能够更高效地处理同步辐射实验产生的海量复杂数据。
2025-06-24 09:43
新修订的《中华人民共和国科学技术普及法》实施半年,近日,有媒体采访多位科研人员,梳理新科普法落实效果。受访的多位科研人员表示,新科普法为科研人员开展科普工作提供了制度保障。
2025-06-24 04:50
6月初,依托东南大学共建的南京紫金山实验室发布全球首个6G广域低空覆盖的无蜂窝通智感融合外场试验网,赋能低空经济、数字能源、智能制造等应用场景,有望催生千亿级产业链,助力南京打造“6G之城”。这是东南大学勇挑硬核科技创新大梁,支撑服务新质生产力发展的生动缩影。
2025-06-24 05:00
从国铁集团获悉,近期,沪昆高铁杭州东至长沙南段(以下简称“沪昆高铁杭长段”)安全标准示范线建设拉通试验圆满成功,复兴号动车组列车最高试验时速达385公里,各项设备指标表现良好。
2025-06-24 05:00
构建新农科人才“四新”培育目标体系。
2025-06-24 03:45
专家建议,预防糖尿病足,糖尿病患者每日需用38℃以下温水泡脚,擦干后检查趾间有无破损,穿透气棉 袜与宽松鞋,并每年至少做一次足部血管神经专项检查。基因疗法主要是通过刺激血管生成来改善近端肢体的血液流入,从而改善单个血管小体中的血液再分。
2025-06-24 09:31
既能上天飞行,也能踏海遨游,我国完全自主研制的AG600“鲲龙”飞机,正是这样的“跨界”航空装备。近期,“鲲龙”喜讯频传——4月20日,获颁中国民航局型号合格证;5月6日,批产首架机总装下线;5月18日,顺利完成生产试飞;6月11日,获颁中国民航局生产许可证。
2025-06-23 09:32
记者从展会上感受到,过去几年氢燃料汽车的发展倒逼氢能产业的发展,而今,氢能的应用从燃料电池车的单一赛道向其他行业辐射。丰田智能电动汽车研发中心(中国)有限公司丰田中国氢能事业总部领域长真锅晃太表示,中国实现2035年百万辆燃料电池汽车规模的目标面临挑战。
2025-06-23 09:31
近日,解放军总医院第五医学中心血液病医学部高晓宁教授团队和周杰教授团队合作,在国际著名期刊《Oncogene》发表突破性研究成果,首次揭示PHF19基因在急性髓系白血病中的“致命开关”作用,为破解白血病复发耐药难题带来全新解决方案。团队首次阐明WTAP-PHF19调控轴的双重表观遗传调控机制,这相当于找到了癌细胞的“能量总控开关”。
2025-06-23 09:29
加载更多