科技

人工智能从“大炼模型”到“炼大模型”

人工智能可以分为几个发展阶段:基于数据的互联网时代、基于算力的云计算时代,以及接下来可能将进入的基于模型的AI时代,这相当于把数据提升为超大规模预训练模型。未来,研究人员可以直接在云模型上进行微调,很多公司甚至不用维护自己的算法研发团队,只需要应用工程师即可。

写小说、和人聊天、设计网页、编写吉他曲谱……号称迄今为止最“全能”的AI模型GPT-3,当然远远不止会这些。作为2020年人工智能领域最惊艳的模型之一,GPT-3无疑把超大规模预训练模型的热度推向了新高。

3月下旬,我国首个超大规模人工智能模型“悟道1.0”发布,该模型由智源学术副院长、清华大学教授唐杰领衔,带领来自清华大学、北京大学、中国人民大学、中国科学院等单位的100余位AI科学家组成联合攻关团队,取得了多项国际领先的AI技术突破,形成了超大规模智能模型训练技术体系,训练出包括中文、多模态、认知和蛋白质预测在内的系列超大模型。

已启动4个大模型开发

据悉,“悟道1.0”先期启动了4个大模型研发项目:以中文为核心的超大规模预训练语言模型文源、超大规模多模态预训练模型文澜、超大规模蛋白质序列预测预训练模型文溯,以及面向认知的超大规模新型预训练模型文汇。

唐杰介绍,文源拥有26亿参数,文澜则为10亿,文溯是2.8亿,文汇则达到了百亿以上。虽然相对于GPT-3的1750亿参数而言还有差距,但“接下来会有更大的模型”。

目前,文源模型参数量达26亿,具有识记、理解、检索、数值计算、多语言等多种能力,并覆盖开放域回答、语法改错、情感分析等20种主流中文自然语言处理任务,在中文生成模型中达到了领先的效果。

“目前这些模型既有一些交集,但也存在明显差异。文源的重点是在中文和跨语言,未来也会加入知识;文澜的重点主要是图文;文汇则更多地瞄向认知。”唐杰表示,认知是人工智能技术发展的趋势和目标,关系到机器是否能像人一样思考这个终极问题。

“下一代人工智能技术的发展方向一定是认知。”据唐杰介绍,在作诗任务中,目前文汇已经通过了图灵测试。从算法的角度上来看,文汇能通过图灵测试的关键在于“生成”,而不仅仅限于“匹配”,这种生成能力是多样的。

被问及为何会选择这4个预训练模型项目时,唐杰说,这是综合考虑了国内外同行的相关工作、国内人工智能发展的现状、团队人员构成、北京区域优势等作出的决定。“当时GPT-3刚发布不久,悟道团队认为首先要对标其卓越的少样本学习能力,同时还要做出差异化,做短、中、长3个阶段的布局。于是,中文版GPT-3即清源CPM(文源的前身)应运而生,这是短期布局。之后,文源要向中英文模型乃至多语言模型发展,这是中期布局。最后走向认知智能,这是长期布局。”唐杰说,与此同时,国内顶尖的企业人才、学术人才和自然科学人才所组成的团队给了项目巨大的想象空间。

大模型有大智慧

自2018年谷歌发布BERT以来,预训练模型逐渐成为自然语言处理(NLP)领域的主流。

2020年5月,OpenAI发布了拥有1750亿参数量的预训练模型GPT-3。作为一个语言生成模型,GPT-3不仅能够生成流畅自然的文本,还能完成问答、翻译、创作小说等一系列NLP任务,甚至可以进行简单的算术运算,并且其性能在很多任务上都超越相关领域的专有模型。

以GPT-3为代表的超大规模预训练模型,不仅以绝对的数据和算力优势取代了一些小的算法模型,更重要的是,它展示了一条通向通用人工智能的可能路径。在此背景下,建设国内的超大规模预训练模型和生态势在必行。

在唐杰看来,为了提高机器学习算法的效率,改变传统的行业布局,过去几年,大家拼命做模型,导致模型越做越多。然而,一般的模型训练效果并不如人意,花了大量财力精力却达不到理想的训练效果,“为了优化效果、提高精度,模型越来越复杂,数据越来越大,很多公司的能力不足以应对这种状况,效率越来越低。”唐杰举了个例子,小炼钢厂往往条件简陋,能炼钢,但质量不好。大炼钢厂买得起设备、花得起电费,炼出的钢质量就好,大模型就是大炼钢厂,它可以获得大量数据,并把数据清洗干净,提升算力,满足要求。

与此同时,“小模型可能只需要几个老师和学生就能完成算法的设计,但是大模型的每一层都要找专人来做,这样可以把模型的设计和训练精细化,模型设计也从单打独斗变成了众人拾柴。”唐杰说。

小团队将成最大受益者

据唐杰透露,团队目前正在跟北京冬奥会合作,开发可通过文本自动转成手语的模型,“医疗方面我们的主要方向是癌症早筛,如上传乳腺癌图像,找到乳腺癌相关预测亚类,通过影像识别宫颈癌亚类等。”

而谈到“悟道1.0”的发展,唐杰坦言,目前还存在需要持续攻关的问题。一是模型能否持续学习的问题,即能否不断地从新样本中学习新的知识,并能保存大部分以前已经学习到的知识。就目前来看模型还需要调整,其效果还有待加强;二是面对一些复杂问题,目前模型还无法回答;三是万亿级模型的实用性问题,即如何在保证精度的同时压缩模型,从而能让用户低成本地使用。

“这是一个全新的产业模式。原来大家数据上云、算力上云,现在模型上云。”唐杰说。

他认为,人工智能可以分为几个发展阶段:基于数据的互联网时代、基于算力的云计算时代,以及接下来可能将进入的基于模型的AI时代,这相当于把数据提升为超大规模预训练模型。未来,研究人员可以直接在云模型上进行微调,很多公司甚至不用维护自己的算法研发团队,只需要应用工程师即可。

唐杰表示,随着超大规模预训练模型系统的开放,小团队是最大的受益者,大家不必从零开始,预训练基线智能水平大幅提升,平台多样化、规模化,大家在云上可以找到自己所需的模型,剩下的就是对行业、对场景的理解。这将给AI应用创新带来全新的局面。

唐杰透露,“悟道1.0”只是一个阶段性的成果,今年6月将会有一个规模更大、水平更高的智慧模型发布。届时,模型规模会有实质性的进展:模型会在更多任务上突破图灵测试,其应用平台的效果也会更加让人期待。


【责任编辑:欧阳雪】

上海开源大会锚定AI未来:百万开发者生态迈向“主导型”崛起

开源不再只是代码共享,而是开放协同的新生产方式,上海正构建一个从使用生态到主导生态的开源体系。第二届开源产业生态大会1月13日在上海落幕。会上披露的数据显示,上海开源开发者数量已超过100万人,位居全国第二,而这一数字计划在2027年达到300万人。上海市经信委总工程师裘薇在大会上表示,开源已成为实现技术突破、参与全球科技创新的重要途径。本次大会不仅启动了“开源产

智能伴侣与静默革命:AI无缝织入2026生活图景

从能感知情绪的AI助手到街头无人的自动驾驶出租车,人工智能正以润物细无声的方式,重塑我们日常生活的节奏。2026年将成为人工智能深度嵌入日常生活的转折点。美国《纽约时报》最新观察指出,生成式AI已不再是实验室的奇观,而成为推动人机关系根本变革的引擎。清晨,智能眼镜在视野边缘提示今日议程;通勤时,自动驾驶出租车平稳穿梭;工作中,AI代理主动处理邮件安排会议;回家后,

北京推出“亿元补助”新政,破解创新成果转化“最后一公里”难题

实验室里的科研成果如何跨越产业化鸿沟?北京新年首个产业政策瞄准中试关键环节,最高亿元补助助力科技成果从“书架”走向“货架”。1月4日,北京市发展和改革委员会等部门联合发布《关于进一步提升本市中试服务能力促进科技创新和产业创新融合发展的若干措施》,以最高1亿元的补助力度支持中试平台建设。中试作为创新成果产业化的“最后一公里”,是实验室成果迈向市场化应用的关键过渡阶段。该政策

北京推出“科技副总”与“产业教授”机制,破解产教融合难题

校企之间的制度性壁垒正在被打破,一支扎根一线的卓越工程师队伍将获得全链条支持。1月4日,北京市委教育科技人才工作领导小组办公室正式印发《关于加强卓越工程师队伍建设的若干措施》。这份包含18条具体举措的政策文件,从产教融合载体搭建、后备人才培养到人才集聚引育、成长发展激励等方面提供“全链条”支持。措施旨在培养建设一支爱党报国、敬业奉献、具有突出技术创新

AI赋能“智造”跃升 四川构建现代化产业体系

“十四五”以来,四川深入实施制造业智能化改造数字化转型行动,全省规模以上工业企业数字化转型覆盖率在两年间提升20个百分点以上,计划在2027年底实现全覆盖。

西安“隐形冠军”集群崛起,硬科技矩阵激活区域创新动能

从AI健康检测到激光美容模块,从智慧城市平台到射频微波芯片,西安专精特新企业正以“小而美”的技术创新,撬动大市场。在西安维塑智能科技有限公司的展示厅里,一台搭载AI技术的3D身体形态评估设备正在精准捕捉人体数据。这家扎根西安经开区的国家高新技术企业,其核心产品已成功打入全球60多个国家,在超过10000家机构落地应用。而在不远处的西安欧益光电科技有限公司无尘车间,技术人员

数字立交桥崛起:中国打造一体化互联网交换体系

一部关于互联网“交通枢纽”的创新指南正式出炉,为数据流通架设高速通道。工业和信息化部办公厅12月30日印发《关于加快推进国家新型互联网交换中心创新发展的指导意见》,这份针对国家新型互联网交换中心的首个系统性指导文件,标志着我国互联网架构优化进入新阶段。国家新型互联网交换中心作为新型信息基础设施,通过构建中立、公平、开放的流量集中交换平台,实现不同网络间数据高效流通。该指

创新基因深度觉醒 双擎驱动能级跃升 - 杭州以“两新融合+教科人一体”改写创新活力之城进阶密码

当实验室的前沿技术无缝对接生产线的市场需求,当高校的人才培养精准匹配产业的创新渴求,这座把创新刻进基因的城市正加速蝶变。2025年以来,杭州锚定“打造更高水平创新活力之城”目标,以科技创新与产业创新深度融合为核心路径,以教育、科技、人才一体改革为关键支撑,通过构建全链条创新生态、打破体制机制壁垒,正书写着创新驱动高质量发展的新篇章。最新数据显示,2024年杭州数字

数字大物业 城乡新动能│厦门翔安“智理”方法论 数据赋能大物业重塑城乡未来

在厦门市翔安区,基层治理的日常正在被一系列智能化场景所改变:堆积如山的海蛎壳在智能系统的精准调度下,变废为宝转化为绿色的环保材料;AI数字社工化身为社区“新成员”,以数百倍于人工的效率完成和各类任务,让社区工作者有更多时间走进群众;无人机与智能摄像头织就全域感知网络,赋予城乡管理“千里眼”

数字化转型有了“导航图”!14个行业可“按图索骥”

曾经“摸黑走路”的制造业数字化转型,如今有了清晰的“施工图”。在近日沈阳举行的2025年两化融合暨数字化转型大会上,一位与会企业代表这样感慨。此次大会上,工业和信息化部正式发布《场景化、图谱化推进重点行业数字化转型的参考指引(2025版)》,为钢铁、石化等14个重点行业绘制了企业数字化转型“场景导航图”。

河北空天控股公司多项创新技术成果亮相 “三年上、五年强”科技成果展

12月6日至7日,河北省国资委监管企业研发投入“三年上、五年强”专项行动科技成果展在河北交投数智产业园盛大举办。河北空天控股公司作为河北交投集团空天信息领域科技创新核心力量,携系列北斗高精尖装备、省级低空交通监管平台、“北斗+低空”危化品监管系统等多项拥有自主知识产权与自主品牌的创新技术成果参展,通过图文解说、音频演示、动态视频等多元化形式,立体化呈现公司在空天信息领域

河北国资成果展:科技赋能,创新成果“多点开花”

科技赋能国企,创新引领发展。12月6日,河北省国资委监管企业研发投入“三年上、五年强”专项行动科技成果展在河北正定新区未来电子信息与装备制造产业基地成功启动,展期2天。成果展期间将举办专家主旨报告会、青年科技人才分享会、专利转化对接会、京津冀三地国资委联合发布《京津冀国有企业青年科技创新倡议书》等系列活动。现场还设有招商洽谈区、成果路演区,旨在打通创新成果与产业需求、金融资本对接的“最

从云计算到星计算:算力革命的技术演进与产业变革​

随着人工智能技术的快速发展和全球算力需求的爆发式增长,传统地面数据中心面临着前所未有的挑战。据统计,到 2026 年,全球数据中心的总用电量或将超过 1000 太瓦时,堪比日本全国的用电量。在能源消耗、土地资源和散热成本的多重压力下,算力基础设施正迎来从地面集中式向天地一体化分布式的范式跃迁。星计算作为这一变革的核心,通过将高性能计算、AI 与边缘计算集成于天基平台,构建分布式卫星星

京广铁路长台关站完成信号系统升级 “智慧机房”助力路网安全提效

日前,经过230分钟紧张有序的施工作业,京广铁路信阳段关键节点站 —— 长台关站计算机联锁设备技术改造工程顺利完工。升级后的新型信号系统与创新建设的“智慧机房”,为这条贯通南北的运输大动脉筑牢安全屏障,进一步提升区域路网运输效能。

智能模型与手术机器人协同,AI医疗开启精准诊疗新时代

医疗大模型具备“专家级”推理能力,手术机器人实现毫米级精细操作,人工智能正重塑从看病到手术的每一个医疗环节。在宁波大学附属第一医院方桥院区,70岁的王阿姨在AI数字人引导下精准挂号,就诊后收到一份AI生成的个性化复查建议。诊室里,医生屏幕已由AI助手自动生成初步病历;手术室内,骨科机器人正辅助医生进行毫米级精准操作。这些场景勾勒出“未来医院”的实景图。智能诊断模型将病变

瞄准九大前沿领域 工信部启动国家新兴产业发展示范基地创建

到2035年培育100个示范园区和1000家示范企业,这一长期计划为中国新兴产业绘制了清晰的发展路线图。工业和信息化部近日正式印发通知,启动国家新兴产业发展示范基地创建工作。该举措旨在面向2035年和“十五五”时期国家发展战略,聚焦新兴产业重点领域,遴选一批具有国内领先水平的产业园区和企业。示范基地创建瞄准新一轮科技革命和产业变革前沿,聚焦新一代信息技术、新能源、新材料、

中国启动“燃烧等离子体”国际科学计划,携手全球点燃“人造太阳”

在安徽合肥未来大科学城,一座名为BEST的紧凑型聚变能实验装置主机大厅内,全球能源未来的一页新篇章正悄然开启。11月24日上午,中国科学院在安徽合肥未来大科学城的紧凑型聚变能实验装置(BEST)主机大厅正式启动“燃烧等离子体”国际科学计划,并首次面向国际聚变界发布BEST研究计划。来自法国、英国、德国、意大利等十余个国家的聚变科学家齐聚合肥,共同签署了《合肥聚变宣言》,

数智赋能解锁文脉守护新范式“今古集”亮相长三角文博会获行业聚焦

11月20日,“今古集:数智赋能·守护文明”2025年社会教育活动在国家会展中心(上海)开幕,活动由中国文物保护基金会科技保护专项基金主办。中国文物保护基金会秘书长陶诚,上海市委宣传部二级巡视员、市文创办专职副主任黄建富,中国科学院院士、同济大学建筑与城市规划学院教授常青等出席活动并致辞,来自文博机构、高等院校、科技企业等众多专家学者与行业代表参加活动。
返回
顶部