林达华谈大模型发展之路:未来会有更高效的模型结构出现 林达华谈大模型发展之路:未来会有更高效的模型结构出现
admin
2024-03-24 17:27:28
0

·大模型的上下文长度快速增长,超长上下文解锁新应用,但推理计算代价高昂,上下文本身对于信息不会进行压缩,不能直接捕捉其中的深层知识和规律。


上海人工智能实验室领军科学家林达华。

过去一年,人工智能领域风起云涌,模型架构、训练数据、多模态、超长上下文、智能体发展突飞猛进。大模型的技术演进路在何方?

3月24日,在2024全球开发者先锋大会的大模型前沿论坛上,上海人工智能实验室领军科学家林达华分享了对大模型的思考。他表示,大规模生产高质量数据是大模型研发机构的竞争力所在。当前主流的大模型无一例外都建立在Transformer架构堆叠的基础上,但产业界和学术界在不断探索更加高效的架构,随着验证逐渐成功,未来它们会慢慢进入产业界,带来模型架构新的黄金期。

林达华表示,在大模型时代,技术演进有两股主要的驱动力量,一方面是研究人员对通用人工智能的追求和对尺度定律(Scaling Law)的信仰,从而不断突破边界,寻求接近通用人工智能的道路。另一方面,产业界也看到了大模型带来产业革命的可能性,无数企业投入了巨大资源。两股力量交织,促成了人工智能行业的迅猛发展。过去一年,人工智能领域所取得的技术突破远远超过了过去十年甚至几十年的突破和进展。

在模型架构方面,当前主流的大模型无一例外都建立在Transformer架构堆叠的基础上,但林达华表示,这种架构的问题是对计算资源的消耗特别大,反观人脑的效率远高于主流大模型架构。人脑有大约100万亿个神经连接,远远超过现有大模型体量,但人脑的运行功率只有20瓦,而千亿参数模型的推理功率是它的百倍以上,处理的信息也更单一。

过去一年,产业界和学术界在不断探索更加高效的架构,其中MoE是宏观结构稀疏化的一种简单形态,经过良好训练的MoE可取得比同等激活参数量的稠密模型更好的性能。“但这仅仅是一个起点,未来还会有更加高效的稀疏模型结构出现。”林达华表示,这些架构现在还停留在学术研究阶段,但随着验证的逐渐成功,它们会慢慢进入产业界,从而带来模型架构新的黄金时期。

在训练数据方面,最初训练数据并不被认为是大模型训练最重要的要素。2022年,DeepMind的研究报告提到,模型的数据量要跟参数量同步增长,才能训练出最佳模式。“从那时候起,人们开始关注模型的数据。”林达华表示,去年一年,大模型的参数体量没有呈现指数级的增长速度,但无论是开源模型还是闭源模型,数据量增长了近一个数量级。

到去年中期,大家慢慢观察到数据质量扮演了越来越重要的角色,高质量数据对模型能力和模型天花板有重要的正面意义,“大规模生产高质量的数据是一个开放性的问题,也是大模型研发机构的竞争力所在。”林达华表示,好的数据要有多样性,单一数据对模型性能具有破坏性影响,“10%的带有重复模式的数据注入到训练集里,有可能会使得模型降级到原来1/2的体量。”

在多模态方面,多模态融合将成为重要技术趋势,但技术探索仍在路上。相比语言,多模态模型的训练多了一个重要维度,即图像和视频的分辨率对多模态模型最终的性能表现有重要影响。如果使用非常高的分辨率进行多模态的训练和推理,模型能够得到巨大提升,但高分辨率会带来高计算成本。“如何在高分辨率和合理计算成本之间取得最佳平衡,这为架构研究带来了很大的创新空间。”

在上下文方面,上下文长度快速增长。去年上半年,上下文基本处于4K水平。GBT-4突破到32K,今年3月,支持1M或更长上下文的模型出现。超长上下文解锁新应用,2K的上下文只能从事简单的聊天和短文分析;32K可以长时间对话,完成长文分析;上下文支持能力突破到1M时,就能阅读长篇小说,实现项目级的代码分析和构建。但超长上下文的推理计算代价高昂,上下文本身对于信息不会进行压缩,不能直接捕捉其中的深层知识和规律。

在智能体方面,随着GPT-4的突破,智能体在去年成为领域内的一个关注方向。林达华表示,智能体并不是一个简单的流程化过程,它需要建立在一个非常坚实的基础模型上,具有很强的指令跟随能力、理解能力、反思能力和执行能力。

在计算环境方面,林达华表示,芯片进入到后摩尔定律时代,未来算力会变成体量的拓展,越来越多的芯片连接在一起,建成越来越大的计算中心,支撑对通用人工智能的追求。最终瓶颈不再是芯片,而是能源。现在,小规格的大语言模型已具备较强性能水平和实用可能性,优秀的模型越做越小,可以进入到手机直接运行。林达华表示,端侧算力快速增长,端侧即将迎来黄金增长期,云端协同将成为未来重要趋势。

2024全球开发者先锋大会大模型前沿论坛由全球开发者先锋大会组委会指导,上海人工智能实验室及上海市人工智能行业协会共同主办。首届书生·浦源大模型挑战赛(春季赛)于现场揭晓比赛结果,同时启动2024浦源大模型系列挑战赛(夏季赛)。

相关内容

热门资讯

国民性创新,越来越阳春白雪 问一个问题,最近两年爆火的创新,从生成式AI到人形机器人,到底是离大众越来越近,还是离大众越来越远?...
男子被显示欠银行1000万亿索... 男子被显示欠银行1000万亿索赔200万遭拒,银行仅愿赔偿3万元
研究显示美国散户投资者推动杠杆... 来源:环球市场播报 Direxion公司联合Vanda Research与The Compound ...
高瓴、李录、巴菲特最新持仓披露... 最近,随着美股13F文件的披露,多家私募机构2025Q4最新调仓情况浮出水面。之前的文章,证星研究院...
原创 老... 四十年代的北京珠市口路口,正处于从民国向新中国过渡的时期,它既保留着清末民初形成的鲜明社会分层特征,...
原创 相... 在金融圈,流行一个词叫“估值修复”。意思是股价跌狠了,总会涨回来。 但阿睿发现,自己在相亲市场的估值...
上海楼市重磅新政,非沪籍大松绑... wumiancaijing.com / 最热的泛财经新闻,都在这儿了。 重要提醒!!!为防失联,请“...
春节白酒消费:高端产品热度升高... 来源:新京报 春节是酒水消费传统旺季,马年春节期间,白酒动销稳健复苏。多家机构调研发现,白酒消费呈现...
黄金暴涨的秘密找到了!不是散户... 过去两年,黄金市场最容易被忽视的一条主线,并不是价格本身的起伏,而是一个更为深层的结构性变化——全球...
刘强东投资50亿进军游艇产业,... 极目新闻记者 陈红 刘强东近日创立了独立游艇品牌Sea Expandary,进入游艇产业,计划从研...
韩国驻美大使:密切关注美方新关... 据韩联社报道,韩国驻美国大使康京和2月24日就美国总统特朗普在联邦最高法院裁定“对等关税”违法后宣布...
现货黄金刚刚涨破5200美元关... 25日,现货黄金持续拉涨,盘中再次突破5200美元大关,涨超1.3%。 瑞银(UBS)分析师此前在...
【银行业展望系列】五篇大文章:... 当前银行息差持续承压、规模扩张的增长红利逐渐消退,已经陷入内卷式的同质化竞争。“规模为王”的旧模式将...
原创 一... 美国总统唐纳德·特朗普迅速恢复了之前被最高法院废除的关税政策,这一急转弯让本就面临成本激增压力的美国...
收盘:上证指数、深证成指涨1.... 上证指数(000001)涨0.72%,深证成指(399001)涨1.29%,创业板指(399006)...
蔡宏波、毛健:美国贸易逆差“转... 近年来,美国政府反复将“贸易失衡”描述为事关国家安全的核心问题。从政策实践看,自2018年以来,美国...
五粮液集团入股四川三江汇海融资... 天眼查显示,近日,四川三江汇海融资租赁有限公司发生工商变更,新增四川省宜宾五粮液集团有限公司为股东,...
A股高开高走:周期股延续强势,... A股三大股指2月25日集体高开。早盘震荡走高,午后震荡回落,全天呈现高位震荡走势。 从盘面上看,周期...