免费、SOTA、中文,微软卷出了新高度 免费的微软 免费微软系统
admin
2024-02-10 10:09:55
0


出品 | 虎嗅科技组

作者 | 杜钰君

编辑 | 王一鹏

头图 | 摄图网

碾压谷歌的GeminiPro和阿里的Qwen-VL-Plus,与GPT-4V正面硬刚,这个有着SOTA级别性能的多模态大模型真正做到了“人无我有,人有我优”。

继2023年4月的初级版本、2023年10月的LLaVA-1.5之后,2024年1月31日,微软研究院又联合威斯康星大学麦迪逊分校和哥伦比亚大学的研究者共同发布了多模态大模型LLaVa(LargeLanguageandVisionAssistant)的1.6版本。与GPT-4V只提供API接口的闭源经营理念不同,LLaVA1.6的代码、模型与训练数据全开源,且在标准评测数据集上跑出了较为亮眼的成绩。

一、LLaVA1.6:卷上加卷

LLaVA是一种端到端训练的大型多模态模型,又被称为“大型语言和视觉助手”。LLaVa-1.6是微软LLaVa系列的第三个迭代版本。升级后的LLaVa-1.6可谓buff叠满:SOTA级别的性能,低训练花销,多模态的内容生成能力和再一次将开源大模型卷上了新高度。

根据LLaVa-1.6官网的标准评测数据集,该模型的表现超越了Qwen-VL-Plus、CogVLM和Yi-VL等一众模型,在大部分数据集上的表现都优于GeminiPro,在Math-Vista、MMB-ENG等部分数据集上的表现甚至胜于GPT-4V,成为了开源模型中的“性能王者“。


图片来源:LLaVA-1.6官网的标准评测数据

在不拘泥于单一模态的内容生成,具有Text-to-Text和Image-to-Text两种模式的同时,LLaVa-1.6的过人之处还在于更低的训练数据成本。LLaVA-1.6能用32个GPU在一天之内完成训练,仅需1.3M条训练数据,其计算和训练数据比其他模型小100到1000倍。

除了通过对话式AI生成文本外,LLaVA-1.6还可以识别图片信息并转化成文字答案。升级后的LLaVa-1.6对输入图像的分辨率提升到原来的4倍以上,使得模型能够抓住图片的更多细节。目前支持的图像分辨率有672x672、336x1344以及1344x336三种。

LLaVA模型架构基于大量的图像-文本配对的数据集,将预训练的CLIP视觉编码器与大型语言模型(Vicuna)通过映射矩阵相连接,来实现视觉和语言特征的匹配。根据该模型的研发团队成员HaotianLiu在X平台的介绍,此增强版本建立在其前身的简约设计和数据效率基础上,并通过改进视觉指令数据集和SGLang,提升了“推理、OCR等方面的性能”,意味着人类向AGI(通用人工智能)探索的道路上又迈进了一步。


LLaVA-1.6的研发团队成员HaotianLiu在X平台发文原文

二、更适合中国人体质的GPT-4V

在奋力追平GPT-4V的同时,LLaVa-1.6也展现出强大的零样本中文能力。

LLaVa-1.6不需要额外训练便具备杰出的中文理解和运用能力,其在中文多模态场景下表现优异,使得用户不必学习复杂的“prompt”便可以轻松上手,这对于执行“免费(限制文本长度、使用次数等)+付费会员”制的文心一言们而言无疑提出了新的挑战。

笔者在对LLaVa-1.6模型的demo进行尝试时发现,LLaVa-1.6对古诗词等具有中文语言特色的文本内容理解也较为到位,且能给出中上水平的答案。因而对于有图生文或文生文需求的用户而言,LLaVa-1.6模型不失为更适合中国人体质的GPT-4V。


图片来源:笔者在文心一格平台的使用截图

更强的视觉对话能力使得LLaVa-1.6的智能服务可以覆盖更多元的场景、具有更强的常识和逻辑推理能力。


图片来源:用户在X平台对LLaVA-1.6的试用截图

在上图的应用场景中,用户发给LLaVA-1.6一张机票,询问与之相关的接机和日程安排。LLaVA-1.6不仅准确的估计了驾驶时间,还考虑到了可能堵车的情况,颇具一个“智能管家”的自我修养。


图片来源:用户在X平台对LLaVA-1.6的试用截图

为了促进多模态大模型社区的发展,开发者们开源了LLaVa-1.6的全部代码、训练数据和模型。这无疑有益于人工智能开发的透明度和协作。在较小训练样本和开源的前提下,如果可以基于本地数据训练专业模型,推动解决当前大模型基于云的产品的责任和隐私问题。

不难发现,轻量化的训练数据是LLaVa-1.6与其他多模态大模型不同的关键一点。一直以来,成本的高企便是横亘在大模型训练面前的一大难题。随着大模型赛道越来越卷,研发者们开始将关注点从性能转向成本,在关注大规模参数量的同时着力降低模型的运算和推理成本,实现模型压缩化和计算高效化。

相关内容

热门资讯

别让老ERP拖垮业务:强制升级... ERP系统是企业运营的“神经中枢”,但随着技术迭代与业务环境变化,老旧系统可能从“稳定工具”变为“发...
2025年地方债市场回顾与20... 扫码文末“投小圈” 加入行业交流群 文章来源:中证鹏元评级 作者:吴志武 "主要内容 1、2025年...
原创 危... 2026年1月,俄乌战争进入了它的第四个冬季。在这片被冰雪覆盖的土地上,基辅的寒冷几乎让人无法忍受,...
GDP140万亿跟你无关?醒醒... 近日,官方数据出来了! “十四五”时期,我国经济总量实现“四连跳”,先后迈上了110万亿、120万亿...
原创 印... 印度近期一声永不屈服,却最终扛不住压力,宣布暂停进口俄罗斯石油。失去了印度这个重要市场后,俄罗斯的目...
原创 帮... 各位朋友,这个周末的市场资讯简直像开了盲盒,监管重罚、行业涨价、妖股停牌全凑齐了,每一个都关乎咱们的...
中基协:注销瑞丰达等9家私募基... 1月23日,中国证券投资基金业协会发布公告,注销5家期限届满未提交专项法律意见书的私募基金管理人登记...
原创 中... 前言 中国买大豆,美国抓油船,这一场景背后,正上演着一场双轨博弈。乍一看,这似乎只是农产品采购与能源...
原创 欧... 因为特朗普的无理要求,欧洲终于忍无可忍,近期在格陵兰岛问题上对美国亮出了底线,明确表示绝不允许美国夺...
昭衍新药大宗交易折价成交595... 昭衍新药01月23日大宗交易平台共发生2笔成交,合计成交量595.00万股,成交金额21306.95...
锚定10%增速、年推30款新品... 本报(chinatimes.net.cn)记者胡梦然 深圳报道 一份行动方案,将深圳科技保险保费的年...
黄金白银再创历史新高,高手怎么... 本周,虽然上证指数表现平淡,但结构性行情较好,如黄金白银、锂电池表现靓丽。在周五,马斯克讲话刺激太空...
京东年货节1月25日晚8点开启... 1月25日晚8点,京东年货节盛大开启!不仅有官方直降5折起、国补加补至高3000元等重磅福利,而且还...
AI应用龙头,又被空头整了 在过去两年的美股市场里,Applovin堪称AI应用的顶流。 这家公司凭借AI广告的业务定位,在一年...
嘉实低价策略股票:2025年第... AI基金嘉实低价策略股票(001577)披露2025年四季报,第四季度基金利润1220.76万元,加...
原创 变... 本文内容均引用权威资料结合个人观点进行撰写,文末已标注文献来源,请知悉。 近几年来,中国经济增长的...
图解牛熊股贵金属概念涨幅居前,... 财联社1月25日讯,本周A股三大指数涨跌不一,其中上证指数周涨0.83%,深成指周涨1.11%,创业...
兴银研究精选股票A:2025年... AI基金兴银研究精选股票A(008537)披露2025年四季报,第四季度基金利润398.92万元,加...
2026全球服务商大会:为中国... 转自:新华财经 新华财经上海1月25日电(记者 郭敬丹、有之炘)自2019年首次发布以来,上海市静安...
权威访谈 开局“十五五”丨央行... “十五五”开局之年,适度宽松的货币政策如何发力?总台央视记者对中国人民银行行长潘功胜进行了专访。潘功...