微软发布Phi-3,性能超Llama-3,可手机端运行 微软发布phi-2模型硬件要求 微软免费的3a大作
admin
2024-04-24 13:04:53
0



机器之心报道

编辑:小舟、泽南

数据已成为提升大模型能力的重点。

Llama-3 刚发布没多久,竞争对手就来了,而且是可以在手机上运行的小体量模型。

本周二,微软发布了自研小尺寸模型 Phi-3。

新模型有三个版本,其中 Phi-3 mini 是一个拥有 38 亿参数的语言模型,经过 3.3 万亿 token 的训练,其整体性能在学术基准和内部测试上成绩优异。

尽管 Phi-3 mini 被优化至可部署在手机上,但它的性能可以与 Mixtral 8x7B 和 GPT-3.5 等模型相媲美。微软表示,创新主要在于用于训练的数据集。



与此同时,Phi-3 与 Llama-2 使用相同的架构,方便开源社区在其基础上开发。



此前,微软的 Phi 系列模型曾经引发了人们的热议,去年 6 月,微软发布了《Textbooks Are All You Need》论文,用规模仅为 7B token 的「教科书质量」数据训练 1.3B 参数的模型 phi-1,实现了良好的性能。

去年 9 月,微软进一步探索这条道路,让 1.3B 参数的 Transformer 架构语言模型 Phi-1.5 显示出强大的编码能力。

去年底,微软提出的 Phi-2 具备了一定的常识能力,在 2.7B 的量级上多个基准测试成绩超过 Llama2 7B、Llama2 13B、Mistral 7B 等一众先进模型。



Phi-3 技术报告:https://arxiv.org/abs/2404.14219

刚刚提出的 phi-3-mini 是一个在 3.3 万亿个 token 上训练的 38 亿参数语言模型。实验测试表明,phi-3-mini 的整体性能可与 Mixtral 8x7B 和 GPT-3.5 等模型相媲美,例如 phi -3-mini 在 MMLU 上达到了 69%,在 MT-bench 上达到了 8.38。

微软之前对 phi 系列模型的研究表明,高质量的「小数据」能够让较小的模型具备良好的性能。phi-3-mini 在经过严格过滤的网络数据和合成数据(类似于 phi-2)上进行训练,并进一步调整了稳健性、安全性和聊天格式。

此外,研究团队还提供了针对 4.8T token 训练的 7B 和 14B 模型的初始参数扩展结果,称为 phi-3-small 和 phi-3-medium,两者都比 phi-3-mini 能力更强。



学术基准

在标准开源基准测试中,phi-3-mini 与 phi-2 、Mistral-7b-v0.1、Mixtral-8x7B、Gemma 7B 、Llama-3-instruct8B 和 GPT-3.5 的比较结果如下表所示,为了确保具有可比性,所有结果都是通过完全相同的 pipeline 得到的。



安全性

Phi-3-mini 是根据微软负责任人工智能原则开发的。保证大模型安全的总体方法包括训练后的安全调整、红队(red-teaming)测试、自动化测试和数十个 RAI 危害类别的评估。微软利用受 [BSA+ 24] 启发修改的有用和无害偏好数据集 [BJN+ 22、JLD+ 23] 和多个内部生成的数据集来解决安全性后训练(post-training)的 RAI 危害类别。微软一个独立的 red team 反复检查了 phi-3-mini,以进一步确定后训练过程中需要改进的领域。

根据 red team 的反馈,研究团队整理了额外的数据集从而完善后训练数据集。这一过程导致有害响应率显著降低,如图 3 所示。



下表显示了 phi-3-mini-4k 和 phi-3-mini-128k 与 phi-2、Mistral-7B-v0.1、Gemma 7B 的内部多轮对话 RAI 基准测试结果。该基准测试利用 GPT-4 模拟五个不同类别的多轮对话并评估模型响应。



缺陷

微软表示,就 LLM 能力而言,虽然 phi-3-mini 模型达到了与大型模型相似的语言理解和推理能力水平,但它在某些任务上仍然受到其规模的根本限制。例如,该模型根本没有能力存储太多「事实知识」,这可以从 TriviaQA 上的低评分中看出。不过,研究人员相信这些问题可以通过搜索引擎增强的方式来解决。



参考内容:https://news.ycombinator.com/item?id=40127806

相关内容

热门资讯

地缘局势风险难稳、金价震荡调整... 上交易日周四(2月19日):国际黄金震荡收涨,其日内受到美伊紧张局势持续,获得反弹动力,但近日美元指...
逆周期调节推动A股行稳致远 (来源:经济日报) 转自:经济日报 高频数据显示,沪深北交易所调整融资保证金比例以来,融资融券市场交...
奥尔特曼:AI确实会影响就业,... 来源:市场资讯 (来源:IT之家) IT之家 2 月 19 日消息,OpenAI 首席执行官萨姆 ·...
全球第四大车企股价大跌,业绩突... 又到了一年一度各家车企公布成绩单的时候,就在这个节骨眼上,全球第四大车企Stellantis业绩变脸...
KKR合伙人兼大中华区私募股权... 岁序更新,新春将近。时间的刻度在前移,市场也在新的起点上重新校准方向。自2007年进入中国以来,KK...
全球第一,易主 当地时间2月19日(周四),美国三大股指全线收跌,道指跌0.54%,标普500指数跌0.28%,纳指...
再惠 Zaihui,在港交所递... 来自上海普陀区的再惠(上海)网络科技有限公司的开曼控股公司Zaihui Inc.(以下简称再惠),于...
春晚机器人刷屏背后!谁是最大赢... 除夕夜,当蔡明身边的仿生机器人精准复刻出她那标志性的挑眉,当宇树的机器人在舞台上完成空中七周半回旋,...
【首都除夕 护卫健康】一碗饺子... 2026年除夕夜,北京朝阳医院总务处餐饮中心联合护理部、医务处、保卫处,常营、石景山院区医疗护理部及...
矿企舆情扰动,炒资源股从成本维... 近期,国内某头部矿企下属矿段发生安全事故,后续涉事企业多名管理人员被控制。企业公告称,涉事矿段过往年...
港股科网股大跌:百度、哔哩哔哩... 记者|杜宇 编辑|程鹏易启江校对|金冥羽 2月20日,港股迎来马年首个开市日。香港恒生指数早盘收跌0...
原创 日... 很多人可能不知道,波音787的起落架、F1赛车的铝合金车架,还有iPhone的钢材外壳,这些高端产品...
原创 买... 在置办房产这一人生大事中,许多过来人都会郑重提醒,尽量避开那些被普遍认为存在问题的楼层,尤其是三层、...
OpenAI有望拿到1000亿... 出品|虎嗅科技组 作者|苗正卿 题图|视觉中国 OpenAI正处于一个命运十字路口。 对OpenAI...
利空来袭!美股集体下跌!资产管... 【导读】美股面临多重利空 隔夜美股市场受担忧、私人信贷消息和中东局势等多重因素拖累。 多重消息令美股...
美联储降息路径分歧加剧 高息预... 美联储内部对降息路径出现巨大分歧。会议纪要显示,部分官员支持通胀回落后降息,但多数委员指出就业下行风...
歪马送酒才是美团2025即时零... 「酒精消费量或许在下降,但我们仍然渴望那种微醺的感觉」,只是喝酒的场景发生了转移,这是歪马被需要的大...
春晚机器人出圈,港股相关概念股... 来源:新浪港股 2月20日消息,港股机器人概念股集体走强,其中,越疆涨超19%,速腾聚创涨超10%,...
金荣中国:美国对伊朗动武风险预... 行情回顾: 国际黄金周四(2月19日)维持震荡走势,开盘价4998.09美元/盎司,最高价5022...
港股异动丨AI应用股集体走强,... 港股市场AI应用股集体走强,其中,海致科技集团涨15%、五一视界、MINIMAX-WP、智普涨超5%...