全球最强大模型一夜易主，GPT-4被全面超越国产大模型gpt4 最强语言模型gpt-4发布在即_市场资讯_商务投诉网

全球最强大模型一夜易主，GPT-4被全面超越国产大模型gpt4 最强语言模型gpt-4发布在即

admin

2024-03-06 03:00:37

0次

白交西风发自凹非寺
量子位 | 公众号 QbitAI

Anthropic刚刚官宣：Claude 3来了！

作为OpenAI最强竞争选手，此次它发布的新模型家族，以最强版Claude 3 Opus为代表，“已经实现了接近人类的理解能力”——

在推理、数学、编码、多语言理解和视觉方面，全面超越GPT-4在内的所有大模型，直接重新树立行业基准的那种。

浅看一下这份成绩单，就十分扎眼~

几项数学类评测都是用0-shot超越GPT-4的4-8 shot。

除此之外，此前就以长下文窗口见长的Claude，此次全系列大模型可提供 200K 上下文窗口，并且接受超过100万Tokens输入。

Gemini 1.5 Pro：嗯？

目前可以免费体验第二强Sonnet，Opus最强版供Claude Pro付费用户使用，但大模型竞技场也可以白嫖。于是乎，网友们已经开始疯玩上了。（Doge）

另外，Opus和Sonnet也开放API访问，开发者可以立即使用。

有人直接艾特奥特曼：好了，你现在可以发布GPT-5了。

不过奥特曼可能还在烦马斯克的诉讼……

最新最强大模型发布

此次Claude 3家族共有三个型号：小杯Haiku、中杯Sonnet以及大杯Opus，成本和性能依次递增。

首先，在性能参数上，Claude 3全系多方面全面提升。其中Opus在MMLU、GPQA、GSM8K等评估基准上领先于其他所有模型：

还有在视觉能力上，它能可以处理各种视觉格式，包括照片、图表、图形和技术图表。

对于这样性能结果，有专业人士表达了自己的看法。

比如爱丁堡大学博士生、中文大模型知识评估基准C - Eval提出者之一符尧就表示，像MMLU / GSM8K / HumanEval这些基准，已经严重饱和：所有模型的表现都相同。

他认为，真正区分模型性能基准的是MATH and GPQA。

另外，在拒绝回答人类问题方面，Claude 3也前进了一大步，拒绝回答的可能性显著降低

在上下文以及记忆能力上，他们用大海捞针（Needle In A Haystack，NIAH）来评估衡量大模型从大量数据中准确召回信息的能力。

结果Claude 3 Opus 不仅实现了近乎完美的召回率，超过 99% 的准确率。而且在某些情况下，它甚至能识别出 “针 “句似乎是人为插入原文的，从而识别出评估本身的局限性。

还在生物知识、网络相关知识等方面取得了进步，但出于负责任的考虑，仍处于AI安全级别2（ASL-2）。

其次，在响应时间上，Claude 3大幅缩短，做到近乎实时。

官方介绍，即将发布的小杯Haiku能够在三秒内阅读并理解带有图表的长度约10k token的arXiv论文。

而中杯Sonnet能够在智能水平更高的基础上，速度比Claude 2和Claude 2.1快2倍，尤其擅长知识检索或自动化销售等需快速响应的任务。

大杯Opus的智能水平最高，但速度不减，与Claude 2和Claude 2.1近似。

官方对三款型号的模型也有清晰的定位。

大杯Opus：比别家模型更智能。适用于复杂的任务自动化、研发和制定策略；中杯Sonnet：比其他同类模型更实惠。更适合规模化。适用于数据处理、RAG、在中等复杂度工作流程中节省时间；小杯Haiku：比同类模型更快速、实惠。适用于与用户实时互动，以及在简单工作流程中节省成本；

在价格方面，最便宜的小杯定价0.25美元/1M tokens输入，最贵的大杯定价75美元/1M tokens输入

对比GPT-4 Turbo，大杯价格确实高出不少，也能体现AnthropicAI对这款模型非常有信心。

第一手实测反馈

既如此，那就先免费来尝尝鲜~

目前官方页面已经更新，Claude展现了「理解和处理图像」这一功能，包括推荐风格改进、从图像中提取文本、将UI转换为前端代码、理解复杂的方程、转录手写笔记等。

即使是模糊不清的有年代感的手记文档，也能准确OCR识别：

底下写着：你正在使用他们第二大智能模型Claude 3 Sonnet。

然鹅，可能是人太多的原因，尝试了几次都显示“Failed”

不过，网友们也已经po出了一些测试效果，比如让Sonnet解谜题。

为其提供一些示例，要求它找出数字之间的关系，比如“1 Dimitris 2 Q 3”，意思是3是1和2相加的结果。

结果Sonnet成功解出-1.1加8等于6.9，所以“X”的值应该是6.9：

还有网友发现Sonnet现在也可以读取 ASCII 码了，直呼：这是GPT-4 ++的水平了。

在编程任务上，谁写的代码好先不说，Claude 3至少不会像GPT-4一样偷懒。

还有体验到了Opus的玩家，在线给模型挖坑，可opus硬是完美躲避不上当：

初看这效果，感觉还行。这时候应该艾特OpenAI：GPT-5在哪里？

好了，感兴趣的朋友，可以戳下方链接体验啦~
https://claude.ai/
参考链接：
[1]https://www.anthropic.com/news/claude-3-family
[2]https://twitter.com/AnthropicAI/status/1764653830468428150/photo/1

基准大模型上下文 gpt-4 视频生成模型全球最强大模型易主 GPT-4被超越

上一篇：朝鲜女足U20 1-1中国女足U20，Kim Song-gyong打破僵局，霍悦欣救主朝鲜u20女足女足u20朝鲜

下一篇：巴雷拉禁区内被铲翻，裁判判罚点球桑切斯一蹴而就巴雷拉被ko 巴雷拉点球

相关内容

热门资讯

财政部在香港发行60亿元人民币... 新华社北京5月30日电《中国证券报》30日刊发文章《财政部在香港发行60亿元人民币绿色主权债券》。...

全球顶级创作者为何齐聚上海——... 5月30日晚，2026互联网优质内容创作盛典（TOP CREATORS GALA，简称TCG）将在上...

全部卸任！百亿基金经理，刚刚发... 爆款产品基金经理宣布卸任！ 5月30日，德邦基金发布公告，旗下基金经理雷涛因个人原因卸任其管理的全部...

利润腰斩也要卷AI！小米模型永... 作者 | 华卫今日，小米宣布永久性翻新整个模型定价体系。价格调整公告称，MiMo-V2.5 系列 ...

超声电子2025年研发投入2.... 超声电子（000823）披露2025年年度报告。报告期内，公司全年研发投入达2.88亿元，同比增长0...

原创一... 雷达财经出品文|丁禹编|孟帅净利润由盈转亏、毛利率暴跌，一季度的理想汽车过得并不“舒坦”。今...

尾盘，生变！02513，“一字... 【导读】“老登”反击，尾盘多股异动，智谱直线闪崩中国基金报记者泰勒大家好啊，今天的市场，又让泰...

段永平单日赚9亿港元，泡泡玛特...

菊乐股份北交所IPO过会，九年... 蓝鲸新闻5月29日讯（记者朱欣悦）5月29日，北交所上市委2026年第53次审议会议结果显示，四川...

原创人... 2023年，联合国人口司报告：印度人口超过了中国。中国丢掉了“世界第一人口大国”的帽子，马路上娃娃车...

缓解亏损压力，消息称Meta明... IT之家 5 月 30 日消息，科技媒体 The Information 今天（5 月 30 日）发...

原创大... " 作者丨追命编辑丨坚果封面来源丨Unsplash " 近日，刘强东的“兄弟论”又一次刷屏。...

美国软件股逆袭，创2001年以... Snowflake与Okta强劲财报提振情绪，市场对AI颠覆软件行业的极端悲观预期开始松动。 Sno...

原创 5... 一夜之间，黄金价格犹如经历一场惊心动魄的“踩踏”，重重跌破了4500美元/盎司的心理大关，昔日被视为...

德康农牧(02419.HK)获... 格隆汇5月29日丨根据联交所最新权益披露资料显示，2026年5月28日，德康农牧(02419.HK)...

37岁公司董事长、车手张秀军比... 每经编辑｜何小桃 5月29日，2026中国环塔国际拉力赛组委会发布通告：5月26日，在2026中国...

原创人... 观察者网报道，本周在纽约经济俱乐部的一场专题讨论会上，加拿大总理卡尼发表了一番引发广泛关注的讲话。这...

反复尿路感染别只吃消炎药很多人尿频、尿急、尿痛一发作，就自行购买消炎药服用，症状消失就立刻停药，这是尿路感染反复发作的主要原...

原创散... 最后再说一遍：散户对白酒、地产的理解是大错特错了…… 投资是投资，现实是现实，行业是行业，大家必须分...

从Vinexpo Asia 2... 5月26日至28日，Vinexpo Asia – Be Spirits – Be No 2026亚洲...

2026 © 商务投诉网网站信息来源网络采集及用户发布，如有侵权违规，请发送邮件至2697952338@qq.com
比特空间八零商务网华商网开创问答网东方游戏网华商生活网易库网澳新网