刚刚,DeepSeek悄悄上线DeepSeek V4 Pro正式版,
马斯克高调推出Grok 4.6。
两者性能直逼顶级闭源,甚至有超越。
每百万输出Token,Grok 4.6要6美元,GPT-5.6 Sol要30美元,Claude Opus 5要25美元,Fable 5要50美元。而DeepSeek只要6元RMB。
DeepSeek每百万输出是Claude Opus 5的约1/29,Agent多项评测分数压过Opus 4.8。
Grok 4.6在综合智能指数上追平GPT-5.6 Sol,职场知识工作三项评测拿下头名。而每百万输出Token是GPT-5.6 Sol 的1/5。
DeepSeek V4 Pro正式版在Agent能力上大幅提升。
网络安全智能体测试CyberGym拿到83.3分,Fable 5是83.1分,Opus 4.8是78.3分。
自动化任务评测AutomationBench拿到31.8分,Fable 5的29.1分和Opus 4.8的27.2分都被压在身后。
终端操作基准Terminal-Bench 2.1上,DeepSeek拿到87.9分,超过Opus 4.8的85.0分,离Fable 5的88.0分只差0.1分,同场Kimi-K3拿到88.3分,守着这一项的头名。
同样的性能,Fable 5是DeepSeek约57倍。
带工具的人类最后考试HLE中,DeepSeek拿到60.0分,反超Opus 4.8的57.9分,继续追Fable 5的63.0分。
跨度最大的跳跃在软件工程上。
DeepSWE(软件工程智能体评测)从预览版的12.8分直接升到62.7分,提升近4.9倍,超过Opus 4.8的58.0分。
工具调用评测Toolathlon-Verified拿到74.1分,只略低于Opus 4.8的76.2分和Kimi-K3的76.5分。
从预览版到正式版,分数跳升几乎覆盖所有测试项,半个月时间模型升级幅度非常大。
马斯克这边的Grok 4.6在AA Intelligence Index(综合智能指数)上拿到61分,与GPT-5.6持平,离Fable 5的62分差1分,比Grok 4.5的56分高出5分,一代模型迈出一大步。
代码编辑器基准CursorBench上拿到69.9%,超过GPT-5.6的67.2%,离Fable 5的70.5%差0.6个百分点。
前沿代码评测FrontierCode上拿到61.3%,压过GPT-5.6的60.6%,紧追Fable 5的64.9%。
职场知识工作三项评测,Grok 4.6全部拿下头名。
职业工作评测GDPval-AA v2拿到1753 Elo(等级分),高过Fable 5的1741和GPT-5.6的1728。
简报案例评测AA-Briefcase拿到1577 Elo,压过Fable 5的1574。
专业法律任务Harvey LAB(哈维法律评测)拿到15.8%,Fable 5是11.3%,GPT-5.6只有2.5%。
Databricks工程师Ivan Zhou发帖,团队与SpaceXAI合作,在Dbrx Mosaic AI的OfficeQA Pro V2(办公问答评测)上评估Grok 4.6,配合Databricks的Genie Harness拿到当前最好成绩,模型在文档理解和数据推理任务上第一。
马斯克在X发帖,把智能、速度、成本放在一起看,与GPT-5.6 Sol、Claude Opus 5对比,Grok 4.6排第一。
新模型同天发布,分数互相咬,价格互相压。OpenAI和Anthropic的头部模型岌岌可危了。
这还没结束,马斯克表示,Grok 4.7将发布,性能会超过现有所有模型!
而据内部测试人士透露,DeepSeek Harness,“宇宙最强”Agent也将面世。
全球大模型竞争格局风云变幻,鹿死谁手未可知。
免责声明:本文来自算泥客户端,不代表超天才网的观点和立场。文章及图片来源网络,版权归作者所有,如有投诉请联系删除。
超天才网©2013-2014 All Rights Reserved 京ICP备09005826号-2 京ICP证130304号