就在不久前,马斯克的SpaceXAI正式发布了全新的主力模型Grok 4.7。
它的核心卖点在于,在保持相同价格和速度的前提下,提供了更强劲的性能。
马斯克第一时间宣称,“Grok 4.7将SpaceXAI在智能体编程领域送上了第三名的位置,仅次于Anthropic和OpenAI”。
速度快、价格低,Grok 4.7被视为个人处理工作的首选工具。
SpaceXAI的官方博客中,官方将其定位为“史上最强Grok,专为编程和知识工作而设计”。
具体而言,Grok 4.7在编程和知识工作的基准测试中,成绩几乎全面超越了GPT-5.6 Sol Max,紧追Fable 5.1 Max。
输入每百万Token定价2美元,输出6美元,与Grok 4.6保持一致。
但底层模型经历了彻底更新,基座模型更大,强化学习训练时间延长,任务难度权重向“需要数小时才能完成的工作”倾斜。
让Grok 4.7和Grok 4.6分别制作一个开放世界城市游戏,两者之间的差距显而易见。
值得一提的是,下一代2.5T新模型Grok 4.8也已训练完毕。
马斯克的拿手好戏,才刚刚拉开序幕。
Grok 4.7登场,编程能力跻身第一梯队
能够更量化地体现Grok 4.7本轮进步的,还是编程测试。
拆解AA的榜单,数据颇具看点。
在综合智能指数上,Grok 4.7获得了46分,相比4.6仅微增2分。而第一梯队的Fable 5.1和GPT-6 Astra均为53分。
按单一模型计算,它排名第16;按实验室计算,则刚好挤入第四。
而真正让马斯克引以为傲的编程榜单,其实有两张。
套上GrokBuild框架后,Grok 4.7得分飙升至56分,排在Fable 5.1、GPT-6 Astra和Opus 5之后。马斯克口中的“全球第三”,是将Anthropic的两个模型合并为一家来计算。
切换到统一基准的Terminal-Bench4.0后,Grok 4.7的通过率骤降至26%~27%。作为对比,GPT-6 Astra为60%,Fable 5.1为55%。
不过,在评测机构ValsAI的榜单上,Grok 4.7的表现不升反降,从第14名一路跌至第24名,比上一代4.6还倒退了5分。
马斯克为何要极力为Build框架站台?答案隐藏在官方公告的附注中——
“Grok 4.7在预训练阶段,深度对齐了GrokBot框架的交互模式。”
换句话说,它极度依赖自家工具的调用逻辑和任务拆解方式。一旦脱离这一环境,其战斗力便会大打折扣。
知识能力,同样表现不俗
此次升级的另一重点,是更贴近大众的场景——办公。
在长流程知识工作测试AA-Briefcase中,Grok 4.7获得了1657 Elo,比Grok 4.6的High档提升了111分。
在GDPval-AA上,它获得了1695 Elo,比上一代高出90分。
这些任务看重的是,AI能否真正帮助专业人士完成工作并产出合格成果。
例如,整理资料、制作文档、进行分析和演示文稿,Grok 4.7的表现明显优于上一代。
此外,在电气工程测试EEBench上,Grok 4.7取得了64.0%的成绩,在所列的四款模型中最高。
全网首测,有惊喜也有失误
Grok 4.7一经上线,许多人便迫不及待地开始尝试。
最引人注目的一个演示来自开发者Tak。
他没有给Grok 4.7任何具体要求,只留下一句话:“你10分钟内能做什么就做什么。”
结果,Grok自行在Blender中制作了一个黄铜浑天仪,上面的行星甚至还能转动,吸引了全网25万人观看。
Tak本人评价道,“说实话,一点也不差”。
然后是经典项目——鹈鹕骑自行车。
有人直接开启最高配置,使用xhigh加fast模式运行,耗时整整18分钟,花费3.16美元。
结果生成的画面效果不错,一只白鹈鹕在海边骑车,翅膀搭在车把上。
另一个人生成的效果则差强人意,生成的棕色鸟直接瘫在自行车上。
产品博主Paweł Huryn使用两个真实代码库,埋入了105个bug进行了三轮测试。
结果是,GPT-6 Astra能修复45个;Grok 4.7修复了28.7个。具有戏剧性的是,上一代Grok 4.6也是28.7个。
还有人直接进行了硬碰硬的对照实验:将同一个芯片项目,同时交给Grok Build和Cursor中的Grok 4.7。
整整两小时测试下来,最直观的感受就是四个字:又快又省。
此外,还发现了一个新细节:Cursor竟然悄悄将Grok 4.7的上下文长度提升到了500K,而上一代4.6只有256K。
做编程Agent的Factory也第一时间接入了自家的Droid,给出的评价较为克制。
它能处理工程、调试、数据、基础设施等任务,查找命令比4.6更快,medium档足够使用,high档在处理旧代码时效果更佳。
定价便宜五倍,算总账却遭遇背刺
此次,Grok 4.7官方宣传的另一大亮点是,价格仅为同类产品的一半。
不得不说,其单价确实诱人:输入2美元、输出6美元。
对比Astra和Fable动辄10美元输入、50美元输出的高价,Grok的单价便宜了5到8倍。
官方展示的Cursor Bench 4.0性价比曲线上,Grok 4.7的最高档获得了46.3%的成绩,解决一道题成本6.01美元;Fable 5.1的中档成绩为46.8%,一道题成本7.05美元。这看起来像是一场势均力敌的精准狙击。
但只要用放大镜查看图表底部的细节,这笔账就完全变了味。
Fable 5.1的低档跑出了45.1%的成绩,单题成本仅为5.44美元,比Grok的最高档还要便宜;而上一代GPT-5.6 Sol的高档成绩为35.7%,单题成本仅为2.85美元。
玄机依然在于那惊人的“话痨体质”。
8.1万输出token,几乎是GPT-6 Astra的三倍。单价便宜5倍,但废话多了3倍,实际账单优势被生生腰斩。
Hacker News上有开发者算清总账后吐槽:Grok 4.7的缓存读取单价甚至反超了Sol。
Cursor社区更是直接破防:“这根本不是什么划时代的性价比怪物,消耗的token几乎是4.6的两倍,4.5时代那种极致廉价感彻底没了。”
不过在纯速度上,它确实快得惊人。
AA实测每秒狂飙188个token,fast模式下更是直接翻倍。
模型加框架,才是下一个战场
如今再看Grok 4.7的战术意图,已经彻底明朗。
它不打算触碰AGI的绝对王座,而是退守前沿第二梯队,卡住最便宜、最快的高地,专打性价比。
但这场发布暴露出的真正行业趋势是——单体模型的时代,正在过去。
Grok 4.7的高分,有一大半是依靠Grok Build的量身定制硬撑上去的;一旦脱离自家框架,分数立刻露馅。
Anthropic用Claude Code锁死长程任务,OpenAI用Codex把持生态,xAI也终于走上了用私有框架捆绑开发者的道路。
未来的第三方评测榜单将彻底失去纯粹性,以后再看到所谓的跑分排名,第一句话必须先问:
你到底是用什么框架测的?
参考资料
https://x.com/SpaceXAI/status/2102069815225586149 https://x.ai/news/grok-4-7 本文来自微信公众号“新智元”,作者:ASI启示录;编辑:摩西 桃子,36氪经授权发布。
九游娱乐入口围绕九游体育不断创新,回应用户的真实需求。
2024年5月13日
欢迎通过九游体育认识关卡设计,从一篇感兴趣的介绍开始,九游娱乐以成为实用的游戏阅读平台为目标,持续关注地图探索的入门步骤,因为理解动作冒险需要清晰的阅读线索,九游娱乐平台从理解顺序入手组织内容,关注预约活动时,建议一并了解使用说明,避免遗漏必要信息。
2024年5月13日
九游娱乐入口围绕九游官网不断创新,回应用户的真实需求。
2024年5月13日
精选专注关卡设计与地图探索的深度解析,降低新手入门门槛。内容,九游娱乐入口与你一同发现更多精彩。