智讯智库

xAI发布Grok 4.7,AA Briefcase获独立榜确认第4

9月21日官宣编程与知识工作旗舰,更大基础模型加长时强化学习,定价每百万token输入2美元输出6美元与4.6同价,AA Briefcase获独立榜确认第4

AI
相关企业:X来源:施展2026年09月22日 12:51
分享
收藏
字体大小
封面图

SpaceXAI(xAI)9月21日发布Grok 4.7,定位编程与知识工作旗舰,采用更大基础模型与面向数小时困难任务的长时强化学习,强化自我校验与长上下文,原生理解Grok Bot框架。定价每百万token输入2美元、输出6美元,与4.6同价同速,另有提速2倍、价格翻倍的fast版。距4.6发布40天[1][2]。

基准成绩需要区分来源。AA Briefcase v1.1得1657,获独立榜确认,总榜第4,落后Claude Fable 5.1 max(1678)[3];CursorBench的46.3%与DeepSWE的71.0%仅有xAI自报,官方榜均未收录4.7[4][5]。即便属实,仍落后Fable 5.1(51.8%)与Muse Spark 1.3(75.4%)。

Harvey法律(19.6%)与EEBench(64.0%)为表内领先,但HealthBench与Terminal-Bench落后对手,“最强编程”应理解为xAI自家最强加性价比前沿;xAI有CursorBench污染前科(4.5被撤分),自报分待复核;外传2.1T参数未经确认[6]。

参考来源:

[1] SpaceXAI. Introducing Grok 4.7[EB/OL]. (2026-09-21)[2026-09-22].

[2] SpaceXAI. Grok models and pricing[EB/OL]. (2026-09-21)[2026-09-22].

[3] Artificial Analysis. AA-Briefcase v1.1 Elo 榜单[EB/OL]. (2026-09)[2026-09-22].

[4] Cursor. CursorBench 官方榜[EB/OL]. (2026-09-10)[2026-09-22].

[5] DataCurve. DeepSWE v1.1 官方榜[EB/OL]. (2026-09-03)[2026-09-22].

[6] Paddo. Publishing the exam you lose[EB/OL]. (2026-08-14)[2026-09-22].

最新发布