刚刚,马斯克交卷 Grok 4.7!但这次吹牛吹大了

AI 圈没有假期。 从 OpenAI、Anthropic 到 xAI,各家巨头仿佛商量好了一样,连夜赶考,集中抢位。假期还没正式开始,基模决战的气氛就已经烘托到位了。 就在刚刚,SpaceXAI 正式发布 Grok 4.7。 官方博客 https://x.ai/news/grok-4-7 官方将其定位为目前最强的编程与知识工作模型。新模型已经进入 Cursor、Grok Build 和 Grok API,也将通过第三方编程工具、模型路由平台与云服务提供。 Grok 4.7 的发布比马斯克最初预告的时间晚了不少。从 7 月下旬开始吹风,到改口「再等几周」,接着压缩到「十天之内」,最后又来了一句「模型还得再调校调校」…… 一鸽再鸽后,Grok 4.7 的发布重点因此显得十分明确。SpaceXAI 没有把主要篇幅放在聊天体验或多模态展示上,而是 集中强调长时间执行、自我检查、专业知识工作,以及更有竞争力的价格性能比。 Grok 4.7,把长任务摆上台面 按照官方介绍, Grok 4.7 使用了一个比 Grok 4.6 更大的全新基础模型 ,强化学习时间更长,训练任务也更难,其中相当一部分需要数小时才能完成。 模型同时加强了长上下文管理和结果核查能力, 并针对 Grok Bot 的运行环境进行了原生训练,以提升对话任务和通用知识工作的表现。 官方公布的多项成绩显示,Grok 4.7 相比上一代有明显进步。 在 CursorBench 4.0 中,Grok 4.7 xHigh 得分为 46.3%,高于 Grok 4.6 High 的 40.4%;DeepSWE v1.1 从 65.2% 提高到 71.0%; Terminal Bench 4.0 则从 20.3% 升至 38.0%。电气工程基准 EEBench 的成绩从 53.0% 提高到 64.0%,面向长时间办公任务的 AA Briefcase v1.1 也从 1546 分增至 1657 分。 向左滑动查看更多内容 横向比较后,Grok 4.7 的优势主要集中在价格和部分专业任务,综合成绩仍未全面领先。 在 CursorBench 4.0 和 Terminal Bench 4.0 上,它低于 Fable 5.1 Max;在 DeepSWE v1.1 上略低于 GPT 5.6 Sol Max; 但在 Harvey Legal Agent Benchmark 中取得 19.6%,明显高于官方表格中的几款对比模型。 Artificial Analysis 随后给出 46 分的 Intelligence Index 成绩,称 Grok 4.7 让 SpaceXAI 进入全球前四名 AI 实验室,其 Coding Agent Index 表现也超过 GPT 5.6 Sol。 价格成为 Grok 4.7 最直接的竞争筹码。其 API 定价与 Grok 4.6 相同, 每百万输入 token 为 2 美元,每百万输出 token 为 6 美元。 https://docs.x.ai/developers/pricing SpaceXAI 还提供输出速度翻倍的快速版本,价格也相应翻倍。 用马斯克的话来说,Grok 4.7 Grok 4.7 是一款集智能、速度和低成本于一体的强大产品, SpaceXAI 官方则直接宣称,它的速度可达到同类模型的两倍,价格只有一半。 编程之外,SpaceXAI 开始争夺专业工作。 官方专门强调文档和演示文稿能力,并引用 GDPval 与 AA Briefcase 等评测,试图证明模型可以承担律师、护士、金融分析师等专业人士的部分工作。 对应到产品方向上,Grok 4.7 想进入的是需要读取大量材料、持续调用工具并反复核对结果的长流程任务。 Box 展示的一项保险理赔案例更能说明这一方向。 Grok 4.7 在 Box Agent 中核对一笔价值 200 万美元的索赔、保单与相关记录,发现 8.2 万美元重复发票和 6.4 万美元遗漏的供应商抵扣,还识别出一个可能令计算结果相差 14.3 万美元的免赔额问题。 系统最终生成了一份带引用的审查报告,保险覆盖范围和付款决定仍由理赔人员完成。 安全能力也被列为此次升级的重要部分。 SpaceXAI 表示,Grok 4.7 使用了全新的安全防护体系,在 LatchBio 生物安全基准中取得 62.4%;在面向高风险网络安全任务的 HackerBench v0.3 中,只有 3.3% 的危险双重用途提示通过,同时尽量减少对正常安全研究的误拒。 部分网络安全合作伙伴还将获得邀请制的红队能力,用于防御研究。 网友玩疯了,但口碑… Grok 4.7 上线后的第一批测试主要集中在网页、3D 场景和可视化编程,但口碑嘛,可以说是两极分化的厉害。

about image