SpaceXAI 推出 Grok 4.7:编程与知识处理能力升级,百万词元输入 2 美元起
SpaceXAI 发布新一代 Grok 4.7 模型,主打编程与知识工作场景。该模型采用更大规模基座并延长强化学习训练,速度与定价同 Grok 4.6 持平,百万词元输入 2 美元起。在 CursorBench 4.0、GDPval 及 AA Briefcase 等基准测试中表现提升,官方称其为当前最强编码与知识处理模型。
SpaceXAI 于 9 月 22 日正式发布新一代模型 Grok 4.7,聚焦编程与知识工作两大应用场景。官方将其定位为该公司迄今最强的编码与知识处理模型,并强调其在速度与成本上的竞争力——运行速度达到同类模型的两倍,价格则仅为一半。
与上一代 Grok 4.6 相比,Grok 4.7 的核心变化在于基础模型的规模扩展与训练策略调整。新模型采用了更大规模的基座模型,并接受了更长时间的强化学习训练,训练数据更加侧重需要数小时才能完成的复杂任务。这一调整使模型在困难任务上能够持续运行更长时间,同时强化了对自身输出结果的检查与验证能力。
在具体能力优化方面,SpaceXAI 针对 Grok Bot harness 对 Grok 4.7 进行了原生训练,提升了其在对话及一般知识工作任务中的表现。此外,该模型在文档和演示文稿生成方面也有所改进。官方表示,Grok 4.7 的运行速度和定价与 Grok 4.6 保持一致。
基准测试结果显示,Grok 4.7 在 CursorBench 4.0 中面向长时间运行的编程任务,在价格与性能方面处于同类模型前列。在 GDPval 和 AA Briefcase 两项基准测试中,该模型均较 Grok 4.6 有所提升。这两项测试要求 AI 完成律师、护士、金融分析师等专业人士日常工作中的相关任务,进一步验证了其在真实知识工作场景中的适用性。