Grok 4.7 终于上线,但 Claude 仍在大多数基准测试中占据优势
SpaceX AI 发布 Grok 4.7:定价亲民,但在多项基准测试中仍落后于 Claude Fable 5.1
周一,SpaceX AI 正式发布了其**大语言模型 Grok 4.7。该模型的输入**价格为每百万个** 2 美元。尽管 SpaceX AI 自身的基准测试数据显示,Anthropic 的 Claude Fable 5.1 在大多数测试项目中依然占据**地位。
核心要点
SpaceX AI 以与 Grok 4.6 相同的价格推出了 Grok 4.7,其中输出**的价格为每百万个 6 美元。 在公司进行的对比中,Claude Fable 5.1 在 GDPval、CursorBench 和 Terminal-Bench 等评测中保持**。 Grok 4.7 经历了多次推迟后终于上线,并在电气工程和法律工作领域取得了胜利。Grok 4.7 的推出详情
该公司于周一宣布了这一模型,称其为目前**大的编码和知识工作模型。目前,Grok 4.7 已在 Cursor、Grok Build、Grok API 以及第三方代码工具包中上线使用。此外,还有一个速度更快的变体版本,其价格翻倍。输出**价格维持在每百万个 6 美元,这与一个多月前发布的 Grok 4.6 保持一致。
SpaceX AI 表示,Grok 4.7 基于一个更大规模的基础模型运行,该模型经过更长时间的强化学习训练,**解决需要数小时才能完成的复杂问题,并配备了重新构建的安全防护栈。马斯克此前曾声称,该模型拥有 2.1 万亿个参数,高于之前的 1.5 万亿,并且利用了 SpaceX 的工程数据进行补充训练,但这一细节并未在官方发布帖文中提及。
Claude Fable 5.1 的优势
在评估律师、护士和金融分析师工作的 GDPval 基准测试中,Grok 4.7 的 Elo 评级为 1,695,而 Claude Fable 5.1 则为 1,735。在多小时办公任务测试 ** Briefcase 中,Grok 4.7 再次落后。在 Terminal-Bench 测试中,两者的差距扩大了近 20 分。
不过,新模型在某些领域也取得了突破,在电气工程测试中以 64% 对 56.4% 的成绩击败了 Fable 5.1,并在 Harvey 的法律代理基准测试中将对手的成绩提高了三倍。Grok 4.7 在公司发布的每一项测试中均优于 Grok 4.6,其在终端工作方面的得分几乎翻了一番。
值得注意的是,上述所有数据均来自 SpaceX AI 自身。CursorBench 是由 Cursor(SpaceX 上个月完成收购的代码编辑器)开发的编码测试,在该测试中,Grok 4.7 以 51.8% 对 46.3% 的成绩落败。Grok 4.7 **具备明显优势的是价格,其输入**费用仅为 Fable 5.1 的五分之一。
马斯克的延期风波
此次发布结束了一个充满错失目标的夏季。马斯克在 7 月底曾表示该模型将在四周内推出,但随后反复推迟发布日期。9 月 1 日,他将时间窗口缩小至 10 天;而在 9 月 11 日,他承认模型还需要几天的训练时间。
在发货前几天,他再次**了预期,将 Grok 4.7 的性能对标为 Claude Opus 5.0,而非更新的 Opus 5.1,且多模态功能尚未完善。此后,马斯克称 Grok 4.8 将是显著的升级,并暗示 Grok 5 可能会**整个行业,但目前这两个模型均未公布具体的发布日期。
本文地址:https://licai.bestwheel.com.cn/qk/720499.html
文章标题:Grok 4.7 终于上线,但 Claude 仍在大多数基准测试中占据优势
版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。






