马斯克旗下SpaceXAI发布Grok 4.7:DeepSWE得分71%,狗狗币(DOGE)受关注

马斯克的SpaceXAI于9月21日发布Grok 4.7:DeepSWE v1.1得分71.0%,Terminal-Bench 4.0得分38.0%,定价维持每百万代币2美元/6美元。

AI 摘要AI
  • SpaceXAI于9月21日发布Grok 4.7,DeepSWE v1.1得分71.0%
  • Grok 4.7定价为每百万代币2美元/6美元,与Grok 4.6持平
  • Terminal-Bench 4.0得分从20.3%跃升至38.0%
  • HackerBench v0.3中仅3.3%高风险双用途提示突破
d2mv6ykl

Grok 4.7瞄准数小时级长任务

马斯克(Elon Musk)旗下AI部门SpaceXAI于9月21日正式发布Grok 4.7,称其为公司迄今在编程与知识工作上能力最强的模型。根据官方公告,该系统建立在比Grok 4.6更大的基础模型之上,并在难度更高的任务组合上经历了更长的强化学习周期,刻意聚焦那些需要数小时才能完成的任务。SpaceXAI把这次发布的卖点放在“耐力”上:以往模型以分钟级速度作答,而这一代被调校为能够持续啃下原本要占用一名人类工程师或分析师数小时的工作。公司表示,模型在长时段运行中自我校验输出的能力明显增强,对超长上下文窗口的处理能力提升,并能原生运行Grok Bot智能体框架——这些升级在对话、通用知识任务以及专业文档和演示文稿的生成中均有体现。公布的跑分显示,xhigh配置已接近前沿水准:在软件工程测试套件DeepSWE v1.1上,Grok 4.7拿下71.0%,小幅领先Fable 5.1 max的70.0%,仅次于GPT-5.6 Sol max的72.7%。在衡量数小时终端操作的Terminal-Bench 4.0上,该模型从前代产品的20.3%跃升至38.0%。在模拟律师、护士和金融分析师数小时专业工作的测试套件中——包括AA Briefcase与HealthBench——SpaceXAI称Grok 4.7已与业界最强模型并驾齐驱。安全是另一项主打声明:重建后的安全体系让这一版本成为公司在拒绝不当请求、抵御越狱攻击方面最严格的一代。在测试恶意网络任务的HackerBench v0.3中,仅3.3%的高风险双用途提示成功突破,且对正当防御性安全工作的误拒极少。部分网络安全合作伙伴已获得仅限邀请的红队访问权限,以支持防御研究。模型现已在Cursor、Grok Build、Grok API、主要云平台及模型路由器上上线。

定价维持2美元,《母巢之战》测试让Grok 4.6颜面扫地

定价才是真正令人意外的地方:Grok 4.7的定价为每百万输入代币2美元、每百万输出代币6美元——与Grok 4.6完全相同——另有一款快速变体,以双倍价格换取双倍输出速度。这一代币经济学式的定价结构对竞争对手形成猛烈压制:GPT-5.6 Sol的报价为每百万代币4美元/20美元,Fable 5.1为10美元/50美元,Grok的费率约为对手的三分之一到一半,且交付速度更快。对照这些数字,SpaceXAI自家的对比表显示,Grok 4.7在电气工程(EEBench:64.0%,GPT-5.6 Sol为39.4%,Fable 5.1为56.4%)和Harvey法律智能体基准(19.6%对2.5%和6.7%)上领先,但在软件工程(CursorBench 4.0:46.3%对Fable 5.1的51.8%)和临床推理(HealthBench Professional:56.7%对62.1%)上落后。上述全部数据均来自SpaceXAI公布的信息。公司背景同样关键:SpaceXAI的现有格局成形于2月,当时xAI并入SpaceX,随后又在6月收购了Cursor——这是马斯克商业版图的一部分,该版图还涵盖Tesla(TSLA),且按我们此前的报道,马斯克计划在数周内整合旗下AI订阅服务。然而就在发布前数小时,一项众包基准测试给前代产品泼了冷水。开发者Ben Swerdlow搭建的Brood War Bench让AI智能体对战《星际争霸:母巢之战》,于9月20日在X上流传:来自Codex、Claude和Grok的19个配置共打了171场对局,其中Codex Astra在最高推理档位下18战全胜。Grok 4.6的三个配置输给了每一个Codex和Claude配置,最好成绩是18场中赢下2场。Swerdlow记录了一场比赛:最高推理档的Grok在43分钟内烧掉11,138个推理代币,却只发出6批指令——自始至终没有造出一个作战单位——并写道,Grok还不够聪明,老一代模型把即时战略游戏当回合制来打。他补充说,没有任何参赛者超过新手水平,而Grok 4.7尚未参与排名。 希望实时跟踪行情的读者,可在Bitget查看现货与合约的实时价格。

定价压力才是真正的信号

发布日数据与《母巢之战》惨败放在一起看,其实是同一个故事:前沿实验室如今以大宗商品式的价格出售推理能力,而智能体的可靠性——而非静态跑分——才决定胜负。COINOTAG的判断是:2美元/6美元的定价让Grok 4.7的代币经济学成为竞争对手必须跟进的标杆,正如期货定价迫使市场重新锚定预期一样;而缺乏可比算力的实验室,可能在这场价格战中沦为退出流动性。从历史经验看,马斯克算力相关的头条往往会带动狗狗币(DOGE)等与马斯克关联资产的情绪——关注Grok 4.7的智能体实测结果,而不是发布日的宣传话术。

COINOTAG News Desk

COINOTAG News Desk

COINOTAG 的编辑与研究团队。

News Desk 运作方式
AI 辅助

本文由人工智能辅助生成、经 AI 审核,并在 COINOTAG 编辑监督 下发布。