首页 > 正文

AI智能体赛道同台竞技 Grok 4.6亮相“撞车”DeepSeek V4 Pro正式版

2026年08月13日 14:02
来源: 澎湃新闻
编辑:东方财富网

手机上阅读文章

  • 提示:
  • 微信扫一扫
  • 分享到您的
  • 朋友圈

K图 SPCX_0

  马斯克旗下SpaceXAI发布新一代大模型Grok 4.6,将重点进一步转向长时间运行的AI智能体(AI Agent)。

  巧合的是,中国大模型企业DeepSeek同步推出V4 Pro正式版,两款聚焦AI智能体赛道的前沿模型形成正面同台竞技。

  当地时间8月12日,SpaceXAI发布Grok 4.6。SpaceXAI表示,新模型是在Grok 4.5基础上进一步升级,重点提升长流程任务中的表现,以及处理更复杂的交互式、视觉和知识工作任务的能力。

  此次发布距离Grok 4.5亮相仅一个多月。7月8日,SpaceXAI刚刚发布Grok 4.5,并将其定位为面向编程和AI智能体任务的模型。

  Grok 4.6发布后获市场积极反馈,美股周三收盘,SpaceX股价涨超9%。

  性能进入第一梯队

  从第三方测试来看,Grok 4.6已经重新进入前沿大模型竞争的第一梯队。

  全球知名独立AI大模型评测机构Artificial Analysis公布的Artificial Analysis Intelligence Index显示,Grok 4.6得分为61分,与OpenAI的GPT-5.6 Sol处于同一水平,相比上一代Grok 4.5提高5分。Artificial Analysis称,Grok 4.6由此重新进入前沿模型行列。

四款前沿模型 Artificial Analysis 综合智能指数对比

  不过,Grok 4.6对比Anthropic旗下的Fable 5未能有碾压态势。

  从完整测试结果来看,Grok 4.6在部分智能体和知识工作相关测试中表现突出,但在一些软件工程、终端操作等测试中,Fable 5仍然领先。

SpaceXAI 官方公布 Grok 4.6 与主流前沿模型基准测试对比

  这一点也使此次升级的意义更加清晰。有分析称,SpaceXAI 的目标不只是冲击传统问答类基准榜单,而是打造能够独立承接连续复杂任务的模型。

  从“回答问题”转向“完成任务”

  SpaceXAI此次特别强调了Grok 4.6的长流程智能体能力。

  例如,用户要求开发一个软件,模型需要自行理解需求、编写代码、运行测试、发现问题,再修改代码,而不是每一步都等待用户下达新的指令。

  SpaceXAI表示,Grok 4.6针对这类长时间运行任务进行了专门训练,包括软件工程、研究分析、STEM以及其他知识工作,同时增加了模型生成的推理数据和高质量工程数据。

  软件工程是此次Grok 4.6升级的核心应用场景之一。

  SpaceXAI表示,新模型经过针对复杂工程任务的强化训练,覆盖内核优化、网页开发、计算机辅助设计等任务。

  这也是目前全球AI产业竞争最激烈的方向之一。OpenAI、Anthropic、谷歌等公司都在推动AI从代码补全工具向能够独立承担软件开发任务的智能体演进。

  此前,马斯克也曾在演讲中强调,SpaceXAI的策略则是把Grok与自身庞大的技术体系结合起来。

  在马斯克的规划中,随着Grok进入SpaceX体系,其潜在应用范围已经不再局限于一个独立的聊天机器人产品,而可以进一步延伸到SpaceX自身的工程研发、软件开发以及其他业务场景。这也是SpaceXAI的优势所在:拥有SpaceX的计算基础设施、工程场景和资本支持。

  从产业角度看,AI大模型竞争正在越来越依赖“模型+算力+数据+应用场景”的综合能力。

  有分析指出,Grok 4.6的发布折射出整个AI产业正在发生的变化。近年大模型竞争早期焦点集中在参数规模、通用推理与各类基准跑分;随着前沿模型能力逐步收敛,行业竞争重心正向落地应用层转移。谁能够让AI真正完成软件开发、研究分析、数据处理和企业流程,谁就更有可能获得稳定的商业收入。

  下一个战场AI智能体

  Grok 4.6发布同期,DeepSeek推出V4 Pro正式版,两款模型更新重心均聚焦长流程AI智能体方向。从公开信息来看,Grok 4.6上下文窗口上限500K Token,支持图文多模态输入;DeepSeek V4 Pro上下文窗口可达1000K Token,最大输出384K Token,为文本模型。

  在能力优化上,Grok 4.6重点强化科研分析、复杂STEM与高端软件工程任务;DeepSeek V4 Pro侧重代码工程、终端自动化等场景。二者依托不同技术路线与生态体系面向开发者开放选型。

  根据DeepSeek给出的模式测试对比成绩,V4-Pro-0813在AI编程智能体基准测试DeepSWE中得分为62.7,甚至超越了Claude Opus 4.8。在AI安全智能体基准测试Cybergym、智能体基准测试Automation Bench中甚至超越目前公认最强大的Claude Fable 5。

  商业化方面,Grok 4.6已经通过API向开发者开放,并接入包括OpenRouter、Vercel和 Cloudflare等平台,同时进入Cursor和Grok Build等开发工具。

  AI Agent与传统聊天机器人相比,需要消耗更多Token,因为一个复杂任务往往需要模型进行多轮推理、调用工具、读取文件并反复修改结果。因此,对于Agent开发者而言,模型性能之外,Token成本同样直接影响最终产品能否实现商业化。

  价格方面,Grok 4.6 API 输入价格为2美元/百万token,输出价格为6美元/百万token。Artificial Analysis称,Grok 4.6在达到前沿模型水平的同时,其价格仍具有明显竞争力。

  对比之下,V4-Pro模型输入(缓存未命中)3元/百万Token、输出6元/百万Token。但值得注意的是,DeepSeek此前已发布公告,预告近期将整体上调API定价,预计涨幅较大。涨价落地后二者成本竞争格局或将重塑。

(文章来源:澎湃新闻)

(原标题:AI智能体赛道同台竞技,Grok 4.6亮相“撞车”DeepSeek V4 Pro正式版)

(责任编辑:10)

 
 
 
 

网友点击排行

 
  • 基金
  • 财经
  • 股票
  • 基金吧
 
郑重声明:天天基金网发布此信息目的在于传播更多信息,与本网站立场无关。天天基金网不保证该信息(包括但不限于文字、数据及图表)全部或者部分内容的准确性、真实性、完整性、有效性、及时性、原创性等。相关信息并未经过本网站证实,不对您构成任何投资决策建议,据此操作,风险自担。数据来源:东方财富Choice数据。

将天天基金网设为上网首页吗?      将天天基金网添加到收藏夹吗?

关于我们|资质证明|研究中心|联系我们|安全指引|免责条款|隐私条款|风险提示函|意见建议|在线客服|诚聘英才

天天基金客服热线:95021 |客服邮箱:vip@1234567.com.cn|人工服务时间:工作日 7:30-21:30 双休日 9:00-21:30
郑重声明:天天基金系证监会批准的基金销售机构[000000303]。天天基金网所载文章、数据仅供参考,使用前请核实,风险自负。
中国证监会上海监管局网址:www.csrc.gov.cn/pub/shanghai
CopyRight  上海天天基金销售有限公司  2011-现在  沪ICP证:沪B2-20130026  网站备案号:沪ICP备11042629号-1

A
安联基金安信基金
B
博道基金渤海汇金北京京管泰富基金百嘉基金贝莱德基金管理博时基金宝盈基金博远基金
C
长安基金长城基金长城证券财达证券淳厚基金创金合信基金长江证券(上海)资管长盛基金财通基金财通资管诚通证券长信基金财信基金财信证券
D
德邦基金德邦证券资管大成基金东财基金达诚基金东方阿尔法基金东方红资产管理东方基金东莞证券东海基金东海证券东吴基金东吴证券东兴基金东兴证券第一创业东证融汇证券资产管理
F
富安达基金蜂巢基金富达基金(中国)富国基金富荣基金方正富邦基金方正证券
G
光大保德信基金国都证券广发基金广发资产管理国海富兰克林基金国海证券国金基金国联安基金国联基金格林基金国联民生国联证券资产管理国融基金国寿安保基金国泰海通资管国泰基金国投瑞银基金国投证券国投证券资产管理国新国证基金国信资管国信证券国新证券股份工银瑞信基金国元证券
H
华安基金汇安基金华安证券华安证券资产管理汇百川基金华宝基金华宸未来基金华创证券泓德基金华富基金汇丰晋信基金海富通基金宏利基金汇泉基金华润元大基金华商基金惠升基金恒生前海基金华泰柏瑞基金华泰保兴基金红土创新基金汇添富基金红塔红土华泰证券(上海)资产管理华夏基金华西基金华鑫证券合煦智远基金华银基金恒越基金弘毅远方基金
J
嘉合基金金融街证券景顺长城基金嘉实基金九泰基金建信基金江信基金金信基金金鹰基金金元顺安基金交银施罗德基金