Grok 4.6跻身大模型第一梯队,马斯克AI征程仍需跨越“奥德赛”挑战

   时间:2026-08-14 12:52 来源:天脉网作者:冯璃月

马斯克又一次立下了一个看似不可能完成的目标:让旗下AI公司xAI的Grok在今年年底前制作出一部完整的《奥德赛》电影。这个宣言不仅延续了他一贯的夸张风格,也引发了科技界和影视界的广泛讨论。虽然Grok生成的三分钟短片已展现出电影预告片般的质感,但要将这部史诗扩展为90分钟的长片,仍面临巨大挑战。

Grok 4.6的发布,为这一雄心提供了新的技术支撑。在最新一轮模型竞争中,Grok已跻身美国大模型第一梯队,其能力接近OpenAI和Anthropic的旗舰产品,编程成绩甚至在部分榜单上领先,且API价格更具竞争力。然而,在长链条Agent任务方面,Grok仍存在短板,尤其是在任务收尾阶段的稳定性上表现欠佳。

为了验证Grok的实际能力,测试人员提出了两项挑战:一是解读荷马史诗《奥德赛》的历史与文学价值,二是设计一套将三分钟短片扩展为90分钟长片的制片系统。面对第一项挑战,Grok展现出了深厚的学术功底,将问题拆解为青铜时代考古、史诗时间层、作品诗学和现代改编四个维度,并纠正了一个流传已久的错误,指出“让千艘战船起航的面孔”出自马洛而非荷马。

在第二项挑战中,Grok设计了一个电影制片计算器,将成片时长、镜头长度、复杂镜头占比等参数纳入考量。根据默认设置,完成一部90分钟长片需要约208个工作日。尽管Grok建议缩短片长以降低风险,但这一计算仍停留在理论层面,未考虑实际制作中可能出现的连续性失败和人工审核成本。

外部榜单的数据进一步印证了Grok的优势与不足。在Artificial Analysis榜单上,Grok 4.6的综合智能指数与GPT-5.6 Sol持平,仅落后Claude Fable 5一分。在编程任务榜单CursorBench 3.2上,Grok 4.6 High的完成率超过Sol,且成本更低。然而,在DeepSWE和TerminalBench等长链条任务测试中,Grok的表现仍落后于竞争对手。

Grok的快速迭代能力,是其追赶第一梯队的关键。从7月8日Grok 4.5发布到8月12日Grok 4.6问世,仅间隔35天。马斯克还预告,拥有2.1万亿参数的Grok 4.7将在几周后发布,进一步提升能力并优化Token效率。这种高频更新策略,得益于xAI在算力、数据和工程速度上的全面投入。

xAI在122天内建成了首期10万张Hopper GPU的Colossus集群,并在92天内扩展至20万张。X平台为Grok提供实时信息和用户数据,Cursor则贡献了大量编程任务和开发者反馈。这种数据与算力的双重驱动,使Grok能够持续优化模型性能,缩短版本更新周期。

马斯克的AI野心,与SpaceX的资本布局紧密相连。根据招股书,SpaceX计划在2025年向AI分部投入127亿美元,占公司总资本开支的61%。2026年二季度,这一数字进一步升至158.28亿美元,占三大分部资本开支的86%。AI业务被视为SpaceX未来垂直整合的基础平台,马斯克预计其收入将在2026年9月超过其他业务总和。

然而,Grok的商业化之路仍充满挑战。尽管其性价比优势显著,但在长任务可靠性和企业信任度方面仍需提升。企业客户对安全、稳定性和品牌风险的顾虑,不会因一次榜单排名上升而消除。从“最具性价比的第一梯队模型”到“最大的商业赢家”,Grok还需跨越可靠性、渠道建设和真实采用率等多重障碍。

马斯克的《奥德赛》计划,恰似Grok当前处境的缩影:生成短片已非难事,但完成整部长片仍需突破技术瓶颈。正如奥德修斯历经十年漂泊才重返故乡,Grok的商业化征程也需跨越重重挑战,方能抵达成功的彼岸。

 
 
更多>同类内容
全站最新
热门内容