Grok 4.5速度碾压竞品,80 TPS快在哪?

admin AI新闻 21

于2026年7月9日, SpaceXAI(原本是xAI)正式把Grok 4.5发布出来, 马斯克将它定位成“Opus级模型”。就在同一天, OpenAI宣称会在本周四发布GPT-5.6 Sol、Terra、Luna这三款模型, 之前Anthropic的Fable 5、Mythos 5也已经解禁了。Grok 4.5在这个时间点出现, 靠着的到底是什么呢? **推理速度**, 这是一个核心维度, **基准测试**, 它也是核心维度之一, **上下文能力**, 同样属于核心维度范畴, **工具使用**, 还是核心维度里的一项, **定价**, 亦是核心维度的组成部分, 把它拆成这几个核心维度来看。同一把尺子量两边, 看看Grok 4.5和同期竞品之间的真实差距究竟在何处。推理速度方面, Grok 4.5拉开断层领先开云app在线入口,开云真人官方下载世界杯直播平台开云手机入口app下载开云app官方入口网站,Grok 4.5的推理速度是其最突出的硬指标。官方数据表明, 其输出速度达到**80 TPS(每秒Token数)**, 官方声称“比Flash类模型更快”。这个速度方面的优势可不是毫无缘由就产生的, 其背后有SpaceXAI, 有那数万个NVIDIA GB300 GPU进行协同适配, 单任务Token消耗仅仅是同级处于领先位置模型的50%, 单次任务所需要的步骤数量减少了一半呢, 在基准测试里, 在工程任务方面局部实现了反超, 综合能力紧紧跟随着第一梯队, 在核心工程基准测试中, Grok 4.5的表现能够归纳成“稳——并非是最强的, 不过足够能够挤进第一梯队”。**DeepSWE 1.0** 方面, Grok 4.5 达到 62.0%, Claude Opus 4.8 为 55.75%, GPT - 5.5 是 64.31%。**Terminal Bench 2.1** 方面, Grok 4.5 占比 83.3%, Claude Opus 4.8 将近 78%, GPT - 5.5 为 83.4%。**SWE Bench Pro** 中, Grok 4.5 是 64.7%, Claude Opus 4.8 占 69.2%, GPT - 5.5 为 58.6%。于 **DeepSWE 1.0** 里, Grok 4.5 凭借 62.0% 超过 Claude Opus 4.8(55.75%), 并紧追 GPT - 5.5(64.31%);在 **Terminal Bench 2.1** 上, 83.3% 与 GPT - 5.5(83.4%)仅相差 0.1 个百分点;在更具挑战性的 **SWE Bench Pro** 上, Grok 4.5 以 64.7% 的解决率反超 GPT - 5.5(58.6%), 且朝 Claude Opus 4.8(69.2%)逼近。除此之外, 于**Harvey法律智能体基准测试**里, Grok 4.5处于榜首位置。然而, 不得不承认, 在**AAAI官方测试**当中, Grok 4.5的名次是第四, 仅仅比不上Fable 5、GPT-5.5、Opus 4.8。马斯克本人在内部评估时讲得颇为实在: “Grok 4.5大体上跟Opus 4.7差不多, 不过速度要快得多”。于7月8日被公开表态的马斯克, 在追赶中的差异化里称, 从128K到1M的上下文能力, 将于发布后一周内完成100万Token升级, 这意味着, 一旦升级完成, 其上下文能力将达100万Token, 然而它会低于GPT - 5.6的1.5M标准配置, 并且综合之综合呢, 其能力与GPT - 5 - 5基本上平等, 整体靠近-Claude - Opus - 4 - 8梯队又并非真的在确切此层次里, 仅仅是有这个相似可作比方的趋向罢了, 在工程类专项任务范围之内又形成了局部的一种超过其他类似情况的表现。SpaceXAI的迭代优先级为“速度 - 成本 - 上下文长度”, 1M上下文落地不会致使现有的每秒80次事务处理的高推理速度被牺牲, 也不会让减半的成本优势丧失, 将构建出“长上下文 + 高速度 + 低价格”的组合竞争力。工具使用方面: 适用于长周期工程任务, 以及跨界法律、金融领域。Grok 4.5是SpaceXAI首个专门针对编程和长周期智能体任务进行优化的模型, 它是由SpaceXAI与Cursor联合训练的, 并且依托Cursor真实编程工作流数据来完成补充训练。它的核心强化方向着重于, 那个跨众多代码仓库、牵涉数百种技能以及多种工具协同的长时间复杂任务是其核心强化方向着重关注的内容之一, 其核心强化方向还包括覆盖Rust、C/C++等具有挑战性的开发语言, 并且支持直接凭借自然指令构建端到端功能应用, 其核心强化方向另外还有拓展垂直领域, 正式将法律服务、金融服务、网络安全(漏洞发现与修复)场景纳入其中, 其核心强化方向还有全Office原生工具支持, 能够直接构建包含多工作表逻辑的复杂Excel模型、绘制PowerPoint原生图表、撰写结构化Word文档, 对比来看, Claude Opus 4.8在长链条复杂任务稳定性方面是最优的, 企业工具生态是最完善的;GPT - 5.5工具调用响应速度是最快的, 开发者生态覆盖率是最高的。Grok 4.5的与众不同之处在于**“针对工程场景进行的优化”**, 它并非在通用性方面最为强大, 然而在特定的长工程任务当中, 它或许比其他任何都更具便利性。它的定价情况是: 成本仅仅是同级别模型的25%至33%,定价可能是Grok 4.5最不存在悬念的一个方面。官方所定的价格是: **每百万输入Token为2美元, 每百万输出Token为6美元**。摩根士丹利、阿波罗全球管理公司等这般的华尔街机构, 已然着手展开了内部对于Grok的测试, 至于企业订阅与定制化服务, 则是SpaceXAI于IPO窗口期之内着重去推进的商业化途径。得出的结论是: 是谁更加适配什么样的场景呢? Grok 4.5虽并非是“最强”的那种模型, 然而它却是当前处于速度最快、成本同时还是最低状态下的第一梯队模式。倘若仅能挑选一个, 答案会依据你的场景来定: 要是你身为创业者或者开发者, 核心所要完成的任务是长周期的软件工程以及跨仓库多工具协同: Grok 4.5具备80TPS的推理速度, Token消耗被减半, 而定价只占据同级的25%到33%, 这是当下最为实惠经济的选择。它在DeepSWE 1.0、Terminal Bench 2.1上已然证实了自身的工程能力, 对于Rust、C/C++等硬核任务的执行效率是首要与众不同的优势。- 若是大企业并涉及通用长文档处理、复杂多轮推理以及低幻觉率需求, Claude Opus 4.8的长链条稳定性, GPT-5.5的1.5M上下文窗口所具有的特性以及其开发者生态覆盖率, 依然是更为保险的选择。Grok 4.5的通用场景稳定性有待大量用户去进行验证。- 要是从事法律、金融、网络安全等垂直场景相关工作, Grok 4.5于Harvey法律智能体基准测试里位居第一名, 其跨界布局已然正式实现落地, 是值得去尝试一番的。主要推出的结论是, 在“速度与成本”这一维度当中, Grok 4.5当前不存在对手, SpaceXAI正运用“性能近似Opus、速度以及成本实现反超”这种有错位的竞争策略, 打出一张比单纯堆积算力更为明智的牌, 而马斯克所承诺的“在2026年每月推出一款从零开始训练的全新模型”的节奏, 意味着这个差距或许还会持续拉大。

标签: Grok4.5 推理速度 基准测试 上下文能力 定价

发布评论 0条评论)

还木有评论哦,快来抢沙发吧~