📑 目录
InferenceX v3:在智能体推理时代,CUDA 的护城河还能守住吗?-InferenceXv3 Does CUDA Moat Hold up in Agentic Inferencing.pdf
① 核心矛盾
这份报告的核心矛盾可以概括为:agentic推理正在成为生产环境的主要负载,但它对硬件/软件栈的要求与传统固定长度推理不同;NVIDIA在多数frontier模型上仍表现很好,但AMD在部分特定比较中也能做到不错,开源软件栈一定程度上降低了客户被CUDA锁定的程度。
PDF原文给出几个关键事实:
- 自2025年11月Claude Code拐点以来,长上下文、多轮agentic工作负载快速增长,已成为生产推理流量的主导形态。
- 2026年4月,OpenAI企业级agentic支出超过ChatGPT支出,说明企业端agentic负载已具备商业规模。
- 原文明确表述:“NVIDIA在大量frontier模型上表现非常好,而AMD在一些frontier模型、特定比较中也表现良好。”
- AgentX 1.0是首个100万上下文、多轮agentic编码推理基准,构建成本超过300万美元,测试了超过1000颗芯片。
- 已有70+上游PR围绕AgentX优化vLLM、SGLang、TensorRT-LLM、Dynamo等开源或半开源栈,且多数优化可迁移到生产流量。
换句话说,这份报告没有简单宣告“CUDA护城河崩塌”,而是提供了一个更细致的证据:NVIDIA仍然领先,但竞争维度正在从单纯的芯片算力转向系统级能力——KV cache传输、前缀复用、请求路由、HBM容量、开源栈适配等。 在这个维度上,护城河比传统印象中更“可渗透”。
外部FinGPT分析提示,NVIDIA估值处于高位:PE约32.88、PB约25.83,但外部数据存在口径矛盾,需要谨慎使用。原文没有提供公司财务数据。
② 数据深挖
需要先说明:本报告是技术基准报告,原文未涉及营收、EPS、毛利率、分部业绩等传统财务数据。financial_data中market_data的price/pe/mcap均为空,financial_trends为空。因此财务深挖只能以“原文未涉及”为主,并对外部数据做可信度核验。
表1:研报技术数据要点
| 指标 | 数据/描述 | 来源 |
|---|---|---|
| AgentX上下文长度 | 100万token | PDF原文 |
| 数据集构建成本 | 超过300万美元 | PDF原文 |
| 测试芯片规模 | 超过1000颗 | PDF原文 |
| 持续运行功耗 | 约2MW | PDF原文 |
| 测试SKU范围 | MI355X、GB300 NVL72、GB200 NVL72、B300、B200、MI325、MI300X、H200、RTX Pro Servers | PDF原文 |
| 基准场景 | 固定长度8k1k、1k1k、1k8k;新增AgentX agentic编码流量 | PDF原文 |
| 上游优化PR数量 | 70+ | PDF原文 |
| 后续更新时点 | 未来3-4周发布AgentX更新文章 | PDF原文 |
表2:财务与业务指标核验
| 指标 | 研报原文 | 外部数据 | 备注 |
|---|---|---|---|
| 营收 | 原文未涉及 | 无可用数据 | 不可核验 |
| EPS | 原文未涉及 | 无可用数据 | 不可核验 |
| 毛利率 | 原文未涉及 | 无可用数据 | 不可核验 |
| PE | 原文未涉及 | 32.88(FinGPT) | FinGPT提示存在口径矛盾 |
| PB | 原文未涉及 | 25.83(FinGPT) | 同上,需核对 |
| 市值 | 原文未涉及 | 5.05T(FinGPT) | 与净利数据矛盾约21% |
FinGPT明确指出:若市值5.05T、PE32.88,隐含净利约153.6B;但外部给定净利约1,860亿,对应PE约27.2,二者差异约21%。这可能是Non-GAAP/GAAP口径、一次性损益或单位错误导致。在本报告框架内,应视为“未可靠披露”。
③ 逻辑论证
原文的推理链条可以拆解如下:
表3:研报推理链条与前提假设
| 推理步骤 | 核心逻辑 | 前提假设 | 假设脆弱性 |
|---|---|---|---|
| 1. 负载结构变化 | 生产推理从单轮chatbot转向多轮、长上下文、多工具调用的agentic负载 | Claude Code拐点以来的趋势会延续;企业agentic支出会继续增长 | 中:若算法效率大幅提升,单位任务所需token可能下降 |
| 2. 基准必须升级 | 固定序列长度prefill/decode无法真实反映agentic系统行为,需要AgentX这类多轮基准 | AgentX配置能代表客户实际生产工作负载 | 中:PDF称其跟踪recipes.vllm.ai和SGLang cookbook,但与闭源生产环境仍有差异 |
| 3. 竞争格局 | NVIDIA在大量frontier模型表现很好;AMD在部分frontier模型特定比较中也好 | 当前frontier模型结构与软件栈仍以CUDA为主流 | 中:若模型架构或服务框架进一步向开源跨厂商方向演进 |
| 4. 生态锁定 | 70+上游PR覆盖vLLM、SGLang、TensorRT-LLM等,多数优化可迁移,降低单一供应商锁定 | 开源优化能够持续覆盖生产级agentic负载,且客户愿意采用非NVIDIA专有栈 | 中高:NVIDIA仍深度参与其中,其TensorRT-LLM和Dynamo也有优化 |
| 5. 系统问题主导 | 高前缀复用下,KV tensor跨节点传输、前缀路由、HBM容量成为关键 | 硬件性能之外,系统软件效率会决定实际吞吐和成本 | 低:原文已显示各主要推理框架均在针对此进行优化 |
总体看,原文并未否定NVIDIA的领先,但指出了这种领先的载体正在发生变化:CUDA护城河需要被重新放在“系统级推理效率”的框架下检验,而不是仅在单芯片算力上检验。
④ 影响分析
原文没有对NVIDIA给出投资评级或目标价,因此影响分析应围绕“业务生态与估值含义”展开。
表4:主要风险与不确定性
| 风险类别 | 风险描述 | 来源 | 可能性 | 影响程度 |
|---|---|---|---|---|
| 研报提及 | AMD在部分frontier模型的特定比较中表现良好 | PDF原文 | 中 | 中 |
| 研报提及 | 开源栈优化跨vLLM/SGLang/TensorRT-LLM等,可能降低CUDA锁定效应 | PDF原文 | 中 | 中 |
| 研报提及 | agentic负载特征变化快,若优化方向判断错误可能影响后续份额 | PDF原文 | 中 | 中 |
| 模型补充 | 高PE/PB对盈利增速和推理效率高度敏感 | FinGPT分析 | 中 | 高 |
| 模型补充 | 外部财务口径矛盾约21%,估值横向比较可信度受限 | FinGPT分析 | 中 | 中 |
需要注意平衡:原文也明确写到“NVIDIA在大量frontier模型上表现非常好”,并且NVIDIA上海TensorRT-LLM团队参与了AgentX相关优化。这意味着NVIDIA并未缺席开源或生产级优化,而是在生态中仍有较强参与度。因此风险并非单边恶化,而是竞争边界发生变化。
⑤ 前瞻与判断
原文没有给出2028E EPS或盈利预测。由于外部数据缺失且存在口径矛盾,无法构造基于EPS的回报测算。以下情景分析使用“关键观察指标”代替价格预测,避免给出具体买卖点位。
表5:情景分析
| 情景 | 概率 | 核心条件 | 关键观察指标 | 影响判断 |
|---|---|---|---|---|
| 乐观 | 约30% | agentic推理持续高增长;NVIDIA在后续AgentX更新中保持多数frontier模型领先;CUDA在企业生产部署中仍占主导 | 未来3-4周AgentX更新中NVIDIA优势幅度;OpenAI/企业agentic支出增速;GB300/Rubin实际部署 | 高估值有业绩支撑,压力减轻 |
| 基准 | 约50% | NVIDIA与AMD在不同模型/场景各有胜负;开源栈降低迁移成本,但NVIDIA整体份额未大幅流失 | AgentX中NVIDIA与AMD差距变化;vLLM/TensorRT-LLM等优化扩散;云厂商实际采购结构 | 高估值进入消化期,等待盈利兑现 |
| 谨慎 | 约20% | AMD/ASIC在特定agentic负载持续逼近;开源跨厂商栈显著降低CUDA锁定;单位算力价格下行 | AMD MI355X/Mi455X实测;云厂自研ASIC导入进度;NVIDIA毛利率变化 | 估值压缩风险上升 |
需要强调:以上情景中“约”表示主观概率,仅用于框架性判断,不代表可验证的统计概率。
本文基于公开研报分析整理,不构成投资建议。
⑥ 说人话版
通俗地说,这份报告不是推荐买还是卖,而是给AI芯片和AI软件生态做了一个新的“体能测试”。
以前测试AI芯片,像测短跑冲刺:输入一段固定长度、输出一段固定长度,比谁快。但现在生产环境里,AI已经变成“代理助手”:一次任务要来回对话几十上百轮,上下文越来越长,还要频繁调用工具、开子任务。
这种新负载有点像“马拉松加上不断上下楼搬东西”。单一芯片算力强不够,还要看系统能不能聪明地复用已经算过的内容、能不能把请求派到正确的地方、内存够不够放上下文。
报告说,NVIDIA在大多数前沿模型上表现依然很好,但AMD在一些特定项目上也能打;同时,很多开源工具越来越通用,客户换硬件的难度在下降。因此NVIDIA的领先未必消失,但领先的“牢固程度”需要持续用新基准来验证。
估值方面,外部数据给出的PE/PB不低,但口径有矛盾,所以不能把估值结论当成确定事实。
⑦ 投资者行动指南
由于原报告不构成评级,下面只提供观察指标,不提供买入/卖出或仓位建议。
-
关注3-4周后的AgentX更新文章
原文明确提到将在3-4周后发布进一步优化和AMD/Nvidia更新结果。这是验证NVIDIA是否继续领先的关键节点。 -
验证需求端真实性
重点关注OpenAI企业级agentic支出是否持续增长,以及Claude等agentic编码工具的企业采用情况。需求端若走弱,会直接削弱agentic推理“成为主流负载”的前提。 -
观察NVIDIA与AMD在AgentX中的差距方向
如果NVIDIA在更多frontier模型及生产级配置上拉开差距,则CUDA生态维持强势;如果AMD继续在特定模型上取得性价比优势,则需重新评估竞争边界。 -
关注开源推理栈的渗透
重点观察vLLM、SGLang、TensorRT-LLM、Dynamo、LMCache、Mooncake等项目中,跨厂商优化的实际生产采用率。若开源优化持续降低供应商绑定,则NVIDIA的长期软件溢价可能收窄。 -
财务数据核验
在FinGPT指出的PE/PB口径矛盾解决前,不应单独用PE32.88/PB25.83作为估值判断依据。建议等待多年期、Non-GAAP/GAPP对账后的数据。
本站分析内容由 AI 自动生成,仅供研究与学习参考,不构成任何投资建议、要约或招揽。据此操作,风险自负。 免责声明