报告日期 ·

智能体时代的底层管道
谁在铺设 AI Agent 的基建

从沙盒隔离到算力调度,从可观测性到安全审计,5 个问题把 Agent 基建讲清楚

2026.07.23 产业链深度研报 数据截至 2026 年 7 月

核心结论

AI Agent 基础设施正处于从概念验证向规模化应用转型的过渡期。全球 AI 智能体市场预计从 2024 年的 51 亿美元增长到 2030 年的 471 亿美元,年复合增长率 44.8%。推理算力需求已占总 AI 算力的 60% 至 70%,较 2024 年的约 40% 大幅攀升。每一个 Agent 完成一个多步任务可能触发数十次模型调用,算力消耗呈非线性增长。

产业链分四层:底层算力芯片(NVIDIA 市占 70%+,FY2026 营收 2159 亿美元)→ 云基础设施(Azure/AWS/GCP 托管沙盒与无服务器函数)→ Agent 运行环境(E2B 沙盒月创建量一年内从 4 万暴增至 1500 万,88% 财富 100 强已接入)→ 可观测性与安全(Datadog FY2025 营收 34.3 亿美元,推出 Bits AI SRE Agent)。越底层玩家越少、替代越难、定价权越强。

主要风险:Agent 在无人看管时产生错误决策的后果可能极严重(删库、乱发邮件),安全隐患是 24 小时运行场景下最大的瓶颈。证伪条件:若推理算力成本未如预期下降(当前 Blackwell Ultra 较 Hopper 降本 35 倍),或 Agent 沙盒隔离技术出现重大安全事故,产业链增长逻辑将受冲击。

先看结论

↗
44.8%
AI Agent 市场
年复合增长率(2024-2030)
↗
60-70%
推理算力占总算力比重
(2024 年约 40%)
↗
375x
E2B 沙盒月创建量增长
4 万 → 1500 万
↗
$2159亿
NVIDIA FY2026 营收
同比 +65%

Logic · 因果主线

Agent 基建的投资逻辑链

01
大模型能力突破
LLM 推理成本下降,Agent 从概念走向落地
→
02
Agent 需要执行环境
代码执行、浏览器操作必须在隔离沙盒中运行
→
03
推理算力需求爆发
单 Agent 多步任务触发数十次调用,算力非线性增长
→
04
基建层投资机会
芯片、云平台、沙盒、监控四层供应商受益
核心判断:Agent 基建的投资机会沿着产业链自下而上扩散。底层芯片(NVIDIA)确定性最高,中层云平台(Azure/AWS)规模最大,上层沙盒与监控(E2B/Datadog)增速最快。2025 下半年到 2026 年是 Agent Infra 大规模商业化部署的关键时期。
Part 01 · 沙盒革命

Agent 的安全办公室:从 Docker 到 MicroVM

代码执行能力是 Agent 的灵魂,也是最大的安全风险

沙盒(Sandbox)是 Agent 执行代码、处理文件和访问互联网的隔离安全环境。它允许不可信或具有潜在风险的代码在其中运行,而不会对外部系统造成破坏。随着 Agent 获得代码执行和浏览器操控等能力,其自主性带来了前所未有的风险:一个恶意指令可能导致数据被删、系统被入侵。

隔离技术的三代演进

沙盒技术经历了三代演进,核心矛盾始终是隔离性、性能和资源占用三者之间的平衡。

图 1:沙盒隔离技术演进对比
启动速度 vs 隔离强度,Firecracker MicroVM 实现了最优平衡

第一代是传统安全沙箱(如 Cuckoo Sandbox),用于恶意软件分析,隔离性强但资源占用大。第二代是虚拟机技术(VMware),提供硬件级隔离,但因资源占用大、启动慢而显得过重。第三代是容器技术(Docker),轻量快速但所有容器共享宿主机内核,隔离性天生弱于虚拟机。

AWS 开源的 Firecracker MicroVM 技术找到了更优解:结合虚拟机的强隔离性和容器的轻量化优势,实现约 125 毫秒启动和硬件级安全隔离。这完美契合了 AI Agent 对沙盒的需求:既要启动快、响应及时,又要绝对安全、互不干扰。

E2B:Agent 沙盒的标杆

E2B 成立于 2023 年,选择将复杂的沙盒技术封装成简单的 API,底层使用 Firecracker,保证虚拟机级别硬件隔离的安全性、150 至 200 毫秒启动的性能和高密度部署的低运营成本。Manus 的自动编程 Agent 依赖 E2B 沙箱执行代码,Groq 的 CompoundAI 系统也使用 E2B 解决安全代码执行问题。

关键数据:E2B 沙盒月创建量在一年内从 4 万暴增至 1500 万,增长 375 倍。88% 的财富 100 强公司已接入 E2B 平台。2025 年 7 月完成 2100 万美元 A 轮融资(Insight Partners 领投)。客户包括 Hugging Face、Perplexity、Groq 和 Manus。

中国玩家:PPIO 与腾讯云

国内厂商也在快速跟进。PPIO 在 2025 WAIC 上发布了中国首款兼容 E2B 接口的 Agent 沙箱,平均启动时间小于 200 毫秒,具备同时启动数千个沙箱实例的能力。腾讯云在 2025 年 9 月发布 Agent Runtime 解决方案,其自研 Cube 安全沙箱技术实现 100 毫秒级启动速度,支持数万实例并发,每分钟扩容超十万实例。阿里云则在 WAIC 上推出无影 AgentBay,三行代码即可接入。

本段结论

Firecracker MicroVM 已成为 Agent 沙盒的技术共识。E2B 凭借先发优势占据标杆位置,但腾讯云、阿里云等巨头凭借生态和资源优势正在快速追赶。沙盒层的竞争焦点正在从启动速度转向生态兼容性和企业级安全合规。

Part 02 · 算力范式转移

从训练到推理:算力需求的结构性变化

推理已占总算力 60-70%,Agent 是非线性增长的推手

AI 算力的需求结构正在发生根本性变化。训练是一次性成本,推理是持续性成本。一个前沿模型训练一次花费数千万美元,但同一个模型每天服务百万用户时,推理算力的持续消耗在投产 12 至 18 个月内就会超过训练成本。

Agent 加剧了这一趋势。一个自主完成多步工作流的 Agent 不会只消耗一次推理调用,它可能执行数十次模型调用。当数千个 Agent 并发运行时,需求曲线以单查询聊天机器人从未产生过的方式呈非线性增长。

图 2:AI 算力需求结构变化(训练 vs 推理占比)
推理算力占比从 2024 年约 40% 升至 2025 年 60-70%

NVIDIA:仍是不可替代的底座

NVIDIA FY2026(截至 2026 年 1 月)全年营收 2159 亿美元,同比增长 65%,首次突破 2000 亿大关。净利润 1200 亿美元,同比增长 65%。数据中心业务全年收入 1937 亿美元,增长 68%。Q4 单季数据中心收入 623 亿美元,同比增长 75%。

Blackwell 架构已成为主导产品。根据 SemiAnalysis InferenceX 基准测试,Blackwell Ultra 在 Agent 式 AI 领域的性能较 Hopper 平台提升 50 倍,成本降至 1/35。黄仁勋在财报会上明确表示:代理式 AI 的拐点已经到来。FY2027 Q1 收入指引 780 亿美元(不含中国数据中心),远超分析师预期的 727 亿美元。

估值锚:NVIDIA 当前股价约 212 美元,市值约 4.3 万亿美元。远期市盈率已回落至 24 倍以下,接近五年最低点,远低于 38 倍的五年平均水平。分析师一致预期目标价中枢约 235 美元(区间 185-280),隐含上行空间约 11%。

AMD:追赶者, silicon 追上但软件仍有差距

AMD MI300X 凭借 192GB HBM3 内存(H100 仅 80GB),单卡可承载 H100 需要 2-3 张卡才能处理的模型,在推理场景具备系统级成本优势。MI355X 在 Llama 3.1 405B 推理中的 token 性价比比 NVIDIA B200 高 40%。十大模型厂商中已有七家(含 Meta、OpenAI、Microsoft、xAI)在生产环境使用 AMD Instinct 加速器。

但软件生态仍是根本短板。ROCm 7(2025 年 9 月发布)在 PyTorch + vLLM 无自定义内核的场景下接近 CUDA,但 CUDA 在 TensorRT-LLM、FlashAttention-3 等 Hopper 专用优化上仍占据明显优势。摩根士丹利报告显示,AMD MI355X 平台 AI 推理利润率为负 28.2%,而 NVIDIA GB200 NVL72 利润率高达 77.6%。

图 3:AI 推理硬件市场规模预测(2025-2035)
从 437.8 亿美元增长至 4100.35 亿美元,推理硬件将成为企业科技最大资本科目
本段结论

推理算力需求的结构性爆发是 Agent 基建投资的核心驱动力。NVIDIA 凭借 Blackwell 架构和 CUDA 生态保持绝对领先,AMD 在硬件层面已追近但软件差距仍需时间弥合。AI 推理硬件市场到 2035 年将达 4100 亿美元,成为企业科技领域最大资本科目。

Part 03 · 可观测性

让 Agent 不在半夜失控

24 小时运行的关键:持久化、事件驱动、预算熔断、可观测性

要让 Agent 像数字员工一样 24 小时在线,关键在于持久化和健壮性。如果服务器重启,Agent 必须能从数据库中读取它刚才在干什么。如果网络波动,任务不能因此中断。如果 Agent 陷入死循环,监控系统必须自动检测并重启。

四个必要条件

  1. 持久化状态存储:Agent 的状态不能只存在于内存中。会话状态、对话记忆、任务进度必须持久化到数据库,支持断点续办。腾讯云 Agent Runtime 支持会话持续运行 7 天,暂停保留 30 天。
  2. 事件驱动架构:使用消息队列(如 Kafka)处理异步任务,确保任务不因网络波动中断。Agent 的多步任务本质上是异步事件流。
  3. 算力成本管理:24 小时运行意味着巨大的 Token 消耗。必须设置预算熔断机制,当单次任务消耗超过阈值时自动暂停或降级。
  4. 可观测性:自动监控 Agent 是否陷入死循环(Hallucination Loop),实时追踪延迟、错误率和资源消耗,出错时自动告警和重启。

Datadog:Agent 监控的领跑者

Datadog FY2025 全年营收 34.3 亿美元,同比增长 28%。自由现金流 9.15 亿美元。年付费 100 万美元以上的大客户达 603 家,同比增长 31%。公司已推出 Bits AI SRE,一个自主巡检 AI 值班 Agent,能在数分钟内利用遥测数据和组织上下文定位告警根因,帮助工程师更快解决问题。

关键变化:Datadog 2025 年在 DASH 大会上发布超过 125 项新功能,其中三款 AI Agent(Bits AI SRE、Bits AI Dev Agent、Bits AI Security Analyst)直接服务于 Agent 运维场景。AI 原生客户贡献的收入占比持续上升,管理层指出这些客户的用量增长尤为迅猛。

Datadog 2026 财年指引营收 40.6 至 41.0 亿美元,隐含增速约 19%。公司已加入标普 500 指数,并连续五年被 Gartner 评为可观测性平台魔力象限领导者。

本段结论

可观测性是 Agent 24 小时运行的安全网。Datadog 凭借全栈监控能力和 AI Agent 产品线占据领跑位置。随着企业 Agent 部署规模扩大,对 Agent 行为审计、异常检测和自动恢复的需求将指数级增长。CrowdStrike 和 Palo Alto Networks 等网络安全公司也在积极介入 AI 行为审计领域。

Part 04 · 产业链地图

钱从哪来,流向哪:Agent 基建四层结构

越底层玩家越少,替代越难,定价权越强

AI Agent 基础设施的产业链可以分为四层,每一层的商业模式、竞争格局和投资逻辑各不相同。钱沿着产业链自下而上流动:最底层的芯片供应商拿走最大份额的利润,中间的云平台赚取规模效应,上层的沙盒和监控公司赚取增速溢价。

1
底层算力芯片
提供 Agent 推理所需的硬件核心。壁垒最高,替代最难,毛利率 70%+。
NVIDIA (NVDA) · AMD (AMD) · Broadcom (AVGO)
↑
2
云基础设施平台
提供托管沙盒、K8s 集群和无服务器函数。规模效应最强,资本门槛极高。
Microsoft (MSFT) · Amazon (AMZN) · Alphabet (GOOGL)
↑
3
Agent 运行环境(沙盒)
提供安全隔离的代码执行和浏览器环境。增速最快,创业公司活跃。
E2B · PPIO · 腾讯云 Agent Runtime · 阿里云 AgentBay
↑
4
可观测性与安全
监控 Agent 运行状态、延迟及异常,审计 AI 行为。刚需属性强。
Datadog (DDOG) · Cloudflare (NET) · CrowdStrike (CRWD)

利润流向:谁拿走了最多

底层芯片层拿走了产业链最大份额的利润。NVIDIA FY2026 毛利率 71.3%(Non-GAAP),净利润 1200 亿美元。云平台层依靠规模效应赚取稳定利润,但 AI 基建资本开支巨大(四大云厂商 2026 年资本开支预计超 6600 亿美元,同比增长超 60%)。沙盒层目前以创业公司为主,尚未形成稳定的盈利模式。监控层则已跑出 Datadog 这样的上市公司,自由现金流稳健。

本段结论

从投资确定性看,底层芯片 > 云平台 > 可观测性 > 沙盒。从增速看,沙盒 > 可观测性 > 云平台 > 芯片。投资者需要在确定性和增速之间做取舍:追求确定性选 NVIDIA,追求增速选 E2B(一级市场)或 Datadog(二级市场)。

Part 05 · 上市公司全景

谁在卖铲子:Agent 基建的美股标的全景

从芯片到安全,7 个领域 14 家核心上市公司

以下为 Agent 基建产业链各环节的核心美股上市公司,按产业链层级排列。数据截至 2026 年 7 月 22 日收盘。

领域 公司(代码) 关键技术 / 资源 最新数据
底层算力 NVIDIA
NVDA
GPU 推理核心;Blackwell Ultra 性能 50x / 成本 1/35 vs Hopper;CUDA 生态壁垒 股价 $212;市值 $4.3T
FY26 营收 $2159 亿 (+65%)
净利 $1200 亿;毛利率 71.3%
底层算力 AMD
AMD
MI300X 192GB HBM3;MI355X token/$ 比 B200 高 40%;ROCm 7 接近 CUDA Q3 数据中心营收 $43 亿
推理利润率仍为负(摩根士丹利)
软件生态仍是短板
云基础设施 Microsoft
MSFT
Azure 托管沙盒、K8s、无服务器函数;2026 资本开支预计 $1200 亿+ 四大云厂商 2026 合计资本开支
$6600 亿+,同比 +60%
云基础设施 Amazon
AMZN
AWS Spot Instances 全球最大闲置算力变现;Firecracker MicroVM 开源 AWS Bedrock / AgentCore
提供 Agent 运行环境
云基础设施 Alphabet
GOOGL
GCP + TPU 自研芯片;Gemini 3 使用 TPU 而非 NVIDIA;Waymo 自动驾驶 2025 营收 $4030 亿 (+15%)
净利 $1322 亿 (+32%)
2026 资本开支 $1750-1850 亿
网络与边缘 Cloudflare
NET
Workers AI 在边缘闲置节点运行 AI 任务;全球负载均衡 股价 $269
2025 营收约 $217 亿
区间涨幅 +147%
网络与边缘 Arista Networks
ANET
超低延迟数据中心交换机;算力池化网络保障 股价 $175
区间涨幅 +57%
可观测性 Datadog
DDOG
Bits AI SRE / Dev / Security 三款 Agent;LLM 可观测性;AWS 深度合作 FY25 营收 $34.3 亿 (+28%)
FCF $9.15 亿;$1M+ ARR 客户 603 家
2026 指引 $40.6-41.0 亿
数据处理 Snowflake
SNOW
存储 Agent 产生的结构化和非结构化数据;AI 数据仓库 Agent 数据存储刚需
虚拟化 Broadcom
AVGO
VMware 多租户算力隔离;定制 AI 芯片(ASIC);AI 网络胶水 股价 $397
Q1 FY26 营收 $190 亿+ (+29%)
净利 +34% YoY
网络安全 CrowdStrike
CRWD
AI 行为审计;Agent 权限控制;防止 Agent 越权操作 Agent 安全审计赛道
24h 运行场景刚需
基础架构 IBM
IBM
Red Hat OpenShift 企业级 K8s 调度方案 复杂算力环境管理
图 4:Agent 基建核心标的 2025 年区间涨跌幅
截至 2026 年 7 月 22 日,Cloudflare (+147%) 领跑,NVIDIA (+55%) 稳健
Part 06 · 算力利用率

把闲置算力榨干:三种路径

混合负载调度、算力池化、分布式算力网络

24 小时运行 Agent 意味着巨大的 Token 消耗,但 Agent 并非每时每刻都在满载推理。当 Agent 处于休眠或等待 API 响应的空隙,大量算力被闲置。提高算力利用率本质上是解决资源调度与任务切片的问题。

路径一:混合负载调度

将延迟敏感型任务(如实时交易的 Agent)与吞吐量导向型任务(如大模型预训练、数据挖掘)混合部署。当 Agent 等待 API 响应时,调度系统自动将剩余算力分配给后台任务。主要依赖 Kubernetes 的资源配额管理和 NVIDIA MIG(Multi-Instance GPU)技术,允许单个 GPU 被分割为多个独立实例。

路径二:算力池化与虚拟化

将单机孤立的算力打通,形成巨大的算力池。vGPU 技术允许多个虚拟机或容器共享同一个硬件 GPU。动态超分类似银行的准备金制度:分配出去的算力总量大于实际物理算力,博取用户不会同时满载的机会。

路径三:分布式算力网络(DePIN)

利用区块链技术,将全球散落的个人电脑、小型服务器里的闲置算力聚合起来。PPIO 的做法是典型代表:其核心团队源自 PPTV,拥有近 20 年大规模分布式计算经验,通过智能工作负载调度聚合全球闲置 GPU 资源,以削峰填谷模式提供高性价比 AI 推理算力。自研推理引擎通过算子融合、低精度量化、投机采样等优化技术,将模型推理效率提升 7 倍以上,理论运营成本降低超 85%。

AWS Spot Instances:全球最大的闲置算力变现案例。将闲置算力以 1 至 3 折的价格出售,既提高了自身 GPU 利用率,也为 Agent 开发者提供了极低成本的推理算力选择。
本段结论

算力利用率提升的核心技术(MIG、vGPU、K8s 调度)均掌握在 NVIDIA、AWS、Broadcom 等巨头手中。PPIO 等创业公司通过分布式算力网络切入,在成本端具备差异化优势,但规模和可靠性仍需验证。对投资者而言,算力利用率提升利好 NVIDIA(MIG/vGPU 软件许可)和 AWS(Spot Instances 变现)。

★ Bottom · 关注信号

接下来盯住什么

信号 01

推理成本是否持续下降

NVIDIA Rubin 平台号称将推理 token 成本降至 Blackwell 的 1/10。若 2026-2027 年推理成本如期下降一个数量级,Agent 大规模部署的经济门槛将被彻底打开。反之,若成本下降停滞,Agent 的商业化节奏将放缓。可观察指标:NVIDIA 每季度财报中推理相关收入占比、AWS Spot Instance 价格走势。

信号 02

Agent 沙盒是否出现重大安全事故

沙盒隔离是 Agent 安全的最后一道防线。若 Firecracker MicroVM 或同类技术出现可被利用的逃逸漏洞,将严重打击企业部署 Agent 的信心。反之,若头部企业(财富 100 强中已有 88% 接入 E2B)的 Agent 部署案例持续增加且无重大安全事故,将加速行业渗透。可观察指标:E2B 沙盒月创建量增速、CVE 漏洞公告。

信号 03

四大云厂商资本开支兑现节奏

Google、Meta、Microsoft、Amazon 2026 年资本开支预计合计超 6600 亿美元,同比增长超 60%,其中大部分投向数据中心和 AI 处理器。这笔钱的花速远超创收速度。若云厂商开始削减资本开支,底层芯片需求将首当其冲。可观察指标:各季度资本开支实际值 vs 指引、云业务收入增速。

信号 04

AMD 软件生态是否追平 CUDA

AMD 在硬件层面已追近 NVIDIA(MI355X token/$ 高 40%),但软件生态仍是根本短板。若 ROCm 在 2026 年实现与 CUDA 的全面兼容(含 TensorRT-LLM、FlashAttention 等关键优化),AMD 的市场份额将显著提升。可观察指标:AMD 数据中心收入增速、主要云厂商 AMD 实例上架量。

⚠ 风险与不确定性

什么情况下结论不成立

  • 安全隐患:Agent 无人看管时的错误决策
    Agent 在 24 小时运行场景下如果产生错误决策(如删库、乱发邮件、越权操作),后果可能极严重。 CrowdStrike 和 Palo Alto Networks 等网络安全公司虽在介入 AI 行为审计,但尚未形成成熟的安全标准。若发生重大 Agent 安全事故,监管可能收紧,延缓行业渗透。
  • 算力成本下降不及预期
    若 NVIDIA Rubin 平台未能实现推理 token 成本降至 Blackwell 1/10 的目标,或 AMD 软件生态迟迟无法追平 CUDA 导致竞争不足,推理算力成本下降速度可能放缓,限制 Agent 的商业化规模。
  • 云厂商资本开支退坡
    四大云厂商 2026 年资本开支合计超 6600 亿美元,但 AI 下游应用落地速度并不理想,企业投入产出比较低。若云厂商因自由现金流压力削减资本开支,底层芯片需求将首当其冲。NVIDIA 远期市盈率已回落至 24 倍,部分反映了市场对此的担忧。
  • 中国市场不确定性
    NVIDIA FY2027 Q1 指引中未计入中国数据中心收入。H200 芯片虽获出口许可但截至 2026 年 2 月尚未产生任何收入。中国本土 AI 芯片(华为等)的崛起可能改变全球竞争格局。

Research notes · 研究收束

资料与继续阅读

本投研报告基于公开信息整理,用于梳理研究框架与关键判断;仅供研究学习,不构成任何投资建议。市场有风险,投资需谨慎。

引用说明

本页未单独列出可点击的外部引用链接。数据与观点口径以正文说明为准,阅读时请结合公司公告及公开资料独立核验。