智东西(公众号:zhidxcom)
作者 | 王涵
编辑 | 漠影

2026年初,“小龙虾”OpenClaw横空出世,爆火出圈。这款开源AI智能体凭借自主规划、多步推理和工具调用的能力,让无数开发者和极客第一次真正感受到“AI能自己干活”的震撼。

紧接着,各类定制化个人智能体百花齐放,全球AI智能体市场预计将从2024年的51亿美元增长到2030年的471亿美元。

而Agent的每一次多步推理、每一次长程任务,背后都需要数以万计的Token供给。Token作为智能时代的度量单位,其生产、优化和调度,被推到聚光灯下。人们开始追问:Token从哪来?如何让Token更加稳定、更加优质?

在智东西与PPIO联合创始人兼CEO姚欣的深度对话中,姚欣将今年的变化精炼为“Token会更智能”和“云会被重新定义:从人用Token到Agent用Token”

当Token的客户不再是人,而是Agent时,云服务商需要的不再只是CPU、硬盘和带宽,而是面向Agent工作负载的“Token工厂”,一种更低延迟、更高吞吐、更懂Agent的运行方式。

正是在这样的行业拐点上,PPIO在WAIC 2026大会上正式发布全新的Agentic Cloud定位,以及智能模型网关新品,致力于打造面向Agent时代的智能Token工厂

围绕这一定位,PPIO Agentic Cloud构建了两层原生产品体系:智能模型网关与Agent Harness层。

对话PPIO姚欣:Token的第一客户不再是人,而是Agent

一、智能Token工厂的两大关键词:让Agent既省钱又变聪明

根据灼识咨询,虽然推理成本每年以10倍以上的速度下降,但Agent任务的复杂度同步攀升,单次Agent任务消耗的Token数量,从早期的数百增长到如今的数万甚至数十万,综合算下来成本压力不降反升。

另一方面,单一模型无法覆盖Agent的多样化需求,Agent既要深度推理,又要快速响应,还要处理多模态信息,而市面上的MaaS平台大多绑定自家模型生态,无法灵活适配。更关键的是,Agent对延迟和稳定性的要求远高于传统AI应用——一次工具调用失败,整个任务链条可能瞬间崩断。

对于这一难点,PPIO在本次WAIC上给出的核心解法是发布智能模型网关。姚欣透露,这款新品的核心逻辑是“在提升智能上限的同时,帮用户大幅省钱”。

对话PPIO姚欣:Token的第一客户不再是人,而是Agent

首先是“混合模型”(MoM,Mixture of Models)机制。

在处理高价值、高风险或结果不确定的关键Agent步骤时,网关会触发多模型融合。它会将问题同时分发给多个擅长此道的专家模型,通过交叉验证生成最终答案。这种“专家会诊”模式可以极大避免因模型“偏科”导致的任务失败和返工。

其次是“智能调度”成本优化

网关会根据任务类型进行智能路由:简单问答用轻量模型,复杂推理用强模型,并通过压缩冗余上下文、复用计算结果、设置预算护栏和失败回退机制,确保用最经济的成本完成同样质量的任务。

这种工程化手段带来的效果立竿见影。根据DRACO深度研究基准测试,PPIO通过融合Mimo-V2.5-Pro、Kimi-K2.7和GLM-5.2进行混合推理,可将性能提升至接近Claude Fable 5的水平,而成本大幅度下降。据综合测算,PPIO智能模型网关能将智能水平提升20%,同时将成本降低50%-60%

对话PPIO姚欣:Token的第一客户不再是人,而是Agent

姚欣形象地总结道:“智能模型网关不卖最贵的‘超级模型’,也不卖最便宜的‘乞丐模型’。我们是把模型的智商稳定在头部梯队,同时把价格打到了中低梯队。”

此外,PPIO自研的推理加速引擎针对Agent高频工具调用、长上下文推理等场景深度优化,推理性能提升可达10倍。搭配Prompt Cache技术,Token成本最高能省80%。

这一技术实力也已获得权威认可。今年,PPIO入选中国信通院首批“企业级Token服务性能攀登基线”,在通用场景下跑出了TPS≥55个/秒TTFT≤0.9秒、调用成功率≥99.9%的硬指标。

二、Agent沙箱上线一年增长123倍,Harness为Agent装上手脚和记忆

传统云服务的控制台、API、数据库、计费模式……一切都是围绕“人如何使用云”来构建的。但Agent的工作方式完全不同:它们的任务是毫秒级启动、秒级执行、完成后即刻销毁,整个生命周期可能只有两三分钟。

行业正在形成一个新的共识:Agentic AI Infra的核心不再仅仅是GPU,而是Runtime(运行时)。Agent需要的是一个理解Agent工作方式的专属运行环境,即低延迟启动、隔离安全、自带记忆、天然工具接口。

PPIO Agent沙箱正是由此而生的。

PPIO Agent沙箱基于microVM技术,可以实现毫秒级冷启动(<200ms),满足Agent实时响应需求;每个Agent任务均可运行在独立虚拟机环境,实现系统级安全隔离,防止跨任务数据泄露与资源竞争;支持上万个沙箱同时创建,每个请求获得独立执行环境;Auto Pause/Resume机制让任务空闲时自动暂停、恢复时秒级唤起,成本较同类产品最高降低90%以上

自去年WAIC发布以来,Agent沙箱经历了爆炸式增长。姚欣在采访中提到:“去年我们在WAIC上发布了Agent Sandbox,是国内首发,今年再看Sandbox的增量,增速非常夸张。”这款国内首款兼容E2B接口的Agent沙箱,让开发者无需修改现有代码即可迁移,上线不到一年业务规模增长超123倍

对话PPIO姚欣:Token的第一客户不再是人,而是Agent

沙箱解决了“在哪跑”,但生产级Agent还需要“怎么编排、怎么操作、怎么记住”。PPIO正面向长程任务持续演进Harness能力。

PPIO Agent Harness内置Browser Use让Agent驱动浏览器搜索信息、填写表单、抓取数据;Computer Use让Agent操控桌面环境完成GUI自动化;Code Interpreter让Agent在沙箱内执行代码做数据分析和文件处理;MCP Server通过标准协议接入飞书、数据库、第三方API等外部服务。

工具调用叠加多智能体编排、记忆管理等一套工具组合,覆盖Agent从信息获取到执行操作的完整链路。

姚欣的观点很清晰:“当Agent成为Token工厂的第一客户,云平台就不能再用给人类用的工具去服务程序化的Agent。”

对话PPIO姚欣:Token的第一客户不再是人,而是Agent

基于Harness层,平台预置了PPClaw、PPHermes等多款开箱即用的智能体模板,开发者通过控制台一键操作即可完成云端部署,最快10分钟即可上线运行。部署后的Agent支持7×24小时持续托管与定时任务调度,不使用时可一键暂停计费,恢复时秒级唤醒,成本完全可控、可预测。

同时,PPIO还提供面向Agent的AI原生接口,支持MCP标准协议,Agent可通过自然语言直接调用GPU算力、沙箱环境、模型API、存储网络等全量基础设施能力。平台兼容LangChain、CrewAI、AutoGen等主流Agent框架,现有代码零改造即可接入部署,最大程度降低迁移成本。

姚欣认为,在Agent时代,开发范式发生了转变“从基于程序开发,变成基于Agent开发。以后企业搭建的是数字员工团队。这种模式未来很可能成为替代SaaS的新趋势。”

三、PPIO:从“基础设施”到“Agentic Cloud”的进化

智能Token工厂不是凭空出现的。

PPIO日均万亿级Token消耗量的背后,是提前数年布局的分布式算力网络和高密度计算节点

正如姚欣在采访中所说:“PPIO跟同行的发展路径不一样,我们从八年前就开始打造分布式云的底座。到了2023年之后,这变成了我们做分布式推理的基础;2024年我们又推出了推理加速平台PPInfer;到了2025年,Token工厂服务集成了从底层算力调度到上层推理加速的全栈能力。”

PPIO的爆发式增长数据印证了这一逻辑。

2026年6月,PPIO日均Tokens调用量超1.2万亿,在中国独立AI云计算服务商中排名第一,较2025年同期增长超8倍。按2025年及2026年第一季度平均每日Token消耗量计,PPIO同样位居独立AI云计算服务商榜首

PPIO的AI云收入自2025年起增长逾十倍,公司营收从2023年3.584亿元增至2025年7.703亿元。全球注册开发者超67万名

客户覆盖泛互联网、社交媒体、电商、教育、汽车、电信、信息科技、智能制造等八大行业,其中包括大部分中国前十大互联网公司及多家“独角兽”初创公司。

还有一个关键数据值得关注:PPIO平均GPU利用率2025年一直高于75%,远超行业平均40%-50%。

姚欣在采访中揭示了背后的逻辑:“推理是跟着用户的使用习惯走的,大部分人在白天工作用AI,流量高峰就在白天,凌晨是低谷,这就导致很多GPU集群的平均利用率只有40%到50%。而PPIO利用东西半球的时差互补,能在全球24小时内把GPU利用率拉到70%到80%。”

PPIO将此增长归因于全球调度网络的“削峰填谷”能力

PPIO在欧洲、北美洲、南美洲、东南亚等关键区域部署分布式多集群,覆盖全球6大洲。其利用跨地区时区差异和多样化客户群的交错需求概况,将全球闲置算力动态分配至任何特定时刻的需求高点,确保GPU资源有效部署而非在非高峰时段闲置。

这种调度能力直接降低了单位Token的实际成本,成为PPIO“前店后厂”模式得以盈利的底层保障。

结语:智能Token工厂,Agent时代的基础设施

姚欣在采访中说了一句话,描述了PPIO的愿景:“今天的智能上限不仅存在于模型内部,在模型之外,像Agent工程、模型融合这些方向,同样能大幅提升智能水平。”

这意味着,通往AGI的道路不止一条。当行业在卷模型参数、卷训练数据时,PPIO选择在另一条路上深耕:让Token更便宜、让Agent跑得更稳、让云真正服务于AI。

Agent的规模化部署才刚刚开始。从单Agent执行简单任务,到多Agent协同完成复杂工作流,再到数字员工与人类员工的无缝协作……每一次跃升都会对Token的供给能力提出更高要求。

智能Token工厂的意义,不只为适配当下需求,更为智能体经济的爆发提前布局底层基建。