Token经济正蓬勃发展。
2026年,人工智能产业正经历一场从模型训练到推理应用的重心转移。国家数据局在3月的国新办发布会上公布的数据显示,截至2026年3月,中国日均Token调用量已超过140万亿,较2024年初的1000亿增长了千倍以上,两年内实现了四个数量级的飞跃。
Token已不再是技术文档中的一个晦涩计量单位,而是AI时代最基本的交易媒介,如同电力、水资源或过去的CPU核心数。其增长速度远超历史上任何一种基础资源。
根据IDC的预测,全球年度Token消耗量预计将从2025年的0.0005 Peta Token飙升至2030年的15万Peta Token,年复合增长率高达3418%。到2031年,全球活跃的智能体数量预计将达到3.5亿。
推动这一增长的关键在于AI领域的结构性转变。在2026年之前,AI产业的重心在于模型训练,即投入大量GPU资源、调整参数并追求在各项榜单上的领先。然而,2026年之后,推理正成为算力消耗的主要驱动力。IDC估计,2026年中国AI服务器市场规模将达到3500亿元,其需求结构已从“训练驱动”转变为“训练与推理并重”,推理服务器的出货量已接近训练机型。
除了推理需求的不断扩大,智能体应用的兴起以及推理成本的急剧下降也在促进行业的爆发。业内正形成广泛共识:AI正从“回答问题”向“执行任务”演进。今年的WAIC上,多个智能体应用与手机产品同期发布,而每一次智能体的自主规划、工具调用和多步骤执行,都在以指数级速度消耗Token。
这一转变对算力基础设施也带来了颠覆性影响。PPIO联合创始人兼CEO姚欣在接受36氪采访时表示:“传统云计算服务的是人,程序员通常会使用一台虚拟机数天甚至数月;而Agent的调用任务则呈现碎片化、高频化的特点。PPIO平台上的Sandbox最小结算单位已精确到秒。”
人类使用云服务存在使用高峰和低谷,通常遵循工作和睡眠周期。但Agent使用云是全天候的,7x24小时不间断。
在延迟方面,两者也存在显著差异。人类可容忍秒级的延迟,但Agent完成一项复杂任务可能需要反复调用数十次甚至上百次。如果每次调用都存在几百毫秒的延迟,累积效应将导致任务执行效率变得不可接受。
这些差异表明,为人类用户设计的云计算架构难以直接满足Agent的需求。
正是在这样的背景下,Token工厂成为调节算力运力的关键环节,并吸引了市场的广泛关注。
根据灼识咨询的数据,按2025年及2026年第一季度平均每日Token消耗量计算,PPIO在中国独立AI云计算服务提供商中位居首位。2026年4月,平台日均Token消耗量达到1.03万亿次;到6月,这一数字进一步攀升至1.2万亿次以上,较2025年同期增长超过8倍。
另据披露,PPIO的AI云计算收入从2024年的1038.7万元增长至2025年的1.192亿元,同比增长超过10倍。平台全球注册开发者数量也从2024年末的12.5万人增至2026年6月的超过66.6万人。
解决效率瓶颈,智能Token工厂应运而生
随着推理成本的逐年下降(每年下降10倍),单纯提供算力资源的商业模式正迅速失去价格优势。真正的价值在于能否以更高的效率、更低的成本和更优的体验来交付Token。
PPIO所定义的“智能Token工厂”,是一套围绕Token全生命周期进行优化的规模化生产与交付体系。
姚欣在接受36氪采访时提到,尽管“Token工厂”的概念在2026年3月的GTC大会上才被广泛提出,但PPIO自2023年起便已涉足推理服务,并于2024年推出了MaaS平台,在该领域已积累了三年多的经验。
“如今Token工厂已不新鲜,更关键的是如何不断提升其智能化水平。”姚欣认为,“仅仅是购买算力、部署模型来生产Token是远远不够的,核心问题在于如何高质量、高效率地生产出更智能的Token?”
为此,姚欣提出了Agent时代的核心公式——Agent生产力 = Token智能密度 × Agent Loop时长。其中,Token智能密度决定了Agent每次决策的质量上限,而Agent Loop时长则决定了Agent能够持续运行多久以及完成任务的复杂程度。
围绕这一公式,PPIO的智能Token工厂在国内率先推出了智能模型网关。这是一个AI Agent的智能调度中心,通过混合模型进行关键决策,从而提升质量;对于简单任务,则由模型自动分流到轻量级模型,确保Agent以最低的Token成本、最高的智能性能完成任务,持续推高Token的智能密度。
姚欣向36氪透露,PPIO正在测试将两到三款不同模型组合使用,让它们进行相互比较和讨论。在内部测试中,这种混合模型方法在某些任务执行上的表现已超越GPT-5.6。“虽然在单模型性能上可能仍有微小差距,但通过投入一定的算力和Token消耗,可以获得更强的最终任务执行能力。”这意味着,模型的智能上限不仅存在于模型内部,还可以通过工程化手段从外部进行突破。
这就是智能模型网关的工作原理,它通过为AI应用提供混合推理系统,使每一次模型调用都如同一次“专家会诊”。
PPIO构建了从底层GPU集群到推理服务优化,再到应用场景深度理解的全栈式AI云能力,这体现了其极致的效率优势。
姚欣举例说明了三种典型场景:人类对话、智能体调用和AI编程。这三者对性能参数的要求各不相同。人类追求秒级响应,智能体要求毫秒级,而AI编程则对精度要求最高,期望尽量减少错误。基于不同场景进行定制化优化,是PPIO区别于其他平台公司的关键所在。
在具体产品能力方面,PPIO的差异化路线还体现在以下几个维度:
- 快速集成,开箱即用。
- **平台中立,不被任何模型生态所绑定。**姚欣表示,一个应用开发者平均需要调用10到15款不同类型的模型,并且需要每三个月根据模型迭代进行更新。PPIO平台支持接入200余款开源模型,用户切换模型只需修改一行代码。这种中立的定位赢得了开发者的信任,也是其重要的市场切入战略。
- **自研推理加速引擎,深度优化Agent调用模式。**与传统云计算的通用架构不同,PPIO的整个技术栈从底层就适配Agent负载的碎片化、高频化和连续性特征。
值得注意的是,行业内GPU的平均利用率通常在40%至50%之间,而PPIO的利用率长期保持在75%以上。姚欣介绍,公司依托分布式算力调度能力,整合了全球六大洲的5000多个算力节点,通过利用东西半球的时区错峰调度,将不同时间、空间和请求频率的负载进行高效融合,后台呈现出一条接近直线且高度平稳的利用率曲线。
当前,算力成本持续上涨,能否充分利用已生产出的算力,直接关系到企业的盈利能力。PPIO在该指标上的表现,构成了其重要的竞争壁垒。
Agentic Cloud:下一波Token消耗的基础设施浪潮
智能Token工厂解决了“如何高效生产Token”的问题,而Agentic Cloud则回应了“未来Token将由谁、以何种方式消耗”这一更宏大的命题。
2026年,全球云巨头不约而同地发布了Agentic Cloud战略。谷歌在Next'26大会上提出了Agentic Cloud战略,并发布了Agent Engine和Agentic Data Cloud;阿里云宣布完成全栈智能体化升级;亚马逊推出了AgentCore;微软的Foundry Agent Service也正式商用。所有这些举措的目标一致:让Agent成为云服务最核心的用户。
在WAIC 2026上,PPIO正式发布了“Agentic Cloud”的全新定位。姚欣认为,这一战略的核心逻辑是:云服务的第一用户正从人类转向AI Agent。
行业趋势也正发生着类似的转变。AI智能体的自主推理、工具调用和多步骤工作流,具备持续、高频、密集的Token消耗特性,对云基础设施提出了新的要求。
姚欣还分享了一组数据:在全球80亿人口中,可能只有20%的人使用了AI,其中真正付费的仅占约5%。这意味着,人类使用AI仍有巨大的增长潜力。与此同时,智能体的调用量正在呈指数级增长。以PPIO为例,公司拥有300多名员工,后台已有近千个Agent在运行,开发、运维、客服等工作都在Agent化。一个人可以拥有10个、100个Agent,每个Agent都在7x24小时消耗Token。
基于这种多元化的需求,PPIO将Agentic Cloud的产品架构划分为三个层级:基础设施层、模型服务层和Agent Harness平台层。
需要特别指出的是,Harness作为专门用于约束、指导、验证和纠错Agent执行的工程框架,它涵盖了除大模型本身之外的所有环节:上下文构建、工具编排、验证循环、成本控制和可观测性。
沙箱是Harness的核心组件之一。去年,PPIO推出了国内首款兼容E2B接口的Agent沙箱,为Agent Harness提供了安全隔离的运行环境。
姚欣提到,去年发布沙箱时,行业对智能体的理解仍停留在“模型调用的手和脑”层面。到今年年初,随着OpenClaw等开源智能体的普及,大家才意识到真正的痛点在于长程任务和复杂任务的持续执行。
据PPIO官方透露,PPIO Agent沙箱的冷启动时延低于200毫秒,采用系统级安全隔离,确保每个Agent任务运行在独立的虚拟机环境中;支持同时创建上万个沙箱,并且在任务空闲时可自动暂停计费,综合使用成本比同类产品降低90%以上。PPIO Agent沙箱上线一年,业务规模已增长超过120倍。
目前,Token定价的排序本身已呈现出规律:编程任务最贵,其次是智能体,最便宜的是为人类提供对话服务。这一排序已预示了未来Token消耗的主要方向。
姚欣认为,“我们服务的对象正从人转向Agent,甚至未来的机器人。”
这一转变正在重塑云计算的商业模式。过去,云计算比拼的是功能数量和生态封闭程度。而在Agent时代,竞争的核心在于谁能让硅基生命运行得更快、更便宜、更稳定。PPIO的选择是:不建立封闭的花园,而是拥抱开源;不追求全栈替代,而是成为AI时代的互补者。
Token经济正在重新定义算力的价值尺度,在这场重构中,效率最高者将最终胜出。


