软件与服务-TOKEN工厂:从“堆资源”到“榨资源”的产业趋势
2026-08-01 · 博星优配
Token 工是以Token 吞吐量为核心产出指标的新一代AI 基础设施。其运营目标不再是简单提供GPU 算力,而是将电力、GPU、网络和模型高效转化为持续输出的Token 流,并最终转化为智能服务和收入。正如英伟达黄仁勋所提出的,AI 工厂的本质是将能源转化为Token,再将Token 转化为实际价值,而Token 正逐渐成为衡量AI 生产力的核心单位。
Token 工是以Token 吞吐量为核心产出指标的新一代AI 基础设施。其运营目标不再是简单提供GPU 算力,而是将电力、GPU、网络和模型高效转化为持续输出的Token 流,并最终转化为智能服务和收入。正如英伟达黄仁勋所提出的,AI 工厂的本质是将能源转化为Token,再将Token 转化为实际价值,而Token 正逐渐成为衡量AI 生产力的核心单位。 由于Token 吞吐量直接决定了AI 工厂的收入能力和资本回报率(ROI),如何高效榨取有限资源、最大化单位GPU和单位功耗所产生的Token 数量,正在成为AI 基础设施竞争的新焦点。在这一过程中,竞争逻辑也正在从“拥有多少GPU”转向“如何让GPU 生产更多Token”。 量:AI 系统软件栈决定了Token 工厂的资源转化效率AI 时代,GPU 已经逐渐成为标准化的算力资源,其性能决定了Token 工厂的理论生产能力上限,而真正决定既定的算力资源能够释放多少价值的,则是覆盖调度平台、推理引擎、编译器和模型优化在内的AI 系统软件栈。相比传统云时代主要依赖硬件扩容提升计算能力,Token 工厂更强调通过软件持续挖掘存量算力的生产效率,即以更少的GPU、更低的功耗生产更多的Token。本报告中将主要讨论两项核心能力:1)以调度平台为核心,通过各项技术提高GPU利用率,减少资源碎片化和空闲时间,让更多GPU 真正投入Token 生产。2)以芯模协同为核心,通过芯片架构、编译器、推理框架与模型结构的联合优化,提高单位GPU 的Token 生成效和单位功耗性能,进一步释放硬件潜力。 价:Token 的定价本质上由推理成本、能力溢价和竞争策略共同决定Token 的定价本质上由推理成本、能力溢价和竞争策略共同决定,但不同层级Token 的主导因素存在显著差异。对于基础设施级Token 而言,由于模型能力趋于同质化、市场竞争激烈,厂商定价主要围绕推理成本展开,价格持续向边际成本收敛,长期壁垒更多来自成本优化和资源运营效率。对于专家级Token 而言,用户开始根据任务复杂度主动选择模型,模型能力成为影响定价的重要因素,因此其定价逻辑表现为“推理成本+能力溢价”,具备更强的推理能力、专业能力和品牌影响力的模型能够获得更高定价。 商业模式看,通用Token 和垂类行业Token 的竞争壁垒截然不同针对不同层级、不同需求的市场,目前衍生出了两种商业模式:聚合平台和垂类行业Token。 聚合平台模式是当前主流的商业模式之一,可以形象地比喻为“大模型界的 App Store”或“AI算力聚合路由平台”。它自身不训练任何大模型,而是通过搭建一个统一的中间层,将全球各大厂商的 AI 模型接口(API)打包整合,为开发者提供一站式的调用服务。垂类行业Token 指的是部分拥有特定行业Know-how 的软件公司通过将自己的行业数据和Know-how 封装进传统的Token,从而进一步生产出更加具备行业生产力的垂类Token,以获得更大的利润空间。 风险提示 1、模型发展不及预期风险; 2、算力供给不足风险; 3、数据供应不足风险; 4、行业竞争加剧风险。