界面新闻记者 |
界面新闻编辑 | 文姝琪
过去两年,AI算力行业经历了一次明显的重心转移。
最初,企业争抢的是GPU。随着大模型快速发展,算力成为AI应用落地的前提,地方政府和企业纷纷建设数据中心、采购GPU,甚至一度出现“有卡就有算力”的行业共识。
但当企业真正开始把大模型部署到自己的业务环境中,问题随之从“有没有GPU”变成“GPU能不能真正跑起来”。
这中间隔着一整套复杂的软件工程。
GPUStack CEO秦小康在接受界面新闻采访时称,目前市场上存在大量GPU、模型和推理后端,不同硬件、模型和推理框架之间形成复杂的组合关系。一款模型即使拿到了GPU,也不能直接运行,需要经过推理后端适配以及针对具体硬件的性能优化。

GPUStack因此从最初的GPU资源管理,转向覆盖GPU管理、模型部署、推理引擎适配和运营管理的“一揽子工程”。
如果把AI算力比作水电基础设施,GPU是发电设备,模型和应用是用电、用水的一端,那么GPUStack更像一家“水力公司”——它不生产GPU,也不制造大模型,而是负责把分散的算力组织起来,根据需求调度,让算力能够稳定地转化为Token。
这背后变化的是AI算力产业的计量方式:从“有多少张卡”,开始走向“这些卡能生产多少Token”。
从“抢GPU”到“用好GPU”
国产GPU正在经历一个重要的产业阶段。
秦小康认为,过去两年AI基础设施最明显的两个变化,一是开源模型快速追赶并进入更多应用场景,二是非英伟达体系的GPU开始被更多真实业务验证。对国产算力而言,这意味着行业关注点开始从芯片本身向软件生态和实际使用效率移动。
这也是GPUStack切入的核心位置,一块国产GPU真正进入生产环境,要解决的并不只是硬件问题。秦小康对界面新闻表示,目前最普遍的两类问题,一类是模型和GPU无法适配,导致GPU直接闲置;另一类是模型虽然能够运行,但硬件性能无法充分释放。
他提到一个金融客户的案例,该客户此前基于华为GPU运行模型,经优化后吞吐量提升8至9倍、推理延迟降低80%至90%。不过这一案例属于极致优化效果;对于原本已经具备较好优化基础的场景,平台方面认为,20%至30%左右的利用率提升已经属于行业较好的水平。
这里真正值得关注的,并不是某个平台能够把利用率提高多少个百分点,而是国产GPU产业的竞争正在向软件栈延伸。
“单纯做GPU算力编排本身并不是最难的事情,真正复杂的是推理后端和推理引擎的适配优化。”GPUStack CTO梁胜认为,不同GPU对应不同的软件体系,不同模型又有不同的运行要求,模型架构还在快速变化,导致AI算力基础设施仍处于类似早期PC时代“驱动不断适配”的阶段。
GPUStack试图通过可插拔的推理后端机制解决这一问题:模型厂商推出新的模型或定制化推理后端时,不必重新改造整个平台,而是通过接口快速接入。
这也是GPUStack与传统GPU云、单纯GPU调度工具之间的一个区别。
该公司认为,目前这一市场并不存在一个完全对应GPUStack的竞争对手,海外已经形成多种GPU编排和AI基础设施方案,例如NVIDIA旗下Run:ai主要解决GPU调度、资源池化和集群编排;Kubernetes生态中的Kueue、Volcano等开源项目也在解决GPU工作负载调度问题;Anyscale则更多从分布式计算和AI工作负载扩展切入。欧盟委员会在分析GPU编排软件市场时,也将Run:ai与Slurm、ClearML、Anyscale、Kubeflow等视为不同程度的替代方案。
GPUStack则试图把竞争位置进一步向上延伸:不仅管GPU,还要把GPU、模型、推理引擎和Token服务串起来。
这意味着它真正面对的竞争,并不只是另一家GPU调度软件公司,而是企业自己搭建平台、芯片厂商自有软件栈、云厂商AI基础设施以及各种开源项目的组合。
这也是开源模式对GPUStack的重要意义,其团队认为,AI硬件和模型都在高速迭代,不可能依靠单一企业完成所有适配,因此需要硬件厂商、模型厂商和开发者共同参与。GPUStack目前已经形成11万级部署体量,用户的真实使用和反馈成为产品迭代的重要来源。
算力开始拼效率
AI算力行业的商业模式也正在发生变化。
秦小康认为,目前国内不少Token工厂仍然采取项目制模式,主要服务万卡以上的大型算力集群。但未来不可能所有企业都依赖少数大型公有算力中心。对于金融、能源、制造等大量对数据安全、成本和业务场景有要求的企业而言,私有部署仍然存在需求。
这意味着,AI算力市场可能出现一个新的分层:少数超大型算力中心提供基础算力,大量企业建设自己的“小型Token工厂”。
GPUStack瞄准的正是后者,从商业逻辑上看,这与过去云计算的发展有一定相似之处:基础设施逐渐标准化之后,企业不再需要自己搭建所有底层系统,而是购买一套成熟的软件和服务,把底层复杂性屏蔽掉。
帝欧水华集团董事长朱江的经历,提供了一个来自“买方”的观察。
作为传统产业企业,其团队此前已经开始建设算力业务,并尝试自己搭建算力管理体系。朱江向界面新闻回忆,该公司曾投入上百万元自研,但AI工程化人才稀缺,GPU适配、软件部署和漏洞修复都需要大量投入。最终,开源的GPUStack降低了自研门槛,使企业能够更快完成多品牌GPU的统一管理和算力服务搭建。
朱江对行业的判断是,GPU短缺不会永远存在。随着GPU供给增加,企业竞争的重点将从“谁能拿到GPU”转向“谁能把GPU管理好、利用好”。其所在企业已经将算力业务视为第二增长曲线。
这实际上也是GPUStack试图回答的行业问题:当GPU逐渐从稀缺资源变成一种可以被规模化采购的生产资料,新的瓶颈会在哪里?
答案可能不是更多的GPU,而是如何把不同品牌的GPU、不同模型和不同推理引擎组织成一个稳定的生产系统。
因此,“Token工厂”并不只是给AI算力换了一个新名字,它指向的是AI基础设施的一次变化——AI行业正在从争夺算力资产,转向争夺算力效率;从建设算力中心,转向建设能够持续生产Token的基础设施。
