大家发现没?
今年AI基础设施建设的风向,彻底变了!
![]()
以前大家关注的是↓
抢了多少张卡?攒了多少个柜子?总算力是多少FLOPS?
![]()
现在,问题变成了↓
每天能稳定产多少Token?一个Token折合多少钱?多久能回本儿?
![]()
于是乎,一个新概念爆火,这就是Token工厂↓
算力卡只是机器,模型和数据是原料,Token才是能够赚回真金白银的产品。
![]()
就这样,一大波Token工厂建设工程上马了。
可真动手建设,大家才发现:Token工厂比想象中难开多了。
![]()
一、Token工厂,想说爱你不容易
我们先正经解释一下。
所谓Token工厂,就是像经营一座工厂一样,把算力、模型、推理引擎、调度和运营系统组合起来,持续生产可供AI应用调用的Token。
![]()
然而,从买机床,到有产能再到见效益,这里面的坑,多得很↓
❙ 第一坑:散装算力,看得见却调不动
这两年,大家没少买各种GPU、加速卡,但在普通企业场景,它们很少整整齐齐地待在一个机房里。
![]()
在国内还有个非常现实的难题:GPU的品牌和型号异常复杂,基本上属于能淘到啥用啥。
不止NVIDIA、AMD,还有昇腾、海光、摩尔线程、昆仑芯、沐曦、寒武纪、平头哥……一大批国产GPU唱主角。
![]()
大家的名字都叫“算力”,驱动、算子、工具链、推理引擎却各有脾气。
这些散装算力就像草台班子,很难抱团稳定输出。
![]()
❙ 第二坑:模型更新快,适配永远慢半拍
现在,各种模型的新版本发布相当频繁,各种新特性让人眼馋。
作为企业IT人员,常常会被老板或者业务部门催更↓
![]()
“理论上可以”通常是加班故事的开场白。
模型官方给的Day0推荐配置,往往跟企业本地环境不一致,想要上线还要一一验证。
![]()
❙ 第三坑:模型跑起来了,效率上不去,成本下不来
模型适配完成,成功启动,只能算工厂产线通电。
![]()
决定Token生产效率的,除了算存网,还有量化、并行、批处理、上下文长度、KV Cache和推理引擎参数。
没有一组配置可以包打天下,经常GPU都跑冒烟了,效果却不佳。
![]()
不止如此,不同AI业务的要求还大不相同。
在线对话追求快速响应,批量生成重视吞吐,智能体任务需要长上下文,那叫一个众口难调。
![]()
❙ 第四坑:Token产出来,运营还是糊涂账
你以为产能和效率都搞定,就完事了?
![]()
如果这些问题回答不了,企业拥有的只是一个能运行模型的集群,谈不上生产级AI服务,谈不上Token工厂。
![]()
二、如何给Token工厂填坑?
坑多?没关系!上周我发现了一个填坑神器↓
在一场技术大会上,有个现场实景Demo把我镇住了。
这个Demo有多离谱:20分钟,创建一座跨洲的token工厂。
![]()
3个大洲、3家厂商、3种不同架构的芯片。
共同扛起Qwen模型,对外交付一个统一的模型API,稳定生产Token。
![]()
这个Demo不是屏幕录像,是现场实景操作,短短10几分钟,一个跨洲的token工厂就诞生了。
干成这件事的主角,就是GPUStack:开源企业AI基础设施平台,分分钟地把一堆GPU变成Token工厂。
![]()
在会上,GPUStack夸下了一句海口↓
![]()
客观来说,所谓“任何模型、任何GPU”不能机械理解成世上所有组合都能即插即用。
实际支持范围仍要看芯片、驱动、推理引擎和具体版本。
![]()
但是,GPUStack的底气在于↓
通过统一平台尽量屏蔽这些差异,理顺那一团乱麻,把大量人工拼装、适配工作编排成标准化流程。
![]()
❙ 1. 化零为整,把分散的GPU收进一个资源池
GPUStack可以统一纳管本地GPU服务器、远程GPU主机、K8S集群和云GPU集群,让散装算力变成资源池。
![]()
Any GPU都适配并聚合到一个大池子里,它们还在原来的物理位置上,却可以被统一调度、管理、分配。
不只是跨地域、跨组织架构、技术架构,GPUStack对国产化算力的异构纳管,更是相当到位。
![]()
这一步,相当于把工厂的散装机床全部编排重整,组合起一套能干活的标准产线。
先把机床盘清楚、整明白,才有资格谈产能。
![]()
❙ 2. Day0适配,把模型部署从手工作坊变成标准流程
部署一个模型时,GPUStack会根据模型信息估算资源需求,再结合资源池现有显存、内存和调度规则,判断模型适合放在哪些机器上。
![]()
当然,调度器也能把单个模型部署到异构的资源上:跨地域、跨架构、跨品牌。
跨度可以有多大?那个洲际Token工厂就是最好的例证。
![]()
对于刚刚发布的各种新模型,GPUStack采用可插拔推理后端。
平台与推理引擎版本可以独立更新,企业无需每次都等待整个平台升级。
新模型发布后,通过新版或自定义推理后端,就能完成Day0适配。
![]()
❙ 3. 评测+经验沉淀,把推理优化变成可比较、可积累的工程
GPUStack支持vLLM、SGLang、TensorRT-LLM、MindIE等推理后端,并把量化、KV Cache扩展、推测解码、并行部署等优化方式纳入统一编排。
![]()
同时,GPUStack内置基准测试,记录测试时使用的硬件、驱动、推理引擎、参数配置,再比较吞吐、延迟等结果。
让优化结果可比较、可度量,而不是全凭体感。
![]()
更重要一点,GPUStack把专家优化经验沉淀进了平台,自动进行编排优化。
有了这些预置经验,企业在遇到新模型、新硬件、新场景需求的时候,不用每次都从头“炼丹”。
![]()
❙ 4. 统一入口,统一服务,统一算账
GPUStack内置了AI网关,为模型提供统一入口,并负责请求路由、负载均衡、健康检查和故障切换。
至于后台模型今天跑在英伟达上,明天迁到国产GPU,或者总部集群挂了,需要切换分支备用服务,这些都交给平台处理。
![]()
GPUStack能够监控GPU利用率、显存占用、模型吞吐和延迟,并按照模型、用户和API Key统计Token使用量。
各类用量被放同一套统计体系,方便管理员算账和运营。
![]()
从资源管理到模型供给,再到性能优化和运营治理,坑总算都填平了。
至此,GPUStack终于把Token工厂从工程师维护的技术项目干到了企业可以持续运营的服务。
![]()
三、哪些地方最需要GPUStack?
这么说吧:GPU越多、品牌越杂、模型越多、参与部门越多,GPUStack的价值越明显。
我看到很多GPUStack用户的真实分享↓
GPUStack真实案例
01、某大型国企
把原来分散在集团和各分公司的异构GPU回收纳管(不需要物理机搬迁),用一套模型服务全集团,用Token配额、GPU时长配额来替代机器配发,不再重复采购显卡。
02、某头部985高校
把英伟达A800、H800、RTX4090、昇腾910B节点,用GPUStack统一纳管,组成异构资源池,为全校25000+师生提供统一模型服务。
03、某运营商Token工厂平台
一期纳管160台平头哥真武系列芯片服务器,面向政企提供Token服务,并与集团BOSS计费系统对接。
04、某AI一体机厂商
全系列AI一体机搭载GPUStack作为AIOS,单机就能构建Token工厂。
大家为什么都选择了GPUStack呢?我觉得有这么几点↓
首先,作为一套企业级AI基础设施平台,它纳管本地、云端和不同品牌的GPU,对接各类主流推理引擎,适配全量模型,高效稳定交付两种类型的服务。
![]()
这些产品能力,非常符合当前的Token工厂建设需求。
也正因为如此,GPUStack得到了全球超过120个国家和地区用户的认可,累计安装量超10万套。
![]()
第二,GPUStack是一套开源平台,这意味着用户可以自己先下载、部署、体验,是骡子是马,用户自己能遛。
很多用户,是先用了开源版本被圈粉,然后成为了GPUStack企业版客户。
![]()
第三,GPUStack还有一个藏在产品背后的优势:团队基因。
GPUStack联合创始人梁胜,是著名开源云管理平台CloudStack之父,后来又联合创办Rancher Labs,孵化出著名的云原生管理平台Rancher。
![]()
从云计算到云原生,再到AI大模型基础设施,梁胜这支团队始终在做同一类事:把复杂技术装进一个更容易使用、更适合规模化落地的平台。
From GPU to Token Factory in Minutes,正如GPUStack官网这句话,选择GPUStack,建设Token工厂分分钟变捷径。
![]()
特别预告↓
在GPUStack举办的AI Infra生态与技术创新峰会期间,我与梁胜博士进行了一次深入对话——
经历云计算、容器和AI三次浪潮之后,他为何再次选择基础设施?
GPUStack想在AI时代筑起一座怎样的“Stack”?
如何看待当下Token工厂的商业机会?
如何避免基础设施平台陷入定制化项目泥潭?
作为开源项目,GPUStack如何看待被“白嫖”现象?
新模型Day0适配到底重要不重要?
完整访谈内容将于近期发布,敬请关注。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.