Hugging Face WebAI团队近日发布了@huggingface/kernels,这是一个用于从Hugging Face Hub加载和运行优化WebGPU内核的轻量级库,同时发布了首批207个内核,托管在huggingface.co/webgpu-kernels。
这是该团队推进浏览器端AI推理策略中的第一层工作。在他们看来,要让浏览器推理足够快且好用,需要多层配合:模型需要适合浏览器的表示形式,运行时需要构建高效的执行计划,而最底层的GPU操作则需要适配多种设备和浏览器实现。这次发布的正是最底层这一环。
![]()
每个内核都是完整版本化包
这批内核覆盖了多种机器学习架构和负载中会用到的操作。每个内核都以完整、带版本号的包形式发布:接口、着色器模板、正确性测试用例、基准测试用例和使用说明,全部一起放在Hub上。
这种打包方式意味着,开发者拿到的不只是一段能跑的代码,而是一套有明确契约、可复现验证的组件。
Fleet:让真实设备帮你测内核
与内核库同步推出的还有Fleet,一个运行在浏览器里的GPU基准测试和验证套件。它会在你本机的硬件上运行这些内核并给出评分。除了让你了解自己设备的性能表现,Fleet还给社区提供了一种方式,从常规测试实验室无法覆盖的设备上贡献性能和正确性证据。
在你同意的前提下,每次运行都会添加私有证据,帮助团队发现失败案例(错误结果、病态慢速案例等),改进内核变体,并在真实硬件上做出更好的优化决策。
为什么先从内核入手?
一个模型在浏览器里运行,最终会变成一串GPU操作。WebGPU通过可移植的API让这些操作在主流浏览器里可用,WGSL则提供了执行这些操作的着色器通用语言。
但可移植不等于高性能。两个实现同一操作的着色器,可能输出相同结果,在不同加速器上的表现却天差地别。这正是Hugging Face选择从内核层入手的原因——把这一层做扎实,上层的模型和运行时才能有更好的性能基础。
目前,这批内核和加载器已经可以在Hugging Face Hub上获取,开发者可以直接下载使用,也可以参与Fleet测试为内核优化贡献数据。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.