在浏览器中运行大模型,长期受限于底层计算内核的碎片化与不透明。Hugging Face WebAI 团队今日发布 @huggingface/kernels 库,以一套包含 207 个 WebGPU 内核的集合,试图为这一领域建立更规范的开发范式。这些内核并非以单一包形式分发,而是各自作为独立仓库托管于 Hugging Face Hub,采用 Apache-2.0 开源许可,便于开发者按需引用与审计。
每个内核仓库都包含完整的配套资源:manifest 文件用于声明元数据与依赖关系,正确性测试确保运算结果与 CPU 参考实现一致,基准用例提供跨设备性能对比基线,以及可直接编译的 WGSL 着色器模板。这种结构意味着开发者无需从零编写底层着色器,也无需在多个来源间拼凑工具链,即可将经过验证的计算单元集成到自己的 WebAI 应用中。
从技术角度看,这批内核覆盖了 Transformer 推理中的常见算子,包括矩阵乘法、注意力机制、归一化层及各类激活函数。通过 WebGPU 的 compute shader 路径,这些内核能够直接调用 GPU 并行计算能力,从而绕开传统 WebGL 的图形管线限制,在浏览器内实现更高效的张量运算。Hugging Face 方面表示,该库的设计初衷是让模型部署到 Web 端时,开发者能更专注于上层应用逻辑,而非底层性能调优。
目前,该库已开放下载,社区开发者可通过 Hub 上的独立仓库浏览每个内核的测试记录与基准数据。此举也被视为 Hugging Face 在 Web 端推理生态布局中的关键一步——通过标准化内核层,降低浏览器本地运行大模型的工程复杂度,为后续 Transformer 模型的 Web 端落地提供更坚实的地基。