已确认事实

llama.cpp 的 GitHub Releases 发布了 b10090。版本说明显示,WebGPU 后端新增 GGML_OP_CONV_2D_DW 深度二维卷积内核,该实现移植自 Vulkan 后端,并同步更新了 WebGPU 支持操作表。

为什么重要

深度卷积是部分视觉与端侧模型会使用的基础算子。新增该内核可减少相关工作负载在 WebGPU 后端的算子缺口。

仍待确认

版本说明未提供该内核在具体模型、浏览器或硬件上的性能数据,也未说明其对端到端推理速度的影响。

来源依据