已确认事实
llama.cpp 的 GitHub Releases 发布了 b10090。版本说明显示,WebGPU 后端新增 GGML_OP_CONV_2D_DW 深度二维卷积内核,该实现移植自 Vulkan 后端,并同步更新了 WebGPU 支持操作表。
为什么重要
深度卷积是部分视觉与端侧模型会使用的基础算子。新增该内核可减少相关工作负载在 WebGPU 后端的算子缺口。
仍待确认
版本说明未提供该内核在具体模型、浏览器或硬件上的性能数据,也未说明其对端到端推理速度的影响。
llama.cpp 发布稳定版本 b10090,为 WebGPU 后端加入深度二维卷积(CONV_2D_DW)内核,并更新支持操作表。该更新扩展了 WebGPU 后端可执行的算子范围。
llama.cpp 的 GitHub Releases 发布了 b10090。版本说明显示,WebGPU 后端新增 GGML_OP_CONV_2D_DW 深度二维卷积内核,该实现移植自 Vulkan 后端,并同步更新了 WebGPU 支持操作表。
深度卷积是部分视觉与端侧模型会使用的基础算子。新增该内核可减少相关工作负载在 WebGPU 后端的算子缺口。
版本说明未提供该内核在具体模型、浏览器或硬件上的性能数据,也未说明其对端到端推理速度的影响。