摘要
llama.cpp 在 GitHub Releases 发布 b10069。发布说明列出的主要变更包括:为 Adreno 的 MUL_MAT 支持广播,并在 llama-server 多流场景中处理 Adreno Q8_0 MUL_MAT 的 view_offs;同时扩展了通用 GEMM/GEMV 的广播支持。
该版本还提供 macOS、iOS 和多种 Linux 平台的预编译二进制包。对使用 Adreno OpenCL 后端运行 llama.cpp 或 llama-server 的开发者而言,这些修正可能提升特定矩阵计算与多流工作负载的兼容性。