已确认事实
- ggml-org 发布了 llama.cpp 稳定版本 b10098。
- 发布说明显示,更新涉及 Hexagon 后端的激活算子:优化一体化 GEGLU 微内核,并为 GEGLU 及其他激活算子加入非连续源数据和跨步 DMA 支持。
- 更新还将部分 GLU 的逐线程函数泛化,并以每个激活算子的本地 HTP VTCM 布局计算替换通用
ops_context暂存区用法。 - 发布页列出 macOS、iOS、Ubuntu 与 s390x 等平台的预构建包。
为什么重要
这类后端优化有助于改善 llama.cpp 在 Qualcomm Hexagon 等硬件路径上的算子实现与部署兼容性。
仍待确认
- 发布说明未提供可直接比较的性能基准,实际性能影响仍需用户或维护者测试验证。