已确认事实

  • ggml-org 发布了 llama.cpp 稳定版本 b10098。
  • 发布说明显示,更新涉及 Hexagon 后端的激活算子:优化一体化 GEGLU 微内核,并为 GEGLU 及其他激活算子加入非连续源数据和跨步 DMA 支持。
  • 更新还将部分 GLU 的逐线程函数泛化,并以每个激活算子的本地 HTP VTCM 布局计算替换通用 ops_context 暂存区用法。
  • 发布页列出 macOS、iOS、Ubuntu 与 s390x 等平台的预构建包。

为什么重要

这类后端优化有助于改善 llama.cpp 在 Qualcomm Hexagon 等硬件路径上的算子实现与部署兼容性。

仍待确认

  • 发布说明未提供可直接比较的性能基准,实际性能影响仍需用户或维护者测试验证。

来源依据