已确认事实

llama.cpp 已发布 b10099。发行说明显示,该版本重点优化 CUDA 的 NVFP4 W4A4 激活量化:包括使用可用的 NVFP4x4 intrinsic、融合逐通道 amax 与量化内核、采用 32 字节加载,并调整尺度搜索和对齐处理。

该版本同时提供 macOS、iOS 与 Linux 等平台的预构建产物。

为什么重要

这些改动面向低精度推理路径,旨在减少量化和矩阵乘法相关开销,可能改善支持该 CUDA 特性的硬件上的本地模型推理效率。

仍待确认

发行说明未提供统一的性能基准,实际提升幅度及适用硬件范围仍需通过项目测试或后续基准验证。

来源依据