已确认事实
llama.cpp 已发布稳定版本 b10089。版本说明显示,CUDA 后端的 GET_ROWS 操作新增对 K-quant、i-quant 与 MXFP4 量化格式的支持;i-quants 和 MXFP4 路径带有行长度对齐条件,i-quants 与 MXFP4 以外的部分格式仍有待后续支持。
为什么重要
GET_ROWS 用于嵌入查找。发布说明称,此前部分常见 GGUF 配方会因该操作不受支持而回退至主机端,可能在逐 token 推理时复制完整嵌入矩阵;新实现意在减少这一回退。
仍待确认
本组仅提供发布说明摘要,未包含具体性能测试或对不同模型、硬件配置的影响数据。