摘要

llama.cpp 发布 b10067。该版本将 DeepSeek-V4 的 ffn_gate_tid2eid 排除在量化之外:该张量是 i32 的 token-id 到 expert-id 路由索引表,并非模型权重;此前量化工具尝试将其转换为浮点类型时会失败。

这一改动面向使用 llama-quantize 处理 DeepSeek-V4 的开发者,可避免该特定张量导致的量化中断。

原始来源:GitHub Releases