已确认事实
Hacker News 上的一则作者自述称,其团队以文字多用户地下城(MUD)环境进行 LLM 评估概念验证,并公开了论文、数据、代码、对话记录和 API 账单导出。
作者称,实验对各模型的四个行为维度打分;移除其中两个高度依赖 LLM 分类器的维度后,一款前沿模型的名次下降六位。作者还称,使用第二个裁判复核时,各模型之间的一致率介于 85% 与 22% 之间;在“探测识别”指标上,汇总 kappa 为 0.04。
为什么重要
若可复现,这一观察提示:依赖 LLM 裁判的基准测试可能受到裁判选择与评分噪声的显著影响,模型排行不应脱离评估工具的可靠性单独解读。
仍待确认
这是一则社区作者自述,且作者明确称其不是经过验证的基准。输入所述实验仅对每个模型运行 50 次、没有人工评分者、环境较小,领先模型的置信区间也存在重叠;论文、数据与方法仍需独立审阅和复现。