九位法官,两票有效:相关错误削弱LLM评估小组
Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels
摘要
在三个自然语言推理数据集上,对来自7个模型家族的9个前沿LLM进行测试后,LLM-as-a-judge面板聚合多个模型投票,但实际仅提供约2个独立投票的信息量,名义上的独立性中约四分之三被高估。该框架量化了面板可靠性距离独立投票理想状态的差距。
LLM-as-a-judge(大语言模型作为裁判)面板聚合来自多个模型的投票,期望不同模型能产生更可靠的评估。我们开发了一个框架来衡量此类面板的真实信息价值,并量化其可靠性距离独立投票理想状态有多远。在三个自然语言推理数据集(每个条目包含100个人工标注)上,对来自7个模型家族的9个前沿LLM进行测试后,我们发现这9个裁判实际上仅提供了约2个独立投票的信息量。该面板名义上的独立性中,大约有四分之三……
译自 Apple · ML Research · 录于 二〇二六年六月二十四日