跳转至

[50] MT-Bench/Chatbot Arena:LLM-as-a-Judge 的边界

  • 资料类型:论文/评测方法
  • 原始来源:https://arxiv.org/abs/2306.05685
  • 对应章节:第 18 章(评测体系)

一句话

让模型当裁判能省人力,但裁判也会偏,所以必须有对照与校准。

你该从论文带走什么

  • Judge 不是万能:它擅长风格/解释/覆盖度类评价,但对事实性与引用一致性仍可能误判。
  • 需要校准:用少量人工标注集评估 Judge 的一致性与偏差,再决定它能不能做门禁。

在本书里怎么用

  • 把 LLM-as-a-Judge 用在回归趋势上,而不是用来给单次改动盖棺定论。
  • 设定保护栏:抽样人工复核、针对高风险场景(医疗/金融/合规)提高人工比例。

常见误用

  • 直接把 Judge 分数当发布门禁,但没有任何人工对照集,导致好不好全凭一个模型心情。