Benchmark评测基准

用标准化测试集给模型打分的体系。

用标准化测试集给模型打分的体系。常见的有 MMLU(综合知识)、HumanEval(代码)、GSM8K(数学)、MT-Bench(对话)等。每个新模型发布都会晒 Benchmark 成绩,但刷分和实际产品体验之间经常有巨大鸿沟。

什么时候会用到

讨论模型对比、选型、评测方法论时会用。

例句

  • Benchmark 分数高不代表产品体验好,得在自己的场景里跑 Eval 才算数。
  • 这个模型 MMLU 分数很高,但中文能力其实一般,Benchmark 里中文题太少了。