Benchmark评测基准
用标准化测试集给模型打分的体系。
用标准化测试集给模型打分的体系。常见的有 MMLU(综合知识)、HumanEval(代码)、GSM8K(数学)、MT-Bench(对话)等。每个新模型发布都会晒 Benchmark 成绩,但刷分和实际产品体验之间经常有巨大鸿沟。
什么时候会用到
讨论模型对比、选型、评测方法论时会用。
例句
- Benchmark 分数高不代表产品体验好,得在自己的场景里跑 Eval 才算数。
- 这个模型 MMLU 分数很高,但中文能力其实一般,Benchmark 里中文题太少了。