官方网站:https://blog.salesforceairesearch.com/sfr-judge/
工具简介
SFR-Judge 是 Salesforce AI Research 推出的一系列评估模型,用来加速大语言模型的评测与微调环节。它把评估拆成几种可组合的任务:给两个输出做成对比较、用 1 到 5 的 Likert 量表对单个输出打分,以及判断某个输出是否满足指定标准。每条判断都附带解释,避免只给分数的黑箱结果,也能充当奖励模型参与强化学习微调。
需求人群
需要成规模评估和微调大语言模型的研究人员与开发者,尤其是人工评审成本高、量大到评不完的团队。共同点是既要一个能当参照的评分,又希望看到评分背后的理由。
使用场景
- 研究人员用 SFR-Judge 评估新训练出的语言模型输出质量。
- 开发者拿它的判断结果作为信号,指导聊天机器人模型的微调。
- 教育机构用它评估教学辅助工具的实际效果。
- 需要给出结论理由时,查看每条判断附带的解释而不是只看分数。
产品特色
- 成对比较:判断两个模型输出中哪一个更好。
- 单项评分:使用 1 至 5 的 Likert 量表对单个输出打分。
- 二元分类:判断输出是否满足某项特定标准。
- 每条评估结果附带解释,减少黑箱判断带来的不确定。
- 通过统一评估过程尽量减少人工评审中的偏见。
- 可作为奖励模型参与强化学习微调,并在成对比较中表现出较高一致性。