关键要点
01
先复述用户目标,再判断回答是否解决问题。
02
事实性必须基于证据核对,不看表达是否自信。
03
有帮助但越界的回答仍要在安全维度扣分。
04
偏好理由要可迁移到同类样本,而不是个人口味。
原创练习案例
有帮助但缺少安全提示
场景回答给出数据导出步骤,但没有提示脱敏和权限检查。
任务判断是否应该给满分。
参考判断帮助性可以给分,但安全边界应扣分,并说明缺少脱敏和权限检查。
关联模块模型评测
内容边界
本文不代表任何具体模型平台的官方评分标准,只提供通用学习框架。
能力训练
解释模型回答评分、偏好排序、事实核对和安全边界,帮助学习者理解人工反馈任务。
模型评测要把回答拆成帮助性、事实性、完整性、安全边界和格式可用性,再给出可复述的偏好理由。
先复述用户目标,再判断回答是否解决问题。
事实性必须基于证据核对,不看表达是否自信。
有帮助但越界的回答仍要在安全维度扣分。
偏好理由要可迁移到同类样本,而不是个人口味。
原创练习案例
本文不代表任何具体模型平台的官方评分标准,只提供通用学习框架。