优化一个代理指标,仍要问它代表什么
人类常常难以写出一条完美奖励函数,却能比较两个结果哪个好。偏好学习由此成为一种实用入口;DPO 又把偏好数据直接用于优化语言模型,减少传统奖励模型加在线 RL 流程中的一些复杂环节。方法不同,但都绕不过同一个问题:标注者在比较时依据了什么?
如果标注更喜欢流畅、自信的回答,模型可能学会更流畅、更自信,而不是更准确。若评估任务又偏向短期得分,长远的谨慎和可纠错性可能难以体现。这不是否定这些方法,而是提醒我,损失函数能被优化,并不代表人的真正目标已经被完整写进去。
我准备如何继续读
先把模仿学习、在线 RL、离线 RL 与偏好优化的训练数据和反馈来源画清楚,再比较它们各自容易犯的错。对于 Agent,还要看一次动作的奖励是否会诱导它隐藏失败或绕过验证。下一步会找包含原始任务、标注标准和失败样本的论文,而不是只抄一个榜单分数。
目前这仍是阅读笔记,不是“训练过自己的对齐模型”的项目经历。它值得放在 Garden,正因为问题比结论多。
一个容易被忽略的比较
如果评审更喜欢答案 A 而不是 B,还需要问:评审有没有机会核对事实?他在比较的是正确性、完整性、风格,还是几者混在一起的印象?同一对答案换一个任务背景,偏好可能变。偏好数据不是从真实目标中直接读取的刻度,而是带着标注流程的痕迹。
因此,读到“偏好胜率提高”时,我会找评估题如何构造、谁来判断、是否有独立的事实检查。优化目标、测试指标和用户真正想要的行为如果互相指向不同方向,就算训练曲线很漂亮,也该停下来重新问问题。