摘要
偏好强化学习(PbRL)是一种通过对齐模型与人类意图来减轻奖励工程负担的方法。然而,以往的PbRL研究大多未考虑到标签错误的鲁棒性,这在非专家或时间有限的标签者身上尤为明显。我们提出了一种简单的对比框架——相似性作为奖励对齐(SARA),它既能抵御噪声标签,又能适应多样化的反馈格式。SARA学习偏好样本的潜在表示,并计算与学习到的潜在表示的相似度作为奖励。
在不同真实噪声率的偏好数据上,我们在连续控制的离线强化学习基准测试中展示了竞争力及更稳定的性能,并在统计上显著优于基线模型(Wilcoxon signed-rank, p < 0.05)。
代码实现
以下是SARA的核心代码实现:
// SARA核心实现示例
void saraAlgorithm(vector<Sample> preferences) {
// 学习潜在表示
LatentRepresentation latent = learnLatent(preferences);
// 计算奖励
for (Sample sample : preferences) {
float reward = computeSimilarity(latent, sample);
assignReward(sample, reward);
}
}
博主点评: SARA框架展示了在面对标签噪声时的强健性,尤其适合人类反馈不完美的场景。通过将相似性作为奖励的核心,SARA不仅提升了模型的稳定性,也为偏好强化学习的应用提供了新的思路。其简单有效的设计使其在多种反馈格式下均表现良好,值得深入研究与应用。