在 RLHF(Reinforcement Learning from Human Feedback)的 PPO 训练阶段,一共涉及四个模型:Actor、Critic、Reference、Reward。它们各司其职,协作完成“让语言模型输出更符合人类偏好”的目标。
本文将从每个模型的作用出发,详细推导各自的Loss,最后给出总 Loss的完整形式。
在 RLHF(Reinforcement Learning from Human Feedback)的 PPO 训练阶段,一共涉及四个模型:Actor、Critic、Reference、Reward。它们各司其职,协作完成“让语言模型输出更符合人类偏好”的目标。
本文将从每个模型的作用出发,详细推导各自的Loss,最后给出总 Loss的完整形式。
在Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets这篇论文中,神经网络在训练集上早已达到接近 100% 的准确率,但继续训练很长时间后,验证集准确率才突然从接近随机水平上升到接近完美,作者把这种现象称为 grokking。
GAE(Generalized Advantage Estimation)的推导核心:把优势函数写成一系列TD误差的加权和,再用一个参数 $\lambda$ 去平衡偏差和方差。
PPO(Proximal Policy Optimization)是近年来接触LLM始终绕不过去的RL算法,其核心思想如下:
根据经验调整Policy,但限制新旧Policy之间的变化幅度。
在训练模型的过程中,使用tf.losses.log_loss计算二分类loss,随着训练的深入,loss值为NaN,最终模型训练失败。排查下来发现是该函数存在数值不稳定的情况。
自动驾驶的L1到L5分级,是目前全球最通用的标准,由国际汽车工程师学会(SAE International)制定,用来定义一辆车的“聪明”程度。
在金融领域,PE 通常指 市盈率(Price-to-Earnings Ratio),是评估股票估值水平最常用的指标之一。
Hitrate(命中率)是一个用于评估召回阶段效果的指标。它的核心逻辑是看系统在召回阶段能不能”猜中”用户最终真正感兴趣的那些物品。
此前对于rl的这两个概念一直很模糊,在此整理一下。
这是阿里巴巴在广告自动出价的一篇工作,用扩散模型颠覆了传统深度rl出价的范式,取得了线上线下的巨大收益。