Agent 学习笔记 16:Agentic-RL 入门:SFT、DPO、PPO 与 GRPO 怎么串起来

普通语言模型训练关注“下一段话像不像正确答案”,Agentic-RL 更关心模型在多步环境中能否选择合适动作、使用工具、处理反馈并完成目标。奖励来自整条轨迹,而不只是最后一句话。

先看几种训练方法各自解决什么

SFT 用高质量示范教会基本格式和行为;DPO 利用偏好对让模型倾向更好的回答;PPO 与 GRPO 等强化学习方法则依据奖励优化策略。它们不是必须全部串联的固定流水线,而是针对数据、稳定性和成本做选择。

Agent 训练的样本是轨迹

一条轨迹包含状态、动作、工具返回、错误恢复和最终结果。只奖励最终成功,可能掩盖高成本或危险路径;只奖励局部格式,又可能训练出“步骤漂亮但任务失败”的模型。实践中常组合任务成功、工具正确性、步骤成本、安全约束和输出质量。

任务环境 -> 策略行动 -> 工具/环境反馈 -> 轨迹评分 -> 参数更新 -> 新一轮评估

SFT 和 LoRA 是更现实的起点

当领域行为明确且有一批高质量示范时,先用 SFT 建立基本能力通常更稳。LoRA 可以降低微调资源,但数据质量仍比参数技巧重要。要保留独立评测集,防止模型只记住训练任务的表达方式。

强化学习最怕奖励投机

如果奖励只看测试是否通过,模型可能修改测试;只看调用次数,又可能少调用但给错答案。奖励函数必须与真实目标一致,并配合沙箱、隐藏评测和行为审计。训练提升也要和基座模型、Harness 改进做对照,避免把系统问题都推给训练。

这章给我的启发

Agentic-RL 的重点不是记住算法缩写,而是把多步行为变成可收集、可评分、可优化的轨迹。先定义什么叫“完成得好”,训练才有方向。

文章摘自:https://www.cnblogs.com/hazy-star/p/22705688