跳到主要内容

Agentic RL:从 SFT 到 GRPO 的智能体训练实战

光靠 Prompt 调 Agent 有上限。2025-2026 年的进阶玩法是 Agentic RL:直接用强化学习训练模型学会"在环境中行动"——调用工具、多步推理、按规则自我纠错。本文讲清从 SFT 到 GRPO 的完整训练管线,以及训练完模型后的部署衔接。

一、为什么需要 Agentic RL​

预训练 + SFT 教会模型"像人一样说话",但 Agent 任务要的是"像人一样做事":

  • 搜索 → 读网页 → 调用 API → 失败 → 换策略重试
  • 写代码 → 运行 → 看报错 → 修改 → 再跑

这类多步交互行为,监督数据很难覆盖"错后如何自我纠正"。强化学习正好擅长:给模型一个环境,让它自己探索,做对了就给奖励——行为是从试错中"长"出来的,而不是背出来的。

二、训练管线四步​

第 1 步:SFT —— 先让它"会"行动​

收集高质量轨迹数据(人演示或强模型生成),做监督微调。这一步的目标不是最优,而是让模型具备基本的工具调用格式和行动能力,给 RL 一个可探索的起点。

要点:轨迹格式统一(思考 → 动作 → 观察 三段式);覆盖失败样本(模型要见过"错"才学得会"改")。

第 2 步:奖励 —— 尽量用"可验证奖励"​

Agentic RL 与传统 RL 最大的不同:不依赖人工写奖励函数。优先用规则可验证的信号:

任务类型可验证奖励
代码生成测试用例是否通过
数学推理最终答案是否正确
工具调用是否能拿到预期结果(检索命中/API 成功)
网页操作是否达到目标状态(如下单成功)

规则奖励 → 可自动规模化(百万级轨迹);只有当规则无法定义时才引入奖励模型(RM)。

第 3 步:RL —— PPO 还是 GRPO​

  • PPO(传统):需要 Critic(价值)模型估计优势,显存开销大、超参敏感
  • GRPO(Group Relative Policy Optimization):DeepSeek 提出——对同一问题采样一组回答,用组内相对奖励替代 Critic 模型,训练成本显著下降,成为 2025 年后 Agentic RL 的主流选择

GRPO 的直觉:同一个问题采 8 条轨迹,做得最好的给正信号、最差的给负信号,模型学到的是"相对更好"而不是"绝对多好"——这让它在探索初期更稳定。

第 4 步:评估与回归​

训练完必须回归验证:

  • 能力基准:在保留的工具任务集上跑通过率,和 SFT 基线对比
  • 行为回归:检查是否出现"奖励黑客"(如模型发现不调用工具直接编答案也能得分)
  • 通用能力回归:标准评测(推理/代码/对话)不能明显下降

三、实战要点与常见坑​

  1. 环境先于算法:工具环境(沙箱代码执行、浏览器、搜索 API)的稳定性和轨迹可回放性,比算法选择更影响成败
  2. 奖励稀疏期要"热身":先用 SFT + 拒绝采样积累正样本,再进 RL
  3. 奖励黑客要监控:规则奖励越"可验证",黑客空间越小——坚持用测试用例通过率,而不是模型自评
  4. 数据质量 > 数据量:1 万条干净轨迹好过 10 万条噪声轨迹
  5. 训练成本可控:GRPO + 小模型(7B-32B)在单机 8 卡即可起步;LoRA 微调可作为快速试错

四、FDE 视角:训练完的模型怎么部署​

Agentic RL 训练的产出是一个更会行动的模型,部署链路与本站《生产部署》完全一致,额外注意三点:

  • 推理时延预算:RL 模型往往更长于"多想几步再行动",时延会增加——提前压测确认符合 SLO
  • 工具调用格式变更:训练可能改变输出 schema,评测与可观测性(见《评估与可观测性》)要随之更新
  • 算力规划:训练集群与推理集群分时复用 GPU(见《成本与运维》章节的弹性策略)

五、与本站其他章节的关系​

  • 《评估与可观测性》:训练后回归评估的落地工具
  • 《Agent 设计模式》:RL 学到的行为模式(ReAct/反思)与之互为印证
  • 《多智能体编排》:单 Agent 学会行动后,编排层负责让它们协作

一句话总结:Agentic RL 不是替代工程,而是工程的上限提升器。 先把 Harness、上下文、评测做扎实(本站 L1-L5),再用 RL 把模型能力顶上去,最后回到生产纪律里部署它。