面灵AI→

滴滴算法秋招凉经:GRPO 监控指标与 Agentic RL 数据链路

滴滴 大模型算法

滴滴算法秋招凉经,12 问全部围绕 RL 后训练:GRPO 除 reward 外要盯的六类指标、可训练轨迹必须保留的可见状态、SFT 数据筛选与成功轨迹的幸存者偏差、何时从 SFT 切到 RL,以及异步 rollout 的 off-policy 与 KL 约束。

2026-09