共 1 篇真实面经 · 涵盖 滴滴 等 1 家公司
滴滴算法秋招凉经,12 问全部围绕 RL 后训练:GRPO 除 reward 外要盯的六类指标、可训练轨迹必须保留的可见状态、SFT 数据筛选与成功轨迹的幸存者偏差、何时从 SFT 切到 RL,以及异步 rollout 的 off-policy 与 KL 约束。
微信小程序
手机上刷面经,随时随地
扫码 / 长按识别,免下载直接打开
或在微信 搜一搜「面灵面经」