面灵AI→

合合信息多模态大模型算法研究员一面 + 作业帮大模型算法一面二面

轮次
多轮面试合集
时间
2026-09
来源
牛客网

《面试题目》

合合信息 多模态大模型算法研究员 一面(9.18)

  1. 项目经历深挖。
  2. 如何判断 SFT 模型训好了、可以做 RL 了?
  3. OCR 模型目前都有哪几种架构,区别是什么,有什么优缺点,分别是怎么训练的?

(无手撕)

作业帮 大模型算法工程师 一面(9.20)

  1. DPO 的奖励函数是什么?DPO 和 GRPO 相比哪个效果好?
  2. 为什么模型在做 RL 的过程中会倾向于输出更长的样本?
  3. 手撕:三数之和。

作业帮 大模型算法工程师 二面(9.22)

  1. DPO 如何解决筛选数据不稳定的问题?
  2. 其他关于项目的一些问题。
  3. 手撕:搜索旋转排序数组。

《参考解析》

  1. 怎么判断 SFT 模型可以转 RL:看三件事——SFT 模型在目标任务的 pass@k 已经不为零,说明策略能采样到正确轨迹,RL 才有可优化的信号;格式和指令遵循基本稳定,否则 RL 阶段大量样本浪费在纠正格式上;reward 模型或规则打分在 SFT 输出上能拉开区分度,分数分布不是全挤在一起。这三条都满足就可以上 RL,通常先跑小规模实验看 reward 曲线是否单调爬升。
  2. DPO 的奖励函数:DPO 不显式训练 reward model,它把「最优策略相对参考策略的对数比」当成隐式奖励,即 r(x,y) = β·log(π(y|x)/π_ref(y|x)),代入 Bradley-Terry 偏好模型后,参考策略的对数项在配对里相消,损失变成对 chosen/rejected 的 log-sigmoid。所以只需要成对偏好数据,不用采样再打奖励,代价是必须有一份固定的参考模型,且对数据分布很敏感。
  3. DPO 和 GRPO 哪个效果好:没有绝对答案,取决于数据与场景。DPO 稳定、便宜、不用在线采样,适合偏好数据质量高、任务偏风格或安全性对齐的情况;GRPO 是在线策略优化,用组内相对优势替代 value 网络,能利用 reward 模型的细粒度信号,上限通常更高,但需要采样成本、对 reward 的 hack 更敏感、超参也更难调。被追问时给出自己实测过的对比维度(训练成本、稳定性、最终指标)比背结论更可信。
  4. RL 训练中输出为什么变长:多数 reward 模型或人工偏好对长答案有偏,只要长度和得分正相关,策略就会通过拉长输出刷分;同时串行生成下长度本身放大了单条样本被优化的机会,KL 约束一旦偏松就更容易跑偏。常见对策是长度惩罚或长度归一化、按长度分桶比较、在 reward 里显式约束格式与冗余。
  5. DPO 数据筛选不稳定怎么处理:不稳定通常来自偏好对噪声大、chosen 与 rejected 差异太小,或拒绝了同分布的正样本。做法是先做数据去噪——去掉标注一致率低的样本、按长度和相似度做过滤,再用模型自身打分挑出区分度大的对;也可以改造成 IPO/保守版目标,给 log-sigmoid 加一个目标间隔让训练更稳。同时固定参考模型与数据版本,才能把波动归因到改动上。