面灵AI→

京东 大模型算法岗面经合集 01:PPO/DPO/GRPO 八股、音视频链路与端侧 AI 追问

轮次
多轮面试合集
时间
2026-09
来源
牛客网

《面试题目》

面经 03(2026 年 4 月 25 日)

  1. PPO 和 GRPO 的 KL 散度有什么区别?
  2. AdamW 优化器的原理?
  3. GRPO、DAPO、GSPO 的区别?
  4. DPO 的缺点,数据集怎么构造的?
  5. SFT 的损失函数?
  6. Transformer 原理?
  7. 为什么除以根号 dk?

面经 04(2026 年 4 月 19 日)

  1. 音频格式了解哪些?
  2. 说一下 MP4 帧头结构,moov 中包含哪些参数?
  3. 说一下 AAC 和 Opus 的区别?
  4. 你提到 Opus 延迟更低,且在中低码率下能够有更好的音质,能具体说一下?
  5. 说一下音频文件从 mp4 解复用到播放声音的整个处理链路?
  6. AVPacket 和 AVStream 有什么区别?
  7. 看到你简历有写 WebRTC,讲一下 WebRTC 的主要模块划分?
  8. 讲一下 NAT 穿透和 P2P 打洞?
  9. 你提到 WebRTC FEC 太严格挤占过多带宽,你是怎么去优化的?
  10. 你提到 IDR 帧,能说下 IDR 帧和 I 帧有什么区别吗?
  11. 你提到每个 GOP 开头 IDR 帧会把重传缓冲区冲垮,你通过优化 pacer 来解决这一问题,讲一下思路?
  12. 你提到 RTCP 和 NACK 包,能讲一下 RTCP 包含哪些包类型?
  13. 了解其他流媒体协议吗?说一下音频传输的主流协议和特点?
  14. 你们的 IPC 摄像头有提供一些 AI+ 能力吗?展开讲讲?
  15. 你觉得 IPC 可以集成哪些 AI+ 的能力呢?举些例子说明一下?
  16. 讲一下你们的 IPC 摄像头的整个 AI 识别和反馈结果的流程?
  17. 有了解 AI 模型在端侧的部署和应用吗?
  18. 了解哪些 AI 相关的算法吗?
  19. 讲讲音频的 3A 算法?
  20. 了解 AEC 算法的原理吗?它底层做了什么操作?
  21. 你提到要先消回声、再降噪、最后做自动增益控制,为什么?
  22. 先降噪,再消回声会怎样?
  23. 有调过音频算法的一些参数吗?这些参数的影响是怎样的?
  24. 介绍你提到的卡尔曼滤波器原理?为什么后来又改成了 EMA?
  25. 卡尔曼滤波器和 EMA 有什么联系?
  26. 你的码率控制模块会调节 qp、帧率、分辨率等参数,你是怎么去调节和优化的?
  27. 讲一下你的内存池是怎么实现的?能带来哪些性能上的优化提升?
  28. AI 用的多吗?讲讲你用 AI 实现全栈项目闭环的过程?
  29. 讲讲 agent skills 是怎么封装的?你封装和发布过哪些 skills 解决什么问题?
  30. 手撕:LRU 缓存。
  31. 你目前 base 哪里?老家是哪里人?
  32. 你对工作地点有硬性要求吗?能接受北京工作吗?

反问:

  1. 您这边业务主要会涉及哪些音频编码格式?您是怎么考虑的?
  2. 我们前面有聊到 Opus 延迟更低,从您的专业角度看,它为什么会比 AAC 延迟更低?
  3. 在过去的工作中,我没有合适的机会做端侧的 AI 应用开发,想了解您的团队对这个岗位在 AI 部署能力上的要求是怎样的?会期望候选人有硬性的落地经验吗?

面经 05(2026 年 4 月 19 日)

  1. AI 方面有哪些实践?
  2. 固定次数窗口的实现思路(Redis list:LPUSH 推入 + LTRIM 修剪)。
  3. 编码过程当中有没有用过一些设计模式?
  4. 为什么会有设计模式呢?设计模式主要是为了解决什么问题呢?
  5. 面向对象的设计原则?
  6. 设计一个秒杀系统,有什么思路?
  7. 为什么在 agent 方面实践不多?精力都放在哪里了?
  8. 你学新技术一般是看视频多呀?还是看官网多?还是看博客多?
  9. 如果让你去学习 AI 应用开发,你怎么学?
  10. 这个实习过程当中,你觉得你最大收获是什么呀?

面经 06(2026 年 4 月 16 日)

  1. 项目中的主要角色,负责哪些工作?
  2. prompt 如何设计,如何优化?
  3. 冷启的数据选择?
  4. 能否通过 PE 和数据制作进行 SFT,避免 RL 的学习?
  5. DPO 和 PPO 的差异?
  6. DPO 训练后模型整体效果变差,原因与解决方法?
  7. DPO 的效果衡量?
  8. OCR 模型了解程度?
  9. SGD 的核心原理和逻辑,解决什么问题?
  10. 在有搜索点击的日志时,如何判断 query 的类目意图?
  11. 新 query 下无历史日志,如何判断?

面经 07(2026 年 4 月 16 日)

  1. 逐个实习经历拷打介绍。
  2. 如何判断生成时无幻觉、无错误?如何进行重复判断?
  3. 关键词替换具体逻辑?
  4. 实习过程中感觉最有难度的点?
  5. LoRA 和全量的选择,有无对比尝试?
  6. SFT 和 DPO 区别、原理?
  7. 数据制作上的差异?

面经 08(2026 年 4 月 15 日)

  1. LoRA 微调原理:微调哪些层?常用训练参数怎么设置(epoch、learning_rate 等)?
  2. RAG 切片实现方法:如何设计和优化切片过程?
  3. 微调中的常见问题与解决方案?
  4. Embedding 召回优化策略:如何提高召回效果和模型效率?
  5. 复读问题分析:原生模型复读不严重,微调后却复读明显,原因何在?
  6. 领域知识注入:LoRA 微调能否有效注入领域知识?效果如何?
  7. 大模型幻觉(Hallucination)解决方案:如何缓解模型幻觉问题,稳定输出?
  8. 优化器考点:Loss 除以 10 和学习率除以 10 有什么区别?
  9. Self-Attention 的线性变换(QKV):为什么要做 QKV 线性变换?

《参考解析》

  1. PPO 与 GRPO 的 KL 项差别,要落到「跟谁比」:PPO 里 KL 惩罚是把当前策略和参考策略(通常是 SFT 模型)比,防止策略跑偏;GRPO 去掉价值网络(critic),用同一 prompt 下采样一组回答、以组内相对奖励作为优势估计,因此 KL 约束的形式和强度都会被这一组的分布影响。答题时可以补一句这带来的副作用:组内样本同质化时优势估计方差小但信号弱,奖励尺度变化会直接影响更新幅度,所以很多实现会调整 KL 系数或做奖励归一化。别背公式,讲清「去掉 critic 省了显存、代价是优势估计依赖组内对比」就能过关。

  2. DPO 的缺点要成对讲,并说清数据怎么造:DPO 直接在偏好数据上优化,省掉了奖励模型和在线采样,训练稳定、成本低;缺点是依赖静态偏好数据(离线、分布覆盖有限)、对数据质量极其敏感、缺少探索因而难以突破 SFT 的上限,容易在偏好上过拟合成「更啰嗦」「更保守」的风格。数据构造的常规路径是:同一 prompt 采样多个回答,用人工标注或强模型打分给出 chosen 与 rejected,注意控制两者长度差和风格差,并做去重与难度均衡。被问「DPO 训练后效果整体变差」时,按这个顺序排查:数据里有没有系统性偏差(长度、格式、拒答偏好)、学习率是否过大、参考模型是否选错、评测集是否与训练偏好不一致。

  3. LoRA 的题几乎必问,答法要具体到层和超参:LoRA 冻结原权重,在注意力的 Q、K、V、O 投影上加低秩旁路,实践中常同时加在 FFN 的两个线性层上,得到的效果与参数量都不同,这也是面试官追问「微调哪些层」的意图。rank 越大容量越强、越容易过拟合、显存占用越高;alpha 与 rank 的比值(缩放)比单个值更关键,通常保持 alpha 与 rank 同比例调整。学习率要比全参微调大一档,epoch 一般 2~3 就够,多了容易过拟合。被问「LoRA 能不能注入领域知识」时给一个有区分度的回答:格式、风格、任务模式适合 LoRA,大规模新知识更适合继续预训练或 RAG,LoRA 能学到的知识量受秩和训练步数限制。

  4. RAG 的两问(切片与召回)要讲清权衡:切片要先定切分依据——固定长度、按标题层级、按语义段落切,再定 chunk 大小与重叠率;chunk 太大召回不精准、太小则上下文不完整,重叠是为了避免答案被切断。工程上还常用上下文增强(给每个 chunk 拼接所属标题路径或摘要),显著提升检索命中的稳定性。召回优化从三层做:索引侧(embedding 模型选型与微调、多路召回混合 BM25 做关键词补足)、查询侧(query 改写、多查询扩展、HyDE)、排序侧(加 rerank 模型做精排、按业务权重调权)。上线后要盯召回率、命中段落是否包含答案、以及无答案时的拒答率。

  5. 复读与幻觉是微调后的高发问题:微调后复读变明显,通常是数据里存在重复样本、同一 prompt 对应多个几乎相同的答案、或者训练过度导致模型退化成「复制训练集」;也有解码端的原因(重复惩罚、温度设置不当)。排查顺序是先去重训练数据、再降学习率或减 epoch、最后检查解码参数。幻觉治理是一个组合拳:RAG 提供可溯源的上下文并强制引用、后验校验(抽取事实做一致性检查)、训练侧用偏好数据惩罚编造、产品侧给不确定性提示和拒答口子。答这题时一定区分「事实性幻觉」和「忠实性幻觉」(有上下文但不按上下文答),两者解法不一样。

  6. 音视频这组是简历驱动,答不出细节就会一路被追问:AAC 和 Opus 的比较可以抓三点——编码延迟(Opus 帧长短、支持 2.5~60 ms,算法本身也是低延迟设计,AAC 常见帧长 1024 采样点、还要叠编码器与容器缓冲)、码率区间的效率(Opus 在低码率语音上更好)、专利与授权(Opus 免版权费,这是实时通话选它的实际原因)。3A 的顺序问题要能讲因果:AEC 先把回声消掉,是因为降噪会把回声的非线性残留改得面目全非、也让延迟估计更难做,先降噪会让 AEC 的双讲检测和线性自适应滤波失去可对齐的参考信号。卡尔曼与 EMA 的联系可以这样讲:EMA 相当于固定增益的卡尔曼滤波,卡尔曼在噪声统计可信、状态方程清楚时更优,但 Q 和 R 难调,工程上常退回 EMA。

  7. 手撕 LRU 与工程八股:LRU 要能默写哈希表 + 双向链表,注意三个细节——get 命中后要移动到头部、put 已存在时先更新再移动、超容量时先删尾再插头;面试官常追加「怎么保证线程安全」「LRU 和 LFU 的取舍」,答 synchronized 或分段锁,以及 LFU 更能抵抗偶发批量访问但实现更重。设计模式那一问别报菜名,挑一个自己在项目里真实用过的(策略、模板方法、责任链),讲清解决了什么变化点。秒杀系统的常规答法是从限流(前置网关 + 令牌桶)、库存(Redis 预扣减 + Lua 保证原子性)、异步下单(MQ 削峰)、幂等与防超卖、以及降级兜底五段展开。

  8. 反问与 base 类问题的分寸:面经 04 里那三个反问质量很高,共同点是先承认自己的缺口、再问团队的硬性要求,面试官也给了很实在的答复(做音频主要选 Opus,实时通话延迟低且无版权费;端侧 AI 部署没有硬性经验门槛,更看编程基础和学习能力)。这类表态说明面试官在意的是可培养性而不是现成的技能栈。base 和家乡的提问则是在筛稳定性,回答要具体且和自己的经历一致,能接受就明确说能接受。