京东 大模型算法岗面经合集 01:PPO/DPO/GRPO 八股、音视频链路与端侧 AI 追问
- 轮次
- 多轮面试合集
- 时间
- 2026-09
- 来源
- 牛客网
《面试题目》
面经 03(2026 年 4 月 25 日)
- PPO 和 GRPO 的 KL 散度有什么区别?
- AdamW 优化器的原理?
- GRPO、DAPO、GSPO 的区别?
- DPO 的缺点,数据集怎么构造的?
- SFT 的损失函数?
- Transformer 原理?
- 为什么除以根号 dk?
面经 04(2026 年 4 月 19 日)
- 音频格式了解哪些?
- 说一下 MP4 帧头结构,moov 中包含哪些参数?
- 说一下 AAC 和 Opus 的区别?
- 你提到 Opus 延迟更低,且在中低码率下能够有更好的音质,能具体说一下?
- 说一下音频文件从 mp4 解复用到播放声音的整个处理链路?
- AVPacket 和 AVStream 有什么区别?
- 看到你简历有写 WebRTC,讲一下 WebRTC 的主要模块划分?
- 讲一下 NAT 穿透和 P2P 打洞?
- 你提到 WebRTC FEC 太严格挤占过多带宽,你是怎么去优化的?
- 你提到 IDR 帧,能说下 IDR 帧和 I 帧有什么区别吗?
- 你提到每个 GOP 开头 IDR 帧会把重传缓冲区冲垮,你通过优化 pacer 来解决这一问题,讲一下思路?
- 你提到 RTCP 和 NACK 包,能讲一下 RTCP 包含哪些包类型?
- 了解其他流媒体协议吗?说一下音频传输的主流协议和特点?
- 你们的 IPC 摄像头有提供一些 AI+ 能力吗?展开讲讲?
- 你觉得 IPC 可以集成哪些 AI+ 的能力呢?举些例子说明一下?
- 讲一下你们的 IPC 摄像头的整个 AI 识别和反馈结果的流程?
- 有了解 AI 模型在端侧的部署和应用吗?
- 了解哪些 AI 相关的算法吗?
- 讲讲音频的 3A 算法?
- 了解 AEC 算法的原理吗?它底层做了什么操作?
- 你提到要先消回声、再降噪、最后做自动增益控制,为什么?
- 先降噪,再消回声会怎样?
- 有调过音频算法的一些参数吗?这些参数的影响是怎样的?
- 介绍你提到的卡尔曼滤波器原理?为什么后来又改成了 EMA?
- 卡尔曼滤波器和 EMA 有什么联系?
- 你的码率控制模块会调节 qp、帧率、分辨率等参数,你是怎么去调节和优化的?
- 讲一下你的内存池是怎么实现的?能带来哪些性能上的优化提升?
- AI 用的多吗?讲讲你用 AI 实现全栈项目闭环的过程?
- 讲讲 agent skills 是怎么封装的?你封装和发布过哪些 skills 解决什么问题?
- 手撕:LRU 缓存。
- 你目前 base 哪里?老家是哪里人?
- 你对工作地点有硬性要求吗?能接受北京工作吗?
反问:
- 您这边业务主要会涉及哪些音频编码格式?您是怎么考虑的?
- 我们前面有聊到 Opus 延迟更低,从您的专业角度看,它为什么会比 AAC 延迟更低?
- 在过去的工作中,我没有合适的机会做端侧的 AI 应用开发,想了解您的团队对这个岗位在 AI 部署能力上的要求是怎样的?会期望候选人有硬性的落地经验吗?
面经 05(2026 年 4 月 19 日)
- AI 方面有哪些实践?
- 固定次数窗口的实现思路(Redis list:LPUSH 推入 + LTRIM 修剪)。
- 编码过程当中有没有用过一些设计模式?
- 为什么会有设计模式呢?设计模式主要是为了解决什么问题呢?
- 面向对象的设计原则?
- 设计一个秒杀系统,有什么思路?
- 为什么在 agent 方面实践不多?精力都放在哪里了?
- 你学新技术一般是看视频多呀?还是看官网多?还是看博客多?
- 如果让你去学习 AI 应用开发,你怎么学?
- 这个实习过程当中,你觉得你最大收获是什么呀?
面经 06(2026 年 4 月 16 日)
- 项目中的主要角色,负责哪些工作?
- prompt 如何设计,如何优化?
- 冷启的数据选择?
- 能否通过 PE 和数据制作进行 SFT,避免 RL 的学习?
- DPO 和 PPO 的差异?
- DPO 训练后模型整体效果变差,原因与解决方法?
- DPO 的效果衡量?
- OCR 模型了解程度?
- SGD 的核心原理和逻辑,解决什么问题?
- 在有搜索点击的日志时,如何判断 query 的类目意图?
- 新 query 下无历史日志,如何判断?
面经 07(2026 年 4 月 16 日)
- 逐个实习经历拷打介绍。
- 如何判断生成时无幻觉、无错误?如何进行重复判断?
- 关键词替换具体逻辑?
- 实习过程中感觉最有难度的点?
- LoRA 和全量的选择,有无对比尝试?
- SFT 和 DPO 区别、原理?
- 数据制作上的差异?
面经 08(2026 年 4 月 15 日)
- LoRA 微调原理:微调哪些层?常用训练参数怎么设置(epoch、learning_rate 等)?
- RAG 切片实现方法:如何设计和优化切片过程?
- 微调中的常见问题与解决方案?
- Embedding 召回优化策略:如何提高召回效果和模型效率?
- 复读问题分析:原生模型复读不严重,微调后却复读明显,原因何在?
- 领域知识注入:LoRA 微调能否有效注入领域知识?效果如何?
- 大模型幻觉(Hallucination)解决方案:如何缓解模型幻觉问题,稳定输出?
- 优化器考点:Loss 除以 10 和学习率除以 10 有什么区别?
- Self-Attention 的线性变换(QKV):为什么要做 QKV 线性变换?
《参考解析》
-
PPO 与 GRPO 的 KL 项差别,要落到「跟谁比」:PPO 里 KL 惩罚是把当前策略和参考策略(通常是 SFT 模型)比,防止策略跑偏;GRPO 去掉价值网络(critic),用同一 prompt 下采样一组回答、以组内相对奖励作为优势估计,因此 KL 约束的形式和强度都会被这一组的分布影响。答题时可以补一句这带来的副作用:组内样本同质化时优势估计方差小但信号弱,奖励尺度变化会直接影响更新幅度,所以很多实现会调整 KL 系数或做奖励归一化。别背公式,讲清「去掉 critic 省了显存、代价是优势估计依赖组内对比」就能过关。
-
DPO 的缺点要成对讲,并说清数据怎么造:DPO 直接在偏好数据上优化,省掉了奖励模型和在线采样,训练稳定、成本低;缺点是依赖静态偏好数据(离线、分布覆盖有限)、对数据质量极其敏感、缺少探索因而难以突破 SFT 的上限,容易在偏好上过拟合成「更啰嗦」「更保守」的风格。数据构造的常规路径是:同一 prompt 采样多个回答,用人工标注或强模型打分给出 chosen 与 rejected,注意控制两者长度差和风格差,并做去重与难度均衡。被问「DPO 训练后效果整体变差」时,按这个顺序排查:数据里有没有系统性偏差(长度、格式、拒答偏好)、学习率是否过大、参考模型是否选错、评测集是否与训练偏好不一致。
-
LoRA 的题几乎必问,答法要具体到层和超参:LoRA 冻结原权重,在注意力的 Q、K、V、O 投影上加低秩旁路,实践中常同时加在 FFN 的两个线性层上,得到的效果与参数量都不同,这也是面试官追问「微调哪些层」的意图。rank 越大容量越强、越容易过拟合、显存占用越高;alpha 与 rank 的比值(缩放)比单个值更关键,通常保持 alpha 与 rank 同比例调整。学习率要比全参微调大一档,epoch 一般 2~3 就够,多了容易过拟合。被问「LoRA 能不能注入领域知识」时给一个有区分度的回答:格式、风格、任务模式适合 LoRA,大规模新知识更适合继续预训练或 RAG,LoRA 能学到的知识量受秩和训练步数限制。
-
RAG 的两问(切片与召回)要讲清权衡:切片要先定切分依据——固定长度、按标题层级、按语义段落切,再定 chunk 大小与重叠率;chunk 太大召回不精准、太小则上下文不完整,重叠是为了避免答案被切断。工程上还常用上下文增强(给每个 chunk 拼接所属标题路径或摘要),显著提升检索命中的稳定性。召回优化从三层做:索引侧(embedding 模型选型与微调、多路召回混合 BM25 做关键词补足)、查询侧(query 改写、多查询扩展、HyDE)、排序侧(加 rerank 模型做精排、按业务权重调权)。上线后要盯召回率、命中段落是否包含答案、以及无答案时的拒答率。
-
复读与幻觉是微调后的高发问题:微调后复读变明显,通常是数据里存在重复样本、同一 prompt 对应多个几乎相同的答案、或者训练过度导致模型退化成「复制训练集」;也有解码端的原因(重复惩罚、温度设置不当)。排查顺序是先去重训练数据、再降学习率或减 epoch、最后检查解码参数。幻觉治理是一个组合拳:RAG 提供可溯源的上下文并强制引用、后验校验(抽取事实做一致性检查)、训练侧用偏好数据惩罚编造、产品侧给不确定性提示和拒答口子。答这题时一定区分「事实性幻觉」和「忠实性幻觉」(有上下文但不按上下文答),两者解法不一样。
-
音视频这组是简历驱动,答不出细节就会一路被追问:AAC 和 Opus 的比较可以抓三点——编码延迟(Opus 帧长短、支持 2.5~60 ms,算法本身也是低延迟设计,AAC 常见帧长 1024 采样点、还要叠编码器与容器缓冲)、码率区间的效率(Opus 在低码率语音上更好)、专利与授权(Opus 免版权费,这是实时通话选它的实际原因)。3A 的顺序问题要能讲因果:AEC 先把回声消掉,是因为降噪会把回声的非线性残留改得面目全非、也让延迟估计更难做,先降噪会让 AEC 的双讲检测和线性自适应滤波失去可对齐的参考信号。卡尔曼与 EMA 的联系可以这样讲:EMA 相当于固定增益的卡尔曼滤波,卡尔曼在噪声统计可信、状态方程清楚时更优,但 Q 和 R 难调,工程上常退回 EMA。
-
手撕 LRU 与工程八股:LRU 要能默写哈希表 + 双向链表,注意三个细节——get 命中后要移动到头部、put 已存在时先更新再移动、超容量时先删尾再插头;面试官常追加「怎么保证线程安全」「LRU 和 LFU 的取舍」,答 synchronized 或分段锁,以及 LFU 更能抵抗偶发批量访问但实现更重。设计模式那一问别报菜名,挑一个自己在项目里真实用过的(策略、模板方法、责任链),讲清解决了什么变化点。秒杀系统的常规答法是从限流(前置网关 + 令牌桶)、库存(Redis 预扣减 + Lua 保证原子性)、异步下单(MQ 削峰)、幂等与防超卖、以及降级兜底五段展开。
-
反问与 base 类问题的分寸:面经 04 里那三个反问质量很高,共同点是先承认自己的缺口、再问团队的硬性要求,面试官也给了很实在的答复(做音频主要选 Opus,实时通话延迟低且无版权费;端侧 AI 部署没有硬性经验门槛,更看编程基础和学习能力)。这类表态说明面试官在意的是可培养性而不是现成的技能栈。base 和家乡的提问则是在筛稳定性,回答要具体且和自己的经历一致,能接受就明确说能接受。