面灵AI→

京东 大模型算法岗面经合集 02:多模态位置编码、Agent 与 SFT/RL 追问

轮次
多轮面试合集
时间
2026-09
来源
牛客网

《面试题目》

面经 01(2026 年 2 月 5 日)

  1. 追问了 M-RoPE 比原来的 RoPE 有什么改进?有什么优点?
  2. 原来的 RoPE 在升级成 M-RoPE 之前,它是怎么处理视频的?具体来说,对于每一帧或者说每一个 patch,是怎么处理的?
  3. 项目:既然是一个垂类的场景,为什么要去用通用场景下的 VLM 来做?为什么不用已经具有领域知识的一些模型?
  4. 项目:为什么你的 VLM 是输出点的坐标,而不输出 bbox 呢?bbox 按道理比点的坐标具有更多的图像信息吧?
  5. 讲一下 SAM2 分割模型的原理。
  6. 项目:数据是用算法生成的,你们怎么判断这一批数据是好的还是不好的呢?

面经 02(2026 年 2 月 4 日)

  1. 看了今年哪些生成式推荐论文?
  2. 拷打简历项目。
  3. RoPE 和 ALiBi 两种相对位置编码的原理?
  4. SwiGLU 原理,比 ReLU 好在哪?
  5. attention 常规八股(根号 dk、时间复杂度、为什么要分多头)。
  6. 用过哪些大模型微调方式,LoRA 微调原理?
  7. 了解模型蒸馏吗?
  8. 了解目前主流多模态模型吗?扩散模型公式怎么推导的?
  9. 手撕:lc53 最大子数组和,改为求出这个子数组。

面经 03(2026 年 2 月 4 日)

  1. 为什么要用 agent 解决这个场景?
  2. 什么是 agent?
  3. 你在里面做了哪些工作?
  4. 为什么要 SFT?
  5. 训练前后区别在哪?举一个具体的例子。
  6. 数据怎么构建的?
  7. 什么平台上训练的、训练多久、学习率多少、为什么是这个学习率?
  8. 什么是语言模型?
  9. CNN 能不能做语言模型?
  10. 现在大模型是什么架构?
  11. 写出伪代码:用 abc 预测第四个 token(给出了特征维度与头个数)。
  12. 分头是怎么分的、怎么拼接?
  13. 场景题:做一个意图识别的分类任务,类别特别多怎么做?

面经 04(2026 年 2 月 3 日)

  1. 常见的大模型,或者说 VLM 这块的模型,了解过哪些?
  2. 追问道了 M-RoPE 比原来的 RoPE 有什么改进?有什么优点?
  3. 原来的 RoPE 在升级成 M-RoPE 之前,它是怎么处理视频的?具体来说,对于每一帧或者说每一个 patch,是怎么处理的?
  4. 算法题:lc70 爬楼梯(要求用滚动数组优化)。

面经 05(2026 年 1 月 27 日)

  1. 读了两道代码题,一道是关于变量提升的,一道是关于箭头函数的 this 指向。
  2. 什么是变量提升?除了 var 还有什么变量提升的方法?
  3. Vue2 和 Vue3 的响应式有什么区别?
  4. 使用 AI 有没有什么总结出来的提示词技巧?
  5. 询问专业课有哪些内容。
  6. 什么是随机森林算法?
  7. 什么是过拟合,过拟合如何解决?
  8. 聊聊大模型以及大模型应用。
  9. 项目是怎么跟 AI 结合的,简单介绍项目。
  10. 技术栈是什么?
  11. 对比一下 React 和 Vue。
  12. Vue 中 reactive 和 ref 的区别?
  13. setup 函数是做什么,参数有哪些?
  14. 如何理解 Vue 的响应式?
  15. 虚拟 DOM 是什么?
  16. coding 一道并解释代码。
  17. 数据可视化这个部分主要使用的技术是什么?
  18. 部门对于候选人的综合素质和技术有哪些要求?
  19. 能接受长期在北京发展吗?
  20. 研究生和本科期间压力最大的一次是什么?(相关追问)
  21. 实习期间的工作时间?实习期间遇到过冲突吗,怎么解决的?
  22. 能够回忆起来的最近一次冲突是什么?
  23. 希望第一份工作带给你什么?
  24. 对于京东的感觉,和其他购物平台有什么区别?给京东 App 的建议。
  25. 还有其他的 offer 吗?
  26. 希望什么样的工作节奏?
  27. 你个人能提供三个什么价值?
  28. 你个人在未来发展有哪三个方面需要改进?

面经 06(2025 年 12 月 27 日)

  1. 讲一下实习工作。
  2. 使用的数据集?
  3. 使用了多少张卡?SFT 训练多久?
  4. 增加了串行流程后为什么还能提速?
  5. 讲一下对多模态大模型发展的看法。
  6. 讲一下什么场景下用 SFT,什么场景下用 RL?
  7. SFT 的数据集是越大越好吗?会存在 scaling law 吗?
  8. 为什么使用强化学习会存在训练不稳定问题?为什么业界还在用?

面经 07(2025 年 12 月 27 日)

  1. 项目中的 OCR 怎么做的,为什么用大模型做?
  2. 后训练的数据规模有多少?数据集是自己构建的吗?
  3. 数据清洗采用了什么策略?
  4. OCR 如何处理复杂表格?
  5. 微调前后准确率对比?
  6. Badcase 有哪些,占比怎么样?
  7. 为什么用 GRPO 不用 DPO?
  8. 什么任务适合 DPO?
  9. 模型微调用的是全参微调还是 LoRA 微调,为什么这么选?
  10. LoRA 微调的 alpha 和 rank 是怎么选择的,对模型的影响分别是怎么样的?
  11. GRPO 奖励怎么设计的?
  12. 是否做过消融实验?
  13. 讲讲 React 思想。
  14. 讲讲 agent 中的反思模块逻辑。
  15. Agent 中数据是怎么交互的?

面经 08(2025 年 12 月 12 日)

  1. LoRA 和 Prefix Tuning 的区别?在什么场景下选择 LoRA?
  2. 如果要用 LoRA 做电商推荐场景的微调,你会怎么设计数据和标签?
  3. GRPO 和 PPO 的区别在哪?GRPO 的优化目标函数怎么写?
  4. 搜索中 RAG 的向量检索会受到长尾商品影响,你会如何缓解?
  5. 如果商品知识库实时更新,你怎么保证 RAG 的召回结果和库存一致?
  6. Reflection 机制里,如何判断一个 Agent 的失败是由知识缺失还是工具调用错误引起的?
  7. Toolformer 中通过自监督学习生成 tool call 数据,这个训练范式和 RLHF 的差别在哪里?为什么它更容易泛化?
  8. 语义歧义(如「苹果」既是品牌也是水果)在搜索链路中通常怎么建模?多义词消解和上下文建模的核心方法分别是什么?
  9. 算法题:实现 LRU。

面经 09(2025 年 12 月 11 日)

  1. 语义理解相关:在搜索链路里,像「苹果」这种既代表品牌又代表水果的语义歧义情况,通常是如何进行建模的?多义词消解和上下文建模的核心方法分别是什么?
  2. Toolformer 与 RLHF 对比:Toolformer 采用自监督学习来生成 tool call 数据,这种训练范式和 RLHF 存在哪些差别?为什么 Toolformer 更容易实现泛化呢?
  3. Reflection 机制判断问题:在 Reflection 机制中,我们该如何判断一个 Agent 执行失败是由于知识缺失,还是工具调用错误导致的呢?
  4. RAG 与库存一致性:假如商品知识库是实时更新的,那么要怎样保证 RAG 的召回结果和库存信息保持一致呢?

《参考解析》

  1. M-RoPE 这类题要答出「改了什么、为什么改」:RoPE 给每个 token 在一个序列位置上编码旋转相位,到了视频输入,位置其实是时间、高度、宽度三个维度,把三维位置用同一种方式编码会丢失结构。M-RoPE 的做法是把旋转维度拆成时间、高、宽三段分别编码,让模型能区分「同一帧内不同 patch」和「不同帧的同一位置」。被追问「升级前怎么处理视频」时,老实讲清朴素做法:直接按展平后的 token 顺序排一维位置,帧与帧之间只靠位置差隐含区分,长视频下位置外推和外推误差都会变差。答题时最好补一句自己项目里的取舍,比如帧采样率与位置外推的权衡。

  2. VLM 项目类追问,考的是「你想过替代方案吗」:为什么用通用 VLM 而不是带领域知识的模型、为什么输出点坐标而不是 bbox,这两问都不是让你认错,而是看你有没有方案对比的框架。通用 VLM 的优势是泛化与生态、可迁移的视觉语言对齐能力,代价是需要领域数据继续微调;现成的垂类模型上手快,但类别覆盖和接口灵活性受限。输出点坐标通常是标注成本与任务定义的取舍——如果下游只需要点击或定位一个点,点和框在训练信号上等价,标注成本却差一个量级;框能提供尺度与边界信息,在有遮挡、多目标的场景更有用。答题顺序是:任务定义 → 标注成本 → 下游消费方式 → 数据规模,最后给出「如果重做会怎么选」。

  3. RoPE 与 ALiBi、SwiGLU、多头注意力:一组基础八股要答出动机:RoPE 是通过对 Q、K 施加随位置变化的旋转矩阵,让注意力内积只依赖相对位置;ALiBi 不给位置编码,直接在注意力分数上加与距离成线性偏置,外推性更好但表达能力弱一些。SwiGLU 相比 ReLU 的差别在于门控结构(一路做线性变换、一路过 SiLU 后逐元素相乘),带来更平滑的梯度与更强的表达能力,代价是参数量和计算量增加(通常把 FFN 隐层维度调小以对齐总参数)。多头注意力要讲清「分头不是为了多参数,而是让不同的子空间学不同的关系模式」,以及缩放根号 dk 是为了防止内积随维度增长导致 softmax 进入饱和区、梯度消失。

  4. SFT 与 RL 的选择、以及 GRPO 的奖励设计:什么场景用 SFT——有明确输入输出对、格式与风格类要求、任务可以用监督信号定义;什么场景用 RL——目标难以写成标注样本但可以定义奖励(如排序、可验证的正确性、多轮工具调用)。GRPO 相对 PPO 去掉了 critic,用组内相对奖励做优势估计,省显存、实现简单,适合奖励可自动计算的场景;不稳定的根源在于奖励尺度、组内样本同质化、以及离策略程度。奖励设计是这类题的核心考点:主奖励要对准业务目标(正确性、命中率),过程奖励要给可控的中间信号,同时必须加格式与长度约束防止钻空子,上线前用离线评测集验证奖励与人工判断是否一致。

  5. 多模态与 OCR 的追问要落到数据与指标:OCR 用大模型做的理由通常是复杂版式(表格、印章、手写)上传统检测加识别的级联误差大,端到端模型更稳;被追问指标时必须给出口径——整页准确率还是字段级准确率、复杂表格单独统计、badcase 按版式分类并给出占比。数据侧要能说清清洗策略(去重、模糊与截断样本过滤、标注一致性校验)。凡是回答「准确率提升多少」都记得补一句基线是什么、测试集怎么划分。

  6. Agent 与 Reflection 的判断题,要用可观测信号回答:判断失败是知识缺失还是工具调用错误,最实用的做法是分层定位——先看工具调用轨迹(参数是否合法、返回码与异常、是否是格式解析失败),工具没问题再查检索结果是否包含答案所需事实,最后才归因到模型知识不足。工程上要给每一层加日志与埋点,让反思模块能拿到「证据」而不是靠模型自省。Toolformer 与 RLHF 的对比可以这样答:Toolformer 用自监督的过滤机制(模型自己生成候选调用,再用「加了调用是否降低后续 token 的损失」来筛),不需要偏好标注和奖励模型,因此数据规模和泛化性更好;RLHF 直接优化人类偏好,对齐效果更强但代价高、可能过拟合成保守风格。

  7. 搜索语义歧义与 RAG 一致性是同一类「工程化」题:多义词消解常规做法是先用上下文(query 上下游、用户历史、类目先验)做意图判别,再用点击日志学 query 到类目的映射;新 query 无日志时靠语义向量近邻、类目分类模型和规则兜底。RAG 与实时库存一致这件事的解法不在检索侧而在数据链路:库存这类强一致数据不要走向量检索,改成结构化查询加缓存失效,或者把「可检索的知识」和「实时状态」拆成两条链路,检索只用于解释与召回候选,最终数值以实时接口为准。这样答比硬说「提高 embedding 更新频率」得分高得多。

  8. 这场面试里混进了一套前端题,说明岗位定级和团队池是流动的:Vue2 用 Object.defineProperty 做属性级响应式、需要递归遍历且对新增属性与数组下标有盲区;Vue3 用 Proxy 做对象级代理,能拦截新增与删除、支持 Map/Set,也更容易做依赖收集的细粒度优化。reactive 面向对象、ref 面向基本类型(对象也可包),ref 需要 .value、模板里自动解包,reactive 解构会丢响应性。遇到这种题不必慌,只要基础扎实就能答;反问时可以借机确认岗位实际的技术栈——面试里主动说出「秋招普遍要求 React,所以自己补了这块」,本身就是加分项。