京东 大模型算法岗面经合集 02:多模态位置编码、Agent 与 SFT/RL 追问
- 轮次
- 多轮面试合集
- 时间
- 2026-09
- 来源
- 牛客网
《面试题目》
面经 01(2026 年 2 月 5 日)
- 追问了 M-RoPE 比原来的 RoPE 有什么改进?有什么优点?
- 原来的 RoPE 在升级成 M-RoPE 之前,它是怎么处理视频的?具体来说,对于每一帧或者说每一个 patch,是怎么处理的?
- 项目:既然是一个垂类的场景,为什么要去用通用场景下的 VLM 来做?为什么不用已经具有领域知识的一些模型?
- 项目:为什么你的 VLM 是输出点的坐标,而不输出 bbox 呢?bbox 按道理比点的坐标具有更多的图像信息吧?
- 讲一下 SAM2 分割模型的原理。
- 项目:数据是用算法生成的,你们怎么判断这一批数据是好的还是不好的呢?
面经 02(2026 年 2 月 4 日)
- 看了今年哪些生成式推荐论文?
- 拷打简历项目。
- RoPE 和 ALiBi 两种相对位置编码的原理?
- SwiGLU 原理,比 ReLU 好在哪?
- attention 常规八股(根号 dk、时间复杂度、为什么要分多头)。
- 用过哪些大模型微调方式,LoRA 微调原理?
- 了解模型蒸馏吗?
- 了解目前主流多模态模型吗?扩散模型公式怎么推导的?
- 手撕:lc53 最大子数组和,改为求出这个子数组。
面经 03(2026 年 2 月 4 日)
- 为什么要用 agent 解决这个场景?
- 什么是 agent?
- 你在里面做了哪些工作?
- 为什么要 SFT?
- 训练前后区别在哪?举一个具体的例子。
- 数据怎么构建的?
- 什么平台上训练的、训练多久、学习率多少、为什么是这个学习率?
- 什么是语言模型?
- CNN 能不能做语言模型?
- 现在大模型是什么架构?
- 写出伪代码:用 abc 预测第四个 token(给出了特征维度与头个数)。
- 分头是怎么分的、怎么拼接?
- 场景题:做一个意图识别的分类任务,类别特别多怎么做?
面经 04(2026 年 2 月 3 日)
- 常见的大模型,或者说 VLM 这块的模型,了解过哪些?
- 追问道了 M-RoPE 比原来的 RoPE 有什么改进?有什么优点?
- 原来的 RoPE 在升级成 M-RoPE 之前,它是怎么处理视频的?具体来说,对于每一帧或者说每一个 patch,是怎么处理的?
- 算法题:lc70 爬楼梯(要求用滚动数组优化)。
面经 05(2026 年 1 月 27 日)
- 读了两道代码题,一道是关于变量提升的,一道是关于箭头函数的 this 指向。
- 什么是变量提升?除了 var 还有什么变量提升的方法?
- Vue2 和 Vue3 的响应式有什么区别?
- 使用 AI 有没有什么总结出来的提示词技巧?
- 询问专业课有哪些内容。
- 什么是随机森林算法?
- 什么是过拟合,过拟合如何解决?
- 聊聊大模型以及大模型应用。
- 项目是怎么跟 AI 结合的,简单介绍项目。
- 技术栈是什么?
- 对比一下 React 和 Vue。
- Vue 中 reactive 和 ref 的区别?
- setup 函数是做什么,参数有哪些?
- 如何理解 Vue 的响应式?
- 虚拟 DOM 是什么?
- coding 一道并解释代码。
- 数据可视化这个部分主要使用的技术是什么?
- 部门对于候选人的综合素质和技术有哪些要求?
- 能接受长期在北京发展吗?
- 研究生和本科期间压力最大的一次是什么?(相关追问)
- 实习期间的工作时间?实习期间遇到过冲突吗,怎么解决的?
- 能够回忆起来的最近一次冲突是什么?
- 希望第一份工作带给你什么?
- 对于京东的感觉,和其他购物平台有什么区别?给京东 App 的建议。
- 还有其他的 offer 吗?
- 希望什么样的工作节奏?
- 你个人能提供三个什么价值?
- 你个人在未来发展有哪三个方面需要改进?
面经 06(2025 年 12 月 27 日)
- 讲一下实习工作。
- 使用的数据集?
- 使用了多少张卡?SFT 训练多久?
- 增加了串行流程后为什么还能提速?
- 讲一下对多模态大模型发展的看法。
- 讲一下什么场景下用 SFT,什么场景下用 RL?
- SFT 的数据集是越大越好吗?会存在 scaling law 吗?
- 为什么使用强化学习会存在训练不稳定问题?为什么业界还在用?
面经 07(2025 年 12 月 27 日)
- 项目中的 OCR 怎么做的,为什么用大模型做?
- 后训练的数据规模有多少?数据集是自己构建的吗?
- 数据清洗采用了什么策略?
- OCR 如何处理复杂表格?
- 微调前后准确率对比?
- Badcase 有哪些,占比怎么样?
- 为什么用 GRPO 不用 DPO?
- 什么任务适合 DPO?
- 模型微调用的是全参微调还是 LoRA 微调,为什么这么选?
- LoRA 微调的 alpha 和 rank 是怎么选择的,对模型的影响分别是怎么样的?
- GRPO 奖励怎么设计的?
- 是否做过消融实验?
- 讲讲 React 思想。
- 讲讲 agent 中的反思模块逻辑。
- Agent 中数据是怎么交互的?
面经 08(2025 年 12 月 12 日)
- LoRA 和 Prefix Tuning 的区别?在什么场景下选择 LoRA?
- 如果要用 LoRA 做电商推荐场景的微调,你会怎么设计数据和标签?
- GRPO 和 PPO 的区别在哪?GRPO 的优化目标函数怎么写?
- 搜索中 RAG 的向量检索会受到长尾商品影响,你会如何缓解?
- 如果商品知识库实时更新,你怎么保证 RAG 的召回结果和库存一致?
- Reflection 机制里,如何判断一个 Agent 的失败是由知识缺失还是工具调用错误引起的?
- Toolformer 中通过自监督学习生成 tool call 数据,这个训练范式和 RLHF 的差别在哪里?为什么它更容易泛化?
- 语义歧义(如「苹果」既是品牌也是水果)在搜索链路中通常怎么建模?多义词消解和上下文建模的核心方法分别是什么?
- 算法题:实现 LRU。
面经 09(2025 年 12 月 11 日)
- 语义理解相关:在搜索链路里,像「苹果」这种既代表品牌又代表水果的语义歧义情况,通常是如何进行建模的?多义词消解和上下文建模的核心方法分别是什么?
- Toolformer 与 RLHF 对比:Toolformer 采用自监督学习来生成 tool call 数据,这种训练范式和 RLHF 存在哪些差别?为什么 Toolformer 更容易实现泛化呢?
- Reflection 机制判断问题:在 Reflection 机制中,我们该如何判断一个 Agent 执行失败是由于知识缺失,还是工具调用错误导致的呢?
- RAG 与库存一致性:假如商品知识库是实时更新的,那么要怎样保证 RAG 的召回结果和库存信息保持一致呢?
《参考解析》
-
M-RoPE 这类题要答出「改了什么、为什么改」:RoPE 给每个 token 在一个序列位置上编码旋转相位,到了视频输入,位置其实是时间、高度、宽度三个维度,把三维位置用同一种方式编码会丢失结构。M-RoPE 的做法是把旋转维度拆成时间、高、宽三段分别编码,让模型能区分「同一帧内不同 patch」和「不同帧的同一位置」。被追问「升级前怎么处理视频」时,老实讲清朴素做法:直接按展平后的 token 顺序排一维位置,帧与帧之间只靠位置差隐含区分,长视频下位置外推和外推误差都会变差。答题时最好补一句自己项目里的取舍,比如帧采样率与位置外推的权衡。
-
VLM 项目类追问,考的是「你想过替代方案吗」:为什么用通用 VLM 而不是带领域知识的模型、为什么输出点坐标而不是 bbox,这两问都不是让你认错,而是看你有没有方案对比的框架。通用 VLM 的优势是泛化与生态、可迁移的视觉语言对齐能力,代价是需要领域数据继续微调;现成的垂类模型上手快,但类别覆盖和接口灵活性受限。输出点坐标通常是标注成本与任务定义的取舍——如果下游只需要点击或定位一个点,点和框在训练信号上等价,标注成本却差一个量级;框能提供尺度与边界信息,在有遮挡、多目标的场景更有用。答题顺序是:任务定义 → 标注成本 → 下游消费方式 → 数据规模,最后给出「如果重做会怎么选」。
-
RoPE 与 ALiBi、SwiGLU、多头注意力:一组基础八股要答出动机:RoPE 是通过对 Q、K 施加随位置变化的旋转矩阵,让注意力内积只依赖相对位置;ALiBi 不给位置编码,直接在注意力分数上加与距离成线性偏置,外推性更好但表达能力弱一些。SwiGLU 相比 ReLU 的差别在于门控结构(一路做线性变换、一路过 SiLU 后逐元素相乘),带来更平滑的梯度与更强的表达能力,代价是参数量和计算量增加(通常把 FFN 隐层维度调小以对齐总参数)。多头注意力要讲清「分头不是为了多参数,而是让不同的子空间学不同的关系模式」,以及缩放根号 dk 是为了防止内积随维度增长导致 softmax 进入饱和区、梯度消失。
-
SFT 与 RL 的选择、以及 GRPO 的奖励设计:什么场景用 SFT——有明确输入输出对、格式与风格类要求、任务可以用监督信号定义;什么场景用 RL——目标难以写成标注样本但可以定义奖励(如排序、可验证的正确性、多轮工具调用)。GRPO 相对 PPO 去掉了 critic,用组内相对奖励做优势估计,省显存、实现简单,适合奖励可自动计算的场景;不稳定的根源在于奖励尺度、组内样本同质化、以及离策略程度。奖励设计是这类题的核心考点:主奖励要对准业务目标(正确性、命中率),过程奖励要给可控的中间信号,同时必须加格式与长度约束防止钻空子,上线前用离线评测集验证奖励与人工判断是否一致。
-
多模态与 OCR 的追问要落到数据与指标:OCR 用大模型做的理由通常是复杂版式(表格、印章、手写)上传统检测加识别的级联误差大,端到端模型更稳;被追问指标时必须给出口径——整页准确率还是字段级准确率、复杂表格单独统计、badcase 按版式分类并给出占比。数据侧要能说清清洗策略(去重、模糊与截断样本过滤、标注一致性校验)。凡是回答「准确率提升多少」都记得补一句基线是什么、测试集怎么划分。
-
Agent 与 Reflection 的判断题,要用可观测信号回答:判断失败是知识缺失还是工具调用错误,最实用的做法是分层定位——先看工具调用轨迹(参数是否合法、返回码与异常、是否是格式解析失败),工具没问题再查检索结果是否包含答案所需事实,最后才归因到模型知识不足。工程上要给每一层加日志与埋点,让反思模块能拿到「证据」而不是靠模型自省。Toolformer 与 RLHF 的对比可以这样答:Toolformer 用自监督的过滤机制(模型自己生成候选调用,再用「加了调用是否降低后续 token 的损失」来筛),不需要偏好标注和奖励模型,因此数据规模和泛化性更好;RLHF 直接优化人类偏好,对齐效果更强但代价高、可能过拟合成保守风格。
-
搜索语义歧义与 RAG 一致性是同一类「工程化」题:多义词消解常规做法是先用上下文(query 上下游、用户历史、类目先验)做意图判别,再用点击日志学 query 到类目的映射;新 query 无日志时靠语义向量近邻、类目分类模型和规则兜底。RAG 与实时库存一致这件事的解法不在检索侧而在数据链路:库存这类强一致数据不要走向量检索,改成结构化查询加缓存失效,或者把「可检索的知识」和「实时状态」拆成两条链路,检索只用于解释与召回候选,最终数值以实时接口为准。这样答比硬说「提高 embedding 更新频率」得分高得多。
-
这场面试里混进了一套前端题,说明岗位定级和团队池是流动的:Vue2 用 Object.defineProperty 做属性级响应式、需要递归遍历且对新增属性与数组下标有盲区;Vue3 用 Proxy 做对象级代理,能拦截新增与删除、支持 Map/Set,也更容易做依赖收集的细粒度优化。reactive 面向对象、ref 面向基本类型(对象也可包),ref 需要 .value、模板里自动解包,reactive 解构会丢响应性。遇到这种题不必慌,只要基础扎实就能答;反问时可以借机确认岗位实际的技术栈——面试里主动说出「秋招普遍要求 React,所以自己补了这块」,本身就是加分项。