面灵AI→

腾讯多模态算法岗一二面面经

轮次
一面二面
时间
2026-10
来源
牛客网

《面试题目》

一面

  1. 请做一下自我介绍。
  2. 介绍你论文的研究背景与核心内容。
  3. 论文项目里数据集的搭建思路是什么?
  4. 简述 LoRA 的底层原理。
  5. Adapter 的具体实现方式是什么?
  6. 讲解 Qwen2.5-VL 模型的整体架构。
  7. 项目中为什么没有选用当下 SOTA 模型?
  8. 项目里有没有尝试调用大模型 API 来做实验?
  9. SAM、SAM2、SAM3 三者架构差异是什么?
  10. 开放场景题:多实例人脸视频追踪,如何处理镜头切换场景?
  11. 谈谈你对 Agent 的理解。
  12. 讲解 RAG 技术的核心逻辑。
  13. 聊一聊数字人、AI 短剧、游戏相关 AI 业务。
  14. 说说你的职业规划,以及求职意向。

二面

  1. 自我介绍。
  2. 讲解 SAM3 整套训练流程。
  3. SAM3 中文本相关数据集的构建方案是什么?
  4. CLIP 模型架构以及训练流程是怎样的?
  5. Qwen2.5-VL 模型架构拆解。
  6. Gate 门控机制原理。
  7. 大模型如何计算并输出 token 概率?
  8. LoRA 使用 3×3 矩阵时 rank 怎么选,理由是什么?
  9. 模型权重初始化的通用方案有哪些?
  10. LoRA 权重初始化的底层细节,Kaiming 初始化原理是什么?
  11. Transformer 的核心优势是什么,为什么适合作为基础引擎?
  12. 游戏场景中,玩家人数、付费价格曲线一般符合什么分布?
  13. 如何利用 AI 赋能游戏业务?
  14. 你的论文完整研究落地过程是怎样的?
  15. 你的研究方向是什么,预计到岗时间?
  16. 怎么评估 Token 的消耗规模?
  17. CLI 与 IDE 的区别是什么?

《参考解析》

论文与数据集怎么讲

面试官问研究背景,想听的是问题定义和它为什么值得做,不是论文摘要。按「任务痛点 — 已有方法的缺口 — 你的切入点 — 用什么数据验证」四步讲,控制在两三分钟。数据集这类问题要给出构建流程:数据来源与授权、清洗与去重规则、标注规范与一致性校验、以及划分方式如何避免泄漏(同一视频或同一人的帧不能跨越训练与验证集)。追问通常落在标注成本、长尾类别和评测集是否够独立。

Adapter 与 LoRA 的对比

Adapter 是在 Transformer 层里插入小的下投影加非线性加上投影模块,训练时只更新这部分,代价是增加了网络深度、推理时多一层串行计算,部署上不如 LoRA 好合并。LoRA 走的是旁路低秩分解,训练完可以把 BA 乘进原权重、推理零额外延迟,所以工程上更受欢迎。共同点是都冻结主干、只用少量参数适配下游,回答时把「参数量、推理开销、能否合并、适配能力」四点摆出来就完整了。

SAM3 训练流程与文本数据集构建

训练上一般是三阶段:先在大规模掩码数据上预训练视觉主干与提示编码器,再引入文本编码器做跨模态对齐训练,最后在概念级标注数据上做指令式微调。文本侧数据集的难点是「文本描述与掩码区域必须一致」,常用做法是用图像描述模型生成候选短语、再用检测或分割模型回标区域,然后人工或规则过滤掉指代不清、一物多词、同词多物的样本。追问会指向开放词汇的泛化能力和负样本怎么造。

Transformer 的核心优势

自注意力让任意两个位置直接交互,路径长度是常数级,长距离依赖比循环结构更容易学;计算可以写成矩阵乘法,在加速器上并行度极高,训练能靠堆数据和算力持续放大;结构统一、几乎不依赖任务特定的归纳偏置,所以同一个骨架能覆盖文本、图像、语音。代价是注意力对序列长度是平方复杂度,于是有了稀疏注意力、线性注意力、分块与 KV 缓存这些优化方向。

业务分布类问题怎么答

游戏里玩家人数随开服时间通常先冲高再长尾衰减,付费金额则是典型的重尾分布——少数大 R 贡献大部分流水,中位数远低于均值,讨论付费价格曲线常用幂律或对数正态刻画,而不是正态分布。答这题不要只报分布名,要说明它带来的业务后果:均值会被极值拉偏所以要分位数看、运营策略要照顾大 R 但也要用低门槛道具覆盖长尾、以及小样本下拟合分布不可靠。

怎么评估 Token 消耗规模

分场景拆:单次调用的 token 量等于输入(系统提示、检索片段、历史轮次、工具返回)加输出,先按典型请求估一个均值,再乘 QPS 与并发峰值得到上限,乘留存与活跃得到月度总量。工程上要做的是把可变量挑出来——历史轮次的截断策略、检索片段条数、工具返回是否精简、缓存命中率,这几项通常比换模型更能省钱。面试里给个带假设的算式比给一个拍脑袋的数字强。