面灵AI→

腾讯多模态算法岗一二面面经

轮次
一面二面
时间
2026-10
来源
牛客网

《面试题目》

一面

  1. 请做一下自我介绍。
  2. 介绍你论文的研究背景与核心内容。
  3. 论文项目里数据集的搭建思路是什么?
  4. 简述 LoRA 的底层原理。
  5. Adapter 的具体实现方式是什么?
  6. 讲解 Qwen2.5-VL 模型的整体架构。
  7. 项目中为什么没有选用当下 SOTA 模型?
  8. 项目里有没有尝试调用大模型 API 来做实验?
  9. SAM、SAM2、SAM3 三者架构差异是什么?
  10. 开放场景题:多实例人脸视频追踪,如何处理镜头切换场景?
  11. 谈谈你对 Agent 的理解。
  12. 讲解 RAG 技术的核心逻辑。
  13. 聊一聊数字人、AI 短剧、游戏相关 AI 业务。
  14. 说说你的职业规划,以及求职意向。

二面

  1. 自我介绍。
  2. 讲解 SAM3 整套训练流程。
  3. SAM3 中文本相关数据集的构建方案是什么?
  4. CLIP 模型架构以及训练流程是怎样的?
  5. Qwen2.5-VL 模型架构拆解。
  6. Gate 门控机制原理。
  7. 大模型如何计算并输出 token 概率?
  8. LoRA 使用 3×3 矩阵时 rank 怎么选,理由是什么?
  9. 模型权重初始化的通用方案有哪些?
  10. LoRA 权重初始化的底层细节,Kaiming 初始化原理是什么?
  11. Transformer 的核心优势是什么,为什么适合作为基础引擎?
  12. 游戏场景中,玩家人数、付费价格曲线一般符合什么分布?
  13. 如何利用 AI 赋能游戏业务?
  14. 你的论文完整研究落地过程是怎样的?
  15. 你的研究方向是什么,预计到岗时间?
  16. 怎么评估 Token 的消耗规模?
  17. CLI 与 IDE 的区别是什么?

《参考解析》

LoRA 的底层原理与 rank 选择

LoRA 不动原权重,只旁路一对低秩矩阵:输入先经 A 降维再经 B 升维,前向变成 Wx + (α/r)·BAx,训练时只更新 A、B。A 用高斯或 Kaiming 随机初始化、B 全零初始化,保证训练起点与原模型完全等价。rank 常见 8/16/32/64:任务与原模型领域越接近用越小,域差大(多模态对齐、风格迁移)才往上加;rank 不可能超过矩阵的 min(维度),小矩阵上取一两档就够,再大就退化成全参数微调。切换 rank 时 α 要一起调,因为缩放系数 α/r 会同时变化。

Kaiming 初始化在解决什么

它要的是前向每层输出方差稳定、反向梯度不逐层放大或消失,所以把权重方差设成 2/fan_in 这种与输入维度挂钩的形式。乘 2 是因为 ReLU 会把一半神经元置零、方差减半,必须补回来;换成 tanh 这类对称激活就不能再补。放到 LoRA 里,A 随机初始化是为了打破对称性,B 置零是为了让增量从零开始、不破坏预训练权重。

Qwen2.5-VL 整体架构

三段式:视觉编码器、投影层、语言模型。图像按原生分辨率切 patch 进 ViT,保留细粒度文字与小目标的定位能力;视频分支按动态帧率采样并把时间维度压成 token,用时间戳对齐事件顺序;视觉特征经投影层映射到词嵌入空间,与文本 token 拼在一起交给 decoder-only 语言模型。高频追问是动态分辨率下的位置编码怎么处理、视觉 token 太多如何压缩、以及分辨率与显存延迟之间怎么取舍。

SAM、SAM2、SAM3 的差异

按三条线答:提示模态、时序能力、任务粒度。SAM 是图像编码器加提示编码器加轻量掩码解码器,吃点、框、掩码做零样本分割,只处理静态图。SAM2 加了记忆注意力和记忆库,支持流式视频分割,能在帧间传播掩码并处理遮挡。SAM3 把提示从几何提示扩展到文本提示,做开放词汇的概念级分割与追踪,代价是文本与掩码配对的数据集构建成本很高。

CLIP 的架构与训练流程

双塔:图像侧 ViT、文本侧 Transformer,各自编码后归一化,用可学习温度在 batch 内做对称的对比损失,配对的图文为正样本、同 batch 其他组合为负样本。它的价值是零样本迁移——把类别写成 prompt 取相似度最高的即可分类,也因此成为多模态模型对齐视觉与文本空间的常用底座。局限是只学全局语义,细粒度定位和计数都弱。

门控机制原理

门控就是按输入动态加权选择走哪些分支。MoE 里路由器给每个 token 打分取 top-k 专家,输出是专家结果的加权和,难点在负载均衡(没有辅助损失会塌缩到少数专家)、路由抖动和通信开销。注意力或前馈里的门控(GLU、Swish 变体、GRU 式门控)用 sigmoid 控制信息通过比例,缓解梯度问题。追问一般落在专家容量不足时 token 是丢弃还是走共享专家、以及推理时怎么减少 all-to-all 通信。

大模型如何输出 token 概率

最后一层隐状态经词表维度的输出头得到 logits,softmax 之后就是词表上的概率分布,再按解码策略选词:贪心取最大;温度先除 T 再 softmax,T 小于 1 更尖锐、大于 1 更平坦;top-k 与 top-p 截断长尾后重新归一化再采样。要能说清 logprob 只是模型自己的置信度,不等于正确率,重复惩罚和束搜索改变的是选择过程而不是概率本身。

开放场景题:多实例人脸视频追踪的镜头切换

分三层做:先做镜头边界检测把视频切成 shot;shot 内用检测加跟踪维持轨迹,并给每张脸维护外观特征;镜头切换后清空运动状态重新检测,再用外观特征库加时空先验做跨镜头重识别,把同一个人接回同一条轨迹。难点是低分辨率侧脸和同款工装的误关联,工程上通常只在高置信度时合并、模糊样本交人工或二次校验,评测要看 IDF1 这类关联指标而不是只看检测框精度。