腾讯多模态算法岗一二面面经
- 轮次
- 一面二面
- 时间
- 2026-10
- 来源
- 牛客网
《面试题目》
一面
- 请做一下自我介绍。
- 介绍你论文的研究背景与核心内容。
- 论文项目里数据集的搭建思路是什么?
- 简述 LoRA 的底层原理。
- Adapter 的具体实现方式是什么?
- 讲解 Qwen2.5-VL 模型的整体架构。
- 项目中为什么没有选用当下 SOTA 模型?
- 项目里有没有尝试调用大模型 API 来做实验?
- SAM、SAM2、SAM3 三者架构差异是什么?
- 开放场景题:多实例人脸视频追踪,如何处理镜头切换场景?
- 谈谈你对 Agent 的理解。
- 讲解 RAG 技术的核心逻辑。
- 聊一聊数字人、AI 短剧、游戏相关 AI 业务。
- 说说你的职业规划,以及求职意向。
二面
- 自我介绍。
- 讲解 SAM3 整套训练流程。
- SAM3 中文本相关数据集的构建方案是什么?
- CLIP 模型架构以及训练流程是怎样的?
- Qwen2.5-VL 模型架构拆解。
- Gate 门控机制原理。
- 大模型如何计算并输出 token 概率?
- LoRA 使用 3×3 矩阵时 rank 怎么选,理由是什么?
- 模型权重初始化的通用方案有哪些?
- LoRA 权重初始化的底层细节,Kaiming 初始化原理是什么?
- Transformer 的核心优势是什么,为什么适合作为基础引擎?
- 游戏场景中,玩家人数、付费价格曲线一般符合什么分布?
- 如何利用 AI 赋能游戏业务?
- 你的论文完整研究落地过程是怎样的?
- 你的研究方向是什么,预计到岗时间?
- 怎么评估 Token 的消耗规模?
- CLI 与 IDE 的区别是什么?
《参考解析》
LoRA 的底层原理与 rank 选择
LoRA 不动原权重,只旁路一对低秩矩阵:输入先经 A 降维再经 B 升维,前向变成 Wx + (α/r)·BAx,训练时只更新 A、B。A 用高斯或 Kaiming 随机初始化、B 全零初始化,保证训练起点与原模型完全等价。rank 常见 8/16/32/64:任务与原模型领域越接近用越小,域差大(多模态对齐、风格迁移)才往上加;rank 不可能超过矩阵的 min(维度),小矩阵上取一两档就够,再大就退化成全参数微调。切换 rank 时 α 要一起调,因为缩放系数 α/r 会同时变化。
Kaiming 初始化在解决什么
它要的是前向每层输出方差稳定、反向梯度不逐层放大或消失,所以把权重方差设成 2/fan_in 这种与输入维度挂钩的形式。乘 2 是因为 ReLU 会把一半神经元置零、方差减半,必须补回来;换成 tanh 这类对称激活就不能再补。放到 LoRA 里,A 随机初始化是为了打破对称性,B 置零是为了让增量从零开始、不破坏预训练权重。
Qwen2.5-VL 整体架构
三段式:视觉编码器、投影层、语言模型。图像按原生分辨率切 patch 进 ViT,保留细粒度文字与小目标的定位能力;视频分支按动态帧率采样并把时间维度压成 token,用时间戳对齐事件顺序;视觉特征经投影层映射到词嵌入空间,与文本 token 拼在一起交给 decoder-only 语言模型。高频追问是动态分辨率下的位置编码怎么处理、视觉 token 太多如何压缩、以及分辨率与显存延迟之间怎么取舍。
SAM、SAM2、SAM3 的差异
按三条线答:提示模态、时序能力、任务粒度。SAM 是图像编码器加提示编码器加轻量掩码解码器,吃点、框、掩码做零样本分割,只处理静态图。SAM2 加了记忆注意力和记忆库,支持流式视频分割,能在帧间传播掩码并处理遮挡。SAM3 把提示从几何提示扩展到文本提示,做开放词汇的概念级分割与追踪,代价是文本与掩码配对的数据集构建成本很高。
CLIP 的架构与训练流程
双塔:图像侧 ViT、文本侧 Transformer,各自编码后归一化,用可学习温度在 batch 内做对称的对比损失,配对的图文为正样本、同 batch 其他组合为负样本。它的价值是零样本迁移——把类别写成 prompt 取相似度最高的即可分类,也因此成为多模态模型对齐视觉与文本空间的常用底座。局限是只学全局语义,细粒度定位和计数都弱。
门控机制原理
门控就是按输入动态加权选择走哪些分支。MoE 里路由器给每个 token 打分取 top-k 专家,输出是专家结果的加权和,难点在负载均衡(没有辅助损失会塌缩到少数专家)、路由抖动和通信开销。注意力或前馈里的门控(GLU、Swish 变体、GRU 式门控)用 sigmoid 控制信息通过比例,缓解梯度问题。追问一般落在专家容量不足时 token 是丢弃还是走共享专家、以及推理时怎么减少 all-to-all 通信。
大模型如何输出 token 概率
最后一层隐状态经词表维度的输出头得到 logits,softmax 之后就是词表上的概率分布,再按解码策略选词:贪心取最大;温度先除 T 再 softmax,T 小于 1 更尖锐、大于 1 更平坦;top-k 与 top-p 截断长尾后重新归一化再采样。要能说清 logprob 只是模型自己的置信度,不等于正确率,重复惩罚和束搜索改变的是选择过程而不是概率本身。
开放场景题:多实例人脸视频追踪的镜头切换
分三层做:先做镜头边界检测把视频切成 shot;shot 内用检测加跟踪维持轨迹,并给每张脸维护外观特征;镜头切换后清空运动状态重新检测,再用外观特征库加时空先验做跨镜头重识别,把同一个人接回同一条轨迹。难点是低分辨率侧脸和同款工装的误关联,工程上通常只在高置信度时合并、模糊样本交人工或二次校验,评测要看 IDF1 这类关联指标而不是只看检测框精度。