腾讯多模态算法岗一二面面经
- 轮次
- 一面二面
- 时间
- 2026-10
- 来源
- 牛客网
《面试题目》
一面
- 请做一下自我介绍。
- 介绍你论文的研究背景与核心内容。
- 论文项目里数据集的搭建思路是什么?
- 简述 LoRA 的底层原理。
- Adapter 的具体实现方式是什么?
- 讲解 Qwen2.5-VL 模型的整体架构。
- 项目中为什么没有选用当下 SOTA 模型?
- 项目里有没有尝试调用大模型 API 来做实验?
- SAM、SAM2、SAM3 三者架构差异是什么?
- 开放场景题:多实例人脸视频追踪,如何处理镜头切换场景?
- 谈谈你对 Agent 的理解。
- 讲解 RAG 技术的核心逻辑。
- 聊一聊数字人、AI 短剧、游戏相关 AI 业务。
- 说说你的职业规划,以及求职意向。
二面
- 自我介绍。
- 讲解 SAM3 整套训练流程。
- SAM3 中文本相关数据集的构建方案是什么?
- CLIP 模型架构以及训练流程是怎样的?
- Qwen2.5-VL 模型架构拆解。
- Gate 门控机制原理。
- 大模型如何计算并输出 token 概率?
- LoRA 使用 3×3 矩阵时 rank 怎么选,理由是什么?
- 模型权重初始化的通用方案有哪些?
- LoRA 权重初始化的底层细节,Kaiming 初始化原理是什么?
- Transformer 的核心优势是什么,为什么适合作为基础引擎?
- 游戏场景中,玩家人数、付费价格曲线一般符合什么分布?
- 如何利用 AI 赋能游戏业务?
- 你的论文完整研究落地过程是怎样的?
- 你的研究方向是什么,预计到岗时间?
- 怎么评估 Token 的消耗规模?
- CLI 与 IDE 的区别是什么?
《参考解析》
论文与数据集怎么讲
面试官问研究背景,想听的是问题定义和它为什么值得做,不是论文摘要。按「任务痛点 — 已有方法的缺口 — 你的切入点 — 用什么数据验证」四步讲,控制在两三分钟。数据集这类问题要给出构建流程:数据来源与授权、清洗与去重规则、标注规范与一致性校验、以及划分方式如何避免泄漏(同一视频或同一人的帧不能跨越训练与验证集)。追问通常落在标注成本、长尾类别和评测集是否够独立。
Adapter 与 LoRA 的对比
Adapter 是在 Transformer 层里插入小的下投影加非线性加上投影模块,训练时只更新这部分,代价是增加了网络深度、推理时多一层串行计算,部署上不如 LoRA 好合并。LoRA 走的是旁路低秩分解,训练完可以把 BA 乘进原权重、推理零额外延迟,所以工程上更受欢迎。共同点是都冻结主干、只用少量参数适配下游,回答时把「参数量、推理开销、能否合并、适配能力」四点摆出来就完整了。
SAM3 训练流程与文本数据集构建
训练上一般是三阶段:先在大规模掩码数据上预训练视觉主干与提示编码器,再引入文本编码器做跨模态对齐训练,最后在概念级标注数据上做指令式微调。文本侧数据集的难点是「文本描述与掩码区域必须一致」,常用做法是用图像描述模型生成候选短语、再用检测或分割模型回标区域,然后人工或规则过滤掉指代不清、一物多词、同词多物的样本。追问会指向开放词汇的泛化能力和负样本怎么造。
Transformer 的核心优势
自注意力让任意两个位置直接交互,路径长度是常数级,长距离依赖比循环结构更容易学;计算可以写成矩阵乘法,在加速器上并行度极高,训练能靠堆数据和算力持续放大;结构统一、几乎不依赖任务特定的归纳偏置,所以同一个骨架能覆盖文本、图像、语音。代价是注意力对序列长度是平方复杂度,于是有了稀疏注意力、线性注意力、分块与 KV 缓存这些优化方向。
业务分布类问题怎么答
游戏里玩家人数随开服时间通常先冲高再长尾衰减,付费金额则是典型的重尾分布——少数大 R 贡献大部分流水,中位数远低于均值,讨论付费价格曲线常用幂律或对数正态刻画,而不是正态分布。答这题不要只报分布名,要说明它带来的业务后果:均值会被极值拉偏所以要分位数看、运营策略要照顾大 R 但也要用低门槛道具覆盖长尾、以及小样本下拟合分布不可靠。
怎么评估 Token 消耗规模
分场景拆:单次调用的 token 量等于输入(系统提示、检索片段、历史轮次、工具返回)加输出,先按典型请求估一个均值,再乘 QPS 与并发峰值得到上限,乘留存与活跃得到月度总量。工程上要做的是把可变量挑出来——历史轮次的截断策略、检索片段条数、工具返回是否精简、缓存命中率,这几项通常比换模型更能省钱。面试里给个带假设的算式比给一个拍脑袋的数字强。