面灵AI→

小红书 多模态算法实习 一二面

轮次
多轮面试合集
时间
2026-09
来源
牛客网

《面试题目》

一面

  1. 自我介绍。
  2. 深挖自动驾驶相关项目:阐述本人负责模块的整体技术思路,面试官针对方案持续提出质疑。
  3. 讲解多模态对齐相关论文:简要介绍后面试官直接切入细节,考察算法设计的底层数学原理与损失函数设计思路。
  4. BERT 的核心设计思想是什么?
  5. ViT 与文本 Transformer 模型的结构差异是什么?分别说明基于这两个模型做分类任务的实现方式,图像分类与文本分类的落地思路(回答不完善时会被继续追问 ViT 的完整结构细节)。
  6. 手写代码:LeetCode 整数的平方根。

二面

  1. 自我介绍。
  2. 介绍个人线上落地项目,并针对项目细节答疑。
  3. 讲解自己参与的论文工作。
  4. 继续深挖自动驾驶项目,重点介绍项目中最核心的优化点;同时提问未来是否会继续深耕自动驾驶方向。
  5. Transformer 核心原理。
  6. 残差连接的原理与作用。
  7. 手撕代码:最长回文字符串,要求用区间 DP 实现。
  8. 岗位业务介绍。

《参考解析》

  1. BERT 的核心思想:用 Transformer 编码器加大规模预训练——随机 mask 掉部分 token 让模型还原(MLM),再配合下一句预测,得到双向、上下文化的词表示,下游任务只加一层输出头做微调即可。它和 GPT 这类自回归模型的关键差别在注意力掩码方向:BERT 双向看全句,所以擅长理解类任务(分类、抽取、句对匹配),不擅长直接生成。
  2. ViT 与文本 Transformer 的结构差异:主干都是标准 Transformer 编码器堆叠,差别在输入怎么去序列化——文本用 token embedding 加位置编码,图像先切成固定大小的 patch、把每个 patch 拉平后线性投影成 token,位置编码换成可学习的一维或二维编码。分类落地都是”编码器输出取 [CLS] 或池化表示,接线性分类头”;ViT 的代价是丢了卷积的局部归纳偏置,所以更依赖大规模数据预训练,小数据上往往不如 CNN。
  3. 多模态对齐论文怎么讲:别复述全文。先一句话说清它解决什么问题(图文表示不在同一空间、负样本怎么选、对齐粒度的选择等),再讲方法的关键设计——是双塔还是融合结构、损失是带温度的 InfoNCE 还是别的对比损失、正负样本怎么构造,最后补实验设置和自己的判断。面试官切细节就是在验算你是不是真读懂了底层数学,而不是只记得结论。
  4. 项目被持续质疑怎么应对:这是压力面,考的是逻辑自洽而不是防守。先说清业务目标和成功标准,再讲自己负责的模块与关键技术决策,主动交代没采用的替代方案和已知不足。被质疑某个设计时先复述对方疑问确认理解,再说当时的约束和验证数据;确实答不上来的地方承认边界,比临时改口更安全。
  5. 残差连接的原理与作用:把输入直接加到子层输出上,y = F(x) + x,让梯度能沿恒等路径回传,缓解深层网络的梯度消失与退化,也让”这一层学不动就学成恒等映射”成为可行解。工程上还要注意归一化位置:Post-LN 训练更依赖 warmup,Pre-LN 更稳,这也是大模型普遍采用 Pre-LN 的原因。