BILIBILI 多模态视频 AI 产品面经拆解
《面试题目》
- 【BILIBILI 多模态视频 AI 产品面经拆解】三面全流程:从 Prompt 优化到产品大局观
- ───
- 原文实录(三面实录)
- 岗位: 多模态视频 AI 产品
- 面试官背景: B站 AI 视频方向,团队负责产品 + 算法,无专职开发
- Prompt 怎么优化,怎么写的?
- 原题,B站一面。考察 Prompt Engineering 实战经验。
- 音画不同步怎么办?
- 原题,B站一面。视频 AI 处理中的经典工程问题。
- 我们主要做各种 prompt 优化,旅游 vlog、赛车 vlog(感兴趣 TTS 吗?
- 原题,B站一面。面试官说明团队构成:主要是产品和算法,没有开发。
- 为什么要做产品?
- 原题,B站二面。经典动机题。
- 音画不同步、偏移怎么办?
- 有没有音频和视频拆开来的方法?
- 原题,B站二面。Q2 的升级版,追问技术方案。
- 有没有调研过其他的视频识别模型?
- 有没有自己部署过模型,自测过?
- 原题,B站二面。考察动手能力和技术深度。
- 你在 AI 视频剪辑选择模型的时候,是怎么调研的?
- 调研过哪些模型?
- 有没有想过拆开来——视频和音频拆开来分析?
- 原回答(极详细):
- 调研思路: 需求分析先行 + 市场(商业 API 服务)与学术调研结合(GitHub、HuggingFace)+ 性能与成本评估 + 小范围 POC(概念验证)+ 技术与指标评估。
- 调研过的具体模型:
- 视频理解:Video-LLaMA、VideoMAE V
- Google Cloud Video Intelligence API、Google Gemini API
- 音频理解:Dia-
- 6B、F5-TTS、Fish Speech (Fish-TTS)、Zonos
- 对话语音模型:Dia-
- 6B — 专门为对话设计的开放式 TTS,为每个说话者生成逼真语音,包括情感和非语言声音
- 语音克隆:F5-TTS(零样本,10 秒样本即可)、Fish Speech(多语言)、Zonos(20 万小时训练,擅长语音克隆)
《参考解析》
- AI产品与 Agent 项目:回答这类问题要先讲清目标用户和业务场景,再说明模型、数据、工作流、评测指标和上线后的真实使用效果。面试官通常更看重你能否把 AI 能力转成可落地的产品闭环,而不是只罗列模型名。
- 模型微调:微调适合在任务边界稳定、数据质量可控、单靠提示词难以稳定提升时使用。回答时要说明训练数据来源、标注口径、验证集设计、准确率指标含义,以及上线后如何监控幻觉和退化。
- 商业化分析:商业化问题建议按用户价值、付费方、定价方式、获客成本和边际成本拆解。AI 产品还要说明算力成本、峰谷需求、模型能力差异和可持续毛利。
- 用户研究:用研回答要覆盖样本选择、访谈或问卷方法、洞察提炼和需求转化。面试官会追问研究结论是否真正影响产品决策,因此最好用指标或后续迭代结果闭环。