腾讯 IEG 后台开发日常实习二面与 HR 面面经
- 轮次
- 二面+HR面
- 时间
- 2026-10
- 来源
- 牛客网
《面试题目》
- (二面)你的深度研究项目相比较市面上的大模型的深度思考,有什么优势?
- (二面)评估环节的覆盖率、来源质量、边际收益是怎么计算的?
- (二面)你微调训练模型的预训练模型从哪下载的,名字叫什么,各个参数是多少?
- (二面)你怎么知道训练后效果变好了,训练后的各项数据是多少?
- (二面)既然最后无法确定的情况下你还是要用配置的大模型的判断兜底,那你为什么还要做这个微调训练模型?
- (二面)安全方面你是怎么做的?
- (HR 面)详细讲一下你的实习经历,以及上一家公司的基建做得怎么样?
- (HR 面)你对 AI Coding 的认识是什么?人和 AI 在开发中应当扮演什么角色?
《参考解析》
为什么二面全程只问项目:面试官用 35 分钟只挖一个项目,考的不是功能复述,而是「这个方案是不是你自己定的」。要把项目讲成一条决策链:要解决什么问题、试过哪些更简单的做法、为什么最后选了现在这条、评测口径怎么定的、指标从多少提到多少。数字是这里的关键——能报出评测集规模、基线水平、改进前后的分数,比说「效果提升明显」有说服力得多。
覆盖率、来源质量、边际收益怎么算:这类指标要先把评测集和口径讲清楚,否则数字没有意义。覆盖率通常指在标注好的问题集合里,系统能给出可核查答案的比例(分母是全部问题,分子是召回并通过校验的问题),要说明评测集是人工标注的还是抽样的、样本量多少。来源质量是给来源分级的打分机制——一手权威来源、二手转述、无法溯源的聚合内容给不同权重,再按引用来源的等级加权得到答案的质量分。边际收益是把新增一路来源或一轮检索带来的准确率增量,除以它增加的成本(延迟、调用费用),只有当增量除以成本高于现有手段时才值得加,这本质上是在做收益递减的判断。
微调的基座与参数必须能答出来:这题问的是真实性。要能说清基座模型的名称和版本、参数量、上下文长度、下载渠道,以及微调方式(全参还是 LoRA 这类参数高效方法)、训练数据量与来源、训练轮数和关键超参、显存与训练耗时。答不上这些细节,基本会被判定为「跑过脚本但没自己配过」。反过来,如果确实只是验证性实验,就把实验边界讲清楚,比如只用了小样本、只调了部分层,这比含糊其辞可信。
怎么证明训练后变好:要有一套固定的评测流程,而不是看几个例子。常规做法是准备一份不参与训练的评测集(含正例和负例),用同一个提示与解码参数分别跑基线和微调后模型,对比准确率、格式合规率、拒答率等指标,必要时做多轮取平均,再补人工抽检看错误类型是否变化。工程上还可以看下游链路指标——幻觉率、无效引用比例、平均耗时。面试官追问「数据是多少」,是想知道你有没有对照实验的意识,把评测集怎么切、评了几个维度、结论是提升还是持平都讲清楚即可。
「既然还要大模型兜底,为什么还做微调」怎么答:这题考的是对系统分层的理解,不是让你辩护。合理的答法是说清两者职责不同:微调模型承担高频、可预期的那部分判断,成本低、延迟低、格式稳定,能把大部分简单情况直接处理掉;大模型兜底只在低置信度或超出覆盖范围时触发,是安全网而不是主力。接着给出比例——比如多少比例的请求由微调模型独立处理、多少比例走到兜底,以及兜底带来的额外成本。如果实测下来微调并没有在成本或质量上带来净收益,诚实地说明这是探索性尝试、目前结论是什么,比硬编一个理由更好。
安全与 HR 面怎么答:安全方面可以分输入、执行、输出三层讲:输入做注入与越权指令的过滤,执行时工具权限最小化、只暴露只读或白名单接口、敏感操作二次确认,输出做敏感信息与格式校验,评测集里固定放一批安全用例回归。HR 面问「人和 AI 在开发中扮演什么角色」,关键是给出判断而不是口号:人负责定目标、拆问题、做取舍和验收,AI 负责提速执行与信息归纳;紧接着给一个自己用出来的例子——哪些环节交给 AI、哪些必须自己把关、怎么验证产出是否正确。实习经历按「做了什么、遇到什么卡点、怎么解决、结果如何」讲,能带上量化的结果最好。