深至科技一面:全栈开发实习(医疗 AI)的意图识别与工程难点追问
- 轮次
- 一面
- 时间
- 2026-09
- 来源
- 牛客网
《面试题目》
- 自我介绍
- 你实习期间做的医疗智能体主要服务的人群是怎么样的?意图识别模块是怎么开发的?
- 为什么是 9 类意图,不是 8 类或者 10 类?
- 怎么评估这个意图识别模块是有效的?
- 评测集是自己做的吗?
- 说一下工程方面碰到的有挑战性的、棘手的问题是怎么解决的?
- 反问
《参考解析》
-
意图类别数是业务与评测共同收敛出来的结果,不是拍脑袋定的:可以这样组织答案——先把线上用户问法聚成簇(按业务动作、科室、对话阶段做粗分),再看哪些类别的边界足够清晰、样本量足够支撑训练与评测;边界模糊的两类合并、单类里混着两种完全不同的诉求就拆开。9 类这个数字最后是被「分类指标能不能稳定」和「标注成本能不能扛住」两条约束卡出来的。反过来说,如果被追问「为什么不多分几类」,答法要落在误判代价上:医疗场景把「咨询用药」错分到「描述症状」,下游给的建议完全跑偏,类多了混淆矩阵反而更难看。
-
评估意图识别模块要分层说,别只报一个准确率:离线看混淆矩阵与宏平均 F1(类别不均衡时准确率会骗人),特别关注最容易串的两三类之间的互相误判;线上看转人工率、用户追问率、兜底(走默认回复)的比例,以及按意图分桶后的满意度。如果做过,再补一句上线前后的对比口径——同一个抽样窗口、同一批入口流量,否则数据不可比。
-
评测集自建是这类岗位的加分点,讲清构造与质量控制:真实日志分层抽样(按意图、按时段)+ 人工标注 + 从错分案例里补边界样本,必要时用大模型合成候选再由人复核。真正能讲出深度的是三件事:标注一致性怎么保(双标 + 仲裁、算 Kappa)、训练集与测试集怎么防泄漏(同一条会话的相似问法必须整簇切分,不能随机切)、评测集怎么保持版本可追溯(每次改动跑同一份回归集,指标变化才可解释)。
-
「工程上最棘手的问题」按 STAR 讲,重点给量化证据:情境(什么场景、影响多少用户或多少请求)、任务(你负责的那一块边界)、行动(试过哪条路、为什么否掉、最后落地是什么)、结果(延迟从多少降到多少、错误率、人工介入量)。医疗智能体常见的好素材是长对话上下文膨胀导致的响应变慢、多轮里指代消解丢失、以及模型输出不稳定带来的下游解析失败——挑一个你真做过、能画出链路图的讲。
-
反问环节挑能暴露岗位真实工作的问题:实习生在意图识别这条链路上能独立负责到哪一层(只做标注与调参,还是能改模型与流程)、上线后的效果由谁看哪个指标、医疗场景对输出合规与留痕的要求。这类问题既显专业度,也帮你判断这段实习能不能写出像样的项目经历。