面灵AI→

9.30 新浪测开二面

轮次
二面
时间
2026-09
来源
牛客网

《面试题目》

  1. 请做一下自我介绍。
  2. 知识库的来源是什么?
  3. 给一个智能客服,如何评测?

《参考解析》

  1. 知识库的来源与治理:企业知识库一般三条来源——官方文档与产品资料(权威但更新滞后)、工单与会话记录(最贴近用户真实问法,但要清洗去噪、脱敏、去掉客服与用户的口水话)、业务专家补充的 FAQ 与标准话术(覆盖长尾与合规口径)。工程上真正决定效果的是治理:切分粒度要按问答对或语义段落,不能按固定字数硬切把一句话劈开;同一问题多版本时要指定权威源并做去重;知识要带权限与生效范围(不同渠道能看到的答案不同)、带有效期,话术改了旧切片必须失效。被追问「怎么保证质量」时,答抽样人工校验 + 覆盖率监控 + 无答案问题的聚类回流,比只说「定期清洗」更落地。

  2. 智能客服的离线评测:拆成可量化的几层,每层都有独立指标——意图识别与路由看分意图的混淆矩阵、Top-1/Top-3 命中率;检索看召回率 Recall@k 与 MRR,以及正确知识有没有被召回进来;回答质量看是否答到点上、有没有超出知识范围的编造、话术是否合规,这类主观维度用固定评分卡(正确、完整、礼貌、无越界承诺)做人工标注,再考虑用模型评审做大规模粗筛、人工复核争议样本。评测集按真实问题分布分层抽样,每条带标准答案与期望动作(直接回答 / 追问澄清 / 转人工),上线后的 bad case 要回流进集子做回归,否则评测集会越来越不反映线上。

  3. 线上评测与广告场景的特殊性:离线过线不等于线上可用,线上要看解决率与转人工率、平均对话轮数、重复追问率、首响时延、以及用户满意度回访。广告投放这条业务线还有自己的口径——涉及投放规则、资质与素材审核的问答,答错会直接带来合规与资损风险,所以评测里必须单列「拒答与兜底」这一档:知识库没有覆盖时能不能明确说不知道并引导转人工,敏感或越权问题能不能拒绝。面试里可以顺着讲「评测集怎么分层、指标怎么定阈值、bad case 怎么回流」,因为对方真正关心的是这套评测能不能长期跑下去,而不是一次性的准确率数字。