面灵AI→

腾讯AI Agent开发岗三场面经(评测、Agent Loop与内容安全)

时间
2026-09
来源
牛客网

《面试题目》

  1. 实习中针对什么场景进行评测,评测目标是什么?
  2. 评测集如何构建?
  3. 如何保证评测集覆盖全部场景且可用?
  4. 人工如何进行问题归因,归因标准是什么?
  5. 评测过程中的 Case 错误率和回归验证结果如何?
  6. 使用模型自动生成评测集时,如何确保引用了正确的文档和案例信息?
  7. 如何组织文档和案例两类数据来生成测试 Case?
  8. 为什么实习项目中没有采用自动化评测?
  9. 如何为云端 Agent 的输出设计安全校验方案?
  10. 了解哪些自动化评测论文或项目?
  11. 如何把人工问题归因环节改造成自动化流程?
  12. 是否做过模型本地部署?
  13. 请介绍 Agent Loop 的设计。
  14. 项目中最困难的部分是什么?
  15. 如何为线上元宝内容安全设计检测指标?
  16. 内容安全评测集应如何构建?
  17. 文档切分采用什么策略?
  18. Chunk Size 的取值依据是什么?
  19. 用什么指标判断切分策略是否合理?
  20. 思维题:估算此时此刻上空有多少架飞机,并说明推导过程。
  21. 请做一下自我介绍。

《参考解析》

评测集怎么建才算可用:种子要从真实线上日志和业务场景里抽,别闭门造题;建一张「场景 × 难度 × 意图」的覆盖矩阵,每个格子配额若干条,缺口一眼能看出来。每条 case 必须有可判定的期望结果和评分 rubric(精确匹配、关键词命中还是 LLM 裁判),否则无法回归。质量用双人标注 + 一致率(Cohen’s Kappa)控制,分歧条目当面裁定后进金标集。回归集冻结、只增不改;新场景另建集合,避免改一条脏一片历史结论。

把人工归因改造成自动流程:先固定归因标签体系,例如知识缺失、检索召回错、工具调用参数错、指令跟随差、安全误拒。人工按这套标准打几百条金标,再用 LLM 做 few-shot 分类,逐类比对与人工的一致率,低置信度回流人工复核。归因结果要闭环:检索错误改切分与召回策略,知识缺失补文档,指令类问题改 prompt,并且把归因后的 badcase 沉进评测集,下次回归必须过。

模型自动生成评测集怎么保证有据可依:文档类 case 强制带出处——生成时把候选 chunk 原文喂进上下文,要求输出引用 chunk id 或原文片段,事后校验引用是否真实存在,编造的丢弃;案例类(流程型)case 走结构化模板,把场景字段、期望动作、禁止动作分开写。生成完再让模型自己回跑一遍,跑不出自洽答案、或者多个答案都能算对的条目直接剔除,宁少勿脏。

Agent Loop 的设计要点:主体是「观察 → 思考 → 行动」的 ReAct 式循环,终止条件必须写死:任务完成、轮次上限、token/时间预算耗尽,避免无限自转。工具层给 JSON Schema 校验参数,写操作带幂等键和 dry-run;上下文分层管理——系统提示、任务状态、最近若干轮观察、更早内容的摘要,超窗口先摘要再截断。每一步都要埋点:工具名、入参、耗时、成功率,错误走重试 + 降级而不是直接崩。

内容安全的检测指标与评测集:指标至少三层——按风险类别分桶的拦截率、误杀率,抽样人审估出的漏放率,以及时延与拒答体验(过度拒答同样是事故)。评测集按「政策条目 × 攻击手法」铺开:直接诱导、角色扮演、多轮渐进、编码/谐音绕过、多语言绕过,每条政策都要有正负样本,并定期把线上新出现的 badcase 补进去,形成持续对抗。

RAG 的切分策略与 Chunk Size:优先按语义边界切——标题层级、段落、表格整块保留,其次才用定长滑窗加 10%20% overlap 兜底。chunk 大小由检索粒度和生成侧上下文预算共同决定,一般从 256512 token 起步:问答型偏小(定位准),总结型偏大(信息全),表格和代码块不要拦腰截断。判断切分好坏看检索侧 recall@k、MRR,生成侧答案命中率和上下文冗余比例,用不同切分参数做 A/B 对比,别凭感觉调。