腾讯AI Agent开发岗三场面经(评测、Agent Loop与内容安全)
- 时间
- 2026-09
- 来源
- 牛客网
《面试题目》
- 实习中针对什么场景进行评测,评测目标是什么?
- 评测集如何构建?
- 如何保证评测集覆盖全部场景且可用?
- 人工如何进行问题归因,归因标准是什么?
- 评测过程中的 Case 错误率和回归验证结果如何?
- 使用模型自动生成评测集时,如何确保引用了正确的文档和案例信息?
- 如何组织文档和案例两类数据来生成测试 Case?
- 为什么实习项目中没有采用自动化评测?
- 如何为云端 Agent 的输出设计安全校验方案?
- 了解哪些自动化评测论文或项目?
- 如何把人工问题归因环节改造成自动化流程?
- 是否做过模型本地部署?
- 请介绍 Agent Loop 的设计。
- 项目中最困难的部分是什么?
- 如何为线上元宝内容安全设计检测指标?
- 内容安全评测集应如何构建?
- 文档切分采用什么策略?
- Chunk Size 的取值依据是什么?
- 用什么指标判断切分策略是否合理?
- 思维题:估算此时此刻上空有多少架飞机,并说明推导过程。
- 请做一下自我介绍。
《参考解析》
评测集怎么建才算可用:种子要从真实线上日志和业务场景里抽,别闭门造题;建一张「场景 × 难度 × 意图」的覆盖矩阵,每个格子配额若干条,缺口一眼能看出来。每条 case 必须有可判定的期望结果和评分 rubric(精确匹配、关键词命中还是 LLM 裁判),否则无法回归。质量用双人标注 + 一致率(Cohen’s Kappa)控制,分歧条目当面裁定后进金标集。回归集冻结、只增不改;新场景另建集合,避免改一条脏一片历史结论。
把人工归因改造成自动流程:先固定归因标签体系,例如知识缺失、检索召回错、工具调用参数错、指令跟随差、安全误拒。人工按这套标准打几百条金标,再用 LLM 做 few-shot 分类,逐类比对与人工的一致率,低置信度回流人工复核。归因结果要闭环:检索错误改切分与召回策略,知识缺失补文档,指令类问题改 prompt,并且把归因后的 badcase 沉进评测集,下次回归必须过。
模型自动生成评测集怎么保证有据可依:文档类 case 强制带出处——生成时把候选 chunk 原文喂进上下文,要求输出引用 chunk id 或原文片段,事后校验引用是否真实存在,编造的丢弃;案例类(流程型)case 走结构化模板,把场景字段、期望动作、禁止动作分开写。生成完再让模型自己回跑一遍,跑不出自洽答案、或者多个答案都能算对的条目直接剔除,宁少勿脏。
Agent Loop 的设计要点:主体是「观察 → 思考 → 行动」的 ReAct 式循环,终止条件必须写死:任务完成、轮次上限、token/时间预算耗尽,避免无限自转。工具层给 JSON Schema 校验参数,写操作带幂等键和 dry-run;上下文分层管理——系统提示、任务状态、最近若干轮观察、更早内容的摘要,超窗口先摘要再截断。每一步都要埋点:工具名、入参、耗时、成功率,错误走重试 + 降级而不是直接崩。
内容安全的检测指标与评测集:指标至少三层——按风险类别分桶的拦截率、误杀率,抽样人审估出的漏放率,以及时延与拒答体验(过度拒答同样是事故)。评测集按「政策条目 × 攻击手法」铺开:直接诱导、角色扮演、多轮渐进、编码/谐音绕过、多语言绕过,每条政策都要有正负样本,并定期把线上新出现的 badcase 补进去,形成持续对抗。
RAG 的切分策略与 Chunk Size:优先按语义边界切——标题层级、段落、表格整块保留,其次才用定长滑窗加 10%20% overlap 兜底。chunk 大小由检索粒度和生成侧上下文预算共同决定,一般从 256512 token 起步:问答型偏小(定位准),总结型偏大(信息全),表格和代码块不要拦腰截断。判断切分好坏看检索侧 recall@k、MRR,生成侧答案命中率和上下文冗余比例,用不同切分参数做 A/B 对比,别凭感觉调。