面灵AI→

华橙 Agent 评测二面面经

轮次
二面
时间
2026-09
来源
牛客网

《面试题目》

  1. 自我介绍
  2. 项目介绍
  3. 公司本身没有相关的知识库构建吗?
  4. Skill 的构建方式是怎样的?
  5. 是否有在公司推广 Skill,效果如何?
  6. 新需求进来之后,怎么提升大模型对新需求的理解,让它能一次性理解到位?
  7. 为什么选择测试方向的岗位?
  8. 之前的学习或实习经历中,有没有遇到过比较艰难的时刻,当时是怎么解决的?

《参考解析》

  1. 企业知识库和 Skill 的关系:知识库解决「模型知道什么」,Skill 解决「模型怎么动手」。前者是把散落的文档、接口说明、历史工单清洗成可检索的片段(分块 + 向量化 + 元数据过滤),后者是把一套固定的操作流程固化成可复用、可测试的能力单元。企业里常犯的错是把两者混在一起:把操作步骤也塞进知识库当文档检索,结果模型每次都要「读一遍说明再照做」,既慢又不稳定。正确的切法是:事实进知识库,流程进 Skill。

  2. Skill 的构建方式:一般是一个带描述的文件/工具定义,包含触发条件(什么情况下该用)、输入输出契约、执行步骤,以及失败时的兜底。构建时最该花时间的是描述而不是实现——模型选错能力,九成是描述写得含糊、几个 Skill 的适用边界互相重叠。落地做法是先用真实请求跑一批,把选错的 case 挑出来回改描述,反复几轮,而不是一次性写完就上线。

  3. 推广 Skill 怎么衡量效果:别只报「做了多少个 Skill」,要报「覆盖了多少高频请求、这些请求的成功率和耗时变化」。可用的口径有三类:命中率(该用 Skill 的请求里有多少真的走了它)、端到端成功率(含参数校验失败和重试)、以及人效(同样一件事人工耗时 vs 走 Skill 耗时)。推广卡住通常不是技术问题,而是业务方不信——先挑一个痛点明确、结果可量化的场景做样板,比一次性铺开有效得多。

  4. 让模型一次理解新需求:靠「说清楚」而不是靠「模型更聪明」。把需求拆成结构化的几件事——要做什么、输入是什么、期望输出长什么样、什么算做对了、哪些情况算例外——再喂给模型;能给出正反例的,一定给例子。另外要把「理解」这件事变成可验收的:为这类需求先写几条评测样例,改完 prompt 或换模型后跑一遍,否则每次都是凭感觉判断「好像懂了」。多轮追问式的需求会话里,还要把已确认的结论显式写回上下文,别指望模型自己记住前面聊到哪。

  5. 为什么选测试岗(回答思路):把测试讲成「离质量最近的位置」而不是「退而求其次」。AI 产品的质量问题和传统软件不一样——同一个输入两次结果可能不同、对错没有明确的断言,所以评测集设计、bad case 归因、指标口径这些活反而是最稀缺的能力。结合自己做过的项目说:你做过哪些评测、怎么定义过「好」,比笼统讲「我细心、有耐心」有说服力。

  6. 讲一次艰难时刻:这类题面试官想听的是「你当时做了什么」,不是「这件事有多难」。按情境、你的判断、你采取的动作、结果和复盘四段讲完,重点放在「如果重来会怎么改」。别把自己写成每次都能力挽狂澜的人,承认当时没做好的部分反而更可信。