面灵AI→

快手 AI 应用二面:Agent 平台的效果评估与协作方式

轮次
二面
时间
2026-09
来源
牛客网

《面试题目》

  1. 请做一下自我介绍。
  2. 实习有没有 offer、还会参加转正吗?现在是专心准备秋招吗?
  3. 你怎样理解 AI 技术栈?整体可以分成哪些模块?
  4. ReAct 和 Plan-and-Execute 分别适合什么场景?能举个例子吗?
  5. 在你的项目里,怎样选择或组合这两种模式?
  6. 平台原本就有的能力和你个人开发的内容,分别是什么?
  7. Tool Call、上下文和 Skill 相关工作,你具体改了什么模块、写了什么代码?
  8. 这些工作做完后怎样评估效果?
  9. 这个 Agent 平台的使用背景是什么?服务谁,要达成什么目标?
  10. 平台怎样考核?接入了多少服务、业务方或工具?
  11. 做这个平台的需求从哪里来,是业务方提出还是产品推动?
  12. 平台上线后带来了什么收益,人效怎样衡量?
  13. 从业务问题到技术方案的拆解过程,你参与了多少?还是 Mentor 分好任务后由你开发?
  14. 上下文用错历史结果、漏掉关键结果,具体有哪些典型 Case?
  15. 你的上下文方案是针对某个 Case 的修补,还是能在不同场景复用?
  16. 平台接入了哪些模型?走内部 API 还是自己部署?部署用了多少卡?
  17. 模型推理成本怎样判断是否合理,还有哪些优化空间?
  18. 项目一共多少人?你和其他同事分别负责什么?
  19. 平时用什么 AI Coding 工具和模型写代码?
  20. 怎样保证 AI 生成的代码符合预期、质量可控?会让 AI 提前生成测试吗?
  21. 多个人用不同 AI 工具开发同一个功能时,你们怎样协作?
  22. 在校成绩和排名怎么样?写过论文吗?平时读过相关论文吗?

《参考解析》

AI 技术栈怎么分层:一个通用分法是「模型层—能力层—编排层—应用层—支撑层」。模型层是基座与推理部署(含微调、量化、推理引擎);能力层是 RAG、工具调用、结构化输出、多模态理解等原子能力;编排层负责把能力串成流程(工作流引擎、Agent Loop、状态管理与记忆);应用层是具体业务形态(客服、编码助手、数据分析);支撑层是评测、可观测、权限与成本治理。这样分层的好处是能清楚说出”我在哪一层做了什么”。

这两个模式怎么组合:原则是”不确定性放在哪,自主性就放在哪”。任务可拆解、步骤之间有依赖但整体路径明确时用 Plan-and-Execute,先规划再执行,便于并行与审计;任务目标开放、工具结果影响下一步决策时用 ReAct。实际项目里常见的外层是 Plan(拆出子任务并维护全局目标),内层每个子任务用 ReAct 处理不确定性;如果某一步是固定流程(如调用某个校验接口),就直接硬编码成工作流节点,不交给模型决策。

个人贡献怎么讲:面试官反复追问”哪些是你独立完成的”、“是业务方提出还是产品推动”、“你参与了多少拆解”,本质是在排除”蹭平台”。诚实且有说服力的答法是明确边界——平台底座是谁做的、我负责的是哪几个模块(比如上下文装配与压缩、Skill 路由评测)、我遇到的具体技术问题是什么、我做了什么决策、结果如何量化。把”我提的方案被采纳”和”Mentor 分任务我执行”分开说,反而更可信。

上下文错用与漏召的典型 case:常见几类——① 工具返回结果里包含多组数据,模型取了旧的或错的那一组;② 压缩时把带条件的结论压掉,只留下结论导致模型误用;③ 多轮之后指代消解错误,把”它”指到了错误的对象;④ 检索到了正确文档但被无关内容淹没,排序靠后没被用上。判断方案是”补丁”还是”可复用”的标准是:它是否只针对某个 case 的特征(补丁),还是针对一类失效模式(可复用)——比如”压缩时保留条件与作用域”是一类修复,“把这块内容从压缩里排除”就是打补丁。

效果怎么评估、人效怎么衡量:评估要分两层。技术层看任务成功率、关键步骤成功率、工具调用正确率、上下文召回率、平均步数与成本;业务层看接入业务方的使用量、人工接管率、单任务耗时对比(改造前人工做要多久、改造后多久)、以及交付质量(返工率)。人效不能只报”提效 N%“,要说清口径:是同一类任务的前后对比,还是与人工基线的对比,样本量多少。

AI Coding 的多人协作:不同人用不同工具时,冲突点不在文件覆盖(Git 能解决),而在语义冲突——契约变了、命名风格不一、重复实现。做法是:先固定跨模块契约(接口、数据结构、错误码),各自基于同一基线开发;生成代码必须过统一的 lint/格式化与类型检查,把风格差异压到工具层解决;提交前跑契约测试;合并门禁针对真实合并结果执行,而不是各分支绿了就合。让 AI 提前生成测试是有效的,但要注意测试本身也可能写错——只把”能真实复现失败”的测试当作有效测试。