快手 AI 应用二面:Agent 平台的效果评估与协作方式
- 轮次
- 二面
- 时间
- 2026-09
- 来源
- 牛客网
《面试题目》
- 请做一下自我介绍。
- 实习有没有 offer、还会参加转正吗?现在是专心准备秋招吗?
- 你怎样理解 AI 技术栈?整体可以分成哪些模块?
- ReAct 和 Plan-and-Execute 分别适合什么场景?能举个例子吗?
- 在你的项目里,怎样选择或组合这两种模式?
- 平台原本就有的能力和你个人开发的内容,分别是什么?
- Tool Call、上下文和 Skill 相关工作,你具体改了什么模块、写了什么代码?
- 这些工作做完后怎样评估效果?
- 这个 Agent 平台的使用背景是什么?服务谁,要达成什么目标?
- 平台怎样考核?接入了多少服务、业务方或工具?
- 做这个平台的需求从哪里来,是业务方提出还是产品推动?
- 平台上线后带来了什么收益,人效怎样衡量?
- 从业务问题到技术方案的拆解过程,你参与了多少?还是 Mentor 分好任务后由你开发?
- 上下文用错历史结果、漏掉关键结果,具体有哪些典型 Case?
- 你的上下文方案是针对某个 Case 的修补,还是能在不同场景复用?
- 平台接入了哪些模型?走内部 API 还是自己部署?部署用了多少卡?
- 模型推理成本怎样判断是否合理,还有哪些优化空间?
- 项目一共多少人?你和其他同事分别负责什么?
- 平时用什么 AI Coding 工具和模型写代码?
- 怎样保证 AI 生成的代码符合预期、质量可控?会让 AI 提前生成测试吗?
- 多个人用不同 AI 工具开发同一个功能时,你们怎样协作?
- 在校成绩和排名怎么样?写过论文吗?平时读过相关论文吗?
《参考解析》
AI 技术栈怎么分层:一个通用分法是「模型层—能力层—编排层—应用层—支撑层」。模型层是基座与推理部署(含微调、量化、推理引擎);能力层是 RAG、工具调用、结构化输出、多模态理解等原子能力;编排层负责把能力串成流程(工作流引擎、Agent Loop、状态管理与记忆);应用层是具体业务形态(客服、编码助手、数据分析);支撑层是评测、可观测、权限与成本治理。这样分层的好处是能清楚说出”我在哪一层做了什么”。
这两个模式怎么组合:原则是”不确定性放在哪,自主性就放在哪”。任务可拆解、步骤之间有依赖但整体路径明确时用 Plan-and-Execute,先规划再执行,便于并行与审计;任务目标开放、工具结果影响下一步决策时用 ReAct。实际项目里常见的外层是 Plan(拆出子任务并维护全局目标),内层每个子任务用 ReAct 处理不确定性;如果某一步是固定流程(如调用某个校验接口),就直接硬编码成工作流节点,不交给模型决策。
个人贡献怎么讲:面试官反复追问”哪些是你独立完成的”、“是业务方提出还是产品推动”、“你参与了多少拆解”,本质是在排除”蹭平台”。诚实且有说服力的答法是明确边界——平台底座是谁做的、我负责的是哪几个模块(比如上下文装配与压缩、Skill 路由评测)、我遇到的具体技术问题是什么、我做了什么决策、结果如何量化。把”我提的方案被采纳”和”Mentor 分任务我执行”分开说,反而更可信。
上下文错用与漏召的典型 case:常见几类——① 工具返回结果里包含多组数据,模型取了旧的或错的那一组;② 压缩时把带条件的结论压掉,只留下结论导致模型误用;③ 多轮之后指代消解错误,把”它”指到了错误的对象;④ 检索到了正确文档但被无关内容淹没,排序靠后没被用上。判断方案是”补丁”还是”可复用”的标准是:它是否只针对某个 case 的特征(补丁),还是针对一类失效模式(可复用)——比如”压缩时保留条件与作用域”是一类修复,“把这块内容从压缩里排除”就是打补丁。
效果怎么评估、人效怎么衡量:评估要分两层。技术层看任务成功率、关键步骤成功率、工具调用正确率、上下文召回率、平均步数与成本;业务层看接入业务方的使用量、人工接管率、单任务耗时对比(改造前人工做要多久、改造后多久)、以及交付质量(返工率)。人效不能只报”提效 N%“,要说清口径:是同一类任务的前后对比,还是与人工基线的对比,样本量多少。
AI Coding 的多人协作:不同人用不同工具时,冲突点不在文件覆盖(Git 能解决),而在语义冲突——契约变了、命名风格不一、重复实现。做法是:先固定跨模块契约(接口、数据结构、错误码),各自基于同一基线开发;生成代码必须过统一的 lint/格式化与类型检查,把风格差异压到工具层解决;提交前跑契约测试;合并门禁针对真实合并结果执行,而不是各分支绿了就合。让 AI 提前生成测试是有效的,但要注意测试本身也可能写错——只把”能真实复现失败”的测试当作有效测试。