评测 面试题
共 11 篇真实面经 · 涵盖 百度 / 水滴 / 某互联网公司 / 字节跳动 / 东方财富 等 9 家公司
百度 Agent 二面:不看简历、不做自我介绍,连抛 6 道架构题
百度 Agent 二面面经:全程开放式架构题,考 Agent 应用的分层与模块、通用 Runtime 的多厂商抽象、C 端 Token 成本控制、代码执行沙箱安全、上下文压缩与信息保全、Harness Engineering 演进、评测归因、Trace 可观测性与监控熔断、多 Agent 通信,最后手撕判断二叉树是否平衡。
百度 Agent 算法岗一二面面经:Agent 架构、上下文管理与 Skill 设计
百度 Agent 算法岗一面二面面经:一面从 Agent 核心模块与主流框架问起,覆盖 ReAct 与 Plan-and-Execute 的差异、海量工具下的 Token 爆炸与工具乱选治理、Agentic RL 的动机、全方位评测维度、单 Agent 与多 Agent 取舍以及上下文溢出方案,手撕翻转整数;二面转入源码阅读(OpenClaw、Claude Code)、记忆与上下文管理实现对比、工具错选根因、自定义 Skill 结构,并要求设计「预订明日上海机票」的完整链路与任务停滞的异常处理,手撕单词拆分。
百度 Agent 算法岗一二面面经:Agent 架构、上下文管理与 Skill 设计
百度 Agent 算法岗一面二面面经:一面从 Agent 核心模块与主流框架问起,覆盖 ReAct 与 Plan-and-Execute 的差异、海量工具下的 Token 爆炸与工具乱选治理、Agentic RL 的动机、全方位评测维度、单 Agent 与多 Agent 取舍以及上下文溢出方案,手撕翻转整数;二面转入源码阅读(OpenClaw、Claude Code)、记忆与上下文管理实现对比、工具错选根因、自定义 Skill 结构,并要求设计「预订明日上海机票」的完整链路与任务停滞的异常处理,手撕单词拆分。
水滴校招测试一面:Skill 准入、上下文污染与敏感信息泄露测试
水滴校招测试岗一面面经,全程围绕 Agent 类系统的测试方法:一个 Skill 从注册到被 Agent 使用要验证哪些内容、AI 生成用例如何判断真有价值、如何验证 Agent 的最终答案不是「看起来正确」、如何测试多轮对话的上下文污染、没有标准答案时如何验证 Skill 输出质量、Skill 调用链路的异常测试、Skill 描述歧义的判断方法、敏感信息泄露测试,以及 Agent 的发布准入标准。
AI Agent 开发岗面试题:55 道真实面试里的追问
一份 Agent 开发岗的面试题清单,覆盖技术选型、框架与 runtime、工程细节、多 Agent 协作、对齐与幻觉、评测、安全与开放设计八个方向;问题集中在判断依据与落地细节上,而不是 API 记忆。
字节 260901 一面面经
字节跳动 AI 大模型开发平台后端一面,面试岗位属数据平台方向:实习项目深挖 Agent 迭代与回归评测、文档切分与长上下文、离线评测与线上观测、长程任务评测,个人项目考意图消歧与 Agent 框架选型,场景题讨论通用 Agent 的效果评估与竞品比较,最后两道手撕。
东方财富 AI 应用一面:Skill 路由评测与上下文分层
东方财富 AI 应用一面面经(9.15):主体是 Agent 实习的深挖——Skill 路由评测为什么要做、正反例怎么构造、除描述外的误路由原因、如何量化与设定阈值、历史消息膨胀与错漏召回如何处理、Context 如何分层,以及金融场景下工具返回五六千只 A 股而用户要求全量输出时压缩的信息损失怎么办;随后追问多数据源并发召回为什么用专用线程池、两级缓存一致性、历史访问预热与热点识别、近似统计结构找 Top K,最后考 AI Coding 经验与手撕拓扑排序。
货拉拉大模型二面:上下文压缩与记忆沉淀
货拉拉大模型方向二面面经。从实习难点切入,追问 LLM 沉淀结果的评估与冲突重合处理、firstcoder 与其它 coding agent 的差异、上下文为什么要压缩、上下文与记忆的区别、记忆如何沉淀,以及测评方案。
科大讯飞 AI 应用一面:Agent Harness、沙箱隔离与评测
科大讯飞 AI 应用一面面经(9.15,两位面试官群面):先从实习与转正意向切入,深挖第三个实习的异步工作流框架、小站点网络隔离导致的升级失败与改造、DB 队列设计与执行,再追问第二个实习的搜索链路 P99 优化、两级缓存与本地缓存一致性、广播更新的可靠性;后半段集中在第一个实习的 Agent Harness——Runtime/Workflow/Node 分层、与 Dify/扣子的对比、分层上下文 Roadmap、压缩触发阈值与 Tool Result 处理、摘要对 KV/Prefix Cache 的影响、Skill 路由评测,最后追问自研 Runtime 的理由、沙箱与隔离(gVisor、microVM、Docker 的差异)以及把本地 Coding Agent 做成多人 SaaS 的架构。
9.30 新浪测开二面
新浪广告投放部门测试开发二面面经,9 月 30 日:只问了三道题——自我介绍、知识库的来源、如何评测一个智能客服,剩下的时间面试官都在讲广告投放的底层逻辑。
VIVO Agent 开发秋招一面:超时恢复、状态机与权限边界
VIVO Agent 开发秋招一面面经,问题普遍以「为什么这么做还不够」的形式追问:创建工单超时但外部可能已写入怎么恢复、换更强模型后完成率反降如何定位、多 Agent 并行写同一状态为何分布式锁仍不够、进程崩溃后状态机怎么续跑、文档里的注入指令为何不能只靠系统提示词挡、参数过了 JSON Schema 为什么还不能执行,以及如何证明框架收益来自运行时设计。