面灵AI→

百度 Agent 算法岗一二面面经:Agent 架构、上下文管理与 Skill 设计

百度 Agent算法 一面+二面

百度 Agent 算法岗一面二面面经:一面从 Agent 核心模块与主流框架问起,覆盖 ReAct 与 Plan-and-Execute 的差异、海量工具下的 Token 爆炸与工具乱选治理、Agentic RL 的动机、全方位评测维度、单 Agent 与多 Agent 取舍以及上下文溢出方案,手撕翻转整数;二面转入源码阅读(OpenClaw、Claude Code)、记忆与上下文管理实现对比、工具错选根因、自定义 Skill 结构,并要求设计「预订明日上海机票」的完整链路与任务停滞的异常处理,手撕单词拆分。

2026-10

百度 Agent 算法岗一二面面经:Agent 架构、上下文管理与 Skill 设计

百度 Agent算法 一面+二面

百度 Agent 算法岗一面二面面经:一面从 Agent 核心模块与主流框架问起,覆盖 ReAct 与 Plan-and-Execute 的差异、海量工具下的 Token 爆炸与工具乱选治理、Agentic RL 的动机、全方位评测维度、单 Agent 与多 Agent 取舍以及上下文溢出方案,手撕翻转整数;二面转入源码阅读(OpenClaw、Claude Code)、记忆与上下文管理实现对比、工具错选根因、自定义 Skill 结构,并要求设计「预订明日上海机票」的完整链路与任务停滞的异常处理,手撕单词拆分。

2026-10

阿里云 AI Infra 一面面经:Agentic RL 训练岗

阿里云 AI Infra 一面

阿里云 AI Infra 一面记录,面向 Agentic RL 训练岗:先做三道按简历定制的题(限时 40 分钟三选二)并讲解思路,随后深挖 OPD 蒸馏动机与数据筛选、过程奖励与结果奖励的区别、多轮对话双层奖励与用户模拟器构造、转人工率评测与 A/B 设计,以及 verl 中 AgentLoop 的特点。

2026-09

滴滴算法秋招凉经:GRPO 监控指标与 Agentic RL 数据链路

滴滴 大模型算法

滴滴算法秋招凉经,12 问全部围绕 RL 后训练:GRPO 除 reward 外要盯的六类指标、可训练轨迹必须保留的可见状态、SFT 数据筛选与成功轨迹的幸存者偏差、何时从 SFT 切到 RL,以及异步 rollout 的 off-policy 与 KL 约束。

2026-09

快手大模型应用开发二面:Agentic RL 与 RAG 全链路

快手 大模型应用开发 二面

快手大模型应用开发二面:中段集中考 Agentic RL 的信用分配、PPO 的 Clip 与 KL 约束、GRPO 为何省掉 critic;其余覆盖 Agent 架构、RAG 切分与混合检索、幻觉归因、记忆冲突与 SSE 断点续传。

2026-09