恒生电子 AI 面试换题了:技术岗改考二十多道技术追问
- 时间
- 2026-09
- 来源
- 牛客网
《面试题目》
- 生成的函数调用参数不符合后端 API 规范,怎么解决?
- 让模型稳定输出 JSON 但经常多出文字、格式非法,用哪些手段提升可解析性?
- 输出 JSON 缺少必填字段怎么处理?
- 把解析错误回给模型重生成,在生产环境会带来什么额外问题?
- 跨章节的长文档怎么分块?固定长度切分在投研财报这类文档上会在哪儿失效?
- RAG 支持多轮对话要额外解决什么问题?
- 摘要压缩把冷门技术细节丢了怎么办?
- 多轮历史和外部知识库在排序逻辑上有什么差别?
- 多智能体之间怎么通信调度?
- 两个 Agent 输出矛盾时怎么仲裁?
- Agent 和 Workflow 的区别是什么?
- 为什么选 LangGraph 而不选 LangChain?Checkpoint 解决了什么?
- 为什么需要 Spring AI?没有它,Java 生态接大模型和向量库的痛点在哪?
- 召回不准该怎么量化验证?
- LangGraph 的 Checkpoint 到底存了什么?
- 两个 Agent 结论矛盾时听谁的?
《参考解析》
这轮换题意味着什么:老版「闪面」是五道通用行为题(自我介绍、学习新技能、一次复杂任务、中英文朗读),技术岗和非技术岗同一套,不涉及技术。今年按岗位出题——技术岗全是技术追问,算法岗是三道行为 + 三道技术(哈希表冲突解决、激活函数、位置编码为什么必要),需求分析岗仍是行为题。所以拿行为题去准备技术岗会完全跑偏;同时老版最稳的英文朗读在新帖里一道都没出现,别把它当固定动作。
大模型输出怎么稳住:不能只靠 Prompt 里写”只输出 JSON”。工程上的组合拳是:优先用厂商原生结构化输出(JSON mode / tool calling / response schema);解析时用括号配平或容错 JSON 解析器而不是贪婪正则;解析成功后必须过 schema 校验(必填、枚举、类型、范围);失败时把具体错误字段回给模型做有限次修复。缺必填字段的处理分三类——必须用户提供的追问、能从上下文推导的自动补、可以安全默认的用默认值。把解析错误回给模型重生成在生产上有额外代价:Token 成本翻倍、延迟增加、重试风暴可能打爆下游配额,而且错误信息本身可能把上下文污染得更糟,所以要有轮数上限和降级路径。
RAG 分块与多轮:固定长度切分在财报这类文档上会失效,因为它会把一张表的表头和数据切散、把”上述指标”和指标本身分离、把带条件的结论切断。合理做法是按文档结构切(标题层级、表格、条款号)并结合语义边界,保留重叠窗口,给每块带上来源、章节、页码、生效时间等元数据。多轮对话要额外解决的是查询改写——用户第二句常常是”那它呢”,必须先把指代消解、把历史问题与当前问题合成成独立可检索的查询;同时时间与权限过滤要继续生效。摘要压缩丢细节的解法是分层:保留原文索引与引用,压缩只作用于送入模型的上下文,并且允许模型按需回查原始片段。多轮历史和外部知识库的排序逻辑不同——历史消息按时间与相关性(近期优先、话题切换时衰减),知识库按语义相关性与证据强度。
Agent 编排与框架选型:Agent 与 Workflow 的区别在于控制权——Workflow 的步骤由人定义、模型只做局部判断,可控可审计;Agent 由模型自主决定下一步,灵活但路径不稳定。生产上通常组合:外层 Workflow 保证确定性,局部用 Agent 处理不确定性。LangGraph 相比 LangChain 的核心增量是”图 + 状态”:支持条件分支、并行、回环,并且围绕共享 state 做读写;Checkpoint 存的是每个超级步(super-step)结束时的完整状态快照与待执行任务,它是断点续跑、时间旅行调试和人工介入的基础——崩溃后从最近一次 checkpoint 恢复,而不是从头重跑。Java 生态需要 Spring AI 的原因是:Java 侧原本缺少统一的大模型接入抽象(各家 SDK 风格不一)、向量库客户端、Prompt 模板、函数调用与流式处理的封装,没有它每个项目都要自己重复封装一遍。
容易被追到第二层的四道:面试官常在第一层答案之后继续追问”那怎么证明”。① 召回不准怎么量化验证——标一批问答对当基准,看命中率和召回位置(MRR),再人工抽 top-k 看相关性,把 badcase 固化成回归用例;② 输出 JSON 缺必填字段怎么办——区分必填/可推导/可默认三类,必填缺失要追问而不是让模型猜;③ LangGraph 的 Checkpoint 存了什么——完整的图状态快照(各字段值 + 已完成/待执行的节点 + 版本),因此可以恢复、回放和修改;④ 两个 Agent 结论矛盾听谁的——不能简单投票,要有仲裁层:按证据来源可信度、可复现性、以及是否有权威数据校验来判定,判不了就升级人工。