字节AI产品实习一面面经

字节跳动 · AI产品经理实习生 · 一面 · 2026-04

《面试题目》

  1. 介绍一个最能体现产品能力的 AI 项目。
  2. 项目的评测指标如何设计?评测集如何构建,规模大概多大?
  3. Bad Case 如何归因,失败案例的标签如何定义,是否需要人工参与?
  4. 训练数据是什么格式,如何检查数据质量?是否做过模型微调,微调前后有何提升?
  5. Bad Case 从哪里来?是否做过 RAG 项目,对最新 RAG 模型有什么了解?
  6. 相比单智能体,多智能体系统的独特价值是什么,是否真的提升效率?
  7. 如何看待 OpenClaw?

《参考解析》

  1. 评测体系:先按真实用户任务定义成功标准,再建立覆盖正常、边界和失败场景的评测集;指标通常包含任务成功率、事实准确率、响应时延和成本,并按版本持续回归。
  2. Bad Case 归因:先保留输入、检索结果、提示词、工具调用和输出等完整链路,再按数据、检索、模型、提示词或工程逻辑分类。自动聚类适合提效,关键样本仍需人工复核。
  3. 微调判断:只有当提示词、检索和工具编排无法稳定解决,且问题能用高质量样本清晰表达时才考虑微调;上线前后要用同一评测集对比,并关注泛化和回归风险。
  4. 多智能体价值:适合任务可拆分、角色专业化且需要并行协作的场景;若拆分带来的通信、调度成本高于收益,单智能体配合工具反而更简单可靠。