AI Agent 开发岗面经 背景岗位本质是LLM 应用工程师 / AI Agent 工程岗极少会考大模型训练、Transformer 推导80% 面试围绕Agent 原理、Function‑Calling、RAG、LangGraph、生产落地问题、项目深挖。 岗位分两档 1初级会调用 API、会 LangChain、能做 RAG、跑通 Agent Demo 2中高级LangGraph 状态机、记忆管理、失败处理、多 Agent、性能并发、可观测、线上问题排查。一、面试整体流程自我介绍重点讲项目RAG/Agent 项目遇到什么问题怎么解决Python 后端基础手撕asyncio、json 处理、异常、简单 FastAPIAgent 理论问答高频项目深挖占比最高简历写什么就深挖什么代码手写题手写 ReAct 循环、工具调用处理、RAG 链路片段场景题线上出故障怎么排查是区分 Demo 选手和工程选手的关键反问环节⚠️大坑很多同学简历只写 “基于 LangChain 做了 Agent”没有讲遇到的问题面试官直接判定只会跑 Demo。二、高频面试题 答题思路真实面试高频基础概念题什么是 AI AgentAgent 和普通 LLM 对话有什么区别答题要点 普通对话LLM 只做生成没有外部能力没有任务规划 Agent LLM 大脑 Memory 记忆 Tool 工具调用 Planning 任务规划。 可以自主判断什么时候调用工具、多轮循环完成复杂任务不是一问一答。ReAct 原理是什么ReAct 的执行流程Thought → Action → Observation → 循环直到输出 Final Answer。 要讲清楚Thought 思考要不要调用工具Action 输出工具名 参数Observation 拿到工具返回结果喂回给大模型。 很多面试官会让你手写简易 ReAct 循环。Function Calling / ToolCall 底层原理模型一定能正确调用工具吗失败场景有哪些如何处理原理给模型传入工具 JSON Schema 描述模型输出结构化工具调用解析后执行工具。 失败场景模型幻觉不输出规定 JSON输出自然语言参数缺失、参数类型错误不该调用工具的时候乱调用工具返回结果太长超出上下文窗口解决方案 1强约束 prompt少样本2输出格式校验JSON 解析失败重试3工具参数校验4最大循环轮次限制防止死循环5兜底降级直接让模型回答。Memory 记忆系统有哪几种怎么解决上下文无限膨胀短时记忆完整对话上下文摘要记忆对历史做摘要压缩向量长记忆把久远历史向量化需要的时候检索召回膨胀解决 1滑动窗口保留最近 N 轮2历史摘要3长记忆向量检索不全量塞上下文4token 计数截断。RAG 相关高频RAG 流程RAG 效果差、幻觉怎么排查流程文档加载→切片→Embedding 入库→检索→rerank→组装 prompt→大模型回答。 召回差排查切片策略、embedding 模型、检索 top‑k、是否做 rerank 幻觉检索到无关内容、上下文不足、模型本身幻觉对策引用原文片段、prompt 约束只能基于检索内容回答。框架相关LangChain / LangGraph 面试重灾区LangGraph 相比旧版 AgentExecutor 好在哪里AgentExecutor黑盒循环无法干预中间步骤不能暂停、回退、复杂分支很难写。 LangGraph基于状态机状态可以自定义节点、边、条件分支支持中断、人工介入、重试、回滚每一步状态持久化适合生产级 Agent。 重点不是 LangGraph 封装得更简单是可控性。LangGraph 的 State 是什么全局状态字典所有节点共享保存对话、工具返回、中间变量每一步节点修改 State图流转。CrewAI/AutoGen 多 Agent 原理多 Agent 会遇到什么问题角色分工Agent 之间互相传消息 问题循环闲聊、任务跑偏、角色越权、消息上下文膨胀需要总控 agent、最大轮次限制。工程 生产场景题非常重要初级到中高级分水岭这类题很多人答不好因为只跑本地 Demo没有上线。Agent 上线后出现死循环不停调用同一个工具怎么定位、怎么解决排查看日志看每一轮 state、模型输出看工具返回内容。 解法 ① 设置最大迭代轮次超过直接终止 ② 检测连续多次相同工具调用触发终止 ③ prompt 约束任务完成条件 ④ LangGraph 可以设置递归 limit。工具调用超时第三方接口挂了Agent 怎么处理工具层加超时时间捕获异常把异常信息放回上下文交给 LLM 可以配置重试策略多次失败之后降级告知用户当前工具不可用不要无限循环。线上用户并发上来Agent 会话怎么存储为什么不能内存存记忆内存只适合 demo重启丢失多实例无法共享会话 生产MySQL/Redis 存储会话、历史消息、Agent stateLangGraph 支持持久化 Checkpoint。Agent 系统怎么做可观测记录每一轮 prompt、输入输出、token 消耗、工具调用名称、参数、返回值 记录失败 case统计工具调用成功率、Agent 完成率方便定位是模型问题还是工具问题还是 prompt 问题。用户输入恶意 prompt怎么做安全防护输入输出护栏prompt 注入防护工具权限管控不能随便调用高危接口过滤敏感输入。手写代码题面试会现场写或者口述思路手写极简 ReAct 循环不使用 LangChain伪代码 /python 代码。给定工具返回非 JSON写逻辑处理 JSON 解析失败重试。FastAPI 封装一个 Agent 接口会话管理。RAG 简单链路切片‑向量化‑检索。不会要求写完整大项目主要考察你懂不懂内部流转逻辑而不是只会调用框架 API。三、项目深挖面试套路简历怎么写面试官会怎么问举例子简历写基于 LangGraph 实现文档分析 Agent 面试官追问链条 1为什么选 LangGraph不用 AgentExecutor 2记忆怎么管理如何处理长文档上下文膨胀 3工具调用失败怎么处理遇到哪些失败 case 4RAG 切片用多大为什么这么切遇到召回差怎么调优 5如果上线并发上来会话怎么持久化 6怎么评估这个 Agent 到底好不好用指标是什么✅简历项目一定要写遇到的问题 你的解决方案例如 ❌不好实现一个文档 Agent支持工具调用。 ✅好基于 LangGraph 构建文档分析 Agent解决工具调用 JSON 解析失败增加重试逻辑通过摘要记忆 向量长记忆解决上下文膨胀使用 Checkpoint 做状态持久化评测工具调用成功率、任务完成率。Agent 项目可以写的评估指标面试加分工具调用成功率任务完成率幻觉率token 消耗平均迭代轮次四、面试踩坑很多人踩只会背 LangChain API讲不清楚底层逻辑。面试官问如果不用 LangGraph你自己怎么实现 Agent 循环答不上来。对策一定要手写一遍原生 ReAct理解循环逻辑。只讲理想流程完全不提异常、失败 case。面试官默认你只跑 demo没有工程经验。RAG 只会说切片、向量库讲不出召回差、幻觉的实际排查手段。混淆概念把 RAG 等同于 AgentRAG 只是 Agent 其中一个组件。多 Agent 只会说 CrewAI 示例不知道多 Agent 会出现闲聊循环、任务失控等现实问题。五、不同水平面试侧重点初级岗1‑3 年LLM 应用开发Python 基础、FastAPI理解 Agent、ReAct、Function‑Calling会 RAG会 LangChain能看懂 LangGraph 代码知道常见失败场景。中高级 Agent 工程师3‑5 年LangGraph 状态机深度checkpoint 持久化Agent 系统架构设计多 Agent 系统设计性能、并发、限流、可观测体系Agent 评测体系模型降级策略开源 Agent 框架二次改造。六、面试反问环节参考咱们团队 Agent 主要做什么业务场景单 Agent 为主还是多 Agent 协作生产环境是闭源模型还是开源模型部署Agent 系统现在遇到的主要线上问题是什么