
AI Agent 面试全攻略RAG技术完整指南分块、向量库、重排序与24高频面试题【免费下载链接】ai-agent-interview-guideAI Agent 面试全攻略从零到Offer包含200面试题、企业级项目(Python/Java/Go)、简历模板、STAR面试稿、哆啦A梦漫画图解项目地址: https://gitcode.com/gh_mirrors/ai/ai-agent-interview-guide准备AI Agent 面试时RAG检索增强生成是技术面出场率最高的考点。本文面向新手用大白话讲透 RAG 技术全链路文档分块策略、向量数据库选型、混合检索与重排序并整理 24 道高频 RAG 面试题速查帮你从背八股升级到能讲清设计。 为什么 RAG 是 AI Agent 面试必考核心大模型有两个天然短板知识有截止日期新知识不知道、会编造幻觉。RAG 的思路很简单——先查资料、再回答把企业文档切成小块建好索引用户提问时先检索出最相关的几段塞进 Prompt 让大模型照着资料答。方案知识更新成本适合场景RAG更新索引即可快低事实问答、客服知识库微调需重新训练慢高改输出风格、格式、口吻长上下文仍需塞入上下文高、延迟高单篇超长文档全局推理 面试高频对比题什么时候优先微调而不是 RAG答目标是行为与格式输出 JSON、领域口吻且训练数据稳定可标注时事实类问题永远优先 RAG。 RAG 完整流程从离线建库到在线问答整个 RAG 系统分两条线离线流水线原始文件PDF/Word/Markdown→ 解析清洗 →分块Chunking→ Embedding 向量化 → 写入向量库可再加 BM25 倒排索引在线问答用户提问 →可选查询改写 → 检索 Top-K →可选重排序→ 拼进 Prompt → 大模型生成带引用的答案项目里的漫画图解把这两步画得非常直白——哆啦A梦在图书馆里检索→增强→生成一句话口述版面试直接背 离线负责把非结构化知识变成可检索索引在线负责理解意图、检索、融合、约束生成并控制延迟成本。✂️ 文档分块决定检索质量的第一道关分块Chunking就是把长文档切成一块块能被检索、又不缺上下文的文本。主流策略策略一句话理解注意点固定长度每 512 token 一刀切简单但容易把句子切半递归字符分割优先在段落→句子→空格边界断开生产默认基线推荐语义分块相似度骤降处切贴着话题边界效果好但计算贵按结构分块按 Markdown 标题/HTML 小节切块内主题一致适合文档类父子块小块用于检索、大块用于喂给 LLM兼顾精度与上下文完整性两个黄金参数面试官最爱追问chunk_size覆盖一个完整命题一条规定、一个步骤太小缺主语、太大混噪声chunk_overlap一般为 size 的10%–20%防止关键句被切在两块边界项目中的分块实现支持固定/递归/段落三种策略默认 512 token 64 重叠chunker.py解析与整条 ETL 流水线见 parser.py 和 pipeline.py。❓高频题分块太大或太小分别会怎样太小 → 语义不完整片段缺主语或条件太大 → 混入无关内容、embedding 语义变模糊、费用上升。答完补一句我们用评估集扫网格调参会更加分。 向量数据库选型FAISS、Milvus、Qdrant 怎么挑向量数据库解决的核心问题是上百万条高维向量怎么毫秒级找出最像的 Top-K答案是ANN近似最近邻算法——用一点点精度换数量级速度。产品特点适用场景FAISSMeta 出品的算法库非完整数据库原型、离线实验Milvus云原生、分布式、可扩展百亿级大规模生产本项目采用Chroma轻量、易上手小项目、DemoQdrantRust 实现、元数据过滤强自托管 复杂过滤三个必会的 ANN 算法名词HNSW图索引延迟低、召回高但吃内存调大efSearch 召回升、延迟升IVF先聚类分桶再搜部分桶适合数据量大、内存紧PQ向量压缩省内存精度略降常与 IVF 组合一句话区别题出现率极高❓FAISS 和 Milvus 本质区别FAISS 是ANN 算法库存储、服务、容灾要自己搭Milvus 是向量数据库系统带分布式存储和运维能力。项目里 Milvus 封装在 milvus_client.pyJava 版对应 MilvusService.java。 混合检索与重排序效果提升的两个大杀器单路向量检索的短板专有名词、产品型号、工单编号等精确词经常漏检。业界标配组合拳混合检索向量抓语义 BM25抓字面两路召回用RRF倒数排名融合合并——只比排名不比分数天然规避两路分数尺度不一致的问题经典参数k60Cross-Encoder 重排序向量检索是独立编码求快Cross-Encoder 把 query 和文档拼一起深度交互打分精度更高但慢所以放在召回 Top-K几十到几百条之后精排出 Top 3–10MMR 去冗余防止 Top-K 里塞满几乎重复的段落lambda越大越偏相关、越小越偏多样项目实现路径Python 版多路检索 RRF 融合retriever.pyCross-Encoder 重排reranker.py带引用标注的答案生成generator.pyGo 版同模块见 internal/rag/retriever.go / reranker.go / generator.go。❓高频题Cross-Encoder 为什么不能直接替代向量索引因为它必须对每个文档与 query 跑一次模型复杂度扛不住百万级全库实时扫描只能做小规模精排。 RAG 进阶四件套答出深度感的加分项面试官问还了解哪些 RAG 变体时记住这四个名字变体一句话解释GraphRAG抽实体关系建知识图谱擅长多跳关系和全局总结类问题成本高Agentic RAG由 Agent 动态决定何时检索、检索什么、要不要再查多步循环Self-RAG模型生成中插入反思 token自我检查证据够不够、要不要再查Corrective RAG检索质量不达标时自动改写查询/换数据源纠偏❓加分追问长上下文模型出来后 RAG 会消失吗不会。私域数据规模与成本、检索聚焦证据、合规审计、增量更新这些需求长上下文替代不了。❓ 24 高频 RAG 面试题速查含标准答案要点完整题库含追问应对在 03-RAG技术.md这里列出最高频的 24 道速查#面试题答案要点1简述 RAG 两步流水线离线解析→分块→嵌入→建索引在线检索→重排→拼 Prompt→生成2RAG 和微调如何配合微调管格式与表达RAG 管可更新事实事实类优先 RAG3为什么需要 chunk_overlap防关键句被切断在边界代价是存储略增4递归分块的分隔符顺序为何重要优先在更大语义单元段落断开减少碎片化5语义分块一定更好吗不一定成本高、阈值敏感用数据 A/B 测试6父子文档怎么存子块带parent_id命中子块→映射父块文本再生成7Embedding 要归一化吗用余弦/内积时建议归一化相似度更稳定8IndexFlatIP 与 HNSW 区别Flat 精确但慢HNSW 近似快适合大规模9混合检索权重怎么定验证集网格搜索或用 RRF 免调权10RRF 为什么鲁棒只用排名融合规避分数尺度问题11HyDE 风险如何缓解重排 引用约束 拒答 多路对比12BM25 中文要分词吗要常需分词或 n-gram否则粒度不当13Cross-Encoder 为何不能全库扫复杂度太高只能对 Top-K 小范围精排14MMR 的 lambda 含义调相关性 vs 多样性越大越偏相关15GraphRAG 解决什么痛点多跳关系与全局聚合类问题16Agentic RAG 与一次检索差异多步工具决策 再检索更灵活但成本高17Self-RAG 核心思想生成中自评要不要检索、证据是否充分18Corrective RAG 触发条件检索置信度低或证据矛盾时改查/换源19RAGAS 评估的局限依赖裁判模型有偏好与盲区需人工抽检20低成本在线评估怎么做采样 用户点赞/纠错 点击引用等弱监督21索引频繁更新如何保一致版本号 双写切换 灰度重建读写分离22如何防 Prompt 注入污染 RAG文档清洗、权限隔离、引用限制、异常指令检测23HNSW 和 IVF 怎么取舍中等规模要低延迟选 HNSW超大且内存紧张选 IVF(PQ)24只看答案对错够吗不够要分评检索质量与忠实度定位瓶颈在哪项目面试时还可以结合 面试问答集 里的 100 道项目题以及 STAR 面试稿 练习话术 学习路径与动手项目建议按看原理 → 跑项目 → 练话术三步走吃透八股RAG 技术模块每个主题都有概念、原理、面试问答、追问应对跑通企业级项目三选一Python 版FastAPI Milvus Redis推荐首选Java 版Spring Boot 3 Spring AIGo 版Gin 自研框架简历与话术简历模板 STAR 面试稿 学习路线图最后的高分技巧简历里准备一条可量化指标如Top-5 召回率提升 X%P99 延迟下降 X%和一次失败案例分析到底是检索错了还是生成胡编比背 24 道题更有说服力。【免费下载链接】ai-agent-interview-guideAI Agent 面试全攻略从零到Offer包含200面试题、企业级项目(Python/Java/Go)、简历模板、STAR面试稿、哆啦A梦漫画图解项目地址: https://gitcode.com/gh_mirrors/ai/ai-agent-interview-guide创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考