LangChain 零基础快速上手:从 Hello World 到智能文档问答助手

发布时间:2026/7/22 4:24:28
LangChain 零基础快速上手:从 Hello World 到智能文档问答助手 一、引言大模型浪潮下的开发困境随着 ChatGPT 的爆火大模型Large Language Model, LLM已成为开发者工具箱中的新宠。然而当我们兴奋地拿到 OpenAI API Key准备大干一场时却常常陷入这样的困境裸调 API 的局限性每次调用都是“一问一答”的孤立对话模型无法记住之前的聊天内容。上下文管理复杂想实现多轮对话需要自己维护历史消息列表并小心翼翼地控制 Token 数量。功能扩展困难想让 AI 读取本地 PDF 文件并回答问题仅靠 API 调用你需要自己处理文档加载、文本分割、向量化、检索等一系列繁琐步骤。这正是LangChain诞生的背景。它不是一个新的大模型而是一个用于开发基于大模型的应用框架。想象一下这个场景你有一堆技术文档PDF/TXT希望搭建一个智能助手能够理解文档内容并回答你的问题。如果只用裸 API你需要写大量胶水代码而使用 LangChain你可以像搭积木一样快速组合出完整的解决方案。本文目标面向零基础开发者带你快速理解 LangChain 的核心概念并通过一个完整的“智能文档问答助手”实战项目让你学完就能独立搭建自己的 AI 应用。二、LangChain 是什么官方定位LangChain 是一个用于开发由语言模型驱动的应用程序的框架。核心设计理念模块化与可组合性。它将构建 LLM 应用所需的常见功能如提示词管理、记忆、工具调用、数据检索抽象成独立的组件开发者可以通过“链”Chain的方式将这些组件串联起来形成复杂的工作流。与传统开发方式对比方式特点示例实现文档问答直接调用 OpenAI API灵活但繁琐所有逻辑加载、分割、检索、提示都需要自己实现。需要编写文档加载器、文本分割器、向量数据库客户端、检索逻辑并将所有结果拼接成最终的 Prompt 发送给 API。使用 LangChain开箱即用提供标准化组件和高级接口专注于业务逻辑。使用内置的 Document Loader、Text Splitter、VectorStore 和 RetrievalQA Chain几行代码即可搭建原型。简而言之LangChain 让开发者从“造轮子”中解放出来更专注于应用创新。三、环境准备与安装在开始编码之前请确保你的环境满足以下要求Python 环境建议使用 Python 3.8 或更高版本。安装 LangChain使用 pip 进行安装。pip install langchain安装相关依赖根据你的需求可能还需要安装以下包# 用于连接 OpenAI 模型 pip install openai # 用于文档加载如 PDF pip install pypdf # 用于向量存储本地示例使用 Chroma pip install chromadb # 用于文本嵌入 pip install tiktokenAPI Key 配置OpenAI在代码中设置环境变量。import os os.environ[OPENAI_API_KEY] 你的-OpenAI-API-Key国产大模型如通义千问、文心一言等通常也支持通过 LangChain 接入配置方式类似需参考对应模型的文档。四、LangChain 五大核心组件详解理解这些组件是使用 LangChain 的基础。1. Model模型封装了各类大模型主要分为两类LLM纯文本补全模型如 text-davinci-003输入文本输出文本。Chat Model对话模型如 gpt-3.5-turbo输入为消息列表System, Human, AI输出为 AI 消息。2. Prompt提示词通过PromptTemplate管理提示词支持变量插值和 Few-Shot 示例让提示工程变得规范且可复用。3. Chain链LangChain 的核心。将多个组件模型、提示词、工具等按顺序连接起来形成一个完整的工作流。最简单的链是LLMChain模型 提示词。4. Memory记忆让对话具备上下文能力。常见的 Memory 类型有ConversationBufferMemory保存所有历史对话、ConversationSummaryMemory总结历史对话以节省 Token等。5. Agent代理让 LLM 具备自主决策能力可以理解用户需求并动态选择调用合适的工具如搜索引擎、计算器、数据库来完成任务而不仅仅是生成文本。五、快速上手写一个 Hello World让我们用最简单的LLMChain来感受一下 LangChain 的威力。from langchain.llms import OpenAI from langchain.prompts import PromptTemplate from langchain.chains import LLMChain 1. 初始化模型 llm OpenAI(temperature0.9) # temperature 控制创造性 2. 创建提示词模板 prompt PromptTemplate( input_variables[product], template为一家生产 {product} 的公司起一个朗朗上口的名字。, ) 3. 创建链 chain LLMChain(llmllm, promptprompt) 4. 运行链 result chain.run(环保可降解咖啡杯) print(result) 可能的输出绿杯未来 (GreenCup Future) 或 大地之杯 (EarthCup)关键代码解读LLM封装了 OpenAI 的模型。PromptTemplate定义了一个带变量{product}的模板。LLMChain将模型和提示词组合成一个可执行单元。chain.run()传入变量值执行整个链得到模型输出。看我们只用了几行代码就完成了一个可定制化的文本生成任务六、实战项目搭建一个“智能文档问答助手”需求分析目标上传一个 PDF 或 TXT 文档AI 能够基于文档内容准确回答用户提出的问题。技术方案RAG 流程Document Loader加载本地文档。Text Splitter将长文档分割成适合处理的小块。Embeddings Vector Store将文本块转换为向量并存入向量数据库。RetrievalQA Chain用户提问时从向量库中检索相关文本块连同问题一起发送给 LLM 生成答案。完整代码实现含注释import os from langchain.document_loaders import PyPDFLoader from langchain.text_splitter import RecursiveCharacterTextSplitter from langchain.embeddings.openai import OpenAIEmbeddings from langchain.vectorstores import Chroma from langchain.chains import RetrievalQA from langchain.llms import OpenAI 设置 API Key os.environ[OPENAI_API_KEY] 你的-OpenAI-API-Key 1. 加载文档 loader PyPDFLoader(./your_document.pdf) # 替换为你的PDF路径 documents loader.load() 2. 分割文本 text_splitter RecursiveCharacterTextSplitter( chunk_size500, # 每个块的最大字符数 chunk_overlap50 # 块之间的重叠字符数保持上下文连贯 ) texts text_splitter.split_documents(documents) 3. 创建向量数据库 embeddings OpenAIEmbeddings() vectorstore Chroma.from_documents(texts, embeddings) 4. 创建检索式问答链 qa_chain RetrievalQA.from_chain_type( llmOpenAI(), chain_typestuff, # 将检索到的文档“塞”进提示词 retrievervectorstore.as_retriever() ) 5. 进行问答 while True: query input(\n请输入你的问题 (输入 quit 退出): ) if query.lower() quit: break answer qa_chain.run(query) print(f答案: {answer})效果演示运行上述代码程序会加载你的 PDF建立索引。之后你可以像与 ChatGPT 对话一样用自然语言提问关于文档内容的问题AI 会基于文档内容生成答案。此处可放置程序运行截图或 GIF展示加载文档和问答过程七、进阶拓展可选阅读使用国产大模型LangChain 支持多种模型后端。你可以轻松地将OpenAI()替换为ChatTongyi通义千问或ChatBaidu文心一言等。接入外部工具利用Agent让 LLM 调用搜索引擎、计算器或数据库查询完成更复杂的任务。使用 LangServe 部署为 API 服务将搭建好的 Chain 快速封装成 REST API方便集成到其他应用中。八、总结与展望回顾核心知识点LangChain 是一个模块化、可组合的 LLM 应用开发框架。五大核心组件Model, Prompt, Chain, Memory, Agent。通过Chain可以轻松组合复杂工作流。RAG检索增强生成是让 LLM 掌握私有知识的关键范式LangChain 提供了完整实现。LangChain 的适用场景与局限性适用场景构建聊天机器人、智能问答、文档分析、代码生成助手等需要与 LLM 深度交互的应用。局限性学习曲线存在对于极其简单的单次 API 调用可能显得“杀鸡用牛刀”版本更新较快需关注社区动态。推荐学习资源官方文档https://python.langchain.com/最权威GitHub 示例LangChain 官方仓库 有大量 Cookbook。中文社区关注相关技术博客和公众号获取本地化实践案例。常见问题 FAQQ: 运行时报错 “OpenAI API key not found”。A: 请检查是否正确设置了OPENAI_API_KEY环境变量。Q: 处理中文文档时效果不好。A: 尝试调整TextSplitter的分割策略如按句号、换行符分割或使用针对中文优化的嵌入模型。Q: Token 超限怎么办A: 调整chunk_size减小文本块大小或使用ConversationSummaryMemory来压缩历史对话。