MaxKB 网页抓取完整指南:把 Web 站点变成可直接问答的知识库 MaxKB 网页抓取完整指南把 Web 站点变成可直接问答的知识库【免费下载链接】MaxKB MaxKB is an open-source platform for building enterprise-grade agents. 强大易用的开源企业级智能体平台。项目地址: https://gitcode.com/GitHub_Trending/ma/MaxKB周四下午运营把产品帮助中心的链接甩进群里几十篇文档散落在站点各个角落要求下周一智能客服上线而且答案必须和网页保持同步。手工复制粘贴一遍是慢更麻烦的是网页改版后知识库里留的还是旧答案。这是MaxKB 网页抓取要解决的场景创建一个 Web 站点类型的知识库填入入口 URL系统自动完成抓取、正文提取、分段和向量化之后还能随时同步更新。功能定位MaxKB 网页抓取是什么它是 MaxKB 知识库模块内置的一种数据源方式。创建知识库时类型不只有通用上传文件还可以直接选Web 站点把网址当成文档来源。它适合这几类人客服与支持团队帮助中心、产品手册频繁更新需要答案和网页保持一致文档维护者不想把网页正文一页页复制进 Word 再上传技术团队博客、API 文档分散在多个页面希望统一入库检索相比手动录入它把访问网页、提取正文、建索引这件事交给后台系统你只需要维护入口 URL 和同步动作。 原理速览从 URL 到可检索知识整个过程按输入→处理→输出三步走你可以把它理解成派一个机器人替你翻网页、剪下正文、归档进图书馆。输入入口 URL 与 CSS 选择器创建 Web 知识库时必填一个入口地址source_url可选一个 selectorCSS 选择器。选择器决定机器人只剪哪一块内容比如正文容器从而排除导航栏和广告位。处理抓取、分段、向量化抓取任务由后台异步执行同一个知识库同时只跑一个同步任务。正文被切成若干段落每段经你指定的嵌入模型转成向量存入数据库同时建立关键词索引。段落就是后续检索的最小单元。输出段落 双路索引产出是一个个带状态等待、执行中、成功、失败的段落支持向量、关键词和混合三种检索模式应用里的问答直接基于这些段落作答。工作流配置界面展示多数据源含 Web 站点接入知识库的编排方式️ 实战演练把 Web 站点变成知识库按以下顺序操作全程在 Web 界面完成部署并登录用 Docker 一行命令拉起docker run -d --namemaxkb --restartalways -p 8080:8080 -v ~/.maxkb:/opt/maxkb 1panel/maxkb浏览器打开 8080 端口默认账号 admin、密码 MaxKB123..登录后记得修改密码。新建知识库进入知识库模块点击新建类型选择 Web 站点填写名称、描述并选择一个嵌入模型这是向量化的前提。填入口 URL输入站点入口地址如果只想要某个区块的内容再填 CSS 选择器。确认后开始抓取界面会显示导入进度。查看结果创建完成后能看到文档列表和段落数点开文档可以逐段查看抓取到的正文确认内容是否干净。补充更多页面在知识库里继续添加文档URL 支持批量填入系统会逐个抓取入库。命中测试用知识库自带的命中测试功能输入一句真实问题调整相似度阈值和检索模式向量、关键词、混合确认能召回正确段落后再上线应用。⚠️ 避坑指南新手高频的四个坑抓回来的段落很少或为空。原因多为页面内容靠 JavaScript 动态渲染或入口 URL 填错。先在浏览器里直接打开该 URL确认能看到正文再用选择器缩小抓取范围。正文里混着导航栏、广告、页脚。原因是没配置 CSS 选择器默认抓取整页。用浏览器审查工具找到正文容器的选择器填进 selector同步后内容会干净很多。同步之后原有文档没了。界面上有明确提示所有同步都会删除已有数据重新获取新数据。两种同步方式都会清数据替换同步是重新获取并覆盖本地文档整体同步是先清空再重新获取。同步前先确认网页端内容本身是最新的。把聊天页嵌到自己网站后被浏览器拦截。本地 HTTP 地址会被浏览器当成不安全源需要在浏览器中把该源标记为安全嵌入页即可正常加载。浏览器 flags 中把本地 HTTP 地址标记为安全源后嵌入的 MaxKB 页面即可正常加载⚙️ 深度玩法同步策略与模块组合选择同步方式替换同步适合网页改了、按页覆盖的场景整体同步适合站点结构大改、旧文档全部作废的场景可以理解成一次重建。选择器写多个selector 支持用空格分隔填写多个选择器可以一次圈定正文、侧栏补充说明等多个区域。组合工具回答混合问题网页知识解决产品怎么用数据库工具解决我现在这张单什么状态。把 MySQL、PostgreSQL 工具挂到同一个应用上一个问题里两种来源的答案都能出。转成工作流知识库现有知识库支持转换为工作流知识库用拖拽节点的方式自主编排数据源→处理→写入知识库的流程抓取与清洗规则完全自己定义适合有特殊处理需求的团队。把数据库工具与网页知识挂到同一个应用混合来源一起参与问答收尾下一步做什么环境还没搭好的话按 README 里的 Docker 命令部署即可想从源码层面了解抓取与同步的实现可以看 apps/knowledge/ 目录下的任务代码。建议先从一个静态文档页开始建库、填 URL、跑一遍命中测试确认召回质量后再把同步方式定成你需要的节奏。知识库和网页之间的时差就从这一步开始消失。【免费下载链接】MaxKB MaxKB is an open-source platform for building enterprise-grade agents. 强大易用的开源企业级智能体平台。项目地址: https://gitcode.com/GitHub_Trending/ma/MaxKB创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考