
1. 写在前面我为什么折腾一套OpenResearch体系大概在两年多以前我被一件事折磨得够呛——手头同时推进着三四个研究主题浏览器标签页开了一百多个微信收藏夹里躺着各种截图桌面文件夹里堆着一堆最终版_v7.docx。等到真要用某个资料的时候要么花上半天时间翻找要么干脆忘了自己看过什么。更让我崩溃的是有些东西我明明读过、摘录过到了写作要引用的时候却找不到原出处到底在哪里。后来我下定决心用开放研究的思路重建自己的工作流。OpenResearch在我这里并不是某一个现成软件而是一套组合方案用开源工具把收集—整理—输出—复盘这一整条研究链路彻底打通让每一条资料都进入一个可检索、可追溯、可复用的知识网络。这套体系解决的核心问题有三个信息过载带来的失忆感、动笔时没有米下锅的困窘感、以及研究过程不可回溯造成的重复劳动。这个体系适合谁我的判断是长期追踪某一个领域的技术研究者、产品经理、咨询顾问、创业者以及所有需要持续吸收信息并产出判断的知识工作者。如果你每天都要读大量文章、做大量笔记却总觉得看了就忘、存了不用那这套思路大概率能帮上忙。我不会只讲空洞的理念而是会把我实际用到的工具链、目录结构、命名规范、脚本和踩坑记录全盘托出你可以直接拿去参考再根据自己的习惯调整。2. OpenResearch的核心思路四个关键设计动工之前我先想明白了一个问题一个知识工作者的研究过程最缺的到底是什么答案不是资料而是秩序。资料永远搜不完真正稀缺的是把资料沉淀成自己判断力的能力。围绕这个结论我做几个关键设计。2.1 为什么强调开放开放这个词很多人第一反应是公开免费。但在我的体系里它更接近于不锁死——资料格式不锁死、工具不被单一厂商锁死、研究过程不锁死在自己的脑子里。市面上很多笔记软件进去容易出来难。数据封闭在一个私有格式里一旦厂商调整策略或者停止维护你想换工具就跟搬家一样痛苦。我见过太多人用了五六年某个云笔记突然某天被限制设备数几千条笔记导出格式七零八落。所以我选择了全链路使用开放、基于纯文本的格式。Markdown作为笔记的主体格式PDF和文献元数据交给Zotero版本管理交给Git。这四者没有一个由商业公司垄断都是开放标准或者开源软件。数据始终在我自己手里哪天想换工具复制粘贴就能走。2.2 输入、处理、输出的闭环研究本质上是一个循环疑问→假设→收集证据→形成判断→输出→产生新疑问。但我观察到的普遍现象是大部分人做研究是输入型的——只收集不输出。这就导致知识是死的存在那里永远只是别人的观点。我把输出作为整个闭环里最关键的一环。这里的输出不是指某种宏大的成果而是最朴素的一句话每读一篇文章都要用自己的话写几句札记。这个动作在认知科学里叫精加工本质是强制大脑对新信息做编码。没有这个过程读过的东西就是过眼云烟。所以我在整理任何资料时都会逼自己补一段我的判断哪怕只有一百字。2.3 单一事实来源研究过程中同一份信息往往存在多个副本PDF、网页截图、微信收藏、某个笔记软件里的摘录……副本一多麻烦就来了。引用的时候不知道该信哪一份更新的时候不知道要在几个地方同步时间一长哪份是准的完全要靠记忆。我给自己定的铁律是所有核心资料只存一份位置唯一其他地方只允许出现链接或者索引。具体来说原始PDF和文献条目放Zotero由Zotero统一管理文件存储我在Obsidian里写的所有摘录和思考通过插件指向Zotero里的条目而不是把PDF塞进Obsidian库。这样一来每个信息只有一个家找起来零混乱。2.4 可追溯、可复现这是整个体系里我最看重也最容易被忽略的一点。写文章的时候凡是引用的数据、结论、观点我必须能一键追溯到原始出处。这个能力听起来简单但绝大多数人做不到——因为平时根本没有记录这条信息是从哪来的这个习惯。我的方案是双管齐下。第一每一条笔记都必须有来源字段写明URL、书名、DOI不写来源就不许入库。第二凡是转载、翻译外部文章的笔记必须在开头标注原始作者和发布日期。这两条规矩看起来繁琐一旦养成习惯写作和查证都会变得非常轻松。3. 研究流程的五个关键环节从问题到输出理论上讲得再好落地还是得靠流程。我把自己过去一年多的实操路径拆成五个环节每个环节环环相扣。3.1 选题把模糊兴趣变成可研究的问题研究的起点几乎都是某种模糊的好奇最近Agent好像很火这个系统的性能为什么上不去。这种模糊的兴趣如果不加约束很快就会被信息洪流冲散。我的做法是在启动任何研究之前先用一段话写清楚三件事我想解决什么问题、目前我知道什么、我还缺哪类信息。这个动作花不了十分钟但效果极其明显。它相当于给后续的收集活动画了一个靶子看到文章的时候能快速判断这跟我当前研究有没有关系。没有靶子阅读就是被动的效率极低。我自己最开始跳过这一步结果收集了十几篇文章后发现方向完全跑偏只好全部作废重来。3.2 收集建立统一的待处理入口很多人收集资料时有一个致命习惯看到一篇好文章立刻停下来细读然后花二十分钟把它整理得漂漂亮亮。这种即时整理的认知负担太高了坚持不了几天就会放弃。我的方案是统一入口进箱再说。所有渠道的信息——浏览器里的网页、微信公众号里的推送、邮箱里的PDF报告、读书时的划线——先丢进一个收集箱Inbox不做分类、不做整理。任何一条信息的入箱操作都不超过十秒浏览器一键剪藏公众号链接转发到文件传输助手PDF直接拖进Zotero的待读文件夹。这个设计的核心逻辑是降低收集阻力。如果入箱的成本太高人就会倾向于先放着吧等会儿弄然后就没有然后了。反而是这种无脑往里扔的方式能让收集习惯长期坚持下来。3.3 整理定期批量处理而不是实时零散整理收集箱里的内容不能永远堆着。我给自己安排了固定的整理时间每周至少一次通常放在周五下午。整理不是重新阅读而是做四件事快速扫一遍内容、划出关键信息、用三句话写摘要、决定是否入库以及入库后归属哪个主题。重要的标准只有一个我将来会不会再次引用它。不会的东西果断删掉或者留在原处不占知识库的空间。整理的时候我遵循两分钟法则能在两分钟内处理的条目当场处理完需要深度读的打上待精读标签留在箱里已经过时的直接归档。这样每周的整理时间能控制在四十五分钟以内不会变成负担。3.4 输出写笔记就是写作的草稿我所有的文章最终都不是坐在电脑前从零开始写的而是从知识库里的卡片笔记拼出来的。我在整理环节做完摘要之后会额外写一个我的观点字段强制输出一段独立的判断。这个动作本质上就是在做写作训练每篇笔记都像一个乐高积木块单独看不大但积少成多之后可以拼出各种形状的文章。为了让这个拼接过程更顺畅我在建笔记时尽量做到原子化一张笔记只讲一个主题只回答一个问题。过深的内容单独拆成多张笔记然后用双链连接。这样做的好处是到写季度总结或者研究报告时用Dataview一查所有散落在各处的素材会自动汇集到列表里我只需要调整顺序、补充过渡一篇文章的初稿就出来了。3.5 复盘让知识库长出新的研究问题研究不会因为一篇文章写完了就结束它更像是从一棵树上长出新枝。我每个月会做一次知识库体检看看这一个月新增了哪些笔记、哪些主题下的笔记密度最高、哪条笔记的引用链最深。这些东西就是我的研究雷达——它告诉我真正的兴趣焦点在哪里。实际操作中我在Obsidian里建了一个月度回顾笔记用Dataview自动统计当月新增笔记数量和信息来源分布。统计本身很简单真正值钱的是统计后的那个问题为什么这个主题积累了这么多素材这个主题接下来还能怎么深入顺着这个问题下一轮研究会自然冒出来整个过程不需要意志力硬撑。4. 实操用开源工具搭建一套可落地的OpenResearch工作台理念讲完了接下来是真正可以抄作业的部分。我的工作台由四样东西组成Markdown做统一格式Git做版本管理Zotero做文献管理Obsidian做知识网络编辑。下面逐个说明选型和配置要点。4.1 工具选型为什么偏偏是它们先回答一个很自然的问题市面上笔记软件那么多为什么要用这么一套组合我的答案很简单这套组合的每一个部件都不可取代但组合起来又不绑定。Markdown是我所有笔记的唯一格式。它本质上就是带排版的纯文本没有厂商锁死问题任何一个文本编辑器都能打开十年后绝不会因为某个软件停止服务而无法阅读。很多云笔记软件导出格式混乱说白了就是想把用户留在生态里我可不想被这种机制绑住。Git是版本控制工具很多人写代码才用Git我用来管知识库。好处是每一次修改都有记录哪天手滑删了几百字一条revert命令全部找回。更关键的是它天然支持多机同步和多人协作配合Gitea的私有仓库我的知识库在任何设备上都保持同一个状态。Zotero在我这里负责所有文献类资料论文、报告、专业书籍。它是开源软件文献元数据管理能力非常强还支持插件扩展。我用一个Better BibTeX插件把文献导出为引用键这样在笔记里写[doe2024]就能直接生成规范引用比手动打书名号和作者名高效太多。Obsidian是笔记的编辑界面和知识网络层。它读取本地文件夹里的Markdown文件不把数据锁进自己的数据库所以它倒了文件还在。双向链接、标签、Dataview插件让知识库具备网络效应——笔记之间可以互相引用还能用类SQL语法做动态查询。这一层所有工具里Obsidian是我最不担心被绑架的一个因为它本质上是没有数据库的笔记软件。4.2 目录结构与命名规范搭这套体系的第一件事就是定目录结构。我参考了PARA方法论并针对研究场景做了调整Research/ # 知识库根目录 ├── 00-Inbox/ # 收集箱所有新资料先进这里 ├── 01-Projects/ # 进行中的研究项目每个项目一个子目录 ├── 02-Areas/ # 长期负责的领域例如AI Infra ├── 03-Resources/ # 按主题沉淀的资源库 ├── 04-Archive/ # 已完结项目的归档区 ├── 90-Meta/ # 笔记模板、流程文档、月报总结 └── 95-Scripts/ # 自动化脚本比如快速剪藏脚本这套结构的原则是流程分家进行中的活在01、02里沉淀的知识在03里做完的在04里支撑体系本身的东西在90、95里。好处是分区清晰不互相污染备份和清理都有明确的对象。命名规范同样重要我统一采用日期-关键词的格式比如20250112-AI-Agent-综述.md。日期前置最大的好处是文件夹里自动按时间排序一眼就能看出哪条笔记更新关键词负责语义让人不看内容也能猜到七八分。另外我规定文件名里绝对不能出现空格和特殊符号因为Git和命令行工具对此非常敏感。4.3 Zotero文献管理配置要点Zotero的安装没什么好说的关键是这三个配置点存储路径、引用插件、同步方案。第一个是存储路径。Zotero默认会往C盘塞PDF附件我第一时间把它改到知识库外的独立数据盘并开启附件自动重命名功能。否则时间一长PDF文件名要么是乱码要么是重复找起来心累。第二个是插件。我装了三个必装插件Better BibTeX、Zotfile、Zotero Integration。Better BibTeX负责生成稳定的引用键格式我设置成作者-年份-标题首词例如doe2024agentZotfile负责把PDF里的批注自动提取成独立的Markdown笔记这功能极大减轻了手动摘录的负担Zotero Integration负责让Obsidian和Zotero互通在笔记里输入关键字就会弹出匹配的文献条目。第三个是同步。我的做法是Zotero的WebDAV免费空间用于元数据同步附件储存在本地并纳入定期备份。重要文献绝不只存在于云端万一云端账号出问题本地文件还在。这是我踩过坑之后的血泪教训之前论文PDF只放在了Zotero云同步里某次同步冲突把一批文件搞坏了重新找原文件花了整整两天。4.4 Obsidian笔记流转与双链设计Obsidian的安装是零成本的难的是怎么用它来承载研究流。我的建议是分三步走。第一步只启用核心功能文件夹、标签、双链。不要装一堆花哨插件先用起来。第二步逐步引入Templater模板组件把每一类笔记的固定结构来源、日期、状态、我的观点沉淀为模板新建笔记时一键套用。第三步上Dataview把手动维护清单变成自动生成动态视图。双链的使用有个容易忽略的细节不要为了链接而链接。双链的语义应该是这两张笔记之间存在逻辑关系比如一张是另一张的上位概念、一张是另一张的例证。我在每张笔记底部固定有一个相关笔记区域手动维护有真正引用价值的链接。这样三个月后回头查整棵知识树是清楚的长出来的不是乱编的网络。下面是我在Inbox笔记里用的一个Dataview片段用于自动列出所有还没处理完的收集条目TABLE 来源, 收集时间 FROM 00-Inbox WHERE 状态 ! 已完成 SORT 收集时间 DESC LIMIT 20这个查询放在一个固定的收件箱总览.md里每次打开库第一眼就知道还有几条没消化。不用记任何命令筛选逻辑全部交给查询语句压力瞬间少很多。4.5 用脚本打通收集与整理工具链最大的痛点是割裂浏览器里看到一篇好文章得手动复制、改格式、存文件。我写了一个小脚本把那套重复劳动压缩到一条命令。#!/bin/bash # quick-save.sh — 快速将网页剪藏转成 Markdown 并放入收集箱 # 用法: ./quick-save.sh 标题 文章URL /path/to/content.markdown TITLE$1 URL$2 CONTENT_FILE$3 DATE$(date %Y%m%d) FILENAME$DATE-$TITLE.md # 拼装 frontmatter 与正文 cat $FILENAME EOF --- 标题: $TITLE 来源: $URL 收集时间: $(date %Y-%m-%d) 状态: 待整理 --- $(cat $CONTENT_FILE) EOF # 移入收集箱 mv $FILENAME $HOME/Research/00-Inbox/ echo 已存入 Inbox: $FILENAME使用的时候我用浏览器插件把网页完整转成Markdown存到本地临时目录然后执行一行命令五分钟前还在网页上的内容现在已经在自己的知识库收集箱里了。脚本本身不复杂但它把收集动作从五步压缩到一步这就是坚持下来的关键。4.6 一篇调研笔记的完整生命周期演示理论多抽象不如走一遍完整案例。假设我想调研2025年开源AI Agent框架的现状整个过程是这样的。第一天我把选题拆成三个子问题主流框架有哪些、它们的核心架构区别是什么、社区活跃度如何。然后我把这三个子问题写进01-Projects/AI-Agent-调研/调研计划.md给每个子问题标注了预期的信息来源类型。接下来的两周我所有看到的相关文章都进了00-Inbox。有些是公众号推文我转发到文件传输助手后定期统一拖到电脑上处理有些是arXiv论文直接进Zotero有些是技术博客页面用上面那个脚本一键剪藏。周末整理时我先处理Inbox里的10篇网页剪藏扫一遍留下6篇有独特视角或关键数据的其余归档。6篇各写一张卡片笔记每张都包含核心观点、方法、来源及我的判断。论文部分我用Zotero Integration插件把三篇关键论文的关键段落摘录进Obsidian每段摘录后附上我的引申思考。一个月后写调研报告时我在Obsidian里用Dataview查来源路径含AI-Agent的笔记十几条笔记自动列出来。我按子问题把它们重新排列补充开头和过渡段两天后报告初稿完成。整个过程我没有刻意去找素材它们早就躺在知识库里等着被调用。5. 常见问题与排查技巧实录这套体系我用了两年多踩过的坑不比任何人少。我挑四个最典型的写在这里给你当备查手册。5.1 收集速度快整理速度却跟不上Inbox爆了怎么办Inbox堆积是几乎每个使用者都会经历的崩溃时刻。我的解决方案是设定清箱阈值Inbox里的待处理条目超过30条就强制停止收集只做整理。另外我给每一类来源设置不同的处理优先级论文和报告优先处理深度文章次之新闻资讯类果断丢弃。最反直觉的经验是不要追求每条都读完。整理不是阅读理解是筛选判断。扫一眼标题和摘要能判断这跟我研究方向无关这条就可以归档了。很多人Inbox爆掉是因为读得太认真把整理环节做成了精读环节。5.2 笔记越积越多检索效率反而下降从第500张笔记开始很多人会明显觉得以前搜索一下就能找到的东西现在搜不到了。原因不外乎两个命名不规范关键词覆盖不到标签体系膨胀每个标签下都有几百条笔记。我的对策是双管齐下。第一把命名规则坚持到底文件名即检索入口宁可多写几个关键词也不要偷懒。第二标签体系采用领域主题类型三层结构比如AI/Agent/综述项目管理/方法论/流程每层数量控制在20个以内。超过20个就要合并否则标签就失去筛选意义。定期用Dataview统计标签使用频次会发现哪些标签是僵尸标签该合并的合并该删的删。5.3 工具链总在某个环节断掉最常见的情况是PDF批注提取到一半乱码网页剪藏后格式烂得没法看Git同步冲突导致文件损坏。这些问题不是偶发而是必然。我的经验是降低环节耦合度。PDF乱码主要是因为扫描版PDF没有文字层解法是识别后用OCR工具处理或者干脆放弃依赖自动提取手动做摘录。网页剪藏格式乱解法是设置剪藏工具的CSS选择器只保留正文区域去掉导航、评论、广告等干扰模块。Git同步冲突解法是一台设备在本地改完再推到远端另一台设备先拉取再改不需要学什么高深技巧把这个操作顺序养成习惯冲突就能减少九成。5.4 多人协作或公开分享时如何保护敏感信息OpenResearch未必一定是私人的有时需要和团队成员共享知识库或者把部分内容公开发布。这时候最需要注意的不是功能配置而是敏感信息边界。我的铁律是个人敏感信息身份证号、银行账号、密码、家庭住址绝对不进入知识库即使Gitea仓库是私有的也不行因为一旦同步出错或者账号被盗后果相当严重。团队共享时需要写清楚哪些目录可以公开哪些是私密项目。我在Zotero里同样的原则适用涉密或未公开的文献不要和公开论文混在同一个账户里单独建一个本地专属文献库。6. 写在最后这套体系真正改变我的地方两年用下来我最直观的感受不是效率变高了而是焦虑变少了。以前信息过载会让我有种深深的无力感——觉得世界那么大、内容那么多自己永远追不上。现在这种焦虑消失了因为我知道每一条读过的内容都安放在该在的位置需要用的时候它们会排着队等我取用。最后分享一个不常被提到的小技巧定期给知识库做体检不是看笔记数量而是找断链——那些建了笔记但始终没有跟任何其他笔记产生关联的孤独节点。它们往往是最该去深入挖掘的研究线索也可能是你已经放弃的伪需求。我每次月检都会从断链里挑一个主题深耕一周效果远超漫无目的地刷文章。OpenResearch这套体系不是终点它更像一个活的工程今天读书的方式变了、工具体验变了、研究的方向变了体系就得跟着调整。但那个内核——让信息流通、让判断生长、让知识可复现——是永远不会过时的。希望这篇分享能让你少走几步弯路早点把读过的内容变成自己的判断。