medical-research-skills代码实现原理:从R语言生存曲线脚本到litbase多命令文献系统的架构剖析 medical-research-skills代码实现原理从R语言生存曲线脚本到litbase多命令文献系统的架构剖析【免费下载链接】medical-research-skillsHundreds of agent skills for medical research, including protocol design, data analysis, evidence insights, and academic writing.项目地址: https://gitcode.com/gh_mirrors/me/medical-research-skillsmedical-research-skills 是一个面向医学研究的 AI 技能开源仓库收录了数百个 Agent Skill覆盖方案设计、数据分析、证据洞察与学术写作四大领域。本文以两类典型实现为例——R 语言 Kaplan-Meier 生存曲线脚本与litbase 多命令文献系统——剖析它们背后的代码实现原理与架构差异帮助新手理解一个 Agent Skill 到底是如何被设计出来的。一、项目全景一个技能长什么样仓库按研究领域组织成四大目录分类定位代表技能Data Analysis生物信息学统计脚本km-survival-curve、wgcna-analysisEvidence Insight文献检索与证据评估litbase、pubmed-search-specialistProtocol Design研究方案设计mendelian-randomization-protocol-designerAcademic Writing论文写作辅助introduction-section-writer每个技能都是自包含的文件夹标准解剖结构如下某技能/ ├── SKILL.md ← 技能说明书何时用、怎么跑、输出什么 ├── scripts/ ← 可执行脚本R / Python / Shell ├── references/ ← 方法学细节与排错文档 └── tests/ ← 内置样例数据开箱自测这种文档 脚本 测试数据三位一体的打包方式正是整个仓库最核心的设计约定。下文两个案例恰好代表了两种截然不同的架构路线。二、案例一km-survival-curve——确定性 R 脚本架构技能文档SKILL.md这是医学论文中最常见的图——Kaplan-Meier 生存曲线的自动化脚本。它的理念是所有逻辑都固化在 R 代码里AI 只负责按正确的参数调用它。2.1 四文件分工入口、工具、核心、编排脚本目录拆成职责单一的四个文件文件职责scripts/main.RCLI 入口用optparse声明 27 个命令行参数校验后交给分析函数scripts/utils.R基础设施带时间戳的日志、R 包依赖检查、布尔参数解析、数据读取自动区分 CSV 与制表符 TXTscripts/functions.R业务核心数据清洗、时间单位换算、p 值计算、KM 绘图scripts/run_analysis.R编排层把检查依赖 → 读数据 → 拟合模型 → 导出 PDF串成一条流水线这种分层让每个文件都能独立阅读和测试入口文件不到 150 行就完成了解析、校验、执行的全部职责。2.2 先验证、后计算的防御式数据管道functions.R 中的prepare_survival_input是整个脚本最值得学习的设计在拟合任何模型之前先做六道数据安检——列名是否存在时间列、状态列、分组列时间列是否为有限非负数值状态列是否严格编码为0删失/1事件缺失行剔除后样本量是否 ≥ 2分组列语义检查若列中近半数值都唯一、或全是数字且取值 5判定为连续风险评分而非分组变量直接拒绝——这恰好拦截了新手最常犯的错把连续评分列直接当分组时间单位启发式换算当max(time) 365且声明单位为年/月时自动把天换算成目标单位并打印醒目警告提醒人工复核。2.3 机器可读错误码 人类可读修复建议所有报错都遵循统一模式SKILL_INVALID_DATA: Risk group column x looks continuous... Fix: Use a precomputed categorical grouping column such as low/high.SKILL_FILE_NOT_FOUND、SKILL_INVALID_PARAMETER这类前缀错误码让 AI Agent 能程序化地判断该重试还是该问用户而Fix:后缀则让人类一眼看懂怎么改。这是为 Agent 而写的 CLI的典型特征。2.4 可复现性细节session_info.txt每次运行除输出km-plot.pdf外还会调用sessionInfo()把 R 版本与全部包版本落盘为session_info.txt。审稿人问这张图用什么环境画的时答案就在输出目录里——统计脚本的可复现性被当作了硬指标。配套的三个样例数据集tests/data/km_sample1.txt 等让技能自带冒烟测试能力。三、案例二litbase——Markdown 即程序的多命令文献系统技能文档README.md如果说 KM 脚本是代码为主、文档为辅litbase 恰好相反用 Markdown 文件编写程序AI 是解释器JSON 和 MD 文件充当数据库。它为生物医学研究者提供一条找文献 → 精读 → 讨论 → 汇总成研究基础文档RFD的完整流水线。3.1 八条斜杠命令组成研究流水线commands/目录下的八个命令文件各司其职命令场景作用/setup首次使用引导式填写研究画像生成记忆与搜索配置/feed每日调 Semantic Scholar 按研究方向推荐论文/read每篇生成论文分量 / 亮点 / 可迁移元素 / 如何用四段式结构化笔记/discuss深读按关键词定位笔记并自动记录讨论洞察/recap每周框架完整度地图 缺口分析/update转向时研究方向变更同步到记忆与搜索词/sync维护全库一致性审计 文献完整性扫描/propose立项阶段综合所有笔记产出 RFD直接喂给下游方案设计技能3.2 编排大脑CLAUDE.md整个系统的总装配图是 CLAUDE.md它定义了四条关键机制无硬编码路径一切路径都从config.json的data_dir派生脚本用os.path.dirname(__file__)自我定位——用户只需改一个文件即可搬家静默自动同步每分析完一篇论文系统会自动把新笔记登记进reading_list.md、把文件名追加进search_config.json滑动窗口上限 25 条、往MEMORY.md追加一行进度上限 20 行——无需用户逐条确认用窗口上限防止状态文件无限膨胀能力分级Tier A/B/C命令运行时先探测环境能力有无文件系统、能否跑 bash再降级适配同一个技能集同时支持本地终端、云端 Agent 和纯网页版对话文档同步规则改动任何命令文件后必须同步更新 README、CLAUDE.md、SKILL.md、WORKFLOW.md 四处文档——把文档漂移问题用规则固化下来。3.3 文件即数据库的状态设计litbase 没有传统数据库而是用三类文件承载状态config.json ← 唯一需用户手改的文件data_dir、API key search_config.json ← 动态搜索词由 AI 依阅读记录滚动维护 memory/MEMORY.md ← AI 持久记忆 阅读进度 notes/reading_list.md← 带 [x] 勾选状态的阅读清单这套JSON 存配置、MD 存人读状态的组合恰好利用了 Markdown 仓库的天然优势所有状态都可 diff、可回溯、可人工修改。3.4 反幻觉写进系统层的硬规则文献类工具最大的风险是 AI 编造文献。litbase 的解法是把 LITERATURE_HARD_RULES.md 作为系统级约束注入每一条命令永不虚构 PMID、DOI、被引量、影响因子、样本量来自模型记忆而非实时查询的信息必须标注[Unverified: ...]查不到就写[IF: unavailable]禁止估算/propose产出的每条引用必须能对应reading_list.md中已勾选的条目缺失处插入[GAP: ...]缺口标记/sync命令会对全部笔记做引用交叉核验把对不上的引用标记但不删除⚠️ UNVERIFIED CITATION。把诚实做成可审计的工程规则而不是口头提醒——这是该系统在架构层面最精彩的一笔。3.5 可选的 Python 加速层两个轻量 Python 脚本是可选加速器AI 检测到环境有 Python 时自动启用recommend.py按理论层三级搜索词批量检索 Semantic Scholar遇到 429 限速自动指数退避重试lookup_paper.py按 DOI 或标题查元数据并递归抓取前 5 位作者的 h-index 与机构。它们只用标准库urllib、json、argparse零依赖安装体现了脚本服务于 AI、而非替代 AI的定位。四、两种架构的对照确定性代码 vs Markdown 编排维度km-survival-curvelitbase主要实现R 脚本确定性计算Markdown 命令 JSON/MD 状态AI 的角色调用者填参数、读错误码解释器执行流程、维护状态状态管理无状态输出即结果文件即数据库滑动窗口防膨胀出错处理错误码 Fix 建议fail fast硬规则 /sync 事后审计适用场景数值确定、需可复现的统计计算流程灵活、需判断与生成的研究任务规律很清晰任务越依赖精确数值逻辑越往代码里沉任务越依赖知识判断流程越往 Markdown 里升。两者共享同一套打包规范SKILL.md scripts references tests与同一条底线可复现、可审计、不虚构。五、关键文件速查生存曲线技能总览SKILL.mdCLI 入口scripts/main.R数据验证与绘图核心scripts/functions.Rlitbase 编排大脑CLAUDE.md文献完整性硬规则LITERATURE_HARD_RULES.md命令文件目录commands/质量审计规范skill-auditor/SKILL.md六、获取与上手git clone https://gitcode.com/gh_mirrors/me/medical-research-skills拿到仓库后新手建议按两条路线入门先跑通 km-survival-curve 的内置样例tests/data/km_sample1.txt理解确定性脚本的验证—计算—落盘三段式再打开 litbase 目录通读 CLAUDE.md 与 LITERATURE_HARD_RULES.md体会Markdown 即程序的编排哲学。两种范式各取所长正是这个仓库能覆盖从生存曲线到立项书全流程的根本原因。【免费下载链接】medical-research-skillsHundreds of agent skills for medical research, including protocol design, data analysis, evidence insights, and academic writing.项目地址: https://gitcode.com/gh_mirrors/me/medical-research-skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考