AI-Researcher 论文影响力挖掘:Step 1 引文模式分析(Citation Pattern Analysis)指令深度解读 人工智能大模型AI Agent自主智能体深度研究Agent 工作流科研AI 评测【免费下载链接】AI-Researcher[NeurIPS2025] AI-Researcher: Autonomous Scientific Innovation -- A production-ready version: https://novix.science/chat项目地址https://gitcode.com/GitHub_Trending/aire/AI-Researcher点击查看免费下载本文围绕 AI-Researcher 创新图谱Innovation Graph构建流水线中的Step 1引文模式分析Citation Pattern Analysis指令展开讲解该指令如何引导大语言模型LLM从一篇论文的参考文献中构建引文统计地图并阐明其在整个五步创新图谱流水线中的定位、JSON 输出契约与源码级调用链。读完本文你将掌握该指令的字段语义、与 Step 25 的衔接关系以及如何在1_create_inno_graph.py中实际驱动这一分析步骤。一、Step 1 指令在流水线中的定位AI-Researcher 的 benchmark 构建脚本 1_create_inno_graph.py 负责将一批论文加工成创新图谱数据集。在load_instructions()中脚本一次性加载了 8 份指令文件其中 5 份构成核心分析链指令文件步骤核心任务create_innovation_graph_instruction_overall.md全局按三类标准识别最有影响力的参考文献create_innovation_graph_instruction_step1.mdStep 1引文模式分析统计地图create_innovation_graph_instruction_step2.mdStep 2上下文分析影响力指标create_innovation_graph_instruction_step3.mdStep 3证据收集借用与改进create_innovation_graph_instruction_step4.mdStep 4影响力度量加权打分create_innovation_graph_instruction_step5.mdStep 5最终筛选Top 15–25 排序Step 1 是整个链条的第一环其产出直接喂给 Step 2 做上下文分析results作为previous_results传入后续步骤。从源码看process_step在拼接提示词时会把前序步骤的 JSON 结果追加到当前提示词末尾if previous_results and step_num 1: prev_results_str json.dumps(previous_results, indent2) prompt f\n\nResults from previous steps:\n{prev_results_str}因此 Step 1 的citation_map质量决定了后续所有步骤的分析基底。二、全局指令三类影响力判据Overall Instruction在进入 Step 1 之前LLM 首先收到 overall 指令它定义了贯穿全流程的影响力判定框架方法论奠基Methodological Foundation提供核心方法的论文关键组件Critical Components其具体技术被整合进新模型的论文概念启发Conceptual Inspiration塑造研究方向的论文。这三类判据在 Step 3 的evidence.type字段foundation/component/inspiration和 Step 5 的top_papers.type字段methodological/component/conceptual中被显式落地Step 1 的统计结果则为其提供候选池。三、Step 1 任务分解四类统计动作Step 1 指令 的核心是为论文中的引用创建统计地图statistical map共包含四项动作统计引用频率Count citation frequency对每篇被引论文统计其在全文被引用的次数这是后续 Step 4 中frequency权重 30%的直接数据来源追踪引用位置Track citation locations记录引用出现在哪些章节如 Introduction、Methodology、Experiments对应 Step 4 中location权重 25%的判定依据——出现在方法章节的引用通常比出现在引言中的引用更具影响力标注跨章节引用Note cross-section citations识别同一篇论文被多个章节引用的情况这通常是该文献具备全局影响力的信号也是区分奠基性工作与一次性引用文献的关键列出至少 15 篇最高频被引论文List at least 15 most frequently cited papers为 Step 5 的Top 15–25 最终筛选提供最小候选集下限保证最终图谱的节点规模。四、输出契约citation_map JSON 结构Step 1 要求 LLM 严格按如下 JSON Schema 输出{ citation_map: [ { reference: the exact paper title in references, count: number, sections: [section names], quotes: [citation contexts] } ] }各字段语义与下游用途字段类型说明下游消费referencestring参考文献中的精确论文标题非编号这是整条流水线的主键Step 2/3/4/5 均以reference对齐各篇论文并在最终输出中作为source_papers[].reference持久化countnumber该论文在全文中的被引次数Step 4 的frequency打分占比 30%sectionsstring[]引用出现的章节名列表Step 4 的location打分占比 25%quotesstring[]引用上下文原文片段Step 2 的indicators/quotes、Step 3 的evidence均以此为原始证据要求reference必须使用references 中的精确论文标题这与脚本中的filter_self_references()逻辑直接相关——该函数通过source[reference].lower().strip() target_title.lower().strip()精确匹配来剔除论文对自身的引用self-reference标题不精确将导致自引无法被正确识别。五、源码级调用链指令如何被实际执行在 process_step 中Step 1 的执行流程如下组装提示词overall_instruction step_instruction Paper Metadata(JSON) Paper Content(pdf_text)并通过truncate_text(prompt, max_tokens128000)控制输入长度注入系统提示告知 LLM 它是论文分析专家、当前执行 Step 1、必须按指令规定的 JSON 格式输出调用 LLMclient.chat(prompt, temperature0.7)温度设为 0.7 以在结构化输出与多样性之间取得平衡响应清洗剥离json/围栏后执行json.loads(response)解析失败则该步骤返回None失败重试外层for attempt in range(max_retries)默认 3 次对每次解析失败或异常进行退避重试(attempt 1) * 5秒等待。每篇论文的完整 LLM 交互Prompt Response会通过log_output()写入innovation_graph/logs/llm_output_*.log便于事后审计与复现。Step 1 成功后结果存入results[step1]随后立即执行await asyncio.sleep(5)做限流再进入 Step 2。六、与后续步骤的衔接从统计到排序理解 Step 1 的价值必须放到五步链条中看Step 2Context Analysis接收citation_map对高频论文分析其讨论语境提取based on / extends等影响力指示短语并判定讨论深度detailed/moderate/brief与是否属于方法论引用is_methodStep 3Evidence Collection针对显著引用识别借用概念borrowed、改进方式changes、佐证引文evidence及影响类型Step 4Impact Scoring按四维权重打分frequency 30%、location 25%、depth 25%、influence 20%Step 5Final Selection依据总分排序选出 Top 15–25 篇最具影响力论文作为该目标论文的source_papers写入创新图谱。以仓库实际产物 innovation_graph.json 为例HGCL 论文的source_papers中Sequential recommendation with graph neural networks 以type: [methodological]排第 1 位usage字段明确写道其 GNN 概念是 HGCL 的方法论主干——这正是从 Step 1 的引用频率统计出发经 Step 25 层层筛选后沉淀出的结构化结论。七、使用前提与注意事项运行环境需要全局配置 OpenAI API Key或修改 utils/openai_utils.py执行顺序为先准备papers_to_search文件 → 运行python 0_crawl_paper.py采集论文 → 运行python 1_create_inno_graph.py生成图谱自引过滤最终数据集 innovation_graph_final.json 经过filter_self_references()剔除自引统计信息写入日志评测使用的 merged_papers_with_fields.json 还经过额外人工修订输出契约的严格性Step 1 要求reference精确匹配参考文献标题后续所有步骤的论文对齐与自引剔除都依赖这一约束实践时应提示模型禁用文献编号代替标题。综上所述Step 1 引文模式分析并非简单的数引用次数而是为整条创新图谱流水线建立数据主键、频次基线与证据池的关键起点。开发者可直接复用该指令文件、按上述 JSON 契约自行构建论文影响力分析也可结合1_create_inno_graph.py的调用逻辑将其接入自己的批量论文分析流程。赞分享人工智能大模型AI Agent自主智能体深度研究Agent 工作流科研AI 评测【免费下载链接】AI-Researcher[NeurIPS2025] AI-Researcher: Autonomous Scientific Innovation -- A production-ready version: https://novix.science/chat项目地址https://gitcode.com/GitHub_Trending/aire/AI-Researcher点击查看免费下载相关推荐AI-Researcher 创新图构建实战五步 LLM 指令流水线挖掘论文影响力并生成基准数据集AI Researcher 创新图构建实战五步 LLM 指令流水线挖掘论文影响力并生成基准数据集 导读 本文深入剖析 AI Researcher 开源仓库中人工智能大模型AI Agent自主智能体深度研究Agent 工作流科研AI 评测Wekan 数据持久化架构升级实战泳道高度与列表宽度的 Per-Board/Per-User 分离方案Wekan 数据持久化架构升级实战泳道高度与列表宽度的 Per Board/Per User 分离方案 本文是一份围绕 Wekan基于 Meteor 的开源人工智能大模型AI Agent自主智能体深度研究Agent 工作流科研AI 评测Tegon自定义视图终极指南如何创建完美适配团队需求的工作面板Tegon自定义视图终极指南如何创建完美适配团队需求的工作面板 Tegon是一款面向开发者的开源问题跟踪工具作为Jira和Linear的替代品它提供了强大上一篇Nexus Trust Exchange面向 AI Agent 的去中心化信任交换层设计与实现解析下一篇CANN AMCT 结构化剪枝实战指南从 MiniMLP 到 Qwen3.6-35B-A3B 的 MoE 专家剪枝与恢复微调创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考