
AI-Scientist 自动生成科研论文一条命令走完从想法到投稿的全过程【免费下载链接】AI-ScientistThe AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery 项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Scientist写一次完整的小实验研究你通常需要花几个小时想选题、查文献确认没做过、跑实验、画曲线、写 LaTeX、再自己扮演审稿人挑毛病。AI-Scientist 把这条链路接进了同一条命令给定一个研究方向模板它会自己生成想法、判断新意、修改实验代码、跑 GPU 实验、写出带图表的 PDF 论文最后再让模型模拟审稿人打分。读完全文你能够在一台有 NVIDIA 显卡的机器上配好环境跑通 AI-Scientist 的最小流程并为自己的研究方向选对模板。用 nanoGPT_lite 模板跑通第一条 AI-Scientist 命令先看到结果再理解流程。整个上手路径分四步装环境、备数据、跑基线、启动。git clone https://gitcode.com/GitHub_Trending/ai/AI-Scientist cd AI-Scientist conda activate ai_scientist pip install -r requirements.txt环境装好后进入数据准备依次运行 data/enwik8/prepare.py、data/shakespeare_char/prepare.py、data/text8/prepare.py 三个脚本。这一步帮你省掉的是后续报文件不存在的排查时间——启动脚本会直接读基线结果缺了任何一步都会在开头就中断。然后建立基线cd templates/nanoGPT_lite python experiment.py --out_dir run_0 python plot.py。基线结果存在 run_0 目录里论文中所有比 baseline 提升多少的论断都依赖它。这一步通常分钟级且必须在你自己的机器上跑——论文里的运行时间对比和硬件绑定换台机器数字就不成立了。最后启动主流程核心一行命令是python launch_scientist.py --model gpt-4o-2024-05-13 --experiment nanoGPT_lite --num-ideas 2把--num-ideas设成 2 而不是默认的 50是为了先花最小成本验证整条链路。命令跑起来后所有过程日志会写进results/nanoGPT_lite/时间戳_想法名/下的 log.txt你不用守在终端前。按使用场景拆解 AI-Scientist 的核心能力四个典型任务对应四组功能每个功能都会告诉你它替你省掉哪一段工作。多想法批量实验用 --parallel 参数把想法排进 GPU 队列你的任务是一次性验证一批想法而不是单个实验。给主命令加上--parallel参数并指定进程数AI-Scientist 会把想法队列分发给多个 GPU 进程轮流取任务每个想法独立建一个结果文件夹、独立失败互不影响。你得到的是results/下一组并行的完整实验记录等待时间从逐个串行变成按 GPU 数摊薄同时省掉了自己写多进程调度、隔离 CUDA_VISIBLE_DEVICES 的全部代码。从零产出 LaTeX 论文writeup 环节自动编译出 PDF你的任务是需要一份能直接投出去格式的论文而不是一堆实验笔记。实验成功后写稿环节会基于模板里的 template.tex 填入摘要、方法、图表和引用并自动调用 pdflatex 编译最终在结果文件夹里生成一份以想法命名的 PDF。你省掉的是搭 LaTeX 工程、手插图、逐条补 bib 引文的重复劳动得到一份格式统一、图表已嵌入的投稿稿。自动审稿内置 review 环节给出评分与接收结论你的任务是在投稿前自己挑毛病。每个想法的 PDF 生成后会自动进入审稿环节输出一个结构化 JSON含总体分1-10、各项评分、Weaknesses 列表和 Accept/Reject 结论保存在结果文件夹的 review.txt 里。你不用自己模拟审稿人读三遍论文直接拿到一份可对照修改的批评清单。项目还附带了批量审稿能力review_iclr_bench/iclr_analysis.py 可对已有论文批量跑同样的评审流程适合你攒了一摞论文想统一过筛的场景。换研究方向选对模板就是换掉实验域你的任务是不想被锁定在语言模型上。--experiment参数决定研究方向nanoGPT 系列做字符级语言模型grokking 研究泛化与学习速度templates/grokking/experiment.py 只需额外装 einops2d_diffusion 研究低维数据集上的扩散生成需要先安装 NPEET 依赖。社区还贡献了 seir 传染病建模、sketch_rnn 草图生成、earthquake-prediction 等模板直接放在 templates/ 目录下结构与官方模板一致。选模板时看两点依赖是否好装、你的想法能否落成可运行的代码。效率对照手工流程 vs AI-Scientist环节手工方式AI-Scientist产生想法读论文 头脑风暴半天级一条命令批量生成含新颖性过滤改代码跑实验手动改 experiment.py、盯 GPU小时级自动编辑代码并迭代运行日志落盘画实验图表手调 matplotlib分钟到小时级plot.py 自动出图并入论文撰写 LaTeX搭模板、插图、补引用半天级自动填充 template.tex 并编译 PDF模拟审稿自己读三遍挑问题review.txt 直接给评分与 Reject 理由常见坑与替代方案 三个高频问题按现象 → 原因 → 处理处理。现象启动后立即报缺少 run_0 或 final_info.json。原因跳过了基线步骤或只在一个模板里跑了 run_0却启动了另一个模板。处理每个要用的模板都单独执行一次python experiment.py --out_dir run_0再启动主流程。现象实验和想法都成功了最后没有 PDF。原因writeup 环节需要 pdflatex 和 chktex缺了 texlive-full 时编译失败。处理安装sudo apt-get install texlive-full安装很慢安装过程可能需要你按住回车推进装完重跑。现象想法新颖性检查卡住或报错。原因默认的 Semantic Scholar 接口无 key 时吞吐有限访问不畅。处理没有 key 就加--engine openalex换用免 key 的 OpenAlex 接口或加--skip-novelty-check跳过该阶段——代价是论文里引用文献的质量和数量会下降。回顾与下一步跑通路径就四步装依赖、备数据、出 run_0 基线、一条 launch_scientist.py 命令启动按任务选功能批量实验用--parallel要投稿稿等 writeup 出 PDF想挑毛病看 review.txt换方向改--experiment先跑 2 个想法验证链路单想法 API 成本量级在十几美元以内跑通后再放大规模系统目前只覆盖能写成代码的想法下一步演进大概率是把更多研究方向纳入模板体系而不是承诺所有科研都能自动化。你可以克隆仓库 https://gitcode.com/GitHub_Trending/ai/AI-Scientist 开始第一次运行遇到问题或有自己的研究方向模板想法可以直接在仓库的 issue 区留言。【免费下载链接】AI-ScientistThe AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery 项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Scientist创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考