AI Research Skills 实战演示:用 Autoresearch 双环架构给 RL 对齐算法做“大脑扫描“ AI 技能人工智能大模型深度学习【免费下载链接】AI-Research-SKILLsComprehensive open-source library of AI research and engineering skills for any AI model. Package the skills and your claude code/codex/gemini agent will be an AI research agent with full horsepower. Maintained by Orchestra Research.项目地址https://gitcode.com/gh_mirrors/ai/AI-Research-SKILLs点击查看免费下载本篇技术指南围绕 demos/autoresearch-rl-brain-scan/README.md 展开完整还原一个由 AI Agent 全自主执行的端到端研究项目在同一个 GPT-2 Small 基座模型上分别用 RLOO、GRPO、DPO 三种对齐算法做 sentiment 与 toxicity 任务训练再借助 SVD 权重分解与 SAELens 稀疏自编码器分析对齐算法到底对模型内部做了什么。读完本文你将掌握 autoresearch 双环inner loop / outer loop架构的实际运转方式、跨领域技能路由post-training → mechanistic interpretability → paper writing的编排思路以及DPO 是 rank-1 扰动、在线 RL 保持结构、DPO 存在集中扰动级联三大机制性发现的完整证据链。该 demo 产出的论文见 rl_algorithm_brain_scan.pdf。一、Demo 背景一个此前无人系统回答的问题RL 对齐算法RLOO、GRPO、DPO在行为层面已经被大量比较——谁的 reward 更高、谁更稳、谁更省显存。但在权重与特征层面这些算法对同一个基座模型的内部结构分别做了什么此前没有工作做过系统性对比。这正是本 demo 的研究缺口research gap。Agent 带着这个缺口进入 Autoresearch 技能定义的研究生命周期从文献调研出发识别 gap形成可检验的假设再通过两环架构自主推进。Autoresearch 的核心定位在技能文档中写得很清楚You are a research project manager, not a domain expert. You orchestrate; the domain skills execute.你是研究项目经理而非领域专家负责编排领域技能负责执行。本 demo 正是这句话的完整实践——Agent 自己不写训练循环而是把任务路由给领域技能研究活动路由到的技能仓库位置RL 模型训练GRPO/RLOO/DPOTRL、GRPO RL Training06-post-training/trl-fine-tuning/、06-post-training/grpo-rl-training/内部结构分析SAE 特征、激活缓存SAELens、TransformerLens04-mechanistic-interpretability/saelens/、04-mechanistic-interpretability/transformer-lens/论文产出ICML 格式ML Paper Writing20-ml-paper-writing/ml-paper-writing/二、双环架构如何驱动这项研究本 demo 完整跑通了 Autoresearch 中定义的BOOTSTRAP → INNER LOOP → OUTER LOOP → FINALIZE生命周期BOOTSTRAP 检索 RLOO / GRPO / DPO 文献 → 确认权重与特征层面的系统对比是空白的 INNER LOOP快、自主、重复 假设 → 实验 → 测量 → 记录 → 学习 → 下一个 本轮用三种算法训练 GPT-2 SmallSVD 分析权重增量SAELens 分析特征变化 OUTER LOOP周期性、反思性 回顾结果 → 发现模式 → 更新 findings.md → 形成新理解 → 决定方向 本轮把三个独立实验的证据链合成出机制性结论 FINALIZE 调用 ml-paper-writing 以 ICML 格式成文关键点在于两环分工inner loop 负责跑实验constrained experiments with clear measurable outcomesouter loop 负责找故事synthesize understanding, find the story — this is where novelty comes from。DPO 是 rank-1 扰动这类结论不是某个指标跑出来的而是 outer loop 对指标进行综合后的概念性洞察这正是技能文档强调的 novelty 来源。demo 还体现了 Autoresearch 中的研究非线性原则——实验中随时可以回到文献、随时可以产生新假设节奏由 Agent 判断通常每 5-10 个实验做一次 outer loop 反思。三、Inner Loop 实验设计训练、SVD、SAE 特征分析3.1 训练侧RLOO / GRPO / DPO 三路对照Agent 在GPT-2 Small上分别用 RLOO、GRPO、DPO 三种算法执行 sentiment 与 toxicity 两个任务保证同一个基座模型、同一批任务这一对照前提。这与仓库中 GRPO RL Training 技能文档描述的实现路径一致GRPO 对每个 prompt 生成一组通常 4-16 条completion在组内用 reward 函数比较优劣并更新策略无需独立 reward model。技能文档给出的可落地配置骨架如下from trl import GRPOConfig training_args GRPOConfig( output_diroutputs/grpo-model, learning_rate5e-6, # 更低更稳 num_generations8, # 组大小8-16 推荐 max_prompt_length256, max_completion_length512, per_device_train_batch_size1, gradient_accumulation_steps4, # 有效 batch 4 bf16True, # A100/H100 上更快 logging_steps1, )对 sentiment / toxicity 这类任务reward 函数设计遵循技能文档的黄金法则正确性类 reward 权重最高约 2.0格式类 0.5-1.0长度类 0.1-0.5风格类在 -0.5 到 0.5 之间且必须组合多个 reward 函数并逐个独立调试。DPO 侧则走 TRL 的 preference alignment 路径DPOTrainerchosen/rejected偏好对beta控制 KL 惩罚强度。需要说明的是RLOO 在仓库中作为在线 RL 家族PPO/GRPO/RLOO/OnlineDPO的一员与 GRPO 同属无独立 critic、组内比较的方法详见 trl-fine-tuning 的 online-rl 参考。3.2 分析侧权重增量 SVD SAE 特征对比训练完成后Agent 对每个权重矩阵的**权重增量weight delta**做 SVD 分解考察扰动的低秩结构同时用 SAELens 把模型激活分解成稀疏、可解释的特征feature比较对齐前后基座模型 SAE 特征结构的保持程度。SAELens 的核心逻辑在技能文档中有完整描述SAE 通过稀疏瓶颈重构激活L0平均每 token 激活的特征数、CE Loss Score重建后交叉熵恢复比例、Dead Features比例等是标准评估指标。本 demo 用到的关键能力是sae.encode(activations)得到稀疏特征向量再跨模型基座 vs 对齐后比较哪些特征被激活、哪些被破坏。TransformerLens 则负责run_with_cache缓存各层激活为 SAE 提供输入。技能文档中将 SAE 特征激活投影回 logit 空间做特征归因的范式正是本 demo 分析特征被扰动级联影响的直接工具。四、Outer Loop 合成出的三大关键发现以下数据全部来自 demos/autoresearch-rl-brain-scan/README.md 与对应论文发现一DPO 是 rank-1 对齐对 DPO 训练后的每个权重矩阵单个 SVD 方向top-1 direction就能恢复 95.6% 的行为效果而 GRPO 需要 50 个方向才能达到同等恢复水平。这说明 DPO 的权重扰动高度集中在极低秩的子空间里——从机制上解释了为什么 DPO 是一种小而集中的修改。发现二在线 RL 保持模型结构RLOO 与 GRPO 的权重增量保持了更高的有效秩effective rank 200 vs DPO 的 119并且更好地保留了基座模型的 SAE 特征结构Jaccard 相似度 0.83 vs 0.69。也就是说在线 RL 倾向于把修改摊薄到更多方向上、破坏更少原有特征而 DPO 的修改虽然秩低对原有特征的扰动面却更大。发现三DPO 的集中扰动级联尽管 DPO 的改动秩更低它却在更深的层里破坏了 2 倍以上的 SAE 特征深层被扰动的特征数 1619 vs 在线 RL 的 527-870。低秩扰动通过网络逐层放大amplifying perturbations through the network形成集中扰动级联——这是本 demo 最反直觉、也最有机制深度的结论改动越集中反而越容易被深层放大。统计严谨性三项结论在 sentiment 与 toxicity 两个任务上都成立且带统计显著性n3 个随机种子置信区间不重叠non-overlapping CIs。这与 ML Paper Writing 技能文档对实验章节的要求一致——必须有误差棒、说明标准差还是标准误、给出 seed 设置方法。五、从相关性到因果性SVD 消融验证演示 README 特别强调这些结论经过了因果验证而不仅是相关性分析not just correlation but causal evidence。Agent 的做法是 SVD 消融实验SVD ablation取出对齐后模型的权重增量沿 top-1 SVD 方向做消融移除该方向观察行为效果sentiment/toxicity 指标的回落幅度若移除单一方向导致行为效果大幅回落则证明该方向确实是行为效果的因果载体——对应 DPO 95.6% 的恢复率。这与 TransformerLens 技能文档中 activation patching 的因果范式一脉相承把 clean 激活 patch 进 corrupted 运行观察因果热点只是把干预对象从激活换成了权重子空间。这种先测秩结构、再沿主方向消融、最后对照行为指标的流水线是 outer loop 把三类实验证据拧成一条因果链的关键。六、收尾用 ml-paper-writing 产出 ICML 论文研究结论后进入 FINALIZE 阶段Agent 调用 ML Paper Writing 技能以ICML 格式产出论文即仓库中的 rl_algorithm_brain_scan.pdf。技能文档为 ICML 提供了templates/icml2026/完整模板目录example_paper.tex、icml2026.sty、algorithm.sty等并规定了必须整目录拷贝、先验证模板可编译、按 section 逐个替换的工作流ICML 2026 的硬性要求是 8 页正文 1 页 camera-ready、必须包含 Broader Impact Statement。更关键的是该技能的引用纪律AI 生成的引用有约 40% 的错误率因此强制要求绝不凭记忆写 BibTeX一律通过 Semantic Scholar / arXiv / CrossRef 编程式获取并双重验证无法验证的引用必须标记为占位符。论文中的每个引用都遵循这一流程从源头杜绝幻觉引用。写作层面则贯彻 Neel Nanda 的narrative 原则——如果无法用一句话说出你的贡献你还没有一篇论文——本 demo 的一句话贡献就是DPO 以 rank-1 扰动完成对齐在线 RL 以结构保持的方式完成对齐二者在深层特征破坏上呈现出截然相反的级联模式。七、为什么这个 Demo 重要多技能编排的完整范本这个 demo 的价值不在于单个实验结果而在于它展示了 autoresearch如何把多个领域技能编排成一条完整的自主研究流水线Post-training 技能TRL、GRPO负责把三种对齐算法真正训练出来提供可分析的权重增量可解释性技能SAELens、TransformerLens负责回答改变了什么——SAE 特征对比给出结构层面的证据SVD 消融给出因果层面的证据论文写作技能ML Paper Writing负责把实验证据组织成符合 ICML 规范的投稿稿。对照 Autoresearch 的质量标准本 demo 属于好的 agent 行为的教科书案例假设带有机制性推理DPO 低秩 → 深层放大而非试试看、findings 形成了连贯叙事而非实验日志堆砌、因果消融补齐了验证闭环、最终产物是可以直接进入投稿流程的论文。它同时回答了双环架构为何必要inner loop 提供三个实验的硬指标outer loop 才把它们合成为rank-1 扰动 结构保持 扰动级联这样超越单一指标的概念性理解——这正是 Autoresearch 所定义的 novelty 所在也是这套技能库让任意 AI 模型拥有完整马力的 AI 研究 Agent这一目标的直接证据。八、你可以如何复现或延伸仓库是只读的但你可以按以下方式在本地复现同类工作流搭建研究骨架按 Autoresearch 初始化research-state.yaml、research-log.md、findings.md并设置 agent continuityClaude Code 用/loop 20mOpenClaw 用 20 分钟 cron训练侧参照 GRPO RL Training 与 TRL 的代码骨架在 GPT-2 Small 上分别完成 RLOO/GRPO/DPO 训练记录权重增量分析侧参照 SAELens 的预训练 SAE 加载流程如SAE.from_pretrained(gpt2-small-res-jb, ...)与 TransformerLens 的激活缓存/干预流程计算有效秩、SAE 特征 Jaccard、逐层被扰动特征数因果验证对 top-1 SVD 方向做消融并复测行为指标成文按 ML Paper Writing 的 ICML 模板与引用验证流程产出论文。延伸方向同样开放把对照扩展到 PPO/OnlineDPO、把基座模型换成更大规模、或把扰动级联假说推广到其他偏好优化变体——这正是 autoresearch 的 DEEPEN/BROADEN 方向决策机制所鼓励的后续研究路径。赞分享AI 技能人工智能大模型深度学习【免费下载链接】AI-Research-SKILLsComprehensive open-source library of AI research and engineering skills for any AI model. Package the skills and your claude code/codex/gemini agent will be an AI research agent with full horsepower. Maintained by Orchestra Research.项目地址https://gitcode.com/gh_mirrors/ai/AI-Research-SKILLs点击查看免费下载相关推荐AI-Research-SKILLs 的 Autoresearch 技能用双循环架构驱动全自主 AI 科研编排AI Research SKILLs 的 Autoresearch 技能用双循环架构驱动全自主 AI 科研编排 本篇技术指南围绕 AI Research SKAI 技能人工智能大模型深度学习自主实验循环autoresearch 模式实战用固定时间预算驱动 AI Research Skills 中的快速 ML 迭代自主实验循环autoresearch 模式实战用固定时间预算驱动 AI Research Skills 中的快速 ML 迭代 本指南围绕 AI ReseaAI 技能人工智能大模型深度学习用 /market-scan 一次跑完四大战略框架pm-skills 宏观环境扫描命令实战指南用 /market scan 一次跑完四大战略框架pm skills 宏观环境扫描命令实战指南 导读 /market scan 是 pm skills 项目AI 技能AI 插件创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考