
给AI Agent出题AERS外部计分板与aers-score打分CLI完全指南带你的Agent来考同一份卷子【免费下载链接】Auto-Empirical-Research-Skills A curated collection of 23,000 agent skills for empirical research across 8 social science disciplines. | 精选 23,000 AI Agent 技能库覆盖8大社会科学学科的实证研究。CoPaper.AI 20分钟完成一篇可复现的规范实证论文并支持用户上传 Skills。-- Maintained by CoPaper.AI from Stanford REAP.项目地址: https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-SkillsAuto-Empirical-Research-SkillsAERS是一个精选 23,000 AI Agent 技能库覆盖 8 大社会科学学科的实证研究。除了技能本身它还藏着一套很少人知道的考卷AERS 基准测试——19 道确定性实证分析题配上可复算的评分器以及一个零依赖的打分工具 aers-score。这套机制允许任何人带着自己的 AI Agent甚至是你自己手算的结果来考同一份卷子并把成绩提交到外部计分板External Scoreboard。本指南带你走完全流程看卷、作答、自测、上榜。为什么要给 AI Agent出卷过去一年AI Agent 写回归、跑因果推断已经不难了但新手最常踩的坑恰恰是它默认会做的事看到面板数据就直接上 TWFE不管异质性效应做断点回归RD时直接比较断点两侧的均值不控制趋势把中介变量当控制变量把直接效应当成总效应报告一个看起来合理的系数——即使这个数从来没被真正算出来过。AERS 的解法很朴素出题时让答案已知。每道题的数据集都带着真值例如反事实列y0评分器每次都会从 CSV重新计算所有数据派生的标准答案gold。你的 Agent 报上来的数字会被逐一对账——编造的数字在honest-*交叉校验 gold 面前无处遁形。换句话说这不是一场比谁数字好看的比赛而是一场陷阱测试每道题都专门针对一种经典的folk move随大流的错误做法设计考的是你的 Agent 有没有识别并避开它。考卷长什么样19 道确定性任务19 道题全部存放在 benchmark/tasks/每道题是一个 TOML 任务描述文件配上benchmark/data/下的确定性数据集。以 rdd-recovery.toml 为例101 个无噪声断点回归数据点截断点处真实跳变3.0朴素跨截断均值差会给出5.51严重有偏局部线性估计能恢复真值4 个 gold恢复真值必需、暴露朴素估计偏差必需、局部估计优于全局 OLS可选、诚实报告必需。再看另一道card-iv-recovery它用的正是经典的 Card (1995) 教育回报率 IV 数据3,010 条观测考的是IV 估计应高于 OLS、且必须报告第一阶段 F 统计量约 13.3而不是默认工具变量够强。这张图就是该题数据在 demo-StatsPAI-skill 演示中画出的教育年限 × 是否靠近四年制大学散点图官方基准计分板 docs/BENCHMARK_SCOREBOARD.md 用一张对照表展示了这道考卷的分辨力仓库自带的 reference 实现19/19 全过而一个只回归、不问识别问题的 naive 基线19/19 全挂。差距本身就是考点。aers-score 安装与打分 CLI 快速上手打分 CLI aers-score 是这套考卷的大门。它的核心设计是零重复实现它直接加载评分器 benchmark/check_benchmark.py 的validate_candidate/compute_truth/grade函数所以你本地打出来的分和 CI 给官方参考实现的分数走的是同一条代码路径。安装三步跑通git clone https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-Skills cd Auto-Empirical-Research-Skills pip install -e . # 零依赖仅需 Python 3.9 aers-score tasks # 看看卷子上有哪些题不在仓库目录里工作设一次环境变量即可export AERS_REPO/path/to/Auto-Empirical-Research-Skills或用aers-score where查看当前解析到了哪个 checkout。四命令循环tasks → describe → init → grade命令作用aers-score tasks列出考卷上全部 19 道题、gold 数、分值与数据集aers-score describe task看一道题考什么、埋了什么陷阱aers-score init ./my-run为每题生成字段齐全的候选 JSON未填字段为nullaers-score grade ./my-run打分输出逐题 PASS/FAIL 与进度条几个新手友好的细节半成品也能打分。init生成的骨架里未填字段是null而不是0——缺数报未填而不是伪装成错误的 0填了一半的运行依然能拿到已完成部分的分。掉进陷阱不算工具报错。默认grade即使必需 gold 挂了也返回 0因为你的 Agent 掉进了这道题的坑本身是有价值的结果CI 里想让它变红加--strict。常用开关--json机器可读输出、--task id只处理单题、--verbose打印每个 gold 项。提交到公共计分板你的分数不算数我们的才算这是 AERS 外部计分板最反直觉、也最可靠的地方提交者写的分数永远不直接展示。计分板由脚本从你提交的原始逐题候选文件重新评分生成和你自报的summary对账——对不上直接构建失败。所以规则只有一条提交原始结果而不是提交分数。上榜流程aers-score init ./my-run # 1. 生成骨架 # 2. 让你的 Agent 跑每道题的数据集填入数字 aers-score grade ./my-run # 3. 先自己检查 aers-score submit ./my-run --agent my-agent \ --url 你的Agent仓库或文档 # 4. 生成 submission.json然后把./my-run/*.json放进benchmark/external/agent-slug/candidates/连同submission.json一起发起 PRmake validate会在 CI 里重新评分。完整规则见 docs/SCOREBOARD_RULES.md。计分板怎么排名、能不能只做会的题任何人、任何 Agent/流水线/人工都可提交无审批门槛AERS 自己的提交标记为 first-party 并排除在排名外——出题人不能坐自己榜的第一名。排名依次比较必需 gold 全过的题目数降序→ 总得分 → 尝试题目数 → 名称。跳过的题在表格里显示为—挑题做在规则上永远不占便宜而且一眼就能看出来。每道题都围绕一个具体的folk move设计挂掉一题不是丢人——计分板上的官方示例就故意在一道题上掉坑3 题中 2 题干净、32/46 分专门用来演示部分得分的展示形态。submission.json会记录exam_commit标明你考的是哪个版本的卷子题面重大变更时旧条目会在下次构建自动重评。分数意味着什么又意味着什么一个干净的满分如 17/17说明在这些确定性题目上你的流水线恢复了已知真值且没有掉进每道题专门设计的陷阱。但它不意味着你的 Agent 在真实数据上正确——真实世界没有y0列可对照识别论证才是难的部分。AERS 自己反复强调一句话基准是地板不是天花板。清考是必要的不充分。这正是外部计分板存在的意义它只负责把你的 Agent 和别人的 Agent 在同一张卷子上的表现变成可公开复核的事实其余的判断留给你自己。下一步建议先用aers-score describe bad-control-recovery读一道题的陷阱说明再决定让 Agent 上全卷还是只挑几题热身。祝你和你的 Agent考试顺利。【免费下载链接】Auto-Empirical-Research-Skills A curated collection of 23,000 agent skills for empirical research across 8 social science disciplines. | 精选 23,000 AI Agent 技能库覆盖8大社会科学学科的实证研究。CoPaper.AI 20分钟完成一篇可复现的规范实证论文并支持用户上传 Skills。-- Maintained by CoPaper.AI from Stanford REAP.项目地址: https://gitcode.com/gh_mirrors/aw/Auto-Empirical-Research-Skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考