Harvey LAB 批量重评完整指南:如何用 eval-only 快速重新评分现有运行 Harvey LAB 批量重评完整指南如何用 eval-only 快速重新评分现有运行【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labsHarvey LABLegal Agent Benchmark是用于评估 AI Agent 法律工作能力的开源基准内置 1600 真实法律任务。跑完一轮 Agent 之后如果你想换裁判模型、更新评分细则或补跑遗漏的打分无需重新让 Agent 干活——sweep 工具的eval-only 模式可以批量重评现有运行省时又省钱。 什么时候需要批量重评Agent 跑一次可能耗费数小时与大量 token。但评分本身是独立的阶段以下场景你只需要重新评分而不是重跑 Agent更换或升级裁判模型想让gpt-5.5或更强的模型重新当裁判更新了 task.json 中的 rubric 细则评分标准变了旧分数作废补分上次 sweep 中断部分运行只有metrics.json没有scores.json验证评分稳定性同一份产出用不同裁判再评一遍️ 先看懂三阶段流水线sweep 工具把一次完整基准拆成三个阶段实现见 utils/sweep.py阶段内容eval-only 是否执行Phase 1Agent 跑任务产出文档❌ 跳过Phase 2LLM 裁判逐条打分✅ 只跑这里Phase 3生成单份报告 对比看板✅ 照常执行也就是说--eval-only会直接跳过 Phase 1从已有的results/目录中挑出完成的运行重新送评。 一条命令启动批量重评uv run python utils/sweep.py --task corporate-ma --eval-only--task支持任务 ID、业务领域或all例如重评全部任务uv run python utils/sweep.py --task all --eval-only --parallel 8 相关 CLI 参考详见 docs/tutorial.md 的 CLI Reference 附录兼容性入口 scripts/run_model_sweep.py 也可用。⚙️ 重评是怎么选运行、打分的1. 找最新一次完成运行每个模型×任务配置下工具会扫描results/中带metrics.json的时间戳子目录取最新一个作为重评对象逻辑在 utils/sweep.py 的find_latest_run函数。2. 已打分的自动跳过若该运行已存在scores.json直接 SKIP不会重复消耗裁判 API 配额。想强制全部重评先移开或删除旧的scores.json即可。3. 裁判逐条评分实际打分由 evaluation/run_eval.py 完成裁判模型默认claude-sonnet-4-6可用--judge-model更换按 evaluation/prompts/rubric_criterion.txt 模板逐条评判采用全过制all-pass——所有细则都通过才计 1 分。评分细节见 docs/eval-strategies.md。 重评之后自动刷新报告Phase 3 会为每个配置重新生成单份 HTML 报告并刷新多模型对比看板evaluation/compare.py你就能看到不同模型在不同推理档位下的all-pass 率与细则通过率对比。 进阶技巧只想重生报告不重评--report-only先看看会做什么加--dry-run预览计划不动任何模型只跑预检--preflight-only校验任务加载与 rubric 是否齐全单份产出双裁判重评uv run python -m evaluation.run_eval --run-id run_id --task task --dual会用标准裁判组Sonnet GPT-5.5分别独立打分并取均值结果写入scores_dual.json目录布局迁移旧版模型优先目录结构可用 scripts/remap_results.py 一键重映射为任务优先布局支持--dry-run预演❓ 常见问题Qeval-only 会给新运行的模型打分吗不会。它只对results/中已存在的完成运行有metrics.json评分没有任何产出的配置会被跳过。Q裁判和 Agent 可以是同一个模型吗技术上可以但不建议——建议裁判与参赛选手错开保证评分中立。Q并行度怎么定裁判阶段受 API 限流约束sweep 内部会自动把并行度压到 4~8一般无需手动调。掌握--eval-only你就拥有了只重考、不重做的能力——这是把 Harvey LAB 用成持续迭代工具的关键一步。 【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考