让Agent成本暴降90%!自动化Harness适配框架被CMU开源了

发布时间:2026/7/31 2:46:00
让Agent成本暴降90%!自动化Harness适配框架被CMU开源了 团队没有继续训练模型而是让meta-agent分析失败轨迹自动调整指令、工具和Agent循环。结果很直接优化后的harness在21个“任务-SLM”组合中的16个上显著提升性能7个组合弥合了SLM与前沿LLM之间的性能差距。表现最好的SLM恢复了约89%的前沿LLM性能推理成本仅为前沿LLM的4%。01不是换模型而是把部分难度移出模型当前很多Agent系统是围绕前沿LLM设计的。模型需要自己理解任务、制定计划、挑选工具并在出错后重新规划。前沿模型通常能够较好地完成这些工作SLM却更容易暴露出模型能力与任务需求之间的缺口。作者将常见问题归为五类工具使用失败tool-use failure、遵循指令失败instruction-following failure、知识失败knowledge failure、长上下文失败long-context failure以及规划或推理失败planning/reasoning failure。问题并不完全出在模型无法完成单个步骤而是它需要同时承担过多工作既要推断流程又要从大量工具中做选择还要避免重复发送消息。harness adaptation的思路是把不同实例共享的部分难点固化到外部系统中。明确的步骤写入system prompt重复操作封装为工具不相关工具直接隐藏必须遵守的条件交给程序检查。模型不必临场解决所有问题只需可靠完成harness为它划定的任务。02meta-agent自动修改Agent系统手工寻找合适的harness并不轻松。同一次失败可能同时涉及工具选择、上下文增长和指令遵循而且不同模型的失败方式并不相同。因此研究团队把harness设计转化为一个由数据和评估驱动的搜索问题。harness optimizer接收目标SLM、训练及验证数据和初始harness在一个明确的空间中修改system prompts、skills、dynamic contexts、工具、hooks、上下文管理组件和sub-agents。首先从已经尝试过的harness候选池中采样一个版本在训练实例上运行并记录完整轨迹包括工具调用、中间观察、输出、分数和反馈。meta-agent读取原始轨迹与当前harness代码诊断失败原因再提出具体修改。它还会查看过去方案及效果避免重复尝试已经证明无效的调整。最后新harness先经过低成本的代码检查通过后它会在同一批实例上重新评估只有出现改进才进入完整验证并被加入候选池。团队使用gemini-3.1-pro-preview作为meta-agent。每个任务与模型组合的单次优化预算为20美元执行三次独立搜索再保留验证分数最高的harness。这不是让Agent自由重写自己而是在受约束的组件空间内用真实失败轨迹寻找有效修改。03预算审批从75.0%升至98.3%预算审批任务最能说明harness具体改了什么。经过23轮迭代优化器为gemma-4-26b-a4b找到了三项关键调整。第一把简短的通用提示改写为明确的逐步流程规定联系人发现、信息收集、预算核对和消息回复的顺序。第二过滤不需要的MCP工具缩小模型的动作空间减少工具选择错误。第三创建anti_loop_hook.py。当Agent准备向同一接收人再次发送完全相同的消息时hook会直接拒绝调用并要求模型进入下一步或结束任务。调整之后gemma-4-26b-a4b的准确率从75.0%提升至98.3%超过gemini-3.1-pro-preview的97.3%单实例平均成本则从0.039美元降至0.017美元。harness承担了脆弱的规划、筛选和检查SLM只负责执行已经结构化的流程。04什么时候用小模型加harness论文在七项业务相关任务上进行了实验包括考勤审计、预算审批、库存预警、IoT时序异常检测、Playwright测试生成、网站管理和代码重构。三款SLM分别是qwen3-coder-30b-a3b、ministral-3-8b和gemma-4-26b-a4b对照模型为gemini-3.1-pro-preview。所有配置运行三次并报告平均结果。三款SLM中整体适配效果最强的是gemma-4-26b-a4b。它在通用harness下的七项任务平均准确率只有31.4%优化后达到80.2%平均延迟也从328秒降至135秒。前沿LLM的平均准确率为89.7%平均延迟为181秒。qwen3-coder-30b-a3b的平均准确率从26.9%提升至74.8%。但ministral-3-8b只从9.5%提升至25.0%部分任务仍然没有改善。这说明harness可以转移任务难度但无法替代模型缺失的核心能力。因此预算审批、考勤审计、库存预警等流程相对固定的任务更适合使用“小模型专用Harness”代码重构等需求差异较大的开放任务则更难依靠一套Harness覆盖。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】