
AI Agent Harness 元年从框架混战到运行时收敛2026 年 Agent 基础设施分层重构解读一周之内“框架”这个词突然不够用了2026 年 10 月 4 日到 10 月 5 日这两天中文技术社区里关于 Agent 的讨论重心出现了一次相当明显的位移。据掘金《AI 日报 · 2026-10-05》转述黄仁勋把 agent harness 定义为「套在 LLM 外面的外骨骼」——让模型在被讨论了一年之后真正变得有用的是这层包裹模型的代码同一篇日报还提到 OpenAI 同期放出一份约 34 页的工程白皮书系统讲述其如何构建、评估与部署 agent覆盖架构、工具集成、扩展、agent ops 与评估框架等板块Google 则在 10 月 5 日弃用旧版 harness把流量重定向到新版本并上线 Credentials API官方口径称文件编辑场景的输出 token 下降约 40%、多轮编码任务成本下降约 30%[1]。同日CSDN 上一篇题为《AI Agent Harness 元年从框架到执行外壳》的文章直接提出过去由单一 Agent 框架包揽的“模型调用、工具执行、安全控制、过程记录”正在被拆成上下两层[2]另一篇《从“框架混战”到“运行时收敛”》则围绕 DeepSeek Harness、字节 DeerFlow 2.0 等路线展开讨论[3]。需要先说清楚的是证据强度上述产品名、版本号、百分比均来自日报与社区文章的二次转述本文写作时未能取得 Google 官方评测文档、OpenAI 白皮书原文或黄仁勋演讲的一手记录因此正文统一使用“据转述”“官方口径称”等限定语具体评测口径基准集、任务类型、是否含缓存折扣目前无法确认[1]。同时本次采集到的全部来源热度字段均为 0不能据此宣称任何“刷屏”“万人讨论”的热度叙事。与这股执行层讨论形成反差的是同期仍在密集产出的入门教程《AI Agent 入门到实战》《LangGraph 多智能体实战》《手把手教你玩转 AI 智能体》《从 0 打造 AI Agent 智能体》等内容集中在 10 月 2 日至 10 月 9 日之间发布主题高度重叠于工具调用、工作流编排、记忆、RAG 与多智能体[13]。一边是“把 Agent 跑通”的教程供给过剩一边是产业侧把资源投向“让 Agent 安全、便宜、可审计地跑在真实机器上”这个落差本身就是本文的主线Agent 竞争重心正从上层编排框架下移到 harness/runtime 执行层。本文的阅读路径是先建立分层判断标准再用成本视角解释执行层为什么是账单层然后横评六条路线的取舍最后给出一份可以直接拿去做立项评审的生产就绪清单与选型决策树。一、概念拆解harness/runtime 与上层编排的两层架构1.1 边界在哪里把一个典型 Agent 项目拆开看能力其实分布在两个完全不同的关注面上。**执行层harness / runtime**负责把模型的意图变成真实机器上“可执行、可撤销、可审计”的动作具体包括模型调用循环上下文拼装、工具调用分发、重试与超时工具执行与沙箱进程/容器隔离、文件系统与网络边界凭证与权限密钥注入、最小权限、委托关系状态与过程记录checkpoint、suspend/resume、任务级 trace 与审计日志预算治理单任务、单租户、日维度的成本与调用上限。**编排层framework / orchestration**负责“做什么、谁来做、按什么顺序做”包括任务规划、多 Agent 协作与角色分工、路由与回退策略、RAG 与记忆策略、技能Skills组织方式。这个切分并非本文发明。CSDN 的分层文章明确把“上层负责编排与能力、下层负责工具调用安全落地”作为核心判断[2]黄仁勋“外骨骼”的隐喻在工程上恰好对应同一含义——模型给出的是意图外骨骼负责把它翻译成受控的动作[1]。1.2 用白皮书的板块做映射据掘金日报转述那份约 34 页的 OpenAI 工程白皮书覆盖架构、工具集成、扩展、agent ops、评估框架五个板块[1]。按关注点归位大致是这样白皮书板块据转述名称主要落在哪一层该层要回答的问题架构两层共有模型、工具、状态、人的介入点如何组织工具集成偏执行层工具如何注册、鉴权、隔离、限流扩展偏编排层任务如何并行、分片、横向扩容agent ops执行层怎么观测、重放、归因、止血评估框架跨层变更后性能与成本是否回归要注意这里的板块名称来自二手转述原文标题与层级划分尚未回溯核对[1]。但即便只按这套粗粒度映射也能看出白皮书关心的从来不只是“怎么写出一个 ReAct 循环”。1.3 模糊地带分层是关注点分类不是产品分类checkpoint/suspend、子代理、上下文压缩这些能力既可以做成执行层原语任意编排都能用也可以做成某个框架的私有特性。判断方法很简单看它是否依赖你的任务语义。依赖任务语义的是编排决策不依赖的就是执行层能力。同理工具失败后的处置要分两层看执行层做幂等重试与超时熔断保证动作不重复落地编排层做任务级回退与改道决定是否换一条路径。把这两件事混在一个框架里正是很多系统在生产上难以排障的根源。下面这段是架构示意伪代码并非任何项目的真实 API# 示意代码harness 主循环骨架具体接口以各项目文档为准classHarness:defrun(self,task,policy):stateself.store.load_or_create(task.id)# checkpoint / resumewhilenotstate.done:budget.checkpoint(task.id,state.cost)# budget governorplanself.model.step(state.context)# 模型调用foractioninplan.actions:ifnotself.policy.allows(action,policy):raisePermissionDenied(action)# 权限边界keyidempotency_key(task.id,action)# 幂等键ifself.store.done(key):continueresultself.tools.execute(action,sandboxTrue)self.store.commit(key,result)# 落盘、可重放self.trace.emit(task.id,action,result)这段骨架里没有“规划”“多角色协作”“记忆策略”因为它们属于上层执行层只保证动作被授权、被计量、被记录、可重放。本节结论harness 不是“又一个框架”而是框架之下那层与机器打交道的基础设施。评价一个 Agent 项目时先问它的工具执行、凭证、预算、日志分别在哪一层实现比问“用了哪个框架”更能预测生产事故。二、成本视角执行层就是账单层2.1 一次“只换了执行层”的迁移据掘金日报转述Google 在 10 月 5 日弃用了旧版 harness转述中的版本标识为 antigravity-preview-05-2026把流量重定向到新版本antigravity-preview-09-2026底层模型与价格不变官方评测口径下文件编辑场景输出 token 下降约 40%、多轮编码任务成本下降约 30%转述中给出的归因是“更好的缓存命中”[1]。如果这组描述准确它是一个很有价值的对照实验模型、单价、任务类型都不变只换执行层账单就变了。这正是“外骨骼”比喻的经济学含义——执行层不是附属品而是成本结构的决定项。但必须强调口径边界−40% 指的是“文件编辑场景的输出 token”−30% 指的是“多轮编码任务的成本”两者是不同指标不能相加、不能互相外推也不能直接套用到检索、数据分析等其他场景[1]。原始评测文档、基线设置、是否含缓存折扣目前均无法确认本文后续一律按“据转述的官方口径”处理。2.2 钱具体省在哪即便不了解那份评测的细节从执行层机制出发可以提出几条可验证的推断属于本文的分析而非官方结论编辑粒度决定输出 token。工具设计成“输出 diff/局部编辑”而不是“重写整个文件”输出 token 自然下降。这属于执行层的工具集成设计与模型能力无关。上下文前缀的稳定性决定缓存命中。多轮编码中如果 harness 每轮都重新组织 system 提示、工具定义与历史消息前缀就会抖动缓存命中率下降保持稳定前缀、只追加增量是典型的 harness 工程。状态管理决定重复劳动。没有 checkpoint 时一次超时往往意味着整段任务重跑有幂等与断点续跑重复消耗被截断。路由与降级决定单价。并非每一步都需要最强模型据 CSDN 日报转述亚马逊开源了用于 Agent 工作流路由的 Strands Decider 2B 决策模型专注在预设选项间排序并输出置信度[12]。这类小模型路由是成本工程的常见零件但其实际效果需在自家任务上验证。2.3 一个可以自测的成本对照模板与其相信别人的百分比不如把自家任务在不同 harness 下的 token 结构测出来。下表是空白模板不含任何虚构数字任务集harness 版本输入 token输出 token缓存命中 token重试次数单任务成本任务成功率文件编辑N 个样本A填入填入填入填入填入填入文件编辑同一批B填入填入填入填入填入填入多轮编码M 个样本A填入填入填入填入填入填入多轮编码同一批B填入填入填入填入填入填入配套的成本核算逻辑同样是示意字段名需对照各家真实的 usage 文档# 示意代码按 turn 聚合成本字段名需以各模型 API 文档为准forturnintrace.turns:usageturn.usage cost(usage.input_tokens*price.inputusage.output_tokens*price.outputusage.cached_tokens*price.cached)metrics[retry_count]1ifturn.retriedelse02.4 对商业模型的含义当模型单价趋于透明、能力差距收窄时Agent 产品的毛利率越来越取决于执行层效率一次失败重跑、一段冗余输出、一次缓存失效都会直接体现到单位任务成本上。这也能解释为什么商业化叙事正在从“能力展示”转向“算成本账”——据 CSDN 10 月 10 日的文章转述Manus 母公司完成超 5 亿美元融资、投后估值 40 亿美元该文把这轮融资解读为 Agent 商业化进入成本核算阶段的信号[15]该估值与融资结构均出自转述未见一手公告。本节结论执行层是账单层。评估 harness 时用“同一任务集、同一模型、同一价格”做对照测 token 结构与重试率比看厂商宣传数字更可靠。三、路线横评控制权、生态与运维成本的取舍3.1 先定维度比较框架之前先把评估维度固定下来否则很容易被 star 数和功能清单带偏。本文采用六维依赖面与部署形态、执行层自研程度、多 Agent 协作模型、可运维性checkpoint、预算、幂等、生态与集成广度、可观测性。需要提前声明数据可靠性GitHub 上存在两份社区自评对比一份比较 tiny-agent / LangChain / CrewAI / AutoGen[4]另一份比较 9 到 11 个框架并引入安全审计数据[9]二者在框架数量、评分维度与结论上互不一致且均发布日期未知。它们只能作为“社区如何讨论取舍”的样本不能作为权威基准本文不引用其中的 star 数与评分数值。3.2 路线 A极简执行层tiny-agent 一类据社区对比文描述tiny-agent 一类项目把零依赖部署、budget governor预算治理与 idempotency幂等作为核心卖点并强调 checkpoint/suspend 能力[4]。这条路线的价值主张很清楚依赖树小攻击面与升级成本低执行行为可预测适合安全敏感、需要精细控制预算的场景该对比文举的例子是 bounty/security agent[4]。代价同样明确集成自理。想接一个新的向量库、消息队列或企业身份系统都要自己写适配层团队的工程时间会从“写业务编排”转移到“补基础设施”。是否值得取决于你是否有能力也确实需要自持执行层。3.3 路线 B全生态框架LangChain / CrewAI / AutoGen全生态路线的卖点是集成广度与协作抽象的成熟度LangChain 适合需要灵活组合与研究实验CrewAI 面向多 Agent 工作流AutoGen 强调 Agent 之间的对话式协作[4]。对中小团队这是最快跑通端到端链路的方式。代价是依赖树与版本漂移一次上游大版本升级可能牵动整条链路更关键的是执行层往往成为黑盒——工具重试、凭证注入、日志格式由框架决定出了事故难以归因。生产视角的社区经验也印证了这一点有开源模式库指出多数 Agent 教程停在单个 ReAct 循环而真实系统需要规划、路由、错误恢复、人工介入与多 Agent 协调等结构[5]。这些结构是否可插拔取决于框架有没有把执行层留成接口。3.4 路线 C厂商/模型侧 harnessDeepSeek Harness、DeerFlow 2.0据 CSDN 的转述文章DeepSeek Harness 的某个 rc 版本更新涉及多模态、子代理与 Windows 支持字节 DeerFlow 2.0 被描述为“一站式 SuperAgent 开发框架”[3]。这些信息均来自二手解读具体版本号、功能范围与架构分层需要回源仓库的 release notes 与文档核实[3]。这类路线的优势是执行层与模型、工具链协同优化的空间更大——前文 Google 的迁移案例说明这种协同能带来可观的成本改善[1]。代价是可迁移性harness 的缓存策略、工具协议、凭证模型一旦与特定模型或平台绑定换模型的隐性成本会显著上升。是否接受锁定应基于“你是否会长期使用该模型族”来判断而不是基于 demo 效果。3.5 三种路线的取舍对照路线代表据社区讨论主要收益主要代价更适合的场景极简执行层tiny-agent 一类[4]零依赖、预算与幂等内建、行为可预测集成与生态自理人力成本高安全敏感、需精细成本控制全生态框架LangChain / CrewAI / AutoGen[4]集成快、协作抽象成熟依赖树大、执行层易成黑盒中小团队快速验证与中等复杂度生产厂商 harnessDeepSeek Harness、DeerFlow 2.0[3]执行层与模型协同优化锁定、可迁移性差长期绑定单一模型族一个值得反复强调的判断框架是**你要买的是编排语法还是执行层可靠性**编排语法的替换成本低执行层可靠性的替换成本高而多数生产事故发生在后者。本节结论不要问“哪个框架功能最多”要问“执行层由谁负责、出问题谁能在十分钟内定位到动作级别”。社区对比文之间结论冲突本身[4][9]就说明了打分排名的不可靠。四、生产落地可评估、可运维的执行层最低配置4.1 最低配置清单从“能跑通”到“能上线”差别不在提示词写得多好而在下面这些能力是否具备。有实战文章直接指出能跑通和能上线是两回事[13]。以下是可直接用于立项评审的清单能力项最低要求缺失时的典型事故凭证隔离与最小权限每任务独立凭证按工具授权一个 Agent 泄露全系统密钥工具沙箱文件/网络/进程边界明确工具误操作直接污染生产环境幂等与重试幂等键 有限重试 超时熔断重试导致重复扣款、重复发信预算治理单任务/单租户/日预算上限失控循环烧穿预算超时与人工介入明确的挂起点与升级路径卡死任务无人接手过程日志与审计动作级 trace可重放事故无法归因、无法举证其中凭证与授权是当下争议最集中的部分。据掘金日报转述Meta 与沃尔玛在 10 月初发布了“个人代理协议”同期 Gumloop 上线的 Agent Browsers 提供安全凭证存储与会话重放面向没有 MCP 也没有 API 的系统[7]。这说明“谁代表谁行动、凭证如何委托、动作能否撤销”正在从工程细节上升为协议层议题但相关协议的正式文本与授权模型本文未取得不作展开。4.2 Agent ops日志不够要 trace 与重放多智能体实战文章把日志与追踪称为 Agent 集群的“黑匣子”并指出执行链路天然不可预测、没有日志根本无法排查[6]。这个判断在单 Agent 阶段已经成立多 Agent 阶段会被放大一次失败可能横跨规划、路由、工具调用、子代理多个环节。可用的最低标准是三层任务级 trace每个任务一条完整链路、动作级事件每次工具调用的输入输出与授权记录、失败归因区分模型错误、工具错误、环境错误。只有做到第三层才能回答“这次成本上升是模型变笨了还是工具超时导致重试变多了”。4.3 评估结果级之外要有过程级据掘金日报转述那份 OpenAI 工程白皮书把评估框架作为独立板块[1]同方向的研究也在补过程维度——据 GitHub 上的 ArXiv 摘要日报转述2026 年 10 月 8 日的一批论文中包含从任务结果训练 Agent 顾问Caddie的工作以及关注决策动态、而非仅看最终结果的过程感知型评估基准[11]。工具编排方向亦有类似思路据论文笔记转述NaviAgent 将工具调用拆为高层决策与低层图上路径搜索在若干基准上报告了任务成功率提升[16]该结论出自二手论文笔记需回原文核对。对工程团队的可操作建议是为 harness 变更建立固定回归集同时记录结果指标任务成功率与过程指标工具调用次数、重试率、token 结构、人工介入率。Google 那组 −40%/−30% 数据之所以有说服力正是因为它是在官方评测口径下的对照结果尽管口径细节目前仍待核实[1]。4.4 安全与治理硬约束而非加分项社区分析中提到某开源 Agent 项目在 90 天内获得约 43 万 star同时被安全研究者指出存在关键漏洞[9]该数字与结论出自社区自评发布日期未知未经官方背书。监管侧的动向也在收紧据 CSDN 日报转述美国加州总检察长就 AI 网络安全事件向 OpenAI 发出调查传票联邦贸易委员会启动行业调查多州索取信息[12]。这些事件的细节与后续本文不做展开只保留一条工程结论权限边界、凭证委托与审计留痕是 Agent 上生产的前置条件。下面是一份配置示意展示预算、幂等与超时策略应具备的形状它不是任何产品的真实配置格式# 示意配置非任何产品的真实 schemabudget:per_task_usd:2.00per_tenant_daily_usd:200.00on_exceeded:pause_and_escalateidempotency:key_template:{task_id}:{action_hash}store:redisttl_hours:24retry:max_attempts:3backoff:exponentialretry_on:[tool_timeout,transient_5xx]never_retry_on:[permission_denied,validation_failed]timeout:tool_seconds:60task_seconds:1800audit:log_actions:truestore_payloads:encrypted本节结论生产就绪的判断标准是“能否计量、能否归因、能否撤销”。这三件事都发生在执行层。五、选型决策树三类团队今天怎么选5.1 决策主线选型不应从产品榜单开始而应从约束条件开始是否私有化部署若必须本地化部署优先看依赖面与部署形态极简执行层路线通常阻力最小[4]。是否长期绑定单一模型族若是厂商 harness 的协同优化收益可能超过锁定代价[1][3]若需要多模型混用执行层应尽量模型无关。是否有多 Agent 需求若只是单 Agent 多步任务先不要引入多 Agent 抽象实战经验也强调不是所有任务都需要多智能体[13]。合规与安全要求有多高有审计与凭证隔离硬要求时把预算、幂等、凭证三件套列为必选框架功能多少是次要项。团队能否自持基础设施不能自持却选极简路线结果通常是自己写一套质量更差的框架。5.2 三种典型画像中小团队求快采用全生态框架快速落地但同时立下依赖治理规则锁定版本、定期升级窗口、依赖清单审计并把执行层关键点日志、预算做成可替换接口。平台型团队求可控自建薄 harness 轻编排重点投入预算治理、幂等与凭证隔离三件套编排层只做薄封装便于后续替换。绑定单一模型厂商求效率接受锁定换取执行层与模型的协同优化但要预留一层适配接口避免业务代码直接依赖厂商私有概念。5.3 反模式清单把框架当平台用业务逻辑与框架生命周期强耦合升级即重构。用 demo 评测做选型依据演示集与生产任务分布差一个数量级必须用自家任务集回归。省掉过程日志出事再补事后补的日志无法还原事故现场[6]。盲信社区排名现有对比文之间结论互相冲突[4][9]打分只能当线索不能当证据。只看 star 数star 反映传播不反映生产可用性本次采集数据的热度字段全部为 0本文不做任何热度推断。六、收敛的不是产品是关注点回到开头的三件事。黄仁勋的“外骨骼”是隐喻白皮书是方法论Google 的迁移数据是成本证据[1]——它们指向同一个事实Agent 的价值实现正在下沉到执行层而执行层的三个关键边界是授权谁代表谁行动、计量每个动作花多少、撤销错误动作能否回滚。接下来值得观察的有三点。一是凭证与授权边界的标准化Credentials API 与个人代理协议都在往这个方向试探[1][7]但协议细节与互操作程度尚不明确。二是工具集成协议的生态收敛MCP servers 已被社区视为对接外部工具的核心枢纽google/skills 一类项目代表能力模块化的趋势[8]与之并行的还有绕开 API 直连无接口系统的联网能力层方案据掘金文章转述Agent Reach 以零 API 费用接入多个平台、积累超过 9 万 star[14]这类方案在合规边界上需要格外审慎。三是评估与 agent ops 的事实标准过程级评估能否成为 harness 变更的回归门槛[1][11]将决定执行层能否真正成为“基础设施”而非“脚本集合”。开放问题同样要诚实列出−40%/−30% 这组数字能否外推到其他任务类型目前没有证据harness 与模型的协同优化是否会加剧厂商锁定需要观察多模型适配层的实际成本编排框架是否会退化成薄 DSL取决于执行层接口能否标准化。这些都是判断不是结论。所以选型时该问的问题从来不是“哪个框架最好”而是**谁来为模型的动作负责如何计量如何撤销。**把这三个问题回答清楚执行层才算真正落地。核实状态说明本文涉及的关键数字与事件均处于“二手转述、原文待补”状态黄仁勋“LLM 外骨骼”的原始场合、OpenAI 白皮书的正式标题与页数、Google harness 版本号与 −40%/−30% 的评测口径、Credentials API 的能力范围、DeepSeek Harness 与 DeerFlow 2.0 的版本与特性、tiny-agent 的 budget governor 与 idempotency 实现程度以及两份社区框架对比的评分数据均未取得一手文档核验[1][3][4][9]。读者在引用这些数字前应回溯各产品官方公告、release notes 与评测文档。无发布日期的来源含多条 GitHub 仓库不得作为时效性证据所有来源的热度字段均为 0本文未据此做任何热度推断。参考资料[1] AI 日报 · 2026-10-05Agent harness 成为核心战场掘金https://juejin.cn/post/7692743745478164526[2] AI Agent Harness 元年从框架到执行外壳2026 年 Agent 基础设施的分层重构CSDN 博客https://blog.csdn.net/2601_96949212/article/details/166601192[3] 从“框架混战”到“运行时收敛”2026 年 AI Agent 开发框架的三条路线之争CSDN 博客https://blog.csdn.net/m0_74899094/article/details/167082205[4] AI Agent Framework Comparison 2026 — tiny-agent vs LangChain vs CrewAI vs AutoGenGitHub发布日期未知https://github.com/hussain-alsaibai/agent-framework-comparison-2026[5] Agent Orchestration Patterns: Design patterns for building LLM agents that hold up in productionGitHub发布日期未知https://github.com/leotavares26/agent-orchestration-patterns[6] AI 多智能体集群MCPA2ASkillsDeepAgents 编排实战CSDN 博客https://blog.csdn.net/weixin_29048309/article/details/166977010[7] 2026 年 10 月 7 日 AI 重要新闻OpenAI 一夜公开 722 篇数学论文Meta 联合沃尔玛发布「个人代理协议」掘金https://juejin.cn/post/7693504329366831123[8] 2026 年第 40 周 GitHub 趋势周报导读AI Agent 赛道主导重心转向上下文工程掘金https://juejin.cn/post/7692739051067260937[9] Comprehensive analysis of 9 AI agent frameworks — Security, Code Quality, Orchestration, Ecosystem scoringGitHub发布日期未知https://github.com/janvarez/ai-agent-comparison-2026[10] awesome-ai-agents-2026A curated list of AI Agent frameworks, tools, platforms, and resources for 2026GitHub发布日期未知https://github.com/Zijian-Ni/awesome-ai-agents-2026[11] ArXiv AI Research Digest 2026-10-08 · Issue #3672 · agents-radarGitHubhttps://github.com/duanyytop/agents-radar/issues/3672[12] AI 资讯日报2026 年 10 月 2 日谷歌 Gemini 4 Argon、OpenAI Dots 代理与 GPT-6.1 SolCSDN 博客https://blog.csdn.net/IT_ORACLE/article/details/167027423[13] 从 0 打造 AI Agent 智能体核心部件、工具调用与多智能体编排实战CSDN 博客https://blog.csdn.net/weixin_32285357/article/details/167016502[14] GitHub 94k Star 工具 Agent Reach给 AI Agent 装上互联网能力掘金https://juejin.cn/post/7694184962663022592[15] AI 前沿2026 年 10 月 10 日Manus 40 亿美元估值 AI Agent 商业化 中国智能体重估CSDN 博客https://blog.csdn.net/gedonshen/article/details/167461525[16] NaviAgent: Graph-Driven Bilevel Planning for Scalable Tool OrchestrationICML 2026论文笔记GitHub笔记标注 arXiv:2506.19500原文待核https://github.com/zhaoyang97/Paper-Notes/blob/main/docs/ICML2026/llm_agent/naviagent_graph-driven_bilevel_planning_for_scalable_tool_orchestration.md