同一个AI,为什么有人用成团队,有人用成玩具?一百行代码和十万行代码,考出了差不多的分数 同一个模型有的公司用出一个团队的产能报价、比价、质检一环扣一环有的公司用成一个玩具新鲜两周然后躺在收藏夹里吃灰。差距在哪2026年9月一篇发表在arXiv的论文编号2609.00006读完了含Anthropic、OpenAI、Google官方产品在内的11个生产级编码智能体的源码极简系统Mini-SWE-Agent全部代码约100行同一批研究对象里的产品级系统代码量到了百万行级而论文指出这个百行系统在行业公认的编程考卷SWE-bench Verified上的成绩与比它大三个量级——也就是十万行级——的系统处于同一区间。论文自己加了句注自报数据、模型与日期不同不能当严格排名。但即便算上这句注问题依然成立约100行就能上考场多出来的十万行、上百万行在干什么这套模型之外的东西行业今年给了它正式的名字harness行业术语直译是马具、缰绳——第09篇把它译作缰绳这门学问叫harness工程——论文的说法是这个词2026年2月进入流通2026年初被命名为一门学科。先把答案放桌上模型是给定的杠杆全在环境。同一个AI用成团队还是玩具差的不是模型本身是围着模型的那套环境。论文把它写成一个等式Agent Model Harness智能体模型harness2026年初由LangChain的工程系列文章推广开来。模型你改不了能拉开差距的全是harness。把宇航员活着带回来的不是宇航员1970年4月阿波罗13号服务舱氧气罐爆炸三名宇航员被困在飞往月球的途中。“休斯顿我们出了问题”——这句呼救是说给地面听的把他们活着带回来的是休斯顿的地面控制中心。地面看得见遥测把每个读数传回来地面比宇航员更清楚飞船状态地面有知识飞行规程和检查单在手边随时可翻地面有边界什么情况必须中止规则事前划好地面有分工各岗位飞控各司其职。最关键的一幕在回程舱内二氧化碳浓度升高地面用飞船上现有的材料现场设计出一套过滤器适配方案再一步步念给天上照做——方案在地面生成动作在天上执行结果传回地面验证。三名宇航员活着回来了。拆开看宇航员是模型地面控制中心是harness。模型再强缺了那套看得见、有知识、有边界、有分工、有闭环的环境也只是困在铁罐里的高手。harness到底是什么模型之外的一切一共七格论文的定义很干脆harness是模型之外的一切——把模型接到世界上的运行时。论文2026年9月版本把它拆成七个子系统外加界面层、会话底座两个横切面翻译成老板的话是七格• 干活的循环干完一步想下一步直到活干完• 接模型模型从哪来、怎么调、贵了怎么换• 工具AI伸手够得着的东西——查库存、读单据、发消息• 记忆与上下文干活时看得见、记得住的材料• 安全与权限什么不能碰、碰之前谁签字• 编排分身术——一个AI派活一群AI干活• 扩展手册、插件这些给AI加本事的口子。七格合起来只干一件事让AI看得见、做得了、错得起、错了能发现。第09篇聊过的缰绳四件套——权限、审批、留痕、兜底——就是其中安全与权限那一格。多出来的几十万行花在哪全在管出了错怎么办先说透那个数据。Mini-SWE-Agent用约100行就实现了全部七个子系统一个循环、一个模板、一个工具、一条消息列表、两个上限没有编排——说明原理不难地板很低口径不变自报数据、模型与日期不同。那多出来的几十万、上百万行在管什么论文的判断是区分地板与生产系统的从来不是能不能完成任务而是安全、恢复、成本管理、可扩展性与平台化界面——一句话全在管出了错怎么办。据OpenAI Codex团队2026年公开分享本文依据公开转述一个真实产品约5个月、约100万行代码、人工手写零行、约1500次代码合并产品有内部员工每天用也有外部试用者。团队里人只做三件事设计环境、说明意图、建反馈回路。架构约束不写进提示词当告诫写成自动检查器和结构测试报错信息本身就是怎么改的说明文档即知识库给AI看的总说明就是目录评审也是AI审AI人工评审变成可选。注意分工的变化人从写行为变成设计环境——一个报错附修法说明的检查器胜过提示词里一百条禁止。程序思维穷举路径harness思维塑造决策空间第57篇聊过两种思维程序思维要消灭不确定性AI原生思维学会跟不确定性打交道。这篇接着说harness思维落到工程上长什么样程序思维穷举路径把每种分支提前写死真实任务永远有脚本没想到的变体越写越脆harness思维不穷举路径塑造决策空间——让好路径容易走坏路径机械上走不通或立刻可见。该写死的权限、门禁、检查器必须写死确定性动作下沉成脚本工作流在这层是好零件不该写死的留给模型。四句落地的话。第一模型是给定的杠杆全在环境。同一个模型换套环境结果天差地别——预算投环境常比投更聪明的模型更值钱。第二不在环境里的知识对AI等于不存在。报价规矩躺在老师傅脑子里对AI就是没有写进它能查的手册才算有。第三机械约束优先于口头告诫。能变成权限、门禁、检查器的别写成请注意“严禁”。第四没有闭环的AI不是员工是生成器。干活没人验收、出错没人发现产出再多只是生成第56篇聊过AI放大判断也放大混乱。名片上那个词我自己天天在跑樊军刚AI的交付方式就照这套环境建——名片上印着自研AI军团Harness协作体系说的正是它军长AI规划调度士兵AI并行施工军规是写死的条令铁律一道反幻觉防线——不采信已完成的自报、交活必附测试原始输出、施工和质检不是同一个脑子、失败逐级升级再加135项自动化验收随时体检。关键在条令规定的是什么不规定任何一步怎么做只规定什么算做完、谁来验、错了怎么升级——这就是harness级的控制。第15篇聊过这支军团怎么编队这篇讲它为什么能编军长和士兵都是AI模型把它们编成军队的是那套环境。特别篇3给过一道乘法产出 认知 × 工具——harness就是把认知固化进环境的那一层。你不用造环境但要会问三句话这听着是技术团队的事跟老板有什么关系关系在于你不用亲手造harness但要会查供应商和团队有没有。第81篇把派活压成一句话给AI派活说三样、备两样说目标、标准、边界备知识、工具。三句不懂技术也问得出口第一句AI出了错你们怎么发现我们会测试不算答案——测什么、谁来测、测不过怎么办答到这层才算。第二句什么不能碰是拦住的还是提醒的记住分工边界事前拦标准事后验。不许删数据写进提示词提醒AI等于没拦变成权限和门禁机器事前拦下才叫边界。第三句干完了谁验、验什么验收标准是能逐条检查的数字、条数、通过率还是一句做得不错三句答得顺环境里多半有货支支吾吾的你买到的可能是个玩具。这也不是刁难真有环境的团队答起来不费劲——樊军刚AI自己天天被这三句问出错靠135项自动化验收和独立质检发现不能碰的靠机械拦截干完按验收标准逐条验。这套环境不是大厂专属。AI工程师樊军刚给企业做AI落地价格摆在明处单点场景3万起、2-4周上线多场景组合与长期合作另有分期方案大项目分期落地、风险锁在每期。一句话总结同一个AI用成团队还是玩具差的不是模型是围着模型的那套环境——看得见、做得了、错得起、错了能发现。1970年4月把宇航员带回来的是休斯顿的地面控制中心2026年行业给它起了学名harness工程。模型是给定的杠杆全在环境——纠结换模型之前先看看围着模型的七格。关于樊军刚AI樊军刚AI工程师专注企业AI落地方案。CS科班出身2021年起深耕AI强化学习(RLHF/DPO)方向累计AI实战投入超$40,000CursorClaude深度使用1年自研AI军团Harness协作体系AI安全研究成果获MITRE国际CVE编号收录。已为制造业企业交付AI智能系统深耕非标报价、采购比价、来料质检等场景方法论可迁移到贸易、批发、供应链等有同类痛点的行业。2026年起延伸至物理AIAI操作硬件系统解读Anthropic MHS标准亲手在ESP32上跑通AI读传感器、控设备、看摄像头的闭环为企业提供设备AI可接入性评估与试点设计。我的服务方式先诊断、先算账省不了钱不接。按帮你省下来的价值收费你永远是赚的那个。把你现在给AI、给供应商、给员工写的那份需求或流程文档发来做个AI派活单体检帮你看它是说三样、备两样齐了还是只写了步骤回一页缺什么、怎么补——这件事免费。Harness系列三篇到此收官80讲手册怎么写才不作废81讲派活该交代什么82讲环境为什么决定上限。