从拼指标到拼能力:WRC上机器人泛化与长程任务成新标尺 一个明显的信号是展台背后的技术叙事变了。前几年大家喜欢把自由度峰值扭矩重复定位精度挂在嘴边今年聊得最多的是泛化能力和长程任务能力。这两个词听起来不像具体的参数不带单位没办法直接对比大小但它们恰恰是这届WRC最有信息量的标尺。我绕着展馆走了几圈和做本体、做核心零部件、做AI算法的人分别聊了聊一个感受非常强烈机器人行业正在从拼指标进入拼能力的分化期。谁在裸泳谁在真的往前跑用这两把尺子一量就能看得出来。1. 这届WRC展台比发布会更诚实1.1 从来都来了到看准再聊观众心态在变WRC的现场氛围有一个很微妙的变化。前几年大家逛展是来都来了每个展台都要扫一眼看到能动的机械臂就掏出手机拍一段。今年明显不一样了观众开始带着明确的问题来而且会在展台前停留很久盯着机器人反复执行同一个任务一看看十几分钟。我特意观察了几个热门展台的人流分布。人形机器人展台依然排队最长这是流量担当大家都想看看它的手指能不能灵巧地捏起一颗螺丝。但真正让专业观众驻足的是那些能稳定跑通复合任务的展品比如一个移动底盘带着机械臂完成开门、取物、放回、关门的全流程。这种展台前围着的几乎都是业内人士有人在用手机录视频有人在笔记本上飞快地记参数还有人和现场工程师直接讨论任务成功率。这种心态变化背后是行业预期的改变。投资人不再为能站起来走路买单了他们要看到的是这个机器人到我仓库里到底能不能干活。集成商也不再看自由度数量和负载参数他们更关心换一个工件、换一种摆放方式你的系统还能不能跑。观众不再为概念鼓掌开始为能力付费这是分化期最典型的市场特征。1.2 人形机器人依旧吸睛但展台上的真东西变多了人形机器人依然是C位但今年有个细节很值得玩味光会走路的原型机观众拍完视频就走了敢在现场做收拾桌面或者开关柜子演示的展台前排从早到晚都挤满了人。所谓真东西指的是任务复杂度在肉眼可见地提升。去年很多机械臂的现场demo是从A点抓取工件放到B点动作固定、轨迹固定、工件固定本质上是一个重复执行的程序演示。今年的demo普遍升级了比如给机械臂一个开放式指令把桌面上所有红色物体放进筐里它需要自己识别目标、规划顺序、避开障碍物并且在误抓之后还能重新调整。这个变化之所以重要是因为它直接反映了两家公司在技术路线上的差距。固定轨迹演示考验的是运动控制能力本质上和20年前工业机械臂做圆周运动没有区别而开放式指令考验的是感知、决策、规划、执行的闭环能力这才是机器人从自动化的工具变成能干的助手的关键一跃。2. 泛化能力谁来定义一个机器人什么都能干2.1 泛化不是装得多而是没见过也能干泛化能力这个概念很多人在展会上聊但我发现大家的理解其实有偏差。有人觉得泛化就是给机器人装更多预设的程序预设100个动作比预设10个动作更泛化。这完全是对泛化的误解。真正的泛化不是见过100种情况会处理100种情况而是没见过的情况也能根据经验推理出处理办法。用带小孩的例子来类比特别直观。你教孩子包饺子用的是猪肉白菜馅孩子学会了。泛化能力强的表现是什么是他第一次见到韭菜鸡蛋馅不用你重新教就知道该怎么包。他甚至能根据自己的理解觉得韭菜鸡蛋的水分比较大主动把馅里的水挤一挤再包。这不是学到了包猪肉白菜饺子这个技能而是学到了包饺子这个抽象技能并且能迁移到新的对象上。机器人泛化也是同一个道理。放到机器人身上泛化能力可以拆解成几个维度来理解跨物体泛化学会了夹取圆柱体能不能同样处理不规则的异形件跨布局泛化训练时物体摆在特定位置换一个完全不同的堆放方式还能不能识别跨环境泛化在实验室干净桌面上训练的操作策略到了仓库复杂的照明条件下还灵不灵跨指令泛化理解了把杯子拿过来能不能理解把那个装水的容器递给我这种同义但不同句式的表达这四层泛化能力一层比一层难。第一层考验的是感知模型的鲁棒性第二层考验的是规划算法对状态空间的覆盖程度第三层考验的是sim-to-real的迁移质量第四层考验的是语言模型和视觉模型的对齐程度。能全部做好的团队目前全世界也不多。2.2 怎么量化泛化场景数、成功率、零样本表现问题是泛化能力听起来很虚怎么量化我在展会上和几个做机器人的朋友交流下来比较实用的一套评估方法是这样不看演示看三组数字。第一组是任务场景数量。同一个操作任务官方宣称支持多少种不同的场景变体比如物体的种类、工件的位姿变化、背景环境的变化。这个数字越大说明泛化覆盖面越广但要注意的是数量不等于质量有些厂商把微小的变化也算作一个独立场景水分很大。真正靠谱的做法是看测试场景和训练场景有没有重叠如果没有刻意调优过的独立测试集说明这个泛化是货真价实的。第二组是成功率分布。泛化能力强的系统成功率曲线应该是平缓的在简单场景下98%中等复杂场景95%极端场景90%呈现一个平滑下降的趋势。泛化能力弱的系统曲线是断崖式的在场景复杂度超过某个阈值后成功率直接崩到40%以下。展会现场能当场跑完50次demo并公布统计结果的很少但从业者可以从现场的肢体语言判断敢反复跑同一任务的大概率是成功率真的有底气的。第三组是零样本表现。这是最狠的一刀直接给机器人布置一个它没练过的任务现场看能不能完成。比如机器人在展会上一直在抓取圆柱形工件你突然指着一个装着液体的高脚杯让它拿如果它能在不做额外训练的情况下调整抓取策略并执行这就是很强的泛化信号。零样本表现是最难作假的指标因为没时间现场微调。我在现场看到有家做复合机器人的团队演示了一个很有意思的场景桌面随机的不同形状小件物品语音下达指令让它挑出其中指定的几类并放好。他们坦诚地说物体是训练集外的但策略是通用的。这种坦诚和现场表现比那些把demo排练了一万遍的展台要有说服力得多。3. 长程任务能力机器人界最被低估的生死线3.1 为什么单步准、任务长就崩如果说泛化能力是广度那么长程任务能力就是深度。这个维度是过去几年最被低估的因为它很难从宣传册上看出来但恰恰是决定机器人能不能真正落地的生死线。一个看起来很矛盾的现象是很多机器人在单步任务上表现极其出色抓取成功率能做到99%以上但只要任务一拉长比如连续执行20个步骤整体成功率就断崖式下跌。这不是某一个环节出了问题而是所有的微小误差在累积。我习惯用一个简单的数学直觉来解释这个问题如果一个机器人每一步的成功率是99%执行一个有30个步骤的长程任务理论上的整体成功率是多少0.99的30次方大约74%。听起来好像还凑合。但实际情况远没有这么乐观因为真实场景里每一步的失败率不是平均分布的在感知模糊、光照变化、物体位姿不确定的情况下某些步骤的单步成功率可能只有95%甚至更低。取一个更现实的单步成功率95%来计算30步任务的整体成功率就是0.95的30次方大约21%。这就是为什么很多demo看着很棒一旦拉到真实产线就崩掉的数学原因。除了误差累积长程任务还考验系统的状态跟踪能力。机器人要做到第15步把螺丝放进盒子它必须记得前面14步做了什么事当前世界处于什么状态。很多系统的记忆是残缺的执行到一半就失忆了导致后面的动作全乱套。这和人做事一样你做一个复杂项目如果做到一半忘了之前的决定后面越做越糟。3.2 长程任务的三个观测指标完成率、接管率、恢复能力那么怎么从展台上判断一家公司长程任务能力的强弱我总结了三个观测指标比看任何宣传资料都管用。第一个是任务完成率。就是给定一个完整的多步骤任务比如整理书架把三本书按颜色分类放好把一支笔放进笔筒把垃圾扔进垃圾桶统计全程下来有多少比例能完整跑完所有步骤。这个指标最能直接反映系统的真实水平。我在展会上看到的情况是敢做这种完整demo的厂商不多大部分只敢展示单步操作因为你一旦把任务拉长系统的稳定性就会暴露无遗。第二个是中途接管率。所谓接管就是任务执行到一半机器人卡住了、走错了、或者撞了需要人工干预才能继续。接管率越低说明系统越自主。这个指标的意义在于它直接决定了机器人在实际作业中需要多少人工盯着。如果一个机器人每完成一个任务平均需要人工接管三次那它不但没有解放人力反而增加了负担。第三个是错误恢复能力。这是长程任务里最精彩的部分。好的机器人系统在执行中发现自己搞错了一步比如原本要抓红色杯子结果抓到蓝色杯子它是直接崩溃不知道下一步怎么办还是能自主地撤销错误、重新规划、继续完成任务错误恢复能力是通用人工智能在机器人身上最重要的体现之一因为它意味着机器人拥有对自身行为的监控和修正能力而不只是一套机械执行指令的程序。展会现场有个画面我印象很深一家做具身智能的厂商让机器臂执行一个按颜色分类摆放积木的任务过程中人为干扰故意把一块积木的位置改变了。机械臂没有乱它停顿了大概一秒钟然后重新规划抓取路径绕开挪动后的积木完成分类。这个停顿的一秒钟背后其实是感知重规划、运动重规划、任务状态修正三套系统同时工作的结果。整个行业能做对这一步的团队确实不多。4. 技术底座的分化硬件趋于同质软件成为新分水岭4.1 机械结构、传感器、关节模组的差距在缩小分化期还有一个很显著的特征硬件端的差距在肉眼可见地缩小。本届WRC上无论是关节模组、谐波减速器、力矩传感器还是末端执行器核心零部件的供应商都拿出了成熟度相当高的产品。同样规格的六轴协作臂A家和B家的重复定位精度可能都标着±0.02mm峰值扭矩也基本是同一个量级你很难再从参数表上看出决定性的差异。这不是坏事。硬件的成熟和供应链的完善意味着做机器人的门槛被大大降低了。以前想造一台像样的机械臂减速器要自己设计、伺服驱动要自己调参、控制板要自己攒现在这些都有成熟的标准件可以直接采购。硬件同质化直接导致了一个结果机器人本体的毛利空间被压缩单纯靠卖硬件很难形成壁垒。这也是为什么业内都在喊具身智能——硬件之上需要新的东西来拉开差距。但同质化并不意味着硬件不重要。恰恰相反在比拼软件能力之前硬件是地基。我注意到一个现象做得好的具身智能demo往往跑在扎实的硬件平台上关节响应快、力控稳定、通信延迟低。差一点的平台算法再好也发挥不出来就像用一个入门级车架去装赛车发动机动力根本传导不到地面。所以更准确地说硬件是必要条件但不是充分条件——你有扎实的硬件只是拿到入场券真正的竞赛在硬件之上的软件层。4.2 数据、模型、仿真拉开差距的无形资产硬件同质化之后决定产品力差距的变成了三样东西数据、模型、仿真。先聊数据。泛化能力和长程任务能力本质上都是靠数据喂出来的。每一帧图像、每一次力反馈、每一个成功或失败的尝试都在塑造机器人的经验。问题的关键是高质量的操作数据极其昂贵需要真实机器人的遥操作采集一个人一天能采集的有效数据量非常有限。展会上有家做数据采集的公司展示了一套遥操作设备操作员戴上动捕手套控制机械臂完成精细操作同时记录关节力矩、视觉图像、操作指令的完整对齐数据。这种数据的价值密度比从互联网上爬来的视频要高出一大截。再说模型。这是目前分化最激烈的一层各家技术路线百花齐放。有的是先从单一任务做起把抓取、放置、插拔等基础技能做到极致再逐步组合有的是直接上大模型用视觉-语言-动作模型VLA统一建模希望一步到位实现跨任务的泛化。两种路线各有优劣前者落地快、稳定性好但天花板明显后者上限高、泛化潜力大但当前阶段成功率还不稳定。我不做路线预测但从展台的实际效果看两条路线之间的差距已经在拉开。最后是仿真。仿真环境的重要性很容易被低估但它是打通数据瓶颈的关键一环。好的仿真环境能生成海量高质量的训练数据还能让机器人在虚拟环境里做各种危险动作的试错不用担心损坏真机。但sim-to-real存在一个经典难题仿真里学到的策略迁移到真机上会有域差比如力的感觉是仿不出来的摩擦系数也和现实不一样。展会现场有家做仿真平台的公司模拟了一台双机械臂在狭窄空间里协同作业的场景光线、物理引擎、柔性物体的形变都比较真实。这种仿真能力强的团队在数据积累上具备明显优势长期的竞争力也会更强。5. 三条裂缝分化期里谁在往上走谁在往下掉5.1 做场景深度的在赚钱做通用梦想的还在输血行业的分化从来不是以技术先进性为唯一标准的商业化的速度同样在制造裂缝。在展会上有一个比较清晰的印象在工业细分场景里做深做透的机器人公司日子过得相当不错还在讲通用机器人故事的创业公司大部分依然需要资本输血。做场景深度是什么意思就是放弃什么都能干的执念选择一个足够细分的场景把这个场景里的所有问题都解决透。比如有家公司专注做光伏组件搬运机械臂的每一个参数都针对光伏板的尺寸、重量、易碎特性做了深度优化码垛策略、防划伤工艺都是为这个场景量身定制的。这种产品不酷但它在客户那边就是好用就是稳定复购率极高。反观做通用机器人的方向场景广度的诱惑力很大但落地时要面临一个尴尬的情况机器人在展厅里什么都会玩到了客户现场环境一变、物体一变、光照一变成功率立刻跌到没法用的程度。做深vs做广本质上是现在赚钱和为未来下注的分化。两种选择没有绝对的对错但对团队的要求截然不同前者的核心能力是行业认知和项目交付后者的核心能力是算法创新和数据积累。5.2 本体厂商与AI团队的互相撕扯本次展会上的另一种分化很有意思做机器人本体的和做AI算法的正在经历一场互相撕扯的关系重组。本体厂商的问题是硬件卖不出溢价想往软件层延伸把具身智能的能力打包进去。但他们很快发现自己缺AI人才、缺数据积累要从零搭建一个大模型团队并不容易。AI团队的情况正好相反他们有模型能力但缺硬件调试经验做出的算法在仿真里效果惊艳上了真机就失灵需要在真实机器人上反复打磨的时间。这种撕扯正在催生多种合作模式有的本体厂商直接和AI创业公司深度绑定有的AI团队选择自己下场做本体还有的做中间件把两者的接口打通。本届WRC上有不少做机器人中间件的厂商他们的模式很有意思既不造本体也不做算法而是负责把不同的硬件和不同的算法高效地组装起来。这种连接者的出现本身就是行业分化、分工细化的信号。对用户来说撕扯的最终结果是选择和成本的问题。如果本体厂商和AI团队深度绑定你买到的是一套完整系统省心但贵如果中间件方案同时支持多家硬件和多家算法选择灵活但集成和调试的工作量大。展会上没有标准答案但一个明显的趋势是单纯只卖硬件的厂商展位前的人气是明显不如提供整体解决方案的。5.3 商业化节奏的分化看订单也看毛利如果说前两条裂缝是技术和战略层面的那商业层面的分化则更加现实。仔细看展会的商务洽谈区能发现两类处于完全不同节奏的公司。一类是已经在细分赛道拿到规模化订单的比如做焊接、做上下料、做码垛的。它们的展位上摆着大大的合作品牌Logo销售在认真地整理客户意向表聊的是现场环境怎么样节拍能打到多少你们现有的工装是否需要改造。这类公司已经过了证明技术的阶段进入提升产能的阶段。它们的问题不再是能不能做出来而是如何控制交付成本、如何保证大批量生产的一致性。另一类还在第一单、第二单的阶段它们的产品在demo层面很惊艳但一旦问到现场跑过了吗故障率多少平均开机率多少回答就开始变得含糊。这种公司需要的是一个灯塔客户通过一个标杆项目证明自己才能进入商业正循环。分化期的一个残酷现实是资本会向头部集中拿不到订单的团队可能熬不到技术成熟的那一天。我从展会上感受到的一个趋势是行业正在从技术驱动的单极逻辑转向技术商业化的双极逻辑。纯粹讲技术故事越来越难融资了投资人现在更愿意问的是你这个技术在哪个场景能比现有的方案好多少能多赚多少钱。这种趋势虽然有压力但长远来看对行业健康度是好事。6. 对从业者而言分化期恰恰是入局窗口6.1 研发人员我的技能栈该往哪个方向靠很多技术朋友问我分化期了做机器人还有搞头吗我的观点是分化的本质是低水平竞争结束高水平竞争开始对一个有真实能力的人来说这恰恰是更好的时代。对于研发人员来说分化期对技能栈提出了新要求。以前会调一个运动学算法、会做一个抓取规划就能在行业里立足。现在这些变成了基本功真正稀缺的是跨层能力既懂感知、又懂规划、还能理解大模型的基本原理能把这些模块串成一个闭环系统。长程任务能力背后的状态管理错误恢复任务重规划是非常值得投入的方向。我的建议是与其追逐一个又一个热门的开源模型不如踏踏实实把一个长程任务的闭环亲手搭一遍。从数据采集、模型训练、真机部署、FailCase分析到重新训练这个循环完整走通一次你对机器人能力的理解会超过大多数只会跑通某个开源demo的人。这个领域目前最缺的是能在真实系统上解决问题的人而不是能读论文复现结果的人。6.2 企业选型别纠结自由度先算任务完成率这笔账对于在筹备机器人项目的企业用户展会上最大的坑其实在于信息的误导。厂商的Demo都很漂亮但Demo是一码事到你的产线能不能稳定运行完全是另一码事。我给企业的建议是选型时不要只纠结参数表先问三个问题第一我的任务是什么是每天重复上千次的单一操作还是每天变化的多品种小批量操作如果是前者传统工业机器人加视觉引导足够了不需要为泛化能力多付溢价如果是后者泛化能力才是决定能不能用人的核心指标。第二任务平均有多少步三步以内的短任务对长程任务能力的要求不高但如果任务是十几步的复合流程一定要考察系统的状态跟踪和错误恢复能力而不只是单步的抓取精度。第三谁为效率兜底机器人一次失败可能需要人工介入多长时间系统从失败中恢复的能力直接决定了产线的综合效率。建议企业客户在采购前要求厂商做一个三天连续试运行的压力测试统计真实的完成率、接管率、恢复时间。这三个数字比任何宣传册都更能算出这笔投资划不划算。6.3 最后一个现场感想机器人行业正在从造概念回归造价值今年WRC给我的整体感觉是行业正在经历一次健康的祛魅。前几年夸张的估值和PPT驱动的故事正在退潮大家开始更认真地讨论这个技术到底能不能干活成本能不能打下来交付能不能稳定。整个展会上那些真正在谈订单、谈交付、谈毛利率的展台比那些在谈未来十年愿景的展台要热闹得多。这种变化对行业的长远发展是件好事。泛化能力和长程任务能力成为新标尺本身就是一个行业从炒作走向务实的标志——因为这两个能力恰恰是机器人能否在真实世界创造价值的最关键约束。一个机器人在实验台上再聪明如果拿不到真实任务里95%以上的完成率它就无法成为可靠的生产力工具。经过这几天的观察我最大的体会是机器人行业的分化远未结束甚至才刚刚开始。泛化和长程能力才能真正把那些有能力的公司和靠卖概念的公司区分开。而这对于所有真正在做事的从业者来说意味着一个更公平的竞争环境已经到来了。