
2025年刚开年具身智能圈就扔出了一颗深水炸弹——山姆·奥特曼在一次公开访谈里首次明确确认OpenAI将自研人形机器人。注意他的措辞不是“投资一个团队”不是“联合开发”而是“自己做一整个人形机器人”。这事放在三年前不敢想放在一年前也是争议巨大但放在今天几乎成了顺理成章的一步。我先说结论OpenAI下场做机器人表面上看是业务边界扩张实际上是在给自己寻找“AGI的物理出口”。ChatGPT再强也困在文本和图像里而一个能看、能听、能动手的实体才是大模型真正进入物理世界的最短路径。这篇内容我不想只做新闻复述我会从技术路线、行业格局、个人机会三个角度把这件事拆透适合机器人方向的从业者、大模型应用开发者以及所有正在观望具身智能赛道的朋友。读完你至少能明白OpenAI到底在赌什么这条赛道接下来会怎么走以及你自己该怎么接住这波机会。1. 为什么OpenAI突然“下场”造机器人1.1 从幕后投资到亲自上手态度转变背后有迹可循过去几年OpenAI在机器人领域一直走的是“投资模型输出”路线。公开报道里能看到的就有Figure、1X、Physical Intelligence等多家公司OpenAI要么出钱要么提供GPT系列模型能力让别人的本体搭载自己的“大脑”。这条路线的好处是轻资产风险和成本都压在本体厂商身上OpenAI只需要做好模型就行。但它有一个致命问题模型能力再好数据闭环不在自己手里关键技术路线受制于人。转折点也很明显。2024年底到2025年初Figure公开表态在自研端到端AI系统不再依赖外部大模型甚至还有“某本体公司逐步减少OpenAI依赖”的说法在圈内流传。与此同时OpenAI的内部招聘动向也很敏感——机器人机械设计、电子工程、系统集成、数据采集等岗位一口气放出好几个这绝不是做一个API能解释的。奥特曼这次公开确认只是把已经跑了一段的路摆到台面上。用商业逻辑理解这件事其实特别简单当你发现你送出去的“大脑”正在给别人做嫁衣而对方还想偷偷换脑子的时候最稳妥的办法就是自己也长出一具身体。自研意味着从硬件设计到软件训练所有环节都在自己掌控下推进不会再出现“模型适配度不够”“数据舍不得给”这类扯皮问题。奥特曼的公开表态等于把OpenAI过去几年反复摇摆的答案钉死了。1.2 OpenAI造机器人到底图什么很多人第一反应是“OpenAI终于要跟特斯拉抢生意了”但把账算细一点你会发现它图的根本不是卖一台机器人那么简单。第一层是数据。当前大模型最缺的不是文本而是物理世界的交互数据。文本数据快被挖完了视频数据也差不多但机器人轨迹数据——也就是机械臂怎么动、手指怎么捏、人怎么走过去拿杯子——这些数据目前极度稀缺而且每一小时都真实反映物理世界的因果关系。谁掌握海量真实的机器人操作数据谁就能训练出更接近通用物理理解的模型。OpenAI如果继续只做软件就只能跟人买数据或合作采集这等于把命脉交给别人。自研人形机器人本质上是自己搞了一条高质量数据生产线。第二层是战略卡位。AGI要真正进入现实不可能只靠对话框。无论是替你取快递、帮你做家务还是在工厂里完成装配都需要一个物理载体。谁先把这个载体跑通谁就定义了下一代人机交互入口。OpenAI错过社交、硬件终端这些入口之后不会再轻易放过机器人这个入口。第三层是模型边界验证。当前多模态模型对物理世界的理解还停留在“看图说话”的层面。机器人是天然的验证场模型必须在真实环境里连续推理、纠错、规划一次失误就是一次崩溃。这个过程逼着模型从“会聊天”走向“会干活”对OpenAI整体模型能力的提升是全方位的。1.3 为什么偏偏是人形不是机械臂或轮式机器人有人会问做机械臂或者轮式底盘成本低、技术成熟为什么非要啃人形这个硬骨头。我的理解是通用性的天花板完全不同。机械臂适合固定工位轮式机器人适合平地和导航但它们都只能覆盖特定场景。人形机器人最大的优势在于整个世界的基础设施——楼梯、门把手、椅子、工具——都是按照人体工学设计的。人形意味着它天然能适配仓库、家庭、车间、医院这些场景几乎不需要对环境做任何改造。这一点放在规模化部署语境里价值就太大了你不需要为了一个机器人重新改造整座房子或整条产线。还有一个层面是交互体验。LangChain那类文本工具不需要身体但未来机器人要和普通人协作人形外观会带来更自然的沟通预期。就像老人院里的护理机器人若有手臂和表情心理接受度会显著高于一个扫地机器人。当然人形形态的运动控制、功耗、成本全是地狱级难题OpenAI敢选择这条最难的路也侧面说明它不是想快速卖货而是想在技术栈最深处建立起别人短时间追不上的壁垒。2. 一台能干活的人形机器人核心技术在拼什么2.1 大脑、小脑的分工决定了机器人“聪明”的上限很多非技术读者会以为人形机器人就是“大模型”一个金属身体插上电就能干活。实际上一个能稳定工作的机器人系统至少要在两个层面同时发力。“大脑”负责理解语言、规划任务、识别物体。比如你说“帮我把桌上那个红色马克杯拿来”大脑要做的事情是听懂指令、识别杯子位置、规划路径、判断抓取姿态。这套逻辑现在主要靠多模态大模型来完成也就是视觉语言模型加推理规划。“小脑”负责执行层面的运动控制走路不摔、伸手不抖、抓握不滑。小脑部分现在更依赖强化学习、模型预测控制这类底层算法它们直接输出关节扭矩和轨迹。传统机器人公司更擅长小脑模型公司更擅长大脑。但真正好用的机器人必须把两者缝成一个整体。OpenAI自研的意义就是要把大脑和小脑放到同一个优化目标里去训练而不是像以前那样“大脑输出一个坐标小脑机械执行”。只有联合优化才能实现“看到杯子在倾斜的时候就提前补偿用力”这种自然到像人一样的操作。2.2 VLA把“看”和“说”直接变成“做”最近这个圈子里高频出现的词叫VLA全称是Vision-Language-Action视觉-语言-动作模型。你可以把它理解成一个“端到端”的机器人控制大模型输入是摄像头画面和人类指令输出直接是机械臂或关节的动作序列中间不再依赖一堆手写的规则模块。过去机器人的经典做法是分模块级联先视觉识别再语义理解再路径规划再运动控制每个模块单独调累积误差巨大。VLA的做法是让Transformer去吃海量“图像指令动作”配对数据自己学习从观察直接到动作的映射。谷歌的RT系列、Physical Intelligence的π0走的都是这个方向OpenAI要做人形机器人几乎绕不开VLA这条路线。不过VLA目前的难点也很实在。一是动作表示动作既可以离散成token像文字一样生成也可以预测连续值两种方案在精度和数据效率上差异很大。二是长程任务现在VLA能做一个“拿杯子”动作但要连续完成“打开冰箱、拿出鸡蛋、放到灶台、开火”这种长序列仍然会崩。三是数据量VLA是标准的“喂多少出多少”的模型缺数据就是缺智能而且机器人数据的维度又远高于文本采集成本极高。2.3 数据才是终极壁垒遥操作、仿真与数据飞轮聊到数据就得展开讲讲机器人的数据从哪来。目前主流是三条路。第一条是遥操作采集。人操作员戴上动作捕捉设备远程控制机器人做任务整个轨迹数据被完整录制下来。这套方式数据质量最高、最接近人的操作习惯但人力成本极大一个人一天也就采几百条轨迹而且很难规模化。第二条是仿真训练。在MuJoCo、Isaac Lab这类模拟环境里让机器人自己疯狂做任务相当于让它在虚拟世界里跑几百万次“抓杯子”然后再把策略迁移到真实世界。仿真便宜且量大但要解决“仿真到现实”的鸿沟模型在模拟器里学会的动作一上真机就变形甚至翻车。第三条是数据飞轮。机器人部署到真实环境后一边干活一边回传失败案例和新场景数据自动变成下一代训练集。这条路最终能降低数据成本但只有先卖出去、部署出去才能形成。OpenAI自研人形机器人最重要的其实是把第三条路抓在自己手里。它不缺资金、不缺算力、不缺模型能力缺的是真实世界的数据入口。自己造机器人就拥有了一个全天候工作的数据采集终端网络。长期看这才是远比卖硬件更有想象力的生意。3. OpenAI入场整个机器人生态都得重新洗牌3.1 原来靠OpenAI大脑做事的本体厂商处境最微妙OpenAI宣布自研之前市面上有不少机器人公司的主打卖点是“接入OpenAI模型”等于把“聪明的大脑”作为一个核心亮点。现在OpenAI自己也下场了这些公司就相当尴尬继续用OpenAI模型是在给对手喂数据不用OpenAI模型又可能要从头训练大模型研发成本陡然上升。最理性的选择是转向开源模型或自研模型。Figure已经这么做了更多中小型机器人公司大概率也会跟进。这会带火一波开源VLA和开源多模态模型的生态比如让机器人团队用开源模型做任务规划和控制反而会让模型生态更加百花齐放。对OpenAI来说虽然会失去一部分模型授权生意但它本来就不靠这个盈利这笔账完全划得来。短期里有一类公司反而会因此受益就是专门的机器人AI模型供应商比如Physical Intelligence这类独立公司。它们既不绑定OpenAI也不做本体硬件专门给各家机器人厂商提供AI方案随着OpenAI和本体厂商的矛盾加深它们的议价权反而会上涨。当然这也意味着它们很可能成为OpenAI收购名单上的优先目标。3.2 供应链被推到前台硬件产能成为卡点在软件圈混久了很容易低估硬件制造的难度。一台人形机器人身上的核心零部件比如行星滚柱丝杠、无框力矩电机、谐波减速器、六维力矩传感器、灵巧手里的微型驱动器和触觉传感器每一项都是高精度制造工艺产能爬坡慢、良品率提升难。OpenAI自研消息一出最开心的其实是产业链上游。整机需求的确定性提高意味着这些零部件厂商的订单预期会水涨船高。供应链的逻辑很简单无论谁最终做出爆款人形机器人只要这个品类起来了上游关键零件的出货量就一定会爆发。这也是为什么最近一两个月很多资本开始密集看机器人核心零部件项目本质上是在赌“量产放量”早周期。对OpenAI来说硬件供应链是它最大的短板。强如特斯拉在Optimus的量产过程中也反复吃零部件的亏。OpenAI作为软件基因很重的公司要么自建供应链团队硬啃要么通过与多家零件厂深度绑定的方式借力。这个环节一旦卡住再强的模型能力也无法变成产品所以实际情况可能会比乐观预测慢不少。3.3 创业团队的机会别硬拼整机去做数据与场景每次有巨头入场都会有人焦虑是不是没机会了我的看法恰恰相反大厂做整机反而给中小团队腾出了更清晰的生态位。第一条路是做数据服务。大量机器人公司会缺数据尤其是真实场景的操作数据。如果你能在特定场景里高效采集、清洗、标注机器人轨迹数据并且形成规模化交付能力你就成了所有模型和本体厂商都需要的外包资源。第二条路是做场景集成。工厂巡检、物流分拣、养老护理、零售导览这些行业都不是靠一台裸机就能落地的需要有人做需求分析、方案设计、部署调试和售后运维。这些脏活累活巨头反而做不细恰好是中小团队的收入来源。第三条路是做垂直模型或中间件。开模型底盘特定行业的增量数据训练做成“懂这个行业的机器人解决方案”这是OpenAI短时间不会亲自去碰的角落。说白了人形机器人是一个超级大赛道不会只有一家通吃。大厂抢的是平台和入口创业团队赚的是密度和深度只要找准一个具体场景死磕下去机会并不少。4. 新闻落地到工程普通人该怎么接住这波机会4.1 机器人方向开发者从一条VLA小链路开始如果你有编程背景哪怕没有机器人硬件也完全可以先把VLA链路跑通。最快速的路径是用开源VLA权重加一台便宜的模拟机械臂环境在小规模任务上做行为克隆训练。大致的流程是这样搭建仿真环境比如MuJoCo或Isaac Lab里面放一个机械臂和几个方块。定义动作空间通常是末端位置加夹爪开合或直接输出关节角。用遥操作或脚本控制的方式自动化生成几千条“图像指令动作”的轨迹数据。用开源VLA模型或两阶段训练方式进行行为克隆让模型学会从图像和指令输出动作。在未见过的新位置做泛化测试记录成功率。# 概念示意VLA 模型输入与输出具体接口以所用模型文档为准 observation { image: camera_frame, # 当前相机画面 (H, W, 3) instruction: 把红色方块放到篮子里, state: joint_angles # 当前关节角度假设是7自由度机械臂 } action vla_model.predict(observation) # 返回动作可以是末端轨迹点也可以是目标关节角这里最关键的“第一性原理”是VLA不会天生就会做任务它需要大量行为示范才能像“肌肉记忆”一样把指令转成动作。刚开始跑通流程比追求精度重要你会很快理解模型的泛化极限在哪、数据质量如何影响动作质量这些体感是看再多论文也得不到的。4.2 大模型方向开发者先给机器人装一个“任务大脑”如果你没有机器人硬件基础只熟悉大模型应用开发可以从任务规划的“大脑”切入。核心思想用一句话概括让大模型负责“决定做什么”把“具体怎么做”交给底层运动模块。架构大致是这样接收用户自然语言大模型把它分解成一串可执行的子任务然后调用现成的机器人能力模块比如移动到某个坐标、抓取某个物体、执行某个动作每执行一步再调取环境反馈修正后续计划。这个过程中大模型相当于调度员不是每个动作都直接出扭矩而是做高层决策。# 概念示意任务规划模型的结构化输出 system_prompt 你将获得一句用户指令和一些可用技能。请将指令拆解为有序技能调用列表输出严格的JSON。 可用技能: navigate_to(目标位置), grasp(物体名称), place(放置位置), handover(对象) # 用户输入: “从桌上递水杯给我” # 模型输出: # [ # {skill: navigate_to, target: 桌子}, # {skill: grasp, object: 水杯}, # {skill: navigate_to, target: 用户面前}, # {skill: handover, object: 水杯} # ]这里有一条必须强调的安全红线不要让大模型直接控制机械臂末端更不要让模型直接发关节扭矩指令。正确做法是模型只输出高层意图由一层确定性的安全策略去校验后再触发运动指令。否则大模型的幻觉哪怕只有千分之一的概率也会导致真实世界的危险。这是我在跑机器人Demo时踩过的坑永远别相信模型的每一步判断都正确。如果你连代码也不想写还可以去做机器人语料整理。比如把特定场景的设备说明书、故障知识、操作手册整理成RAG知识库让机器人能回答“这台设备报警了是什么意思”这类问题。这种工作门槛低、需求旺而且不管模型厂商如何换知识库资产都会沉淀下来。4.3 非技术出身场景、数据、产品化三条路没有技术背景的人听到“OpenAI自研机器人”可能觉得跟自己没关系。其实这波浪潮里最缺的往往不是工程师而是“知道怎么把机器人用起来”的人。场景这条线核心是找到愿意付费的具体需求。我认识一个做工业巡检的朋友他对机器人技术细节一窍不通但他非常清楚锌冶炼厂里需要检查哪些仪表、什么温度区间算异常、数据日志怎么录。他只需要把需求文档写清楚对接技术团队就能做集成商门槛不低的生意。这类“懂行业愿意干活”的角色在大厂标准化产品落地前价值非常大。数据这条线是所有模型公司都绕不开的。现在要做机器人操作数据采集就需要大量人做标注、校验、回放比如判断一次抓取动作是否成功、一帧图像里哪个区域是目标物体。这些工作不需要太深的技术背景但需要细心和耐心收入也在随行业水涨船高。产品化这条线适合有产品思维的人。把一台“啥都能干”的人形机器人定义成某个场景里“能干好”的专用设备本身就是一门学问。谁先把功能边界、验收标准、失败兜底策略说清楚谁就能拿到落地合同。5. 热闹背后我看到的冷风险和长期变量5.1 硬件制造是慢生意OpenAI也绕不过供应链OpenAI在软件上再强也要面对一个现实造硬件不是训模型模型迭代可以几周一个版本硬件从设计到量产往往按年计。尤其是人形机器人这种复杂机械系统一颗螺丝的材质选错都可能导致整机寿命缩水。供应链的第二个问题在良率和成本。目前一台人形机器人原型机的物料成本还很高传感器、关节执行器、灵巧手这些部件单是BOM就能压垮多数初创公司。哪怕OpenAI资金充裕也不能凭钱变出产能它需要跟大量零部件供应商磨合、测试、迭代。所以我的判断是OpenAI自研机器人的真正落地周期大概率比宣传的“即将发布”要长可能需要两三年才看到有意义的原型或小批量产品。5.2 泛化、幻觉与安全端口到端还远不能盲目上车技术层面最让人不放心的还是泛化和安全性。VLA模型在实验室里表现亮眼一旦放到真实的家庭或工厂光照、物体位置、干扰因素全变了成功率断崖式下降是家常便饭。再加上大模型本身存在幻觉机器人端到端控制一旦把幻觉“执行”出来就可能造成真实损坏。所以靠谱的产品一定会做分层安全设计。比如在低层加物理约束力矩限制、速度限制、机械急停、安全PLC在高层加逻辑校验机器人准备执行动作前先由另一套规则系统评估动作是否安全。这也是我特别不建议工程师在真机上直接跑端到端模型的原因只适合在仿真或安全隔离区里验证。真正的商用产品必须有一个不依赖大模型的硬性安全兜底这是所有想做机器人落地的人都要记住的底线。5.3 OpenAI这一步给从业者的真正信号把目光从新闻热度上收回来OpenAI自研人形机器人这个决定更大的意义在于它向整个科技和工业界释放了一个明确信号——大模型的下一个主战场一定在物理世界里。对我个人而言这事最有价值的启发不是“某家公司又要引领什么了”而是“能动手的AI终于要成为主流方向”。接下来几年最吃香的人一定是能同时理解大模型和物理系统的人。他们未必需要把两边都做到极致但能在大脑和小脑之间架起桥梁用模型能力驱动真实设备完成真实任务这种稀缺能力会随着这波浪潮被快速放大。所以如果你现在正好站在AI和机器人的交叉路口别被“技术门槛太高”吓退。从仿真环境、从开源模型、从数据标注开始哪怕只跑通一个很小很小的动作也比一万句“未来已来”有价值。我自己就是这么一路试过来的很多东西一开始根本不完美但做起来之后路才会越走越清晰。