AI 不再等你下指令:Meta、OpenAI、Manus 在同一个月做了同一件事 一、2026 年 9 月三家大厂撞在了同一件事上先列三个日期。9 月 8 日Meta 发布 Muse。9 月 28 日Manus 随 2.0 发布 Cue。9 月 29 日OpenAI 在 DevDay 上发布 dots。三家前后不到三周做了同一件事。而这件事的共同点只有一句话AI 不再等你下指令了。以前是你问一句它答一句——你不开口它一动不动。现在是它自己盯着一个目标在后台一直跑跨天、跨设备你不在、电脑关着也在跑只在需要你拍板时才回来找你。这不是模型变强了是智能体换代了。我们得先把这个换代讲清楚否则后面全是误会。以前的 AI 智能体你叫它一次它干一次你熟悉的 Codex、Claude Code、Cursor包括 Manus 1.0全都是这个模式你下一条指令 → 它执行 → 做完 → 停下 → 等你下一条它的生命周期就是一次会话。会话结束它就死了。你不开口它一动不动。现在的常驻智能体你给它一个目标然后可以不管了Muse、dots、Cue 是另一种东西你给一个持续目标→ 它自己拆解 → 后台一直推进 → 跨天、跨设备 → 你不在、电脑关着也在跑 → 只在需要你拍板时才回来找你差别在哪四条任务型常驻型谁在驱动你下指令它守着一个目标有没有自己的东西借你的账号行事有自己的电脑Cue 甚至有自己的邮箱、电话、钱包记多久会话级跨周、跨月还会学你的偏好你不在时不动继续干一句话任务型是你叫一次它动一次常驻型是你雇了它它自己找活干。二、它们到底能干什么1. 不用你开口它自己找活OpenAI 演示 dots 时的例子很说明问题你的日历显示晚餐时段还有个会。你没有问任何问题dot 自己看到了主动去查外卖回来给你两个选项和各自的价格问你要哪个、几点送。另一个例子是 dot 主动去追一个 bug 并修掉还有一次是在公司活动前提醒主讲人——你的幻灯片还没做完。“不用你开口它就已经替你把事情做好”这是奥特曼的原话。2. 它能对外打交道因为有身份这是 Manus Cue 最激进的地方每个 agent 都有自己的邮箱、电话号码、钱包、电脑。所以它能干这些事用自己的邮箱收发消息跟你的收件箱是两码事替你接电话挂断后把通话摘要留在 Cue 里在你设定的预算内付款在餐厅扫个码由 agent 去点餐、排队取号多个 agent 进同一个群聊接力一个调研场地、一个筛短名单、一个起草文稿真人和 bot 混在同一个群里3. 它会自己造工具Meta 官方博客里有一句话我读了两遍an agent that knows you, actually does things, works in the background,launches swarms of subagents, builds its own tools, and edits itself它会拉起一群子 agent、会给自己造工具、会改自己。Meta AI 产品副总裁的说法是得益于自主编写软件的能力Muse 的功能理论上几乎不受限制。遇到没有现成接口的服务只要对方有公开 API它能自己写一个连接器出来——包括跨平台比价下单。4. 它凭什么敢这么干这一段点到为止但值得知道因为这决定了你能信它几分。三个厂商里安全架构做得最细的是 Meta每个用户一台独立的云端 Linux 虚拟机Muse Secure VM数据存在你自己的 VM 里不在 Meta 的中心化设施Sentinel一个和主 agent 同机但相互隔离的独立守门人。所有对外动作、所有出网必须过它审批而且主 agent 没法把它关掉凭据代持OAuth token 存在你的 VM 里主 agent 从来看不到你的真实密码和支付信息运行时隔离agent 跑在systemd-nspawn容器里容器内的 root 映射到宿主机的非特权用户——容器里的 root 不是宿主机的 root还禁了 io_uring、削掉了 CAP_SYS_PTRACE 和 CAP_NET_ADMIN开放漏洞悬赏最高 30 万美元能影响单个用户的成功提示注入攻击最高 13 万美元OpenAI 那边的思路不一样但同样保守dots 的后台研究默认是只读的。安装软件、改密码、永久删除数据这类操作强制要求你显式批准。另外给了 Custom Rules让你自己划红线。顺带说一句Meta 在官方博客里明确写了——Muse 仍然会犯错也会被它读到的数据攻击。他们的设计前提是假设 agent 正处在攻击之下然后限制可能的损失。这个态度是对的。三、工作里怎么用先别给权限讲完了能干什么说落地。我的建议是常驻智能体最值钱的用法恰恰是最不需要给它权限的那些。而真正要放权的时候得按测试的老规矩来——影子运行、灰度、熔断。场景 1先跑两周影子模式只看它敢做什么这是我最推荐的第一步也是做质量的人最熟的套路。做法把动作规则设成先问后做让它照常跑但不真放行。你就坐在旁边看——看它如果放行它会做什么。dots 的 Custom Rules 就是干这个的Cue 是给钱包设预算上限。为什么必须这么做常驻 agent 跟一次性 agent 最大的区别是它不是执行一两次是一直在执行。你没法靠试一次看看来判断它靠不靠谱。这跟测试里新上一个断言是一个道理先只记录、不阻断跑两周看看误报率再决定要不要让它 fail pipeline。场景 2给它划一条熔断线影子模式跑顺了再考虑放权。放权的时候至少设三道线① 动作白名单 / 黑名单哪些能做、哪些永远不能碰写死。OpenAI 给的默认清单可以直接抄装软件、改密码、永久删除数据——这三类必须人来点。② 金额上限Cue 的钱包是用户设定预算这个设计是对的。给一个你亏得起的数字比如一个月 200 块。③ 次数和频率上限一天最多触发几次、一次最多跑多久。常驻 agent 最阴的失效模式不是做错一件大事是**“用很小的错误刷了你一整天”**。这三道线本质上就是超时熔断、失败率熔断、资源配额——全是质量工程里现成的东西换个对象而已。场景 3把它接进你现在的工作流别另起炉灶常驻 agent 的价值大半在你在哪儿它就到哪儿所以接入点比能力更重要。dots走 ChatGPT、Slack、Microsoft Teams——也就是说它活在你和同事本来就在的地方。一个 Slack 里的 bug 报告可以一路走到查代码 → 定位到已有 PR → 在云环境里验证 → 准备好评审。Codex这一侧更实用。DevDay 上它拿了几个真正能用的东西# 把任务丢到云端笔记本合上也能跑codex cloud# 一个终端面板管多个并行 agent/agents# 从当前上下文分叉出一个新会话/fork还有两个我建议质量岗优先开的Code Review接 GitHub PR / GitLab MR可以开自动云评审——你不在的时候它先过一遍Codex Security Cloud按需或定时扫整个仓库 → 调查发现 →去重→ 在云端准备好修复方案注意那个去重。AI 扫漏洞最大的问题从来不是漏是一次报五十条重复的和三条真的。它把这个当作功能点来做说明是真被这个问题坑过。场景 4内网和敏感环境用本地常驻如果你的东西不能出内网那就别用云端的那几个。OpenClaw是开源的那一个跑在你自己的机器上数据不出本机npminstall-gopenclaw openclaw onboard它能接 Cron jobs / Webhooks 做定时自动化有 Browser / Exec / Web 工具模型可以换成 Ollama 本地模型实现完全不出网。适合的活定时巡检、日报周报、告警推送、那些没有 API 只能点网页的内部系统自动化。常驻 只读 内网这是目前争议最小、也最容易落地的一种用法。场景 5退出方案要在进去之前想好这一段大多数介绍稿不会写但你一定会用到。① 断开连接 ≠ 删掉记忆OpenAI 的文档说得很明白dot 会对所有已连接的应用做主动研究并从读到的内容里形成记忆——即使你从没让它这么做。之后你断开某个应用不会删除它已经学到的东西只有删除整个 agent 才会。② 对外可达的联系方式是双向的Cue 的 agent 有自己的电话号码和邮箱。好处是它能替你接电话代价是任何人都能直接找到它。开通之前先定死一件事一条外部进来的消息允许触发什么③ 文件可能跟着订阅一起消失Manus 的 Cloud Computer 是单独计费的而且订阅失效后文件会被删除。别把唯一一份东西存在 agent 的电脑里。建议进之前先走一遍怎么删 agent、怎么清记忆、怎么把产出的文件拿出来。走不通就先别放重要数据。四、几个不该被忽略的负面信号写到这里我得泼点冷水因为这些事就发生在同一个月。dots 发布会现场翻车了。语音响应多次没反应、卡顿断线主持人只能在台上道歉。有 OpenAI 员工事后说主因是一次性发布太多更新导致系统过载。OpenAI 在 DevDay 前一天宣布最新模型因内部测试出现安全问题而延期。而奥特曼在会上亲口承认先进 AI 存在正当失控a legitimate loss of control的可能尤其当能力集中在少数企业或国家时风险更难管控。Muse 也不是没出过事。据报道它出过 SEV-2 级的虚拟机缺陷已修补和地址泄露问题。有统计称光 2026 年 9 月就披露了约 24 起 agent 相关事故。这些不是劝退是要说清楚一件事常驻把出错的性质改变了。以前一个 agent 出错是这一次错了代价有边界。常驻 agent 出错是**“它一直在错而且它在你不知道的时候读了你的东西”**。代价没有天然边界得靠你给它装上去。五、对做质量的人来说这意味着什么我做测试这些年有一个反复被验证的道理一个工具真正的成本不是它做错事的时候是它做错事而你已经习惯相信它的时候。flaky 的用例比没有用例更糟因为第三次失败之后就没人再看了。天天喊狼来了的评审工具第三次就会被关掉。常驻智能体把这个老问题放大了一个量级——它是 7×24 小时运行的 flaky 用例。所以我的判断是这一轮换代里最稀缺的能力不是让 AI 更自主而是给自主的 AI 装上刹车。而装刹车这件事——影子运行、灰度放权、熔断阈值、监控告警、退出预案——全是质量工程的老本行。给 AI 加油门的人已经够多了。六、如果要上手按这个顺序先挑低风险的事开刀监控、消息归类、定时提醒。别一上来接合同、财务、生产环境权限。先设成先问后做跑一两周只看不动手。一次只接一个应用。每接一个就多一个入口。进之前先想好怎么退出删 agent、清记忆、拿回文件三步都要走得通。优先用只读的常驻定时巡检、漏洞扫描、自动代码评审——这三个是当下性价比最高、也最不容易出事的用法。最后2026 年 9 月这三家在同一个月撞在一起不是巧合。它说明一件事AI 智能体从你问它答到你雇它干这个转折已经发生了。而转折之后最先要解决的问题不是它能不能干是你敢不敢让它一直干。Meta 给出的答案是给每个用户开一台虚拟机再配一个主 agent 关不掉的守门人还挂了 30 万美元的悬赏请人来攻它。OpenAI 给出的答案是后台默认只读敏感操作一律要人点头。Manus 给出的答案最不一样——它直接给 agent 发了电话和钱包。三条路哪条对现在还看不出来。但有一点是确定的接下来真正值钱的工程能力是让一个会自己一直跑下去的东西跑得可控。主要来源Meta Research《How We Built Safety Into Muse》、OpenAI 官方 DevDay 2026 公告、WIRED、OpenClaw 官方文档。价格与可用性信息变动较快以官方为准。本文首发于个人公众号转载请注明出处。