华为×香港大学:手机Agent一进App就乱点?KG-RAG先把路径查清楚 原论文题名KG-RAG: Enhancing GUI Agent Decision-Making via Knowledge Graph-Driven Retrieval-Augmented Generation团队信息Ziyi Guan、Jason Chun Lok Li、Zhijian Hou 等Huawei Hong Kong Research Center、The University of Hong Kong、City University of Hong Kong、Xidian University 等联合团队发表信息Proceedings of EMNLP 20252025DOI10.18653/v1/2025.emnlp-main.274研究对象与核心方法面向移动 GUI Agent 的复杂操作任务把 UI Transition Graph 转成可检索的知识图谱向量库再由意图引导搜索生成可执行导航路径。摘要导读**现实问题**手机与企业 App 里的 Agent 看似能点按钮真正执行时却常卡在页面跳转、隐藏入口和多步任务上。**背景**GUI Agent 需要理解当前界面、历史操作与应用内导航结构只靠屏幕文本和大模型推断容易在相似按钮和多层页面里走偏。**方法**KG-RAG 将碎片化 UI Transition Graph 整理为结构化知识图谱并通过实时检索把任务意图连接到可执行路径。**结果**在多类移动应用实验中KG-RAG 达到 75.8% 成功率较 AutoDroid 提高 8.9 个百分点决策准确率为 84.6%平均步骤由 4.5 降至 4.1。**结论**这篇论文把 GUI Agent 的难点从“让模型凭感觉点屏幕”改成“让模型先查询应用内路径再做动作决策”。**关键词**GUI AgentRAG知识图谱移动应用自动执行UI Transition Graph介绍背景与问题提出Agent 进入真实 App 后挑战往往不是“能不能看见按钮”而是“能不能知道下一步该点哪里”。一个订票、改资料、查订单的任务可能跨越多个页面、弹窗和状态切换屏幕截图只呈现当前一帧缺少应用内部的路径记忆。KG-RAG 处理的正是这个断点。论文关注 GUI Agent 决策当任务描述给到模型后系统不再只让模型基于当前界面猜测动作而是把 App 中可能的页面、控件和跳转关系组织成可检索的结构。这样Agent 在做选择前能先查到“从当前页面到目标页面可能怎么走”。这类问题与近期企业 Agent 落地非常接近。系统一旦接入办公、购物、出行或内部管理应用错误点击不只是回答不准还可能造成流程中断、重复提交或权限误触。KG-RAG 的核心价值是把操作路径变成可查询的证据而不是把所有压力压给一步式推理。原文图 1KG-RAG 总体框架页展示任务意图、UI 转换图、检索模块与动作决策之间的连接。来源ACL Anthology 官方 PDF 裁图EMNLP 2025DOI10.18653/v1/2025.emnlp-main.274研究方法KG-RAG 的基础是 UI Transition Graph。UTG 将应用里的页面状态、控件动作和跳转关系表示成图但原始 UTG 往往碎片化、噪声多直接拿来给模型使用并不高效。论文先对 UTG 进行结构化处理再把相关节点和路径编码到向量数据库中。当用户任务进入系统后KG-RAG 先解析任务意图再根据当前界面状态检索可能相关的页面节点、控件节点和跳转路径。检索结果不是普通文本段落而是与“能执行哪一步”直接相关的导航线索。随后LLM 基于这些线索生成下一步动作并在多轮执行中不断更新上下文。论文还构建了 KG-Android-Bench 与 KG-Harmony-Bench用来覆盖中文移动生态中的多应用、多任务和多页面跳转。原文图 2方法流程页展示系统如何从应用内结构中检索页面、控件与导航路径并辅助 GUI Agent 做下一步决策。来源ACL Anthology 官方 PDF 裁图EMNLP 2025DOI10.18653/v1/2025.emnlp-main.274核心发现与结果解读其一路径检索能降低 GUI Agent 的盲点。KG-RAG 在多应用任务中达到 75.8% 成功率较 AutoDroid 提高 8.9 个百分点。这个提升说明复杂 App 操作不能只依赖屏幕文本识别还需要把页面之间的结构关系纳入决策。其二决策准确率提升到 84.6%意味着系统在“该点哪个控件”这一层更稳定。对于真实应用准确率的意义并不只是分数好看而是能减少误触、回退和重复尝试。其三平均执行步骤从 4.5 降到 4.1。步骤减少看似幅度不大但在多轮任务中会累积成明显差异每少一次无效跳转就少一次状态偏移风险。论文还展示KG-RAG 可迁移到网页和桌面任务在 Weibo-web 与 QQ Music-desktop 上也有提升。原文图 3实验结果页呈现 KG-RAG 在成功率、决策准确率和执行步骤等指标上的比较。来源ACL Anthology 官方 PDF 裁图EMNLP 2025DOI10.18653/v1/2025.emnlp-main.274创新点与学术价值KG-RAG 的创新不在于简单把 RAG 接到 GUI Agent而是把应用内导航结构变成可检索知识。传统 RAG 检索的是文档片段这里检索的是页面状态、控件语义和跳转路径。这让 GUI Agent 的决策更接近“查路线再行动”。在复杂应用中模型需要知道的不只是当前按钮文本还包括这个按钮可能通向哪里、是否接近任务目标、历史路径是否已经走过。论文把这些信息组织进图结构为自动执行系统提供了更清楚的工程接口。局限性与未来方向论文也留下清晰边界。构建 UTG 需要探索 App 页面复杂应用可能需要较高采集成本页面频繁更新、权限状态变化、个性化推荐和弹窗都会影响图结构时效性。另一个挑战是安全控制。即使路径检索更准真实系统仍需要权限分级、动作确认、异常回退和日志审计。KG-RAG 解决的是“知道怎么走”的问题不能替代对敏感操作的安全约束。证据链回看复盘这篇论文可以抓住一条线界面不是孤立截图而是一张会跳转的图Agent 不应只看当前屏幕而应查询这张图里的可行动路径。当 Agent 从问答走向执行RAG 的对象也会变化。它不只检索文本知识还要检索流程、状态和操作关系。KG-RAG 给出的启发是让 Agent 执行前把应用内部地图先查清楚。结语GUI Agent 的落地难点常常卡在一个很小的动作上该不该点、点了会去哪、走错后能否回来。KG-RAG 把这些问题放回知识图谱与检索链里让自动执行从“会看屏幕”向“会查路径”迈进。参考文献Guan Z, Li J C L, Hou Z, et al. KG-RAG: Enhancing GUI Agent Decision-Making via Knowledge Graph-Driven Retrieval-Augmented Generation. Proceedings of EMNLP 2025. DOI: 10.18653/v1/2025.emnlp-main.274.本文不构成诊疗建议、投资建议或安全防护方案。