一张RTX 5090能创造世界吗?ABot-World完全介绍:720P/16FPS实时交互式世界模型 一张RTX 5090能创造世界吗ABot-World完全介绍720P/16FPS实时交互式世界模型【免费下载链接】ABot-WorldInfinite Interactive World Rollout on a Single Desktop GPU项目地址: https://gitcode.com/gh_mirrors/ab/ABot-WorldABot-World 是一个跑在单张桌面显卡上的实时交互式世界模型World Model。它把一张 NVIDIA RTX 5090 变成世界模拟器以 720P 分辨率、16 FPS 帧率、1.2 秒延迟、约 19GB 显存持续生成无长度上限、可随你的键盘操作实时响应的互动画面——不是被动播放视频而是你走一步、世界就变一步。为什么这个项目值得关注 多数视频生成模型只能放电影给定一段提示词输出一段固定长度的视频。ABot-World 的核心突破在于动作驱动Action-Driven 无限滚动Infinite Rollout特性说明 动作驱动控制响应 WASD/IJKL 键盘操作世界实时改变而非被动播放⚡ 桌面级实时推理单张 RTX 5090 即可 720P / 16 FPS 运行显存峰值约 19GB♾️ 无限世界滚动突破固定视频长度限制支持长时间连续探索官方已演示 24 小时不中断 开放式世界想象通过 LongForcing 训练滚动过程中持续扩展新场景与动态不锁死在初始画面核心性能指标一览官方参考环境Ubuntu 22.04 CUDA 12.8 Python 3.12 RTX 5090分辨率720P1280×704见 web_client/config.py 中的STREAM_WIDTH/STREAM_HEIGHT帧率16 FPS单帧延迟约 1.2 秒显存峰值约 19GB因此 RTX 3090 / 409024GB原则上也可运行官方已在 4090 上验证内存建议系统内存至少 64GB更多硬件兼容问题可参考 FAQ.md。一键部署Docker 快速上手项目提供了预构建 Docker 镜像docker.io/amapcvlab/abot-world:v0-env可跳过繁琐的手动依赖安装。1️⃣ 克隆仓库并下载模型权重ABot-World-0-5B-LF因果学生模型可通过 HuggingFace 或 ModelScope 获取git clone https://gitcode.com/gh_mirrors/ab/ABot-World cd ABot-World2️⃣ 拉取镜像并启动docker pull amapcvlab/abot-world:v0-env IMAGEamapcvlab/abot-world:v0-env bash docker/run.sh国内用户可改用阿里云容器镜像仓库加速拉取。镜像构建与挂载选项详见 docker/README.md入口脚本为 docker/run.sh。若偏好手动安装README 中给出了 conda 环境 PyTorch (cu128) FlashAttention SageAttention 量化内核的完整步骤依赖清单见 requirements.txt。启动 Web 交互界面 ️环境就绪后一条命令即可启动本地 Gradio 交互 Demobash web_client/run.sh启动后打开浏览器即可体验。界面由 web_client/app.py 定义工作流是选首帧参考图 Prompt场景预设集中在 web_client/scene_presets.yaml每个条目包含一张参考首帧图和对应的文字描述点生成开始世界滚动模型从首帧出发持续生成新画面按键盘与世界互动WASD 控制前进/后退/左移/右移IJKL 控制视角上下左右。按键状态由 web_client/keyboard.py 管理每个生成代码见 web_client/inference.py。内置演示场景这些世界都可以直接玩 项目在 web_client/datasets/images/ 目录下内置了多张高质量首帧参考图对应不同风格的互动世界打开 Demo 即可切换城郊小院烈日下的美国城郊住宅与商业街第一人称漫步example_first.jpg沙漠河谷第三人称行走穿越沙漠绿洲溪流如上图高山草甸第一人称沿山间小路远眺群山林间溪流第一人称踏石过河苔藓与林光交错雪原极光雪地里与狐狸相伴仰望极光另外项目还开放了 500 小时、带精确动作标注的视频训练数据集为研究动作条件世界模型提供了稀缺资源。它是怎么做到实时又省显存的⚡单卡实时 720P 世界生成背后是一整套工程优化主要集中在几个模块因果推理流水线pipeline/causal_inference.py 负责自回归式逐块block生成世界画面而不是整段视频一次生成FP8 量化默认配置 configs/default_config.yaml 开启了fp8-per-token量化 GEMM量化实现位于 quantizer/ 目录轻量 VAE默认使用 TAEHV 轻量 VAEwan/modules/taehv.py加速 latent 编解码自定义 Triton 内核wan/modules/helios_kernels/ 提供了优化的 RoPE、RMSNorm 与分块线性层内核显存调度utils/memory.py 在显存紧张时动态启用内存交换web_client/config.py 中LOW_MEMORY_THRESHOLD_GB40控制该策略。配置参数VAE 类型、量化方式、模型权重路径集中在 configs/default_config.yaml 与 configs/long_forcing_dmd.yaml改配置即可切换推理后端无需改代码。技术路线与后续规划 ️ABot-World 当前发布的是基于 LongForcing 训练的因果学生模型ABot-World-0-5B-LF蒸馏权重已合入diffusion_pytorch_model.safetensors。根据 README.md 的 Roadmap✅ 交互式 Web Playground、推理代码、本地 Gradio Demo、因果学生模型、技术报告、500 小时数据集均已发布⏳ 双向教师模型Bidirectional Teacher Model尚在路线图中项目基于 Apache License 2.0 开源见 LICENSE其核心能力正是世界模型 单卡实时这一组合——如果你想在桌面级硬件上体验或研究可无限交互的世界生成ABot-World 目前是最完整、最易上手的开源方案之一。【免费下载链接】ABot-WorldInfinite Interactive World Rollout on a Single Desktop GPU项目地址: https://gitcode.com/gh_mirrors/ab/ABot-World创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考