让 Agent 成为音视频工作台:AI MediaKit CLI + Skill 发布 在刚刚结束的 2026 Force 源动力大会上火山引擎智能视频云正式发布了 AI MediaKit CLI 与 Skill。火山引擎 AI Media Platform 产品负责人杭梦钰指出AI 视频生产的下一阶段不只是生成一段画面而是交付一条真正能上线的视频。模型让内容生成变得越来越容易。用户可以用一句话、一张图或一段参考视频生成画面。但在真实生产中一条视频从“生成出来”到“可以发布”中间仍然需要大量音视频处理工作理解素材、裁剪片段、拼接成片、添加字幕、擦除原字幕、增强画质、调整帧率和分辨率、适配不同平台规格需要覆盖理解 — 处理 ——交付的全链路工作。这些工作过去属于剪辑软件、后期系统和云端 API。到了 Agent 时代我们希望它们也可以被 Agent 直接理解、调用和编排。这也是AI MediaKit CLI Skill发布的背景让 Agent 不只是会写 prompt、调用模型而是拥有一座可调用、可编排、可交付的音视频工作台。AI MediaKit CLI Skill 发布Agent 需要的不只是模型还有工作台对大多数文本任务来说Agent 的工作方式已经很自然读文档、写代码、调接口、看日志。输入和输出大多是文本Agent 可以直接判断结果是否正确。但音视频任务不一样。视频是画面音频是声波。成片好不好、字幕对不对、节奏顺不顺、画质有没有提升这些都不是纯文本问题。Agent 活在符号世界里而音视频活在感官世界里。因此音视频工具如果只是把一个 API 包成命令并不足够 Agent 可靠使用。Agent 需要知道有哪些音视频能力可以调用每个能力需要什么输入长耗时任务是否提交成功任务执行到哪一步最终产物在哪里结果能不能继续交给下一步处理。这就是“音视频工作台”的意义。它是一组面向 Agent 的能力层把理解、处理、交付等音视频处理流程封装成 Agent 可以调用和编排的工具。AI MediaKit面向 Agent 的音视频能力底座AI MediaKit 是火山引擎面向 Agent 时代提供的音视频开发套件沉淀了100 音视频原子能力覆盖视频理解、剪辑、字幕、画质增强、字幕擦除、转码、音频处理、图像处理等生产环节。这些能力过去往往分散在不同软件、不同 API、不同后期系统里。AI MediaKit 要做的是把它们重新组织成一套面向 Agent 和开发者的能力底座。此次发布的CLI Skill就是 Agent 进入这座工作台的第一层入口。它让开发者可以用命令行调用音视频能力也让 Claude Code、Trae、Cursor、Codex、OpenClaw 等 Agent runtime 可以通过自然语言触发对应工具。换句话说AI MediaKit 提供的是 100 音视频能力池CLI Skill 则是这些能力面向 Agent 生态的标准化入口并会随着底层能力开放持续跟进。AI MediaKit CLI Skill 发布了什么AI MediaKit CLI Skill 主要由三部分组成。第一部分是 AI Mediakit Cli。它是面向 Agent 的原生命令行工具。开发者和Agent都可以直接用命令完成视频裁剪、拼接、加字幕、画质增强、字幕擦除等任务也可以把它接入自动化处理流程。第二部分是 AI MediaKit Skills。Skill 面向 Agent runtime。安装后用户可以在 Agent 对话窗口里直接描述需求由 Agent 理解意图、编排能力、拼接命令、提交任务并交付结果。当前 Skill 按四大能力域拆分并会随着 AI MediaKit 底层能力开放持续跟进byted-mediakit-editing剪辑类能力包括裁剪、拼接、变速、加字幕、加水印、音视频合成等byted-mediakit-video视频处理类能力包括画质增强、字幕擦除、视频处理等高阶视频 AI 能力byted-mediakit-image图像处理类能力包括图像增强、智能抠图、擦除修复、OCR、智能裁剪等byted-mediakit-audio音频处理类能力包括人声背景音分离、音频处理及后续扩展能力。第三部分是 Agent 友好的任务机制。音视频任务经常是异步的不适合只靠一次命令返回判断成功。AI MediaKit CLI Skill 将 task_id、任务查询、轮询等待、终态结果回收等流程下沉到工具层让 Agent 不必靠“记忆”判断什么时候回来查任务。开发者可以通过一行命令快速完成mediakit-cli 和 mediakit skills快速开始npx volcengine/mediakit-cli install -y其中mediakit-cli 负责执行音视频任务npx skills add 会把 AI MediaKit Skills 分发到本机支持的 Agent runtime 中。装好之后Agent 就可以通过自然语言调用这些能力。从一句话到一条可交付视频比如用户说“帮我把这个视频前 10 秒剪出来再加上字幕。”接入 AI MediaKit CLI Skill 后Agent 可以自动识别这是一个剪辑任务调用 editing Skill生成对应的裁剪和加字幕命令执行任务并返回最终视频。再比如“把这条短剧素材做一下画质增强输出 1080p 版本。”Agent 可以调用 video Skill将任务提交到云端画质增强能力并通过 shared Skill 轮询任务状态直到拿到最终产物。在更复杂的场景中Agent 还可以把多个能力编排成工作流先擦除原字幕再重压新字幕先裁剪多个片段再拼接成片先生成素材再做画质增强和平台规格适配。模型擅长生成AI MediaKit 负责把生成后的素材处理成真正可上线、可分发、可消费的成片。不是 API Wrapper而是 Agent 的工作台入口AI MediaKit CLI Skill 并不是把 API 简单包一层命令。它面向 Agent 使用场景做了几件关键设计。能力结构化Agent 不需要凭经验猜命令和参数而是可以通过 Skill 描述理解每个能力的用途、输入和调用方式。长任务可回收音视频任务往往耗时更长。CLI Skill 将任务提交、状态查询、终态判断和结果回收沉到工具层让 Agent 可以稳定完成长链路任务。端云协同基础剪辑类任务适合在本地完成成本低、确定性强画质增强、字幕擦除等重算力任务适合交给云端。Agent 不需要理解底层算力细节只需要围绕目标编排任务。多入口统一底座企业后端可以走 API开发者和 CI 可以走 CLIAgent 用户可以走 Skill。不同入口面向不同使用场景但连接的是同一套 AI MediaKit 能力体系。这让 AI MediaKit 不只是一个能力集合而是逐步成为面向 Agent 的音视频工作台。面向更大的音视频 Agent 生态从内容创作到企业生产音视频任务天然是长链路任务。一次成片往往涉及理解、剪辑、字幕、音频、增强、导出等多个环节。过去这些环节需要人操作多个软件或者开发者手动接入多个 API。Agent 带来的变化是这些工作可以被重新组织成自然语言驱动的工作流。对开发者来说AI MediaKit CLI Skill 降低了接入门槛对 Agent 来说它提供了一组可调用、可组合、可回收结果的音视频工具对内容生产场景来说它让从生成到交付的链路更自动化、更稳定。未来随着 AI MediaKit 100 音视频能力持续开放CLI 和 Skill 也会持续跟进让更多音视频处理能力进入 Agent 工作流。模型让 Agent 拥有生成内容的大脑。AI MediaKit CLI Skill则让 Agent 拥有处理和交付音视频的工作台。让 Agent 成为音视频工作台这只是第一步。了解更多访问AI MediaKit 产品官网访问mediakit-cli GitHub 开源仓库快速开始安装 CLI 与 Skil1. npx volcengine/mediakit-cli install -y或给你常用的 Agent 说1. 帮我安装一下mediakit cli和skillhttps://github.com/volcengine/mediakit-cli