
1. 电商出图这件事为什么值得用 Agent Skills 重做一遍做电商的都知道图就是转化率。一张主图决定点击一套详情页决定停留一组场景图决定加购。但真正做过店铺的人心里都清楚出图这件事有多磨人运营提需求、设计师排期、拍摄或渲染、修图、改尺寸、换背景、做A/B测试版本一圈下来三五天算快的。如果是跨境店铺还要考虑不同站点的审美差异、语言版本、合规要求光是沟通成本就能吃掉大半利润。我过去两年一直在折腾电商视觉的自动化流程从最早的批量套模板到后来用脚本调API生成再到最近半年深度使用 Claude Code、Codex、Cursor 这类带 Agent 能力的工具慢慢摸出一套相对稳定的打法。这次开源的 12 个电商出图 Agent Skills就是把这套打法沉淀成了可复用的技能包核心目标只有一个让 GPT Image 2.5 这类图像模型在电商场景下做到“一键出图”而且出的图能直接上架不是那种一眼假的AI味素材。先说清楚这套东西是什么。Agent Skills 本质上是一组结构化的提示词工程加工具调用编排它把电商出图拆解成若干个标准动作需求解析、场景构建、主体锁定、光影匹配、尺寸适配、合规检查、批量变体。每个 Skill 对应一个具体能力比如“白底主图生成”“场景种草图生成”“模特换装图生成”“详情页长图切分”等等。你不需要每次都从零写提示词而是像调用函数一样调用这些 SkillAgent 会自动帮你补全参数、处理边界情况、做质量校验。它解决的核心问题是三个。第一是一致性同一款产品在不同图里的颜色、材质、比例必须稳定不能这张图是哑光那张图是亮面。第二是可批量一个SKU要出十几张图手动一张张调根本不现实。第三是可复现今天出的图和下周出的图风格要统一换个人操作也不能跑偏。这三点恰恰是纯手动提示词最难保证的而 Agent Skills 通过结构化约束把这些问题压下去了。适合谁来参考如果你是个体电商卖家自己兼运营和设计这套东西能帮你把出图时间从几小时压到几分钟。如果你是设计团队负责人想给团队搭一套标准化出图流程这里的 Skill 拆分思路可以直接抄。如果你只是对 Agent Skills 这个新概念好奇想看看它到底怎么落地那这篇里的实操细节应该也能给你一些启发。下面我会从整体设计思路开始拆然后逐个讲核心 Skill 的实现要点再给完整的实操流程和踩坑记录。2. 整体设计思路为什么是 12 个 Skill而不是一个大而全的提示词2.1 从“写提示词”到“编排技能”的思维转变大多数人用 GPT Image 2.5 的方式是打开对话框敲一段描述等图出来不满意就改描述再试。这种方式在单张图上还能凑合一旦进入电商场景就崩了。因为电商出图不是“生成一张好看的图”而是“在严格约束下生成一张符合上架标准的图”。约束包括产品主体不能变形、背景不能抢戏、文字区域要留白、尺寸比例要符合平台要求、颜色要和实物一致。我一开始也试过写一个超长提示词把所有要求塞进去结果模型经常顾此失彼。你强调背景简洁它就把产品也简化了你强调产品细节它又给你加一堆杂乱元素。后来我想明白了这就像让一个人同时干十件事不如拆成十个专人各干一件。Agent Skills 的核心思路就是职责分离每个 Skill 只负责一个明确的子任务输入输出都有严格定义Agent 负责按顺序调用它们。举个具体例子。生成一张白底主图拆开来看至少涉及识别产品类别和材质、确定拍摄角度、设置纯白背景、匹配柔光箱布光、锁定产品占比、输出指定尺寸。如果把这些揉成一段提示词模型很容易在某个环节跑偏。但拆成 Skill 之后每个环节都有独立的校验点比如“产品占比”这个 Skill 会明确要求主体占画面 70% 到 80%偏离了就重新生成。这种结构化约束是纯提示词做不到的。2.2 12 个 Skill 的划分逻辑与覆盖场景这 12 个 Skill 不是拍脑袋定的而是按电商出图的完整链路倒推出来的。我把链路拆成四个阶段输入解析、主体生成、场景扩展、后处理与校验。每个阶段对应若干 Skill加起来正好覆盖从拿到产品信息到输出可上架图片的全过程。具体划分是这样的。输入解析阶段有两个 Skillproduct-parse负责从产品标题、属性、卖点里提取视觉关键词reference-lock负责锁定参考图的颜色和材质特征。主体生成阶段有四个white-bg-main出白底主图scene-lifestyle出场景种草图model-wear出模特穿戴图detail-closeup出细节特写图。场景扩展阶段有三个multi-angle出多角度图size-chart出尺寸对比图bundle-group出组合套装图。后处理与校验阶段有三个compliance-check做合规检查batch-variant做批量变体upscale-clean做放大和去噪。你可能会问为什么不做成一个 Skill 带参数因为 Agent 调用 Skill 的时候每个 Skill 的提示词模板、参数默认值、校验规则都是独立的。如果合并成一个参数会爆炸维护起来也痛苦。分开之后每个 Skill 可以单独迭代比如你觉得白底主图的布光不对只需要改white-bg-main这一个文件不影响其他场景。这种模块化设计在实际使用中省了太多事。2.3 与 Claude Code、Codex、Cursor 的配合方式这套 Skill 本身是模型无关的但实际用起来配合 Claude Code、Codex 或 Cursor 这类带 Agent 能力的工具效率最高。原因是这些工具能读取本地文件、执行脚本、维护上下文而 Agent Skills 正好是一组本地文件加调用逻辑。在 Claude Code 里你可以把 Skill 定义成.md文件放在项目目录下Claude Code 会自动读取并理解每个 Skill 的用途。调用的时候直接说“用 white-bg-main 给这个产品出主图”它会找到对应文件、解析参数、生成提示词、调用图像接口。Codex 的思路类似通过配置文件把 Skill 注册成可调用的工具。Cursor 则更适合在编辑器里边写边调你可以直接在代码里引用 Skill 模板改完立刻测试。我实测下来Claude Code 在理解 Skill 意图和自动补全参数方面最顺手Codex 在批量执行和脚本编排上更稳Cursor 适合调试单个 Skill 的提示词效果。三者不冲突可以按场景切换。下面讲具体 Skill 的时候我会说明每个 Skill 在不同工具里的调用差异。3. 核心 Skill 拆解与实操要点3.1 product-parse把产品信息翻译成视觉语言这个 Skill 是整个流程的入口也是最容易被低估的一个。很多人觉得解析产品信息很简单不就是读标题吗但电商标题是给搜索算法看的不是给图像模型看的。比如“2024新款女士秋冬加厚保暖羽绒服中长款显瘦修身”这种标题里面全是营销词图像模型根本不知道“显瘦修身”该怎么画。product-parse要做的是把营销语言翻译成视觉语言。它会提取出产品类别羽绒服、目标人群女士、季节秋冬、核心材质羽绒、版型特征中长款、修身、颜色如果标题里有。然后把这些映射成图像模型能理解的描述一件中长款女士羽绒服修身剪裁秋冬场景柔和自然光突出蓬松感和保暖质感。实操的时候我建议给这个 Skill 准备一个映射表把常见的营销词对应到视觉描述。比如“显瘦”对应“修身剪裁、纵向线条”“高级感”对应“低饱和色调、简洁背景、柔和光影”“ins风”对应“自然光、生活化场景、浅景深”。这个映射表可以不断积累用得越久越准。注意product-parse 的输出一定要包含“不确定项”。比如标题里没写颜色就不要瞎猜标记为“待确认”让后续 Skill 或者人工介入。我踩过的坑就是早期让模型自动补全颜色结果生成了一堆和实物不符的图退货率直接上去了。3.2 reference-lock锁定颜色和材质避免“AI变色”电商出图最怕什么怕图上的颜色和实物不一样。客户收到货发现色差大轻则差评重则退货。GPT Image 2.5 虽然色彩还原能力比前代强很多但如果你不给强约束它还是会自由发挥。reference-lock就是干这个的。这个 Skill 的输入是一张或多张产品实拍图输出是一组颜色和材质的锁定参数。具体做法是从参考图里提取主色、辅色、材质反光特征、纹理密度然后把这些参数写进后续所有生成 Skill 的提示词里。比如一件深蓝色牛仔外套它会提取出“深靛蓝、棉质斜纹、轻微做旧、哑光表面”后续生成时这些词会作为硬约束出现。实测下来光靠文字描述颜色是不够的。你说“深蓝色”模型可能给你生成藏蓝、宝蓝、灰蓝各种版本。但如果你同时提供参考图的色值范围比如 HSL 色相在 210 到 220 之间、饱和度 40% 到 50%、明度 25% 到 35%锁定效果会好很多。我在 Skill 里加了一个色值校验步骤生成后用脚本比对主色色值偏离超过阈值就自动重生成。提示参考图的质量直接决定锁定效果。尽量用自然光下拍摄的、没有滤镜的实拍图。如果只有白底图也可以但材质反光特征会丢失一些需要手动补充描述。3.3 white-bg-main白底主图的六个关键参数白底主图是电商最基础的图也是平台要求最严格的图。淘宝、京东、亚马逊对白底图的要求各有差异但核心就几条纯白背景、产品居中、占比合适、无阴影或轻微自然阴影、边缘清晰、尺寸达标。听起来简单但用 AI 生成的时候每一条都可能出问题。我把white-bg-main的参数拆成六个背景色值、产品占比、拍摄角度、布光方式、阴影强度、输出尺寸。背景色值必须是纯白#FFFFFF不能是灰白或米白这个用提示词加后处理双重保证。产品占比我设的是 75%上下留白各 12.5%这个比例在大多数平台都适用。拍摄角度默认正面平视如果是鞋子或包包可以改成 45 度俯视。布光用柔光箱模拟主光从左上 45 度打辅光从右侧补避免硬阴影。阴影强度设成 15%太强显得脏太弱显得飘。输出尺寸按平台要求淘宝主图 800x800亚马逊 1000x1000 起。实操的时候我发现最容易翻车的是边缘处理。AI 生成的产品边缘经常有毛边或者和背景融合尤其是毛发类、透明类产品。我的解决办法是在 Skill 里加一个“边缘锐化”的后处理步骤用简单的图像处理脚本做一次边缘检测和锐化。这个步骤不复杂但效果立竿见影。3.4 scene-lifestyle场景种草图怎么做出“真实感”场景种草图是转化率的关键但也是最难做的。难在哪难在“真实感”。AI 生成的场景图很容易一眼假要么光影不对要么透视不对要么产品像贴上去的。scene-lifestyle这个 Skill 的核心目标就是让生成的场景图看起来像真实拍摄的。我的做法是分三步。第一步场景构建。根据产品类别选择合适的场景模板比如服装选咖啡馆、街拍、居家家居选客厅、卧室、阳台食品选餐桌、厨房、野餐。场景模板里预设了光照方向、色温、景深参数。第二步产品植入。把产品按正确的透视和比例放进场景这一步要锁定产品的光照和场景光照一致否则就会像贴图。第三步氛围统一。加一些环境元素比如咖啡杯、绿植、书本但要注意不能抢戏产品始终是视觉中心。这里有个经验场景图里的人物或手部动作要自然。我早期生成的图里模特拿产品的手经常是六根手指或者姿势诡异。后来我在 Skill 里加了手部约束明确要求“五指自然弯曲、手腕角度合理”情况好了很多。另外场景图的光照色温要和产品色温匹配暖光场景配暖色产品冷光场景配冷色产品不然会很突兀。3.5 model-wear模特穿戴图的合规与自然度平衡模特穿戴图涉及两个难点合规和自然度。合规方面不同平台对模特图的要求不一样有些平台不允许过度修图有些对模特姿势有要求。自然度方面AI 生成的模特经常有肢体比例问题、服装贴合问题、表情僵硬问题。model-wear这个 Skill 我设计了几个约束。模特比例用标准人体比例身高设成 7.5 头身避免夸张。服装贴合要模拟真实穿着效果该有褶皱的地方有褶皱该垂坠的地方垂坠。姿势默认站姿双手自然下垂或轻插口袋避免复杂动作。表情默认自然微笑不露齿或微露齿。背景用简洁纯色或虚化场景突出服装本身。注意模特图涉及肖像权问题我建议用 AI 生成的虚拟模特不要用真人照片做参考。如果平台要求真人模特那就老老实实拍摄不要用 AI 替代。这个边界要清楚。3.6 batch-variant一次生成 20 张变体的编排技巧批量变体是电商出图的刚需。一个产品要出不同颜色、不同角度、不同场景的图手动一张张做太慢。batch-variant的思路是定义一个变体矩阵比如颜色 5 种、角度 4 种组合起来 20 张图然后让 Agent 自动遍历生成。实操的时候我会把变体矩阵写成一个 JSON 配置文件每个维度列出可选值。Agent 读取配置后按笛卡尔积生成所有组合逐个调用对应的生成 Skill。这里有个技巧先生成一张基准图确认颜色、材质、比例都对了再基于基准图做变体。这样能保证所有变体的一致性不会出现某张图颜色偏了的情况。批量生成还要考虑速率限制和成本。GPT Image 2.5 的接口有调用频率限制我一般设置成每分钟不超过 10 次避免被限流。成本方面20 张图如果全部重新生成费用不低。我的做法是能复用就复用比如换背景的图可以基于原图做局部重绘不用整张重生成。3.7 compliance-check上架前的最后一道防线这个 Skill 是我踩了无数次坑之后加的。早期我生成完图直接上架结果被平台驳回理由是“图片含违规元素”或者“与实物不符”。后来我整理了一份合规检查清单做成compliance-checkSkill每次出图后自动跑一遍。检查项包括是否有平台禁用的文字或logo、是否有敏感图案、产品颜色是否与描述一致、尺寸比例是否符合平台要求、是否有过度修图痕迹、背景是否干净。这些检查有些能用脚本自动做比如颜色比对、尺寸校验有些需要人工确认比如敏感图案。我的做法是自动检查先跑一遍把可疑项标出来人工再复核。这个 Skill 看起来不起眼但实际省了很多事。上架被驳回一次损失的时间成本远大于检查的时间。4. 完整实操流程从零到出图的每一步4.1 环境准备与工具链搭建先说环境。这套 Skill 本身是纯文本加脚本不依赖特定平台但为了发挥 Agent 能力我建议用 Claude Code 或 Codex 作为主工具。安装过程不复杂Claude Code 和 Codex 都有官方文档按步骤来就行。Cursor 可以作为辅助用来调试单个 Skill 的提示词。目录结构我建议这样组织根目录下建skills/放所有 Skill 定义文件configs/放变体矩阵和平台参数references/放产品参考图outputs/放生成结果scripts/放后处理脚本。每个 Skill 是一个.md文件里面包含用途说明、输入参数、提示词模板、校验规则。工具链方面图像生成调 GPT Image 2.5 的接口后处理用 Python 的 Pillow 库颜色提取用 colorthief批量编排用简单的 Python 脚本。这些工具都很成熟装起来不费劲。4.2 单个 Skill 的调用与参数传递调用单个 Skill 的流程是这样的。以white-bg-main为例你先把产品参考图放到references/目录然后在 Claude Code 里说“用 white-bg-main 处理 references/product-01.jpg输出 800x800 白底主图。”Claude Code 会读取 Skill 文件解析出需要的参数从参考图里提取颜色和材质生成完整提示词调用图像接口最后把结果存到outputs/。参数传递有两种方式。一种是自然语言就像上面那样适合单次调用。另一种是配置文件适合批量。配置文件里写明产品ID、参考图路径、目标Skill、输出参数Agent 读取后自动执行。我一般先用自然语言调通单个 Skill确认效果后再写成配置批量跑。这里有个细节Skill 之间的参数传递要统一命名。比如product-parse输出的颜色字段叫primary_color那reference-lock和white-bg-main读取的时候也要用这个名字。命名不统一是新手最容易犯的错会导致 Agent 找不到参数。4.3 多 Skill 串联的编排逻辑单个 Skill 跑通之后就要串联了。串联的逻辑是product-parse→reference-lock→ 生成类 Skill →compliance-check→upscale-clean。前面两个是预处理中间是生成后面两个是后处理。编排的时候要注意依赖关系。比如scene-lifestyle依赖reference-lock输出的颜色参数那就要确保reference-lock先执行完。Agent 一般能自动处理依赖但为了保险我会在配置文件里显式写明执行顺序。还有一个技巧中间结果要落盘。每个 Skill 的输出都存成文件下一个 Skill 从文件读取。这样即使中间某一步失败也不用从头重跑改一下重新执行那一步就行。我早期图省事把结果放内存里传递结果一失败全丢重跑浪费了大量时间和接口调用。4.4 批量出图的脚本化与自动化批量出图的核心是把整个流程脚本化。我写了一个 Python 脚本读取变体矩阵配置遍历所有组合依次调用 Skill 链最后汇总输出。脚本里加了重试机制某个组合失败自动重试三次还失败就跳过并记录日志。自动化方面我建议加一个定时任务比如每天晚上跑一次把当天新增的产品自动出图。这样第二天上班直接看结果效率提升很明显。但要注意自动化不等于无人化compliance-check的人工复核环节不能省尤其是新品类第一次出图的时候。成本控制也要在脚本里做。我设置了一个预算上限比如每天不超过 100 次图像生成调用超过就暂停并通知。这样避免脚本跑飞了产生意外费用。5. 常见问题与排查技巧实录5.1 生成图颜色偏差大怎么办颜色偏差是最常见的问题。排查思路分三步。第一步检查参考图质量如果参考图本身有色偏或者滤镜提取的颜色就不准。第二步检查reference-lock的色值范围设置范围太宽模型会自由发挥太窄又可能生成不出来。第三步检查生成后的色值比对脚本看偏差是出在生成环节还是提取环节。我的经验是色值范围设成目标色上下浮动 5% 到 8% 比较合适。另外生成的时候在提示词里同时用文字描述和色值约束双重保险。如果还是偏那就手动调一下参考图把参考图的颜色校正到准确值再重新提取。5.2 产品边缘毛糙或背景不干净这个问题在毛发类、透明类、反光类产品上特别明显。解决办法有两个。一是生成的时候明确要求“清晰边缘、无毛边、背景纯白无杂质”。二是在后处理阶段加边缘锐化和背景净化脚本。我用的是简单的阈值加锐化效果够用。如果产品本身是透明的比如玻璃杯那白底图就很难做。我的做法是改成浅灰底或者带轻微渐变的背景这样透明部分能看出来又不违反平台要求。具体用哪种要看平台规则。5.3 Agent 调用 Skill 时参数丢失或错乱参数丢失通常是因为命名不统一或者配置文件格式错误。排查的时候先看日志确认 Agent 读到了哪些参数缺了哪个。然后检查 Skill 文件里的参数定义和配置文件里的字段名是否一致。我踩过的坑是配置文件里用了中文逗号Agent 解析不了找了半天才发现。另一个原因是上下文太长Agent 记不住前面的参数。解决办法是把关键参数显式写进每次调用的提示词里不要依赖上下文记忆。或者把流程拆短一点分阶段执行。5.4 批量生成时接口限流或超时接口限流是批量生成的常见问题。我的做法是在脚本里加一个速率控制器控制每分钟调用次数。具体设多少要看接口文档一般不超过官方限制的 80%。超时的话加超时重试重试间隔递增比如第一次等 5 秒第二次等 15 秒第三次等 30 秒。还有一个技巧是错峰执行。如果白天接口繁忙就放到晚上跑。我一般设置成凌晨 2 点开始批量任务那时候接口压力小成功率高。5.5 常见问题速查表问题现象可能原因排查步骤解决办法颜色偏差大参考图色偏、色值范围过宽检查参考图、检查色值设置校正参考图、收窄色值范围边缘毛糙提示词未约束、后处理缺失检查提示词、检查后处理脚本加边缘约束、加锐化脚本参数丢失命名不统一、配置格式错误看日志、检查字段名统一命名、修正配置格式接口限流调用频率过高查看接口返回码加速率控制、错峰执行产品变形提示词约束不足检查生成提示词加比例和形状约束场景不真实光照不匹配、透视错误检查场景参数统一光照、校正透视5.6 几个我踩过的坑和独家技巧第一个坑是过度依赖自动补全。早期我让 Agent 自动补全产品颜色结果生成了一堆和实物不符的图。后来我改成“不确定就标记待确认”宁可多一步人工也不要出错。第二个坑是忽略平台差异。不同平台对图片的要求不一样我一开始用同一套参数跑所有平台结果亚马逊的图放到淘宝上就不合规。后来我在配置里加了平台维度每个平台一套参数。第三个技巧是建立自己的提示词库。每次调出好效果就把提示词存下来标注适用场景。积累多了之后新品类可以直接从库里找相似的改改就能用效率提升很明显。第四个技巧是定期复盘生成结果。我每周会抽时间看一遍这周生成的图把效果好的和差的分类分析原因。这个习惯帮我不断优化 Skill 的参数现在出图成功率比半年前高了很多。6. 后续可以怎么扩展这套 Skill 体系这套 12 个 Skill 目前覆盖了电商出图的主要场景但还有扩展空间。我接下来打算加两个方向。一是视频化把静态图扩展成短视频比如产品旋转视频、场景动态视频。二是多语言适配针对跨境店铺自动生成不同语言版本的详情页图。另外Skill 之间的编排还可以更智能。现在是线性流程未来可以做成条件分支比如根据产品类别自动选择不同的生成路径。这需要 Agent 有更强的推理能力目前还在实验阶段。如果你也在做电商出图自动化欢迎交流。这套 Skill 我已经开源代码和文档都在仓库里拿去改改就能用。实际用下来最深的体会是AI 出图不是替代设计师而是把设计师从重复劳动里解放出来让他们专注在真正需要创意的地方。这个边界想清楚了工具用起来就顺了。