生产级 SKILL.md 的 7 条铁律:从 Cloudflare 文档 Linter 到 replica-skill 的共性 生产级 SKILL.md 的 7 条铁律从 Cloudflare 文档 Linter 到 replica-skill 的共性【免费下载链接】replica-skillEleven free Claude skills that clone any app: reverse-engineer it, rebuild it, test it for bugs, then fix what its users hate. Free, MIT.项目地址: https://gitcode.com/gh_mirrors/re/replica-skill2026 年初一篇深度解析 Cloudflare Docs 样式审查 SKILL 的文章在技术社区流传开来一个以纯提示词 规则引擎驱动的 MDX 文档自动 Linter通过 manifest 按需加载规则、只审查 diff 中的新增行、以结构化 JSON 输出结果并用自动化 eval 验证规则有效性——把低误报和可复现做成了硬性工程指标。几乎同一时间另一个开源项目 replica-skill 用十一份 SKILL.md 拼出了一条完整的克隆任意应用流水线逆向、架构、设计、构建、测试、对比、品牌、上线每一步都有配套的标准库 Python 工具做校验。一个在给文档挑刺一个在克隆应用表面上毫无交集。但把两份 SKILL.md 放在一起逐条对照会发现它们对生产级技能包的定义惊人一致。本文从 replica-skill 的源码出发结合 Cloudflare Linter 的设计思路提炼出七条可以被审查、被测试、被门禁拦截的铁律——它们决定了技能包是从提示词模板升级为可交付的工程资产的那条分界线。一、两条线的交汇点技能包正在变成带契约的程序先说清楚 Cloudflare 那个 Linter 为什么值得作为参照系。它的核心不是提示词写得多漂亮而是一整套工程约束机械式规则匹配而非让模型自由发挥规则按 manifest 条件加载杜绝无关规则干扰只审新增行让同一份规则在任意提交上产生可预期的输出两级严重度 稳定 ID让结果可以被引用、被回归测试。replica-skill 则把同样的思想搬进了另一类场景。它的十一份 SKILL.md 每个都是带契约的程序输入是固定的replica/features.csv、replica/reviews.csv、replica/design/tokens.json输出是固定的replica/parity.md、replica/feedback.md、replica/deploy.md中间穿插六个不依赖任何第三方库的 Python 工具。README 里写得很直白Six of them, all standard-library Python. None touch the network.这两条线共同说明一件事生产级 SKILL.md 的重心不在提示词而在它周围那圈可执行、可校验、可被 CI 拦截的工程外壳。下面的七条铁律就是这圈外壳的组成。二、铁律一可复现——零依赖、固定契约、确定性输出一个技能如果每次运行结果都取决于模型当天的状态就无法被验收。生产级技能的第一步是把灵感从关键路径上挪走。Cloudflare Linter 的做法是机械式规则匹配 结构化 JSON 输出协议规则是确定的输出是确定性的唯一变量被压缩到最小。replica-skill 走得同样彻底零安装依赖。六个工具全部只用 Python 标准库运行时要求只有Python 3.8 or newer没有pip install这一步排除了环境漂移。输入即契约。parity.py读取的特征矩阵有严格列约定feature、area、priority、original、clone、notes缺失必需列会直接报错退出reviews.py要求每行必须有url和text缺一即丢弃并计数。可重放。reviews.py提供--today参数固定今天的日期配合--months决定旧评论的衰减权重让同一条评论数据在任何一天跑出同一份排名。imgdiff.py甚至把 PNG 解码都自己做完了见 replica-diff/imgdiff.py 的read_png从 IHDR 解析到滤镜逆变换全部手写就为了没有任何库版本不一致的可能。可复现不是洁癖它是后续一切验收动作的地基。三、铁律二低误报——宁可漏报不可错报一个反复在用户面前报错、而错误与问题无关的 Linter很快会被关掉一个总是给错误建议的技能会被 Agent 悄悄忽略。低误报不是体验优化是存活条件。Cloudflare 那边用两个机制压误报只审 diff 新增行已发布内容不再重复报以及两级严重度让噪声和真问题分层。replica-skill 的对应物更具体对比工具知道什么不该算差异。replica-diff/imgdiff.py 的默认 layout 模式把两张截图转成边缘图按网格比较结构分布刻意忽略颜色——因为replica-brand本来就要换掉全部颜色颜色差异是预期行为而非缺陷。若换用 pixel 模式精确比对文档明确禁止拿它去追原版像素not to chase the originals pixels。分析工具只呈现有把握的信号。replica-entrepreneur/reviews.py 会把少于 3 条评论或仅单一来源的主题标记为thin样本少于 30 条时直接提示只支持一个方向不支持排名。三条愤怒的 Reddit 评论不会被包装成一个趋势。测试报告区分已复现与可能。replica-test/SKILL.md 规定只报告实际复现的缺陷Might be an issue 只能进独立的待查清单。低误报的本质是给每个判断设定可辩护的证据门槛。报错越少每一次报错的分量越重。四、铁律三可验收——退出码即门禁生产级技能必须能被机器验收而最廉价、最通用的机器验收通道就是进程退出码。Cloudflare Linter 用自动化 eval 评测规则有效性把规则好不好变成可量化指标。replica-skill 则把退出码用成了贯穿全流程的门禁开关replica-design/contrast.py 按 WCAG 2.2 计算全部文本/背景对比对Exit code 1 when any pair fails AA, so it can gate a buildreplica-brand/sweep.py 在代码里搜索原应用的名称、域名、品牌色exits 1 if it finds anything, so it can block a deployreplica-launch/listing.py 校验应用商店字数上限、排名/价格宣称、原应用名称残留有 error 即退出 1replica-diff/parity.py 支持--fail-under得分不达标就失败。这些工具被 replica-deploy/preflight.md 编排成一张硬性检查表e2e 全绿、无未关闭的 S1/S2 缺陷、must-have 全部完成、sweep 干净、listing 通过、生产构建通过——Any failure stops the deploy。而工具的可靠性本身又被 tests/ 目录下的 57 个单元测试兜底python3 -m unittest discover -s tests -v连模板文件tokens.json、features.csv、listing.example.json都有必须能被解析且无问题的测试。到这里技能包的验收形成闭环工具门禁检查产物测试门禁检查工具。五、铁律四安全边界——能力最小化与人机分工社区里AI 智能体被投毒的新闻屡见不鲜技能包的安全边界因此从加分项变成了硬约束。Cloudflare 侧体现为 manifest 驱动的条件加载——Agent 只获得当前任务需要的规则子集能力面被显式收窄。腾讯云运维 Agent 复盘文章里也专门提到安全边界控制description 与 allowed-tools。replica-skill 把安全边界写进了每一份 SKILL.md 的规则区而且边界画得极其具体数据来源边界。replica-recon/SKILL.md只读公开页面和用户自己的账号Never log into an account that is not the users, never ask for a password, never get past a paywall by any trick不许爬虫、不许批量下载、不许翻源码或抓私有 API。凭据边界。replica-backend/SKILL.md 和 replica-deploy/SKILL.mdClaude 永不注册账号、永不输入密码/银行卡/线上密钥Stripe、Supabase、域名由用户创建和购买Agent 只负责写好.env.example、DNS 记录和环境变量名敏感操作全部归还给用户。测试边界。replica-test/SKILL.md 开宗明义Test your clone, not the original绝不对原应用服务器做压测、模糊测试或脚本轰炸。这些边界不是修辞而是和工具逻辑咬合在一起的sweep.py跳过了replica/规划目录因为那里面本来就该出现原应用的名字replica-recon/features.csv 里第三方应用市场被标成skip理由是their partner network is not part of the product you can rebuild——边界用数据行表达而不是用语气表达。六、铁律五零虚构——每一条结论都必须有证据链幻觉是生产级技能最致命的敌人。Cloudflare Linter 用结构化 JSON 输出 稳定 ID让每条审查结果可被追溯到具体规则replica-skill 把同样的追溯性推到了极致尤其是在处理用户评论的 replica-entrepreneur/reviews.pyThis tool only reorganises what you give it. It does not write reviews, it does not paraphrase them, and every quote it prints is a substring of a row you supplied, with that rows link.工具层面无链接的评论行直接丢弃并计数Nothing is counted without its source重复文本被去重引文只能是原始文本的子串。技能层面replica-entrepreneur/SKILL.md 规定 Never fabricate引用必须逐字且带 URL刷假评论在美区违反 FTC 2024 新规评论者的原话只能当研究材料、不能当自家落地页的 testimonial。呼应地replica-launch/SKILL.md 也禁止虚构任何proof没有真实测试用户的空证明区好过编造的 trusted by。证据链思维还反向用在品牌安全上listing.py会在商店元数据里查原应用名称sweep.py连OriginalAppEmbed这类嵌在标识符里的名字都不放过。不虚构自己的数据也不残留他人的品牌——这是同一枚硬币的两面。七、铁律六显式编排——稳定 ID 与顺序依赖一个生产级技能包很少是孤立的单技能而是一组相互消费产物的流水线。编排得当与否决定了整条链路的可维护性。Cloudflare 架构里对应的是 Agent 实例化、可信调度与结果合并——多个实例各审一段再按稳定 ID 汇总。replica-skill 的编排哲学更朴素但同样严格稳定 ID 贯穿全局。replica-recon/SKILL.md 规定屏幕编号 S01、S02…IDs are stable…Every other file refers to them测试用例编号 F01-H1、F01-E3、F01-N2 同样被 replica-test/SKILL.md 强制。顺序依赖是显式契约。README 画出完整链路recon - architect - design - build - backend - test - diff - entrepreneur - brand - launch - deploy每个技能reads what the last one wrotereplica-architect遇到没有 recon map 的情况会直接停下要求先跑/replica-reconPlanning a clone from memory of what an app does is how you miss half of it。同一份数据被反复消费。features.csv从 recon 生成被 build 逐行勾选、被 diff 计分、被 deploy 当作 must-have 门禁——一个文件串联起四个技能的状态。这提示了一个容易被忽略的点技能的编排价值不靠长提示词叙述流程而靠稳定的数据契约把上下游焊死。ID 稳定diff 才有意义文件固定消费方才敢依赖。八、铁律七诚实量化——给数字不给 vibe最后一条铁律是把效果如何从形容词变成数字。Cloudflare 侧的表现是 eval 评测与低误报率的量化声明。replica-skill 则把诚实写进了计分逻辑和措辞纪律replica-diff/parity.py 用加权计分must3、should2、could1partial 计一半skip行和你额外加的功能行完全不参与计分——the number only ever measures parity。must-have 未完成时输出明确裁决Not shippable yet。replica-diff/SKILL.md 的纪律是Give honest numbers. A clone at 62% is at 62%.并把结论收敛成三档不可发版must 缺失或 S1 未关、可发版must 全齐、功能分 80、以及作为目标的better than the original——一个纯拷贝没有存在的理由。recon 阶段就要求诚实估规模S/M/L/XLREADME 明言 No guarantee of a perfect clone复杂应用被提前打回重定范围。配合测试环节的严重度模型S1 数据丢失/支付错误/核心流程阻塞S2 功能坏且无绕过S3 有绕过或明显错误S4 纯外观整个链路从规模预估到最终交付每一步都有数字可以复盘。量化未必精确但至少可被挑战——这比一句效果很好值钱得多。九、把铁律套回你自己的技能包七问自检清单与其记住七条抽象原则不如把它们变成一份可执行的自检清单。以下每个问题都能在 replica-skill 的源码里找到答案你也可以用同样的问题审查自己的技能包可复现你的技能是否零依赖、输入输出是否有固定 schema、同样的输入能否跑出同样的结果对照replica-diff/parity.py 的列校验、reviews.py的--today低误报你的检查工具是否知道哪些差异不该报可疑信号是否被降级为 thin / to-check 而非直接报错对照replica-diff/imgdiff.py 的 layout 模式可验收你的检查器是否用退出码表达成败是否有一张 preflight 清单把所有门禁串起来检查器本身有没有测试对照replica-deploy/preflight.md、tests/安全边界你的技能是否声明了数据来源边界、凭据边界、测试边界并把边界落到工具逻辑里对照replica-backend/SKILL.md 的 rules零虚构你的分析结论是否每条都可追溯到带 URL 的原始证据工具是否会丢弃无证据的行对照replica-entrepreneur/reviews.py 的 dropped 计数显式编排你的多技能流水线是否用稳定 ID 和固定文件做契约而不是靠叙述对照replica-recon/features.csv 被四个技能消费诚实量化你的结论是数字还是形容词是否声明了样本量、权重规则和不计分项对照replica-diff/parity.py 的 must/should/could 加权一个技能包从能跑通演示到敢在生产环境放行差的就是这七条铁律。Cloudflare 的 Linter 和 replica-skill 的克隆流水线用了完全不同的领域语言却在同一份答案上相遇把判断权交给规则与证据把执行权留给模型把验收权交还给机器。你的下一个技能包也可以从给第一条规则加一个退出码开始。【免费下载链接】replica-skillEleven free Claude skills that clone any app: reverse-engineer it, rebuild it, test it for bugs, then fix what its users hate. Free, MIT.项目地址: https://gitcode.com/gh_mirrors/re/replica-skill创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考