开源模型 Kimi K3 与闭源 Fable 5 对比测试:多数任务开源模型够用,路由层成护城河

发布时间:2026/7/23 6:52:48
开源模型 Kimi K3 与闭源 Fable 5 对比测试:多数任务开源模型够用,路由层成护城河 【导语此前有分析讨论 Anthropic 的 Fable 5 比开源模型贵三倍的商业模式能否撑住如今 AI 推理平台 Fireworks AI 给出硬数据对 Kimi K3 和 Fable 5 进行对照测试得出了一系列有价值的结论。】开源与闭源模型测试结果差距小AI 推理平台 Fireworks AI 跑了 1030 个真实 agent 任务将 Kimi K3Moonshot 的开源模型和 Fable 5 放在同一 harness 里对照测试。在 SWE - bench 类任务上K3 拿到 92.4%Fable 拿到 92.6%差距不到 0.3 个百分点。但在长 agentic 循环里K3 的成本能做到 Fable 的五十分之一。多类型任务测试凸显模型强项这 1030 个任务分为五类包括 SWE 类真实仓库 bug 修复460 题、终端运维类长链路操作、算法题、六语言交叉实现、法律 agent 任务且每个任务都是完整 agent 循环并非单次推理。两个模型各有优势K3 在符号数学和开发工具链上更强在终端任务里拿到 11 个 solo winFable 为 7 个在安全加密类集群里表现突出。Fable 在 Web 和数据可视化上更好在 Java、Python、C 方面领先于 K3但 JavaScript 和 Rust 表现基本持平。路由选择让模型组合效果更佳Fireworks 做了一个 oracle router每次任务选择更便宜的正确模型结果通过率达 93%高于任何一个单模型。K3 被选中了 72 - 96% 的任务这表明大多数时候开源模型就足以胜任任务。Prompt caching 使 K3 成本更低K3 的 token 量更大SWE 平均 55 轮、130 万 token而 Fable 是 21 轮、13 万 token但成本反而低原因在于 Prompt caching。K3 虽轮数多、token 多但命中的基本都是缓存实际推理成本极低。而 Fable 在终端任务里容易陷入循环64 轮、150 万 token还经常超时成本翻了十倍不止。开源趋势下闭源模型压力增大Fireworks 认为「单一模型既浪费也不再是最佳方案」建议把 K3 作为默认底座多数任务用开源模型即可少数复杂场景再选用 Fable 级别的闭源模型路由层才是关键竞争力。值得注意的是Fireworks 是推理平台没有站队动力。且 Moonshot 上周宣布 K3 会开源权重这会让闭源模型面临更大的价格压力。编辑观点此次测试显示开源模型 K3 在性能和成本上优势明显开源趋势下闭源模型需调整策略路由层技术将成竞争焦点。