OpenBitFun DeepSWE 评测解读:64.6% 通过率背后的工程化秘密 OpenBitFun DeepSWE 评测解读64.6% 通过率背后的工程化秘密【免费下载链接】OpenBitFunOpenBitFun combines a high-performance agent runtime written in Rust with a polished desktop application. It pairs the depth of a Code Agent with open, general-purpose capabilities for work beyond software development.项目地址: https://gitcode.com/gh_mirrors/bit/OpenBitFunOpenBitFun 是一款用 Rust 打造高性能 Agent Runtime 的开源 AI Agent 工作台。在DeepSWE v1.1 评测中它搭配 GLM-5.3-Flash 拿下64.6% 通过率成为对比组中的最高分。这个分数是怎么来的这篇文章带你用 5 分钟看懂这份评测数据以及它背后真正的工程化秘密 ️一、先看数据DeepSWE v1.1 评测到底比什么DeepSWE 是一套面向真实软件工程任务的 Agent 基准评测把完整的问题仓库交给 Agent看它能否独立完成修复并通过测试。它比两个硬指标——通过率Pass Rate任务最终完成的比例越高越好耗时 P50Runtime一半任务完成所需的中位时间越短越好Token P50中位 Token 消耗反映资源效率OpenBitFun 在 README 中公布的完整对比数据如下方案模型通过率耗时 P50Token P50OpenBitFunGLM-5.3-Flash64.6%42.9 min13.05MOpenBitFunDeepSeek-V4-Flash56.6%19.6 min18.54MPIGLM-5.3-Flash61.9%50.7 min9.15MOpenCodeGLM-5.3-Flash57.5%48.3 min9.58MDeepSeek Harness · MinimalDeepSeek-V4-Flash53.1%25.4 min12.87MDeepSeek Harness · StandardDeepSeek-V4-Flash49.6%24.9 min21.32M三个关键结论同一模型下 OpenBitFun 领先GLM-5.3-Flash 在 OpenBitFun 上 64.6%比 PI61.9%和 OpenCode57.5%都高——差距来自 Harness 工程而非模型。模型可自由切换换用 DeepSeek-V4-Flash耗时直接降到 19.6 分钟适合追求速度的场景。Token 消耗受控13M 的 Token P50 在通过率和成本之间取得了不错的平衡。二、秘密一Rust 编写的 Agent Runtime 是地基64.6% 的底气首先来自底座。OpenBitFun 的Agent Runtime 用 Rust 编写专门承载三件事会话状态管理持久会话、中断恢复长任务被网络波动打断后能接着跑而不是从头再来上下文管理长程任务中持续压缩、整理上下文避免越跑越乱工具执行终端、文件、代码编辑等工具在受控策略下稳定执行对新手来说这意味着什么跑一个需要几小时的复杂任务时中途断线、崩溃的代价被 Runtime 兜住了。详细设计可参考 Agent Runtime 服务设计 和 Agent Runtime 部署模型。三、秘密二四种 Agent Harness 模式按任务换挡同样是解题直接冲和深思熟虑的策略完全不同。OpenBitFun 提供了四种 Agent Harness 模式由用户按任务复杂度选择模式适合场景执行策略极简 Minimal目标明确、快速动手直接执行边做边反馈标准 Standard多步骤日常任务有序规划、逐步执行、检查结果极致 Ultimate高难度复杂任务拆解任务、多 Agent 分工协作、整合结果创造 Creative定制应用与扩展创建 Mini App定制工作台面对 DeepSWE 这类高难度任务极致模式的多 Agent 分工与结果整合正是通过率的关键推手一个 Agent 负责规划、其他 Agent 并行处理子问题最后统一验证。四种模式的规范标识定义在 Harness 身份契约 中并通过生成脚本同步为 Rust 与 TypeScript 类型——同一套行为桌面、CLI、远程全平台一致这正是评测成绩可复现的前提。产品层面的完整说明见 产品架构文档。四、秘密三上下文压缩 缓存复用把成本压下来评测里被忽视的指标是Token P50。Agent 在长任务中反复请求模型若每次都全量重发历史上下文Token 消耗会指数级膨胀又慢又贵。OpenBitFun 针对这一点做了两项工程缓存友好的消息结构让消息组织方式最大化命中模型的 Prompt Cache重复前缀不再重复付费模型请求缓存复用跨请求复用已计算的请求减少无效往返对应设计文档缓存友好的消息结构、模型请求缓存复用。这两项优化直接体现在图表中OpenBitFun 的 Token P50 控制在 13M18.5M 区间比 DeepSeek Harness · Standard 的 21.32M 更低通过率反而更高 8 个百分点。五、不止于评测这些能力日常就能用上评测成绩不是孤立的数字它对应的能力你在日常工作中都能直接受益黑灯工厂模式白天布置任务让它在服务器上持续推进第二天回来验收成果设计见 分离任务派发多设备接续电脑上深度工作手机上继续对话浏览器里处理授权任务不中断可观测性DFX诊断、Tracing、指标与审计全程可查任务卡住时能快速定位原因总结回看这组 DeepSWE v1.1 评测数据OpenBitFun 64.6% 的通过率并非某个单点的胜利而是三层工程能力的叠加Rust Agent Runtime保证长任务跑得稳、断了能恢复四种 Harness 模式让执行策略匹配任务难度上下文压缩与缓存复用让 Token 成本始终可控对新手来说这份评测的价值在于它给出了一个实用信号选 Agent 工具时Harness 的工程化程度往往和选哪个模型一样重要想深入源码可以克隆仓库后从 README 的架构章节和 docs/architecture/ 目录开始逐层拆解这套 Runtime 的实现。【免费下载链接】OpenBitFunOpenBitFun combines a high-performance agent runtime written in Rust with a polished desktop application. It pairs the depth of a Code Agent with open, general-purpose capabilities for work beyond software development.项目地址: https://gitcode.com/gh_mirrors/bit/OpenBitFun创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考