AI前沿 | 2026年9月7日:GPT-6 Astra 的「37 分鸿沟」——当 AGI 加冕礼变成 harness 测试 AI前沿 | 2026年9月7日GPT-6 Astra 的「37 分鸿沟」——当 AGI 加冕礼变成 harness 测试本期导读OpenAI 凭「ARC-AGI-3 99.9%」宣布欢迎来到 AGI 时代而基准作者 ARC Prize 在同一份报告里给出另一分数同一模型、标准 harness 只有62.7%。差 37 个百分点的不是智力是套在模型外的脚手架。本文拆解两种 harness 到底差了什么、发布后「成绩单」怎么变的以及采购/选型怎么不被评测叙事绑架。一、事实还原同一个模型为什么有两个分数9 月 3 日OpenAI 正式发布GPT-6 Astra——首个在超过 10 万张 GPU上训练的模型总裁格雷格·布罗克曼在吹风会上说「欢迎来到 AGI 时代」。支撑这个叙事的核心证据是它在ARC-AGI-3上拿到99.9%而对标上一代 GPT-5.6 Sol 的 7.8% 被拿来做「十三倍」对比。同日ARC PrizeARC 基准的作者方在同一份报告中用两种 harness 跑出了两个分数测量口径最佳成绩算力成本本质差异标准 harness中立所有模型同口径62.7%Max约 26,098 美元模型自己决定携带哪些可见笔记其余丢弃Provider Adapter harness99.9%High约 18,817 美元保留模型不透明的推理状态压缩长对话跨请求复用ARC Prize 把两种都称为 state-of-the-art——这是对的两种口径下它都是新纪录。真正的问题在于99.9% 是「装配了厂商上下文管理能力的系统」的成绩而对外销售的是「模型」。启示AI 评测正在从「测模型」变成「测部署系统」。谁的 harness 越强谁就越能「测」出更好的分数——而你买的从来不是分数本身是可复现的、对应你真实用法的那个分数。二、机制拆解脚手架为什么比推理更「通神」ARC Prize 公布的分档表里有一行比任何争论都有说服力把reasoning effort 调到 None不带任何显式推理——标准 harness35.2%Provider Adapter96.7%不带推理的配置比标准 harness 跑满 Max62.7%还高 34 个百分点。这行数据把「99.9% » AGI」的推理链条直接打断如果产出高分的主要是「带状态的脚手架」而非「显式推理」那这个分数学到的就不是基准想测的「通用抽象推理」。推理强度标准 harnessProvider AdapterMax62.7%98.6%XHigh59.3%98.4%High54.8%99.9%Medium38.6%98.4%Low17.5%98.0%None35.2%96.7%ARC Prize 在 X 上的口径也比较克制Astra 的96% 关卡「动作效率」超过测试的人类中位数——注意这是「步数更少」不是「完成率更高」。Chollet 本人的口径与基金会又有 3 个点的出入66% vs 62.7%。同一基准三个数字——这就是今天评测体系的真实生态。三、发布后还在变的「成绩单」5 项指标被修订《Fortune》比对了 OpenAI 发布帖的存档快照发现 Astra 上线后至少有5 项对外数字被修改指标首发快照变化轨迹备注Astra 幻觉率4.2%一度改 2%目前已回到 4.2%Fable 5.1 FrontierMath87.8%一度 78%最终 83%Sol ExploitBench5.5%翻倍至 11.5%官方称在调查是否回退ARC-AGI-3解禁稿98.6%正式帖 99.99%两种写法并存Snorkel AI 的 Vincent Sunn Chen 的判断值得听发布前最后几小时的「数字微调」在业内很普遍——checkpoint、配置、harness、评分都会动关键是修订要可追溯。他建议建立「修订公开评测数字必须留痕」的行业规范。OpenAI 也坦承99.9% 来自自家 responses API harness且「不会针对 ARC-AGI-3 做特别适配」——合规但留白在脚注里。从 Artificial Analysis 的独立视角看故事更平淡Coding Agent Index Astra 67 分与 Opus 5/Fable 5 同档Fable 5.1 领先 70Intelligence Index 61 分与上一代 Sol 持平比 Fable 5.1 低 5 分且按任务完成成本计比 Sol 贵约 75%。四、对 AI 买家和创业者的工程建议不要用「发布会排名」做选型用「可复现的双口径评测」做选型固定口径对比一律用同一 harness、同一 reasoning effort能跑第三方复测就第三方复测ARC Prize 已承诺未来并列标注 Standard / Provider Adapter。看「成本/得分」而非单点分数62.7%$26K 与 99.9%$19K 的关系说明更省的分可能来自更好的状态管理——对应到你的产品就是更快、更省地完成任务。把「评测环境」当产品特性验收厂商说「我们测了 X 项目」时追问「用的哪套 harness、对比模型是否同口径」——这与追问「用了多少 GPU、多少钱」同等重要。建立自己的基准飞轮把高频真实任务沉淀成你的私有评测集模型更新时用你无比分比别用「它家发布稿」比「你家旧版」。对创业者的启示99.9% vs 7.8%被做成「十三倍差距」的营销故事而同口径下的 62.7% vs 7.8% 才是真实进步——依然是巨大跃迁真进步不需要夸大排版。在这个「分数会呼吸」的时代谁能给出可复现的横评谁就能在采购决策里重新拿回主动权。来源ARC Prize 官网报告与博客 / The Next Web / YFarmX / IQ Metrics / Fortune / ArtiFicial Analysis。/ 本文章为 AI 辅助整理的真实行业事件分析不构成投资建议。 延伸阅读 · 我的付费专栏觉得这篇文章对你有帮助我把同类主题的系统化内容沉淀成了付费专栏欢迎订阅支持持续输出专栏定价内容大模型工程师修炼手记9.9 元51 篇 AI 编程 / Agent 深度实战AI时代程序员的自我提升89.9 元27 篇 AI 时代成长方法论 一杯咖啡的价格换来系统化的知识体系你的订阅是我持续创作的最大动力。