AI 日报 2026-08-17|Anthropic 揭秘更强内部模型 Model 2 却不敢发;DeepSeek 峰谷定价终结低价时代; 一、AI Coding10 条1. Anthropic 发布 186 页风险报告披露更强内部模型 Model 2暂不对外发布Anthropic 发布第二份全公司风险报告RSP v3.4 框架下首次披露内部模型 Model 2——能力略强于 Mythos 5CoBench 得 62.8%Mythos 5 为 50.3%已大量用于编码、智能体任务和训练数据生成但尚未完成上线前完整评估暂无对外发布计划。风险评级方面将高风险场景下失准misalignment风险从极低上调至低。报告罕见列出真实安全事故多智能体集体偏航、思维链泄露给奖励模型、生物安全分类器曾静默失效约 11 个月约 5 万人 1.33 亿次交互未运行阻断。公司承认评测基准已饱和对模型能力增长的测量信心下降。值得关注前沿能力与安全评估之间出现明显落差——Anthropic 手握更强模型却测不准也不敢发。Claude 已编写公司生产代码库大部分代码内部 AI 研发加速但评测工具跟不上这种测量滞后是整个 AI 行业面临的结构性风险。对开发者而言闭源前沿模型的真正能力上限已藏在实验室内部公开产品与内部能力之间的剪刀差正在扩大。2. DeepSeek API 8/17 起实施峰谷定价终结低价平价时代8 月 17 日 00:00北京时间起DeepSeek API 正式实行分时定价。非高峰时段09:00-12:00 和 14:00-18:00 以外按高峰价格的 50% 计费。V4-Pro 峰值输出 ¥27/3.96 每百万 token、非高峰 ¥13.5/1.98V4-Flash 峰值输出 ¥9/$1.32、非高峰 ¥4.5。V4-Pro 非高峰输出价格已是旧价的约 2.25 倍峰值约 4.5 倍。值得关注开源模型领军者从低价倾销转向按容量和能力定价标志着大模型 API 市场进入理性定价阶段。企业需重新规划调用窗口——将批量推理任务迁移至非高峰时段可节省 50% 成本。也意味着中国大模型公司开始正视算力成本卷价格阶段落幕、卷能力阶段到来。3. 智谱发布 GLM-5.3最强开源编程模型涌现网络安全能力基座与 GLM-5.2 相同提升全部来自极致后训练 Scaling。Terminal-Bench 从 4.6 升至 28.3开源最高、DeepSWE v1.1 从 46.2 升至 66.9。更意外涌现网络安全能力CyberGym 得 84.5% 持平 Mythos 583.8%预发布测试期间发现 2436 个潜在漏洞1097 个中高危包括一个潜伏 40 年的 DNS 协议缺陷覆盖内核、浏览器、DNS 等 269 个开源项目。同步启动开源的盾计划对重点开源项目免费安全审计。权重两周内开源。值得关注不换基座、仅靠后训练就能实现编程能力数倍跃升证明后训练 Scaling是独立于预训练的有效维度。网络安全能力的涌现更具战略意义——发现 40 年老漏洞意味着模型已具备超越人类安全审计员模式识别的深度推理能力。开源的盾计划将前沿安全能力开源共享与闭源特权路线形成鲜明对比。4. DeepSeek Harness 插件生态爆发GitHub 仓库超 700 个DeepSeek 开源 Agent 架构 Harness 主打万物皆插件发布后 GitHub 上 dsh-plugin 标签公开仓库迅速超 700 个覆盖开发、编排、协作、研究等领域。实用插件层出dsh-agent-teams 可拉起多 Agent 团队、Better Sidebar 整合迷你 IDE另有插件补跨会话记忆、迁入 Claude Code 技能等。值得关注Harness 12 小时破 50K stars 后插件生态持续爆发验证了插件化 Agent 编排范式被开发者广泛接受。与 Grok Bot 的云端全天候助手路线不同DeepSeek 走模块化灵活路线——MIT 协议意味着企业可自建 Agent 基础设施不被任何云厂商锁定。5. GitHub Copilot 八平台同日上线 Grok 4.68 月 14 日Grok 4.6 发布仅两天后即登陆 GitHub Copilot 模型选择器一次性覆盖 VS Code、Visual Studio、Copilot CLI、Copilot 云 Agent、Copilot App、JetBrains、Xcode、Eclipse 全部八个平台。定价2 输入 /6 输出每百万 token。企业版/商业版管理员需手动开启 Grok 4.6 策略默认关闭。Grok 4.6 在 AA Intelligence Index 得 61 分持平 GPT-5.6 Sol但编码任务上仍弱于 Fable 5。值得关注GitHub 将八平台同日上线作为新模型发布的标准要求而非渐进式推送消除了开发者模型在不同工具中可用性不一致的摩擦。这种跨平台同步部署能力是企业级 AI 编程工具的核心竞争力——Cursor 被 SpaceX 收购后Copilot 正在用全平台覆盖策略巩固企业市场。6. AI Coding Agent 8 月排名Claude Code 居首Meta Muse Code 性价比黑马Terminal-Bench 2.1 排行榜8/14 更新Claude Code Fable 5 以 83.8% 居首Codex GPT-5.5 以 83.2% 紧随。综合评价Claude Code 为最佳综合 Agent成熟子代理深度 MCP 生态Codex 为最佳无人值守并行 Agent云沙箱隔离执行Cursor 为最佳企业 IDE多模型切换Meta Muse Code 为最佳性价比1.25/4.25 每百万 token为前沿模型最低。Grok Build 排末位——Grok 4.6 知识工作能力强但终端编码能力弱。值得关注AI Coding Agent 市场已分化为交互式编程无人值守并行企业 IDE低成本终端四层每层都有不同的最优选择。Meta Muse Code 以 1/20 的价格逼近前沿模型能力可能成为独立开发者和小团队的默认选择。7. AI Coding 工具诞生 5 家十亿美元级公司总估值超 1100 亿美元CognitionDevin估值冲 400 亿美元3 个月涨 54%、Lovable 确认 133 亿美元估值、CodeRabbit 以 15 亿美元加入独角兽行列。加上 Cursor已被 SpaceXAI 以 600 亿美元收购和 GitHub Copilot微软旗下五家公司合计估值超 1100 亿美元。三笔融资在两周内完成均高于各自上一轮估值。值得关注单一子赛道 18 个月内诞生 5 家独角兽资本追逐速度远超过往软件周期。但五家公司占据不同层自主 Agent / 应用生成 / 代码审查治理 / IDE / 企业默认并非直接竞争——估值泡沫还是结构性价值取决于各层是否形成独立护城河。8. 阿里开源 Qwen3.8-27B270 亿参数多模态家用显卡可跑8 月 16 日发布Apache 2.0 协议原生多模态稠密模型文本图像视频27.78B 参数262K 上下文YaRN 扩展至 1M。DeepSWE v1.1 从 13.3 跃至 42.2OSWorld-Verified 从 63.9% 升至 84.3%。最低 24GB VRAM 可本地运行。千问累计开源超 460 个模型。值得关注开源模型在编码和 Agent 能力上的进步速度惊人。Qwen3.8-27B 在 SWE 基准上的大幅提升加上 Apache 2.0 免费商用对需要私有部署的企业极具吸引力——24GB VRAM 意味着单张消费级 GPU 即可运行。9. 张一鸣反对蒸馏当 AI 捷径字节坚定自研字节创始人张一鸣在 Seed 团队内部会议明确发声不把蒸馏当作提升模型能力的捷径。梁汝波定调大模型坚定自研接受短期落后。同期苹果正与阿里深入合作至模型训练层——从千问接入扩展至联合训练专属模型国行 Apple Intelligence 落地进入最后阶段。值得关注在 DeepSeek、智谱等开源模型大爆发的背景下字节选择不蒸馏、走自研是一条更难但更自主的路。而苹果选择阿里而非字节/百度作为深度训练合作伙伴标志着千问在中国 AI 生态中的基础设施地位进一步巩固。10. Codex 自动研究将内核性能提升 232 倍Debian 就 AI 代码准入投票开发者 Sankalp 使用 Codex 进行自动研究——让 AI 自动运行 profiling、定位热点、生成补丁、验证效果并迭代——将内核处理时间提升 232 倍。但需理性看待这是特定工作负载的极端案例。更值得关注的是从 profiling 到 patching 的自动化闭环这一方法论。同期Debian 开发者正式发起投票讨论是否允许及如何标注 AI 生成代码进入发行版投票结果将直接影响所有 Debian 维护者的工作流。值得关注232 倍是上限而非常态但AI 自动优化闭环的方法论具有普适性。Debian 的投票则是开源社区对 AI 代码态度的里程碑事件——如果要求声明 AI 生成代码将影响整个开源生态的贡献流程。二、具身智能7 条11. 宇树科技 IPO 超额认购逾 5000 倍但上半年被智元反超宇树科创板 IPO 定价 150.8 元/股市值约 610 亿元网上认购超额逾 5000 倍、中签率约 0.018% 创科创板历史新低。DeepSeek 等参与战略配售。但 2026 上半年智元出货 8400 台同比增 562%、全球份额 44%跃居第一宇树出货约 5900 台31%居第二两家合计占全球近 75%。超 50 家机器人企业申报港股 IPO智元、智平方拟赴港上市。值得关注宇树上市是具身智能赛道的里程碑——0.018% 中签率反映资本市场对赛道的狂热预期。但上市即大考宇树营收 73.6% 依赖科研教育行业应用仅 9%真正代表未来的工业/家庭场景远未撬开。智元在出货量上的反超说明先上者未必赢量产能力和真实场景渗透才是终极考验。12. 梅卡曼德通过港交所聆讯成具身智能眼脑手第一股梅卡曼德雄安机器人通过港交所上市聆讯以全球市场份额第一身份登陆港股。与大多数机器人企业不同梅卡曼德不造整机而是为机器人提供眼脑手核心智能组件Mech-GPT 多模态具身大模型脑、Mech-Eye 工业 3D 相机眼、Mech-Hand 五指灵巧手手。产品已部署于汽车、新能源、消费电子、物流等行业覆盖近 50 个国家和地区。值得关注不造本体、只造核心组件的定位避开了人形机器人整机竞争红海切入的是所有机器人都需要的感知-决策-执行中间层。全球市场份额第一说明这一策略已获商业验证。上市后将成为观察具身智能产业链卖铲人模式的重要标的。13. 天津全尺寸人形机器人量产瞄准高危工业场景视云科技天津RD3 Ultra 全尺寸人形机器人首批下线174cm 高镁合金碳纤维混合骨架支持 24 小时连续作业。定位于站台值守、工业操作、特种巡检、环境勘测、应急救援等高危场景。工厂位于天津 764 具身智能产业园原天津广播设备厂旧址园区聚集帕西尼、海神机器人等 10 余家企业形成从数据采集到整机部署的完整供应链。值得关注RD3 Ultra 选择高危工业场景而非家庭/服务场景切入与当前人形机器人技术成熟度匹配——工业场景环境相对可控、任务边界清晰、ROI 可量化。天津产业集群模式政府审批绿色通道市政测试环境高校合作值得关注。14. 优艾智合发布全球首个工业具身智能大模型 FabriX优艾智合发布工业具身智能大模型智合FabriX定位为从工业场景长出来而非从通用 AI降维的具身大模型。核心差异通用 VLA 模型的概率性输出在工业场景不可接受FabriX 从底层架构为工业可靠性重新设计解决泛化、效率、可靠性的不可能三角。优艾智合以 2024 年收入计工业移动操作机器人全球市占率第一。值得关注当前绝大多数具身大模型走通用 VLA → 工业适配路线FabriX 反其道而行——从工业长出来。如果工业场景的可靠性要求确实是通用模型的根本瓶颈这种场景原生路线可能在 B 端比通用模型更快落地。15. 原力无限完成近 10 亿元融资投向具身大脑与因果世界模型前阿里副总裁白惠源创立的原力无限宣布完成 A 轮及 A 轮近 10 亿元融资敦鸿资产及头部国资平台领投。资金投向具身大脑 AtomBrain、因果世界模型及多形态机器人规模化交付。值得关注因果世界模型是具身智能前沿方向——让机器人理解因果关系而非纯统计关联是突破泛化瓶颈的关键路径。近 10 亿元融资规模在当前具身智能赛道属于头部水平反映资本对大脑层而非本体层的投资偏好。16. 具身智能数据标准研讨会在京举行工信部标准化技术委员会启动编制8 月 14 日人形机器人与具身智能视觉感知数据标准研讨会在北京举行由智在无界 BeingBeyond 主办工信部人形机器人与具身智能标准化技术委员会 WG7 数据工作组参与。四维图新组长单位、帕西尼感知科技、清华智能产业研究院等十余家机构参会。研讨会围绕数据采集场景、动作执行与时序对齐、多模态标注、数据安全合规四大议题展开标准编制工作进入多方协同推进阶段。值得关注数据是具身智能的燃料但当前行业面临采集方式不统一、标注体系不完善、质量评价口径不一致等碎片化问题。标准化工作启动意味着行业从各自为战进入基础设施共建阶段——谁主导标准谁就掌握产业话语权。17. Hugging Face 报告中国开源模型领跑全球Qwen 衍生超 15 万个Hugging Face 最新报告显示2026 年以来中国 AI 企业发布的最大开源模型参数规模在 7540 亿至 2.78 万亿之间美国同期多数月份低于 1300 亿。超 200 亿参数的中国模型中 80% 以上采用宽松授权。Qwen 衍生模型超 15 万个远超谷歌和 Meta。美国新开源模型最多的公司变为 AMD 和英伟达而非谷歌/Meta。小型模型10 亿参数仍占绝大多数下载量AI 智能体正成为模型调用的新用户。值得关注中国 AI 在开源生态层面已实质性全球领先——不仅是参数规模更是开放程度和生态影响力。AMD 和英伟达取代谷歌/Meta 成为美国最活跃的开源模型发布者反映硬件厂商正通过开源模型带动芯片销售的策略转变。一句话总结AI Coding 赛道进入安全测不准时代——Anthropic 握有更强模型却不敢发评测基准饱和暴露行业级风险DeepSeek 峰谷定价终结低价平价期大模型 API 进入理性定价智谱 GLM-5.3 证明后训练 Scaling 独立有效并涌现安全审计能力具身智能从上市定价宇树 5000 倍认购、梅卡曼德聆讯和工业落地FabriX 工业大模型、RD3 Ultra 量产双线推进商业化大考Hugging Face 报告确认中国开源模型全球领跑。