2026-08-01 · Coding Agent 成本崩塌,具身智能定下2028硬指标

2026年8月2日阅读时长约 1 分钟

DeepSeek V4-Flash 仅靠后训练把 DeepSWE 拉高6倍、OpenAI 同日给 Luna 降价80%;ARC-AGI-3 换两个开关得分13.3%→38.3%、重构令 agent 输入token降83%,瓶颈在 harness 与代码结构而非模型;具身侧七部门首次单列人形专题并定下2028硬指标,Gemini Robotics 2 跨本体控制,Figure 03 进宝马排序。


1. DeepSeek V4-Flash 正式版跑分落地,同日 OpenAI 把 Luna 砍价 80%:Coding Agent 单价一夜坍塌

  • 事件内容
    • DeepSeek-V4-Flash-0731 于 7/31 晚结束预览、正式 API 公测,8/1 第三方跑分集中出炉。模型为 2840 亿参数 MoE、激活 130 亿、100 万 token 上下文,可切换思考/非思考模式。官方 9 项 Agent 基准全面超越预览版,部分超过 V4-Pro 预览版:Terminal-Bench 2.1 82.7(Flash 预览版 61.8 / V4-Pro 预览版 72.1 / GLM-5.2 81.0 / Opus 4.8 85.0)、DeepSWE 7.3 → 54.4(涨超 6 倍)、CyberGym 38.7 → 76.7、NL2Repo 39.4 → 54.2、Toolathlon-Verified 70.3、Agents' Last Exam 25.2(Opus-4.8 为 25.7)。Artificial Analysis 智能指数拿到 50 分,比自家 V4-Pro 还高 6 分,仅比 GPT-5.6 Luna 低 1 分。缓存命中价低至 0.2 元/百万 tokens,官方缓存命中率约 98%。原生支持 Responses API 格式,可直接适配 Codex
    • 关键细节:DeepSeek 明确说明该版本模型结构与参数规模和预览版完全一致,提升全部来自后训练升级,未扩规模、未换架构。
    • 同一天,OpenAI 宣布 GPT-5.6 Luna 降价 80%(内核级优化让端到端服务成本降 20%,token 生成效率提升超 15%)。即便如此,社区实测 V4-Flash 单任务成本仍比降价后的 Luna 低约 60%。
    • 国内开发者实测:接入 Hermes 后同任务 40 秒完成,GPT-5.6 Sol + Codex 需 1 分 47 秒;质量上 Codex 更优,但 V4-Flash 交付"在及格线之上、达到可用水平"。
  • 值得关注原因:两点。其一,后训练的剩余空间被严重低估——同一副骨架,仅靠后训练就把长周期编程任务基准拉高 6 倍,这对所有"堆参数才有提升"的路径依赖是一次纠偏,也意味着开源阵营的追赶速度会比预期更快。其二,coding agent 的推理成本正在以季度为单位塌陷:一边是开源侧把 Agent 能力做到接近 Opus 级,一边是闭源侧被迫单日降价 80%。对工程团队而言,"因为太贵所以不敢让 agent 长跑"这个约束正在快速消失,值得重新评估长任务、多 agent 并行的成本模型。
  • 来源云头条·V4-Flash 正式 API 上线原生支持 Codex · TechWeb·Agent 能力暴涨 6 倍 · 每日经济新闻·开发者实测 · AI 快报 2026-08-01 · Top AI Stories 2026-08-01

2. 两组当日实测把矛头指向同一处:拖垮 Agent 的不是模型,是 harness 和你的代码结构

  • 事件内容:两份互不相干却高度呼应的量化实验在 8/1 前后集中曝光。
    • OpenAI 复盘 ARC-AGI-3:GPT-5.6 Sol 在官方评测 harness 上只拿 7.8%(GPT-5.5 仅 0.4%),几乎"不会玩"。排查后发现问题不在模型——官方 harness 每执行一步动作就丢弃全部私有推理,且历史增长后用滚动截断删掉早期动作,等于要求模型每走一步都从零重新理解这个游戏。仅打开 Responses API 的两个开关(保留推理 retained reasoning + 上下文压缩 context compaction),公开任务集得分从 13.3% 三级跳到 38.3%,同时输出 token 减少约 6 倍;在该 harness 下 Sol 通关全部 6 个关卡,而官方榜单上没有任何前沿模型能过第一关以外的关。人类在该基准 RHAE 指标上平均约 48%。
    • 一次 15 步重构的 token 账单:开发者把 agent 写出的 17,155 行 Rust 数据访问层逐步重构(抽出 FirestoreClient 与工具函数,按 queries.rs / traits.rs / codec.rs 拆分关注点,测试与实现同置),最终 19 个文件、最大文件从 17,155 行降到 3,695 行。同一功能变更所需输入 token 从 159,564 降至 27,360,降幅 83%,代码总量几乎没变。每一步都用全新 agent 实例复测以排除学习偏差。三个不可略过的发现:① 输出 token 几乎没变,重构不减少 agent 要写的代码量;② 单次变更省下约 $0.40(按 Sonnet 5 $3/MTok),除非反复回到同一片区域否则回本有限;③ Claude 不会自己识别重构机会,人工指认目标是必需步骤
  • 值得关注原因:这两件事共同重写了一条读榜规则——基准测量的是"模型 × harness × 设置",不是模型本身。一个丢弃思维链的 harness,测出来的是"失忆版模型"。对正在建长周期 agent 的团队,这是当下 ROI 最高的两个动作:先检查 harness 是否在工具调用之间丢弃推理与历史,再对 agent 反复触碰的热点文件做人工指向的结构拆分。前者几乎零成本,后者有了第一份可引用的量化标尺(83%)。同时第 ③ 点也点明边界:这类收益不会自己到来,仍需人主动介入。
  • 来源AI Daily Digest 2026-08-01(ARC-AGI-3 harness) · Claude Code Daily Briefing 2026-08-01(重构 token 实测)

3. 竞争维度上移:WSJ 揭 Codex 为何失守,Cognition 用"模型 + harness + 合规"回应

  • 事件内容
    • WSJ 复盘:OpenAI 2024 年秋就有强代码能力的推理模型,却把训练重心放在竞赛式编程题上,而非"进入代码库、理解上下文、调用工具、改文件、验结果"。Anthropic 2025 年 2 月 Sonnet 3.7 起就强调企业真实任务。结果早期 Codex 内部使用量低于管理层预期,开发者大量倒向 Claude Code;受 Claude Code 带动,Anthropic 的收入增速与私募估值据报已超过 OpenAI,估值正逼近 1 万亿美元。OpenAI 随后调整产品形态向 Claude Code 靠拢,并成立内部代号 "coding ninja" 的团队。The Information 拿到的 Weave 数据(覆盖 200 多家客户)显示,Claude Code 虽贵,企业尚未离开。
    • Cognition 的七月密度:7/8 发布自研前沿编程模型 SWE-1.7(以 Kimi K2.7 为基座做 RL,四项创新:保熵 top-p 采样稳定长 RL、跨三大洲多集群容错训练、执行测试过滤的数据质量流水线、self-compaction 自压缩 working state 以突破原始上下文窗口),FrontierCode 1.1 Main 42.3%、Terminal-Bench 2.1 81.5%、SWE-Bench Multilingual 77.8%,经 Cerebras 以约 1000 tokens/s 提供,Devin Pro 内免费;7/1 推出 Devin Security Swarm(多 agent MapReduce 式分区排查、跨文件推理多步攻击链,在 50-CVE 测试集找出 72% 真实漏洞,单次 $90.23);7/13 达成 FedRAMP High In-Process,与美国能源部签 MOU 加入 Genesis Mission;7/20 收购 TierZero 扩展到故障检测与系统可靠性。公司自述超过 90% 的自有代码已由 Devin 编写,年化收入十二个月内从 3700 万美元升至 4.92 亿美元。其内部 Fusion 架构研究还发现:Claude Fable 5 作为 lead orchestrator 优于 Opus 4.8(60.7 vs 54.6),且单次成本更低
  • 值得关注原因:这条把前两条的技术结论顶到了商业层面。OpenAI 输掉的从来不是"模型会不会写代码",而是没能把模型做成工程师每天都要打开的工作台;Cognition 押的也不是单一模型,而是"模型 + agent harness + 合规资质"整栈。再叠加"编排者选型比主力模型更影响结果"这个内部实测,2026 下半年 coding agent 的竞争关键词已经很清楚:编排设计、上下文经济学、进入企业采购流程的资质。选型时只对比 SWE-bench 分数,会系统性地看错方向。
  • 来源网易科技·Claude Code 抢下开发者,OpenAI 开始翻盘(WSJ / The Information) · AI Daily Digest 2026-08-01(Cognition 七月)

4. 具身智能补的是"毕业证":七部门首次单列人形专题给指标,杭州国家级中试基地给场景

  • 事件内容
    • 政策侧:工信部、应急管理部、人民银行、金融监管总局、证监会、中科院、国家文物局七部门联合印发《关于开展 2026 年工业和信息化领域创新任务揭榜挂帅工作的通知》,围绕六大方向布局 24 个前沿专题。"人形机器人与具身智能技术"被列为未来产业方向首位专题,由工信部与应急管理部联合牵头——这是揭榜挂帅机制启动以来该领域第一次被单独列为专题(此前归入"机器人"或"人工智能"大类)。攻关周期不超过 2 年,明确 2028 年前量化目标:具身智能多模态大模型实现视觉、语言、力触觉、本体状态不少于四类模态协同融合,多场景感知识别准确率 96% 以上;研制自主知识产权的端侧世界模型系统,形成 1 套完整的端侧世界模型开发与部署工具链。核心攻关点包括高转矩密度伺服电机、高动态运动规划与控制、仿生感知与认知、智能灵巧手、电子皮肤。
    • 基础设施侧:财联社 8/1 探营位于杭州高新区(滨江)、今年 5/16 揭牌的国家人工智能应用中试基地(具身智能)——全国唯一面向具身智能的国家级应用中试基地。配套的杭州市具身智能展示与应用推广中心已汇聚 140 多台机器人、建成电力巡检/物流搬运/康养护理等 40 多个应用导向场景,截至 7/29 累计参观 5.58 万人次。现场暴露的真实瓶颈:可直接用于训练的数据仍然稀缺,企业在真机遥操作与无本体动捕之间寻找更低成本采集方式;"仿真到现实"的落差会因光线、地面、障碍物变化而失效。基地已开始探索测试服务、产业投资与保险等商业配套——今年 4 月全国首例具身智能机器人保险完成理赔,赔付 5976 元
  • 值得关注原因:一条给"考纲",一条给"考场"。2028 年 96% 识别准确率、四模态融合、端侧世界模型工具链是罕见的可验收硬指标,等于把此前偏概念的具身智能拉进了工程验收流程,也直接指向电子皮肤、灵巧手、高转矩密度电机这些确定性零部件方向。而中试基地那笔 5976 元的理赔更有意味:机器人能否进入千行百业,不只取决于它能不能完成任务,还取决于坏了怎么修、出事了责任怎么分。目前物流搬运、工业巡检等结构化场景落地更快,进家庭仍受安全、成本、伦理与长期可靠性约束。
  • 来源中国机器人网·七部门揭榜挂帅首次单列人形机器人专题 · 财联社·杭州国家级中试基地探营

5. 大脑与现场同时上台阶:Gemini Robotics 2 跨本体控制,Figure 03 进宝马做"排序"

  • 事件内容
    • Google DeepMind(7/30)发布 Gemini Robotics 2,由三个模型组成:Gemini Robotics 2(VLA,将视觉与语言输入转为完整人形/双臂机器人的运动控制,支持全身智能控制、精细灵巧操作与多机器人协作)、Gemini Robotics ER 2(具身推理模型,与人沟通、理解物理世界、规划数分钟量级的多步任务)、Gemini Robotics On-Device 2(可在机器人硬件本地运行的高效 VLA,数小时内即可适配新本体)。关键能力是同一个模型 checkpoint 控制多种不同机器人本体,包括配置不同手部的 Apptronik Apollo 2。社区评价审慎乐观:动作仍明显慢于人类,约 60% 成功率、约 80% 准确率尚未达到多数场景的生产标准,但轨迹类似早期 LLM。
    • Figure 03 进入宝马:Figure 宣布最新人形 Figure 03 已抵达宝马集团 Spartanburg 工厂 52 号总装物流车间。任务从 Figure 02 时代的钣金取放(曾参与 2025 年 3 万辆整车装配)升级为排序(sequencing)——从料箱中抓取无序摆放的薄壁件,按精确顺序放到发往装配线的小车上。背后是 Helix 02 这一 pixels-to-actions 的 VLA 模型,在单一网络中协调手、臂、躯干与足,实现"边抓取边迈步、调整站位去拉带脚轮的重车"这类 loco-manipulation
  • 值得关注原因:两条正好落在具身智能的两端。DeepMind 解决的是泛化——一个 checkpoint 控多种本体、数小时适配新硬件,如果成立,机器人行业最贵的那部分(每换一款本体就重训一遍)会被大幅摊薄;Figure 解决的是工况——从"抓固定位置的硬件"到"从乱堆的薄壁件里按序取放",考验的是柔性件感知、无序抓取和全身协同,这正是产线上最难自动化、也最值钱的一环。对照条目 4 的国家级指标(四模态融合、端侧世界模型),三者指向同一件事:具身智能的竞争正从"能不能动"转向"换个本体、换个场景还能不能稳定干活"
  • 来源Top AI Stories 2026-08-01(Gemini Robotics 2) · AI Daily Digest 2026-08-01(Figure 03 @ BMW)

今日观察

  • AI Coding:三条形成一条完整链路。条目 1 是成本——V4-Flash 仅靠后训练把 DeepSWE 拉高 6 倍、Luna 单日降价 80%,长跑 agent 的费用约束正在消失;条目 2 是方法——ARC-AGI-3 的 13.3%→38.3% 和重构带来的 83% 输入 token 降幅,共同证明当下最大变量是 harness 与代码结构而非模型;条目 3 是商业——OpenAI 输在没把模型做成工作台,Cognition 押注"模型 + harness + 合规"整栈,且实测编排者选型比主力模型更影响结果。便宜了、方法清楚了、竞争维度上移了,这三件事同时发生的季度并不多见。
  • 具身智能:条目 4 与条目 5 一内一外。国内是给指标、补基础设施(2028 四模态 + 96% 准确率 + 端侧世界模型工具链,配上中试基地的 40 多个场景与首例保险理赔);国外是攻泛化与工况(一个 checkpoint 控多本体、人形进宝马做无序件排序)。两条路径殊途同归——衡量标准都已从"能演什么"变成"换本体、换场景后还能不能稳定交付"。