2026-08-13 · DeepSeek V4 Pro 上线,Grok 4.6 与比亚迪入场

2026年8月13日阅读时长约 1 分钟

8/13 主线:AI Coding——DeepSeek V4 Pro 上线(DeepSWE 7.3→62.7、Terminal Bench 87.9 逼近 Fable 5)、Grok 4.6 编程登顶 AA 指数、Harness 范式深化(SIGIL 约束 harness 完成率 56%→86%);具身——比亚迪人形机器人亮相迪空间、宇树 IPO 认购超 5500 倍创纪录叠加前 7 月出口大增。

1. DeepSeek V4 Pro 正式上线:Agent 能力大幅跃升,多项基准反超 Fable 5

  • 事件内容
    • 8 月 13 日凌晨,DeepSeek 推出 V4 Pro 正式版(DeepSeek-V4-Pro-0813),已更新至 API。新版本大幅增强 Agent 能力,支持 Responses API 与 Codex 接入
    • 跑分跃升显著:AI 编程智能体基准 DeepSWE 从 Preview 的 7.3 升至 62.7,超越 Claude Opus 4.8;终端 Agent 基准 Terminal Bench 得分 87.9,逼近 Claude Fable 5 的 88.0;在 AI 安全智能体基准 CyberGym 与高难度 AutomationBench 上甚至反超 Fable 5;SWE Verified 达 80.6%、Terminal Bench 2.0 达 67.9%。
    • 配套动作:DeepSeek 此前已预告“近期整体上调 API 定价,预计涨幅较大”。业内判断 V4 定位为 Agentic Coding,且据传其内部 harness 已在部分国产厂商测试,公众号“harness 团队”已上线,暗示将做系统级算力优化与生态开源。
  • 值得关注原因:这是国产模型在 Agent 工程化能力上的关键一跃——短短几周内 DeepSWE 从个位数冲到 62.7,标志模型从“能写代码”跨到“能跑长程 agent 任务”。叠加 harness 内测信号,DeepSeek 正从纯模型走向“模型 + 执行装置”闭环,与 Claude Code 类工具正面竞争。对国内团队,这意味着高性价比 agentic coding 底座即将成型,但需关注 API 涨价对成本结构的冲击。
  • 来源澎湃/网易 · DeepSeek V4 Pro 正式上线 · 财联社 · V4 Pro 增强 Agent 能力 · 腾讯新闻 · Harness 工程动态

2. Grok 4.6 发布:长程 agentic 编程登顶 Artificial Analysis 综合指数

  • 事件内容
    • 北京时间 8 月 12 日晚间,Grok 4.6 正式发布。新模型在 Grok 4.5 基础上强化长时间运行的智能体任务、复杂交互与视觉工作,能持续处理大量步骤的复杂任务——包括资料研究、信息分析、大型代码库处理,以及把产品构想转化为完整应用或工作成果。
    • 基准方面:在综合 9 项基准的 Artificial Analysis Intelligence Index 上,Grok 4.6 与 GPT-5.6 Sol 取得相同成绩(并列前沿)。实测显示它擅长把宽泛产品构想落成可运行初版,并在更长任务流程中表现出更多自主测试与验证行为(执行前检查已完成工作)。Grok 4.6 已在 Cursor 与 Grok Build 上线,首周两项服务提供双倍内含额度。
  • 值得关注原因:xAI 把“长程 agentic 编程 + 产品级落地”当成主战场——相比单纯刷 SWE-bench,更强调“从想法到可运行应用”的端到端能力,且自主验证行为缓解了 agent“盲跑”的可靠性痛点。与 GPT-5.6 Sol 并列第一也说明闭源前沿模型在综合智能上再度贴脸。对开发者,Cursor 已可一键切换 Grok 4.6,多模型 harness 的工程价值进一步凸显。
  • 来源DoNews · Grok 4.6 发布 · Artificial Analysis Intelligence Index

3. Harness 范式深化:SIGIL 论文显示“编译为约束 harness”完成率 56%→86%

  • 事件内容
    • 8 月 13 日行业深度文章系统拆解 “Harness(生产系统)”如何替代单纯 Skill 成为 Agent 落地关键。核心证据来自 7 月 30 日 SIGIL 预印本:同一流程写成自然语言 Skill 完成率仅 56%,编译为带类型与前置条件的 Harness 后升至 86%;8 月 5 日 Skill-Use benchmark 亦证明换 Harness 模型排名会变,垂直 Harness 比垂直 Skill 更具壁垒价值。
    • 同一天,AIGC 新知披露 DeepSeek 在 V4-Pro 0813 版本中支持主流 agent 及国产算力,据传 deepseek harness 已在部分国产厂商内部内测,公众号“harness 团队”已上线;文章推测其 harness 将做系统级算力优化与生态开源。
  • 值得关注原因:这把近两周“harness 成主战场”的结论补上学术级证据——差距不在模型智商,而在“运行装置”如何把任务结构化、约束化、可恢复。当自然语言 Skill 只有 56% 完成率、约束 harness 拉到 86%,团队选型的重点应从“追模型”转向“搭 harness”。叠加 DeepSeek 入局,国内“模型商品化 + harness 本土化”的趋势在加速,值得跟踪其开源节奏。
  • 来源腾讯新闻 · Harness 工程动态(含 SIGIL) · AIGC 从 0 到 1 · 深度解读

4. 比亚迪首款人形机器人 8 月亮相“迪空间”,车企加速延伸具身智能

  • 事件内容
    • 比亚迪确认其首款人形机器人将于 2026 年 8 月正式亮相,率先进入旗下 “迪空间” 新能源汽车科普体验中心,与消费者面对面互动——而非静态陈列。据流出资料,该机器人被称为“小迪”,身高约 1.61 米、重约 58.5 公斤、拥有 31 个自由度,配备 360 度视觉感知与动态三维环境建模,可识别人脸、手势、唇部动作,支持六种方言与六种外语实时交互(参数未获官方正式确认)。
    • 与多数先进入汽车工厂的人形机器人不同,比亚迪首批场景面对的是消费者:迎宾、车辆介绍、产品讲解等客服工作,等于把汽车展厅当成真实环境交互能力的测试场。这延续了特斯拉、小鹏、奇瑞等车企布局人形机器人的趋势。
  • 值得关注原因:这是车企把具身智能从“产线工具”推向“消费触点”的新信号——比亚迪用庞大的线下展厅网络作真实交互训练场,场景数据天然高频且多样。对行业而言,车企兼具制造供应链、资金与落地场景三重优势,“整车厂 + 人形”的路线若跑通,将把具身智能的商业化边界从 B 端工厂扩到 C 端服务,值得跟踪“小迪”正式亮相后的交互表现与量产节奏。
  • 来源新浪 · 比亚迪首款人形机器人 8 月亮相迪空间

5. 机器人资本化 + 量产 + 出海三线共振:宇树 IPO 认购超 5500 倍创纪录

  • 事件内容
    • 8 月 13 日机器人板块“资本化 + 量产 + 出海”三线共振。宇树科技科创板 IPO 获约 5526 倍超额认购(发行价 150.8 元/股、募资约 61 亿元,网上中签率 0.0181% 创科创板新低),被视为行业公开估值锚;港股机器人概念股集体走强,华勤技术涨近 10%、来福谐波涨 6.3%。
    • 量产与出海同步提速:海关数据显示,今年前 7 个月我国工业机器人出口同比增长 13.2%,自 1 月增设独立税号以来智能仿生机器人半年出口金额增长超 5 倍;中联重科推出 8 款轮式及双足人形机器人、数十台进厂物流/装配/质检岗位;西湖机器人完成过亿元 A 轮融资(海愿基金领投),主攻人形全身统一大模型;荣耀发布业界首款“能打电话的机器人”Robot Phone。
  • 值得关注原因:这是把“具身量产爆发”推进到资本定价 + 真实出货 + 全球上岗的可验证阶段——宇树 5526 倍认购给出硬估值锚,前 7 月出口大增证明海外需求真实存在,西湖融资与中联进厂则说明“大脑 + 本体 + 场景”的闭环在多点开花。但窗口也是“资本检验期”:2026 下半年至 2027 初被投资人界定为人形赛道的估值兑现节点,需警惕过热与量产可靠性落差。
  • 来源腾讯新闻 · 机器人行业资讯 · 腾讯新闻 · 港股机器人概念股走强 · 网易 · 西湖机器人过亿 A 轮