2026-09-12 · 宇树开源具身大脑,Agent 框架与安全齐飞

2026年9月14日阅读时长约 1 分钟

9/12 双线:OpenAI 发 Agents API 把智能体构建原语化;HarnessDev 揭示外壳比模型更决定 agent 表现(同 GPT-5 换壳 35%→49%);PaperCut CVE 被 AI agent 武器化攻破 48 国 395 组织。具身侧宇树开源 6B 通用人大脑、蚂蚁灵波开源 1.3B 世界模型,核心软件栈平民化。

1. OpenAI 发布 Agents API:把智能体构建原语化

事件:9 月 11 日,OpenAI 官方发布 Agents API,为开发者提供一套用于快速构建智能体的框架。该 API 把任务编排、工具调用与运行态管理封装为可组合的原语,环境与体验仍由用户自行掌控,开发团队可基于统一接口接入自有数据与系统,而不必从零搭建调度层。

为什么值得关注:这是 OpenAI 把 Agent 能力「标准化 / 原语化」的关键一步,延续其将 agent 工程从「手写调度层」推向「统一接口」的思路。对 AI Coding 从业者而言,多步骤 Agent 的工程门槛被进一步拉低,也意味着头部厂商正把「智能体运行时」当作新的平台层来争夺。需标注:Agents API 目前为 public beta,能力与计费细节以官方文档为准。

来源:OpenAI《Introducing the Agents API》2026-09-11

2. HarnessDev 范式:同一模型换外壳,成绩 35%→49%

事件:9 月 12 日,网易号报道(源自 ByteDance Seed、新加坡科技设计大学、佐治亚理工、M-A-P、TokenWave.AI 联合研究)提出 HarnessDev——把评测对象从「模型给出的答案」翻转为「模型自己写出的、可运行的外壳(agent harness)」。同一 GPT-5 在 Terminus2 中仅解决 35.2% 任务,换到 CodexCLI 即达 49.6%;6 个创建者模型自造外壳的 Self-Eval 平均分最高 67.8,而人类工程化参考值为 86.2,且大量代码组件空转、死代码成堆。

为什么值得关注:这对 AI coding 是方法论级提醒——决定 agent 表现的常常不是模型权重本身,而是外壳(执行循环 / 工具 / 上下文 / 恢复 / 验证)。35.2%→49.6% 的跃升证明「模型能力远未到顶,外壳优化空间巨大」,但也暴露模型目前并不真懂自己写的外壳(自造外壳泛化差)。对评测与工程实践都有直接启示:优化 agent 应同时盯紧 harness。需标注:该文为研究自转载,具体 benchmark 口径以原论文 / 模型卡为准。

来源:网易号《同一个 GPT-5,换个外壳成绩从 35% 涨到 49%》2026-09-12(原研究:ByteDance Seed 等 HarnessDev)

3. Agent 安全警报:PaperCut CVE 被 AI agent 武器化 + WeWorm 零点击蠕虫

事件:9 月 12 日 quidproquo AI Daily 披露,安全机构发现两个 PaperCut NG/MF CVE 被攻击者用「OpenAI Codex harness + DeepSeek 模型」组合的 AI agent 武器化,数小时内攻破 48 国 395 家组织,最快 7 分钟抵达域管;同日 WeWorm demo 用 AI 两天写出 RCE 利用、一周内完成横跨 iOS/Android 的微信语音零点击蠕虫。

为什么值得关注:这把本周「能力跃迁 vs 治理缺口」主线推到最尖锐处——agent harness 把「造一个自主系统」的交易成本压到任何人可用,且这个下降没有方向:它同样压低了大规模自动化攻击的成本。横向移动与利用从「团队数周」压缩到「分钟 / 天」。对采用 agent 的团队,威胁模型必须更新:不能只防 prompt injection,要假设攻击者握有与你同等强力的 harness 与模型,检测 / 隔离 / 响应须达到同等自动化。需标注:具体组织数量与时效来自安全机构报道,待独立核实。

来源:quidproquo《AI Daily — 2026-09-12》/ 安全机构披露 2026-09-12

4. 宇树开源 UnifoLM-WLA-1.0:6B 通用人形基座大模型

事件:9 月 12 日,宇树全面开源通用人形基座大模型 UnifoLM-WLA-1.0:6B 参数、2500 小时真机实测数据、64 项复杂任务,同一套权重全部开源。三项工业级泛化最为关键——①单一权重通吃全身协同(底盘导航 + 全身大范围移动 + 桌面毫米级操作);②跨末端执行器泛化(二指夹爪到五指灵巧手无需全盘重训);③端侧实时闭环(双目立体视觉注入,策略推理延迟压到 106ms / Sub-110ms)。代码、权重、数据链路与真机部署指南全开源。

为什么值得关注:这是具身「大脑」开源平民化的标志性事件——宇树把行业最痛的「走路一套 RL、抓杯切另一套扩散、换灵巧手算法报废」的割裂拼装,用单一通用权重强行打通,并直接开源。结合 9/11 蚂蚁灵波开源世界模型,具身核心软件栈正快速从「各家企业私藏融资壁垒」转向「开放基建」,中小团队入场门槛骤降。需标注:基准与延迟为厂商口径,跨硬件泛化待第三方复现。

来源:网易号《6B 参数全开源,宇树把人形机器人大脑打成白菜价》2026-09-12

5. 蚂蚁灵波开源 LingBot-World 2.0 Lite:1.3B 单卡世界模型

事件:9 月 11 日,量子位报道,蚂蚁灵波开源 LingBot-World 2.0 Lite,参数量仅 1.3B,面向消费级单 GPU,可在本地实时生成世界;训练流程一并放出。

为什么值得关注:与宇树开源大脑形成「具身软件栈平民化」双线——世界模型从数据中心拉到普通显卡,开发者无需集群即可在端侧做具身智能的环境仿真;开源权重与训练管线降低复现成本,也为机器人策略离线预训练提供轻量底座。这说明「具身大脑 + 世界模型」两类核心能力同日转向开源,是今日具身侧最清晰的主题。需标注:1.3B 实时生成的画质 / 保真度与下游任务收益待实测。

来源:量子位《This new open-source world model has only 1.3B parameters...》2026-09-11