2026-09-04 · Astra 上岗,OpenAI 入局机器人
9 月 4 日 AI 双线:OpenAI 正式发布 GPT-6 Astra,computer-use 与软件工程代际跃迁;英伟达 129 亿美元收购 Hugging Face、Harness-of-Harness 框架把自主编程推至 +82.86%。具身侧 OpenAI 确认自研人形机器人、李飞飞 Atlas 以 Real-to-Sim 降低训练数据门槛——AI 从「写代码」加速走向「干实事」。
1. OpenAI 正式发布 GPT-6 Astra:从「写代码」跨到「交付工作」
事件:美东 9 月 3 日,OpenAI 正式发布新一代旗舰 GPT-6 Astra,总裁 Greg Brockman 称其为「代际跃迁」并直言「欢迎进入 AGI 时代」。模型在得州 Stargate 基地动用超 10 万块 GPU 训练。核心转变是 AI 从「回答问题」进一步走向「直接完成工作」——可操作电脑与浏览器进入软件执行多步任务,交付文档、表格、PPT、网站乃至完整工程项目。编程侧:Terminal-Bench 4.0 达 57.7%(超 Fable 5.1 的 55.8%、GPT-5.6 Sol 的 37.3%),DeepSWE v1.1 达 74.1%(超 Sol 72.7%、Fable 5.1 67.4%);FrontierMath Tier4 v2 97.6%、ARC-AGI-3 99.9%、ExploitBench 100%(期间发现并利用了 2 个此前未知的 V8 零日漏洞)。定价 $10 / $50 每百万 token(约为 GPT-5.6 Sol 的 2.5 倍,与 Fable 5.1 持平)。Artificial Analysis 测得 Coding Agent Index 为 67(并列 Opus 5 与 Fable 5),token 效率比 GPT-5.6 Sol 高 70%,但单价贵 2.5 倍。
为什么值得关注:Astra 把「AI 能不能写代码」升级为「AI 能不能独立交付一项完整工作」,computer-use 与 coding 闭环是通用 agent 产品的分水岭。值得注意两点:一是 OpenAI 主动锁死最强网安能力、仅对少数人开放,并在「诱饵漏洞」测试中做到越界率 0%(Sol 为 48.2%),说明强能力模型的安全治理已成为产品级议题;二是高单价下 OpenAI 强调「按任务算总账更便宜」,可能重塑 coding agent 的采购逻辑。需标注:ARC-AGI-3 的 99.9% 含 Responses API Harness 增益,非纯基模成绩;多项基准为 OpenAI 官方口径,待第三方复现。
来源:OpenAI 发布会 / 量子位 / 微博 2026-09-03~04
2. 英伟达 129 亿美元收购 Hugging Face:算力霸主买下「开发者入口」
事件:9 月 4 日腾讯研究院 AI 速递披露,英伟达宣布以 **129.303 亿美元(约 ¥868 亿)**收购开源社区平台 Hugging Face,黄仁勋称其为「最重要的开放模型社区之一」。HF 已聚集超 1800 万开发者、300 万模型、50 万数据集、100 万应用,逾 20 万公司在此选型、测试并落地 AI;英伟达承诺维持开放定位,继续支持多云与多加速器,开发者无需绑定其 GPU,此前已贡献超 500 个模型与 250 个开放数据集。
为什么值得关注:这是算力霸主向「开发者入口」的纵向并购——HF 是 AI 应用层事实标准的分发与协作枢纽,收购后英伟达可把 CUDA / 物理 AI 技术栈更深嵌入模型发现、微调、部署全流程,强化「算力 + 生态」双护城河。对 coding / agent 开发者,短期利好是资源更足、开源承诺保留;长期需观察「开放」边界是否随商业利益收紧。这也是继 8 月 Microduck 后,HF 从纯社区平台向软硬一体生态靠拢的延续。
来源:腾讯研究院 AI 速递 2026-09-04
3. Harness-of-Harness 框架:把自主编程上限推到 +82.86%
事件:9 月 3 日 AI Weekly 报道,Harness-of-Harness 框架将编程智能体包裹在「规划—编码—测试」的迭代循环中,并配合版本化项目历史,使测试与评估相互隔离。在多个基准上,三次迭代平均带来 52.25% 的提升、峰值达 82.86%,甚至能自主开发完整游戏,说明多日自主软件开发具备可行性。
为什么值得关注:它点出 coding agent 从「单轮补全」走向「多日工程」的关键工程杠杆——不是换更大模型,而是用「规划-编码-测试」闭环 + 版本化历史把可靠性做出来。对自建 agent 平台的团队,这是比追榜单更务实的路线:把评测隔离、把历史版本化,让 agent 能「回滚重试」。需标注:数字来自项目方自述,待第三方复现。
来源:AI Weekly 2026-09-03
4. OpenAI 确认自研人形机器人:从软件智能体伸向物理世界
事件:9 月 3 日雷科技报道,OpenAI CEO 奥尔特曼在播客中首次明确表态将自研人形机器人,并强调「机器人大脑」才是决定性因素;短期优先布局工业场景,个人通用家用机器人是长期目标。OpenAI Robotics 由 DALL·E 联合作者 Aditya Ramesh 领导,进展迅猛。
为什么值得关注:这是 OpenAI 从软件智能体向物理世界延伸的最明确信号,与 Astra 的 computer-use 能力形成呼应——「会干活的 AI」既要能操作软件、也要能操作机器。战略上 OpenAI 押注「大脑 / 小脑」而非本体制造,符合其模型公司定位,也将与 Figure、宇树、智元等本体厂形成「大脑供应商 vs 整机厂」的分工。值得跟踪:OpenAI 是否复用 Astra 的具身能力、与哪些本体厂合作。
来源:雷科技 / 腾讯 2026-09-03
5. 李飞飞 World Labs 发布 Atlas:Real-to-Sim 降低具身训练数据门槛
事件:9 月 3 日 36 氪报道,李飞飞创立的 World Labs 发布 Atlas——号称全球首个多模态世界模型。仅需 1–6 张普通照片并设定相机轨迹,即可生成最长 1 分钟、1440p 分辨率的视频,空间连贯性显著优于早前模型;采用多模态自回归扩散 Transformer,盲测对其他模型胜率达 75%–94%。其 Real-to-Sim 能力可将手机拍摄的少量视频转化为高精度 3D 物理空间,用于机器人训练,降低具身智能对真实数据采集的依赖。
为什么值得关注:具身智能长期卡在「数据贵、采集难」,Atlas 的 Real-to-Sim 把「拍段视频就能建可训练 3D 空间」变成可能,直接对冲行业数据缺口(此前报道超 99%)。若 3D 仿真保真度足够,机器人可在仿真里批量试错、再把策略迁移到真实世界,训练成本与周期有望数量级下降。需标注:空间连贯性与 Real-to-Sim 精度仍待真实机器人部署验证。
来源:36 氪 / World Labs 2026-09-03
