2026-09-14 · 表格Agent登顶,具身量产提速

2026年9月14日阅读时长约 1 分钟

9/14 双线:WPS 表格 Agent 登顶 SpreadsheetBench V2、同模型编程工具 token 消耗差 70 倍、OpenAI 因 Astra 需求暂停 Pro;具身侧优必选柳州万台工厂投产、上海AI实验室发布视觉-力-触觉物理世界模型 W0,量产与大脑同步提速。

1. WPS AI 表格 Agent 登顶 SpreadsheetBench V2 Full,国产垂类 Agent 跑赢国际前沿大模型

事件:9 月 13 日,观察者网报道,在国际表格 AI 评测 SpreadsheetBench V2 Full 榜单中,WPS AI 表格 Agent 以 50.86% 的综合成绩排名第一,超过 Claude Opus 4.6(34.89%)、GPT-5.2(26.79%)与 Gemini 3.1 Pro(23.68%),且通过了官方 Verified 验证。这是其三个月内第三次登顶权威评测。V2 共 321 项任务,平均每项涉及 11.8 个工作表、593.5 个单元格修改,考察复杂工作簿的端到端交付能力。

为什么值得关注:这是「国产垂类 Agent 在细分专业任务上跑赢通用前沿大模型」的清晰信号——在通用能力趋同的背景下,把模型能力收敛到表格这类高价值垂直场景深耕,反而能越过参数与算力的绝对劣势。对 AI Coding 赛道,它提示了另一条突围路径:不必死磕通用 coding 榜,而是在办公、表格、文档等真实工作负载上做「场景 Agent」,用专业评测建立壁垒。需标注:50.86% 为榜单公布成绩,评测口径以 SpreadsheetBench 官方为准。

来源:观察者网《从表格到教育医疗,国产垂类 AI 正跑赢国际大厂?》(2026-09-13)

2. InfoQ 实测:同一底层模型,不同 AI 编程工具 token 消耗差 70 倍

事件:9 月 13 日,InfoQ 发布三组对比测试:即便使用完全相同的底层模型,不同 AI 编程工具完成同类任务的实际 token 消耗可相差最高 70 倍。成本差异主要来自 Agent 框架的启动开销与缓存命中率,而非模型本身——同样的「改一个函数」,有的工具把整个仓库索引塞进上下文、反复重读大文件,有的则用增量检索与缓存把开销压到极低。

为什么值得关注:这戳中了 AI Coding 团队最现实的 TCO 盲区:选型时盯着模型报价(每百万 token 单价),却忽略了「工具架构的 token 效率」才是账单的真正决定项。它把本周「外壳/harness 比权重更决定 agent 表现」(9/12 HarnessDev)的方法论从「成绩」推进到「成本」维度——约束执行边界、提升缓存命中,直接等于降本一个数量级。对正在把 coding agent 接入 CI/大仓的团队,这应成为选型的核心量化指标之一。需标注:70 倍为 InfoQ 三组测试极值,具体场景与基线以其原文为准。

来源:InfoQ《The model is exactly the same, yet the token count differs by 70 times?》(2026-09-13)

3. OpenAI 暂停 ChatGPT Pro 新订阅:Astra 需求「前所未有」,编码智能体撞上算力瓶颈

事件:9 月 13–14 日,生成式 AI 日报汇总,Codex 产品负责人 Tibo 确认,GPT-6 Astra 上线后需求「前所未有」,其中 Pro 档对系统压力最大,暂停新订阅是「维持广泛访问的最小措施」;同期有用户晒同一提示词前后对比质疑质量退化,官方回应模型上线以来未做改动、正在调查。背景上,Altman 接受《财富》专访确认 OpenAI 2026 年不推进 IPO,称当前安全议题下上市并非明智时机;Anthropic、OpenAI、谷歌三方亦在磋商共建 AI 行业标准机构。

为什么值得关注:Astra 是当下 coding/agent 工作负载的主力底座,Pro 暂停订阅是「编码智能体的真实用量已压垮模型层算力」的公开信号——AI Coding 的竞争正从「谁模型更强」转入「谁能在成本与算力约束内规模化交付」。叠加 Altman 确认 2026 不 IPO、三巨头讨论自建标准机构,行业从「能力军备竞赛」出现「协同放缓 + 治理前置」的转向苗头,值得持续跟踪其对 coding 工具供给与定价的影响。需标注:暂停范围仅限 Pro 新订阅、恢复时间未公布;质量退化质疑待官方调查结论。

来源:生成式 AI 日报(2026-09-14)/《财富》Altman 专访(2026-09-13)

4. 优必选柳州万台级工厂投产 + 上半年销量 921 台同比 +1946.7%:具身从演示走向量产标杆

事件:9 月 12 日,优必选柳州工业人形机器人超级智慧工厂正式投产,占地 1.4 万平方米,联合西门子打造专属数字化智造底座,按设计节拍每 10 分钟下线 1 台、年规划产能超万台,定位「全球首个适配万台级产能的人形机器人智能制造工厂」,实现「用机器人造机器人」。同日披露的上半年数据:全尺寸具身智能人形机器人收入 5.9 亿元(同比 +1445%)、销量 921 台(同比 +1946.7%),收入与销量均列全球第一;并中标乐山约 1.508 亿元商用服务人形机器人项目,海外订单覆盖欧洲、日韩。

为什么值得关注:这是具身「量产可行性」最硬的证据链——不是单台样机,而是「万台级产能工厂 + 上半年近 2000% 销量增长 + 亿元级商业订单」三位一体。它把本周持续追踪的「具身从演示走向量产」(9/12 车企下场、9/13 跨本体架构)推到可验证的商业化节点:工业场景(Walker S2)已成第一大收入来源,而商业/家庭新品尚待放量。对行业,这意味着头部企业的竞争焦点正从「本体炫技」切到「产能、良率、交付与真实营收」。需标注:上半年确认收入的 921 台仍以工业场景为主,商业与家庭场景放量仍需时间;乐山项目为中标披露,最终以合同执行为准。

来源:一财有看投 / 南方都市报 / 优必选公告(2026-09-12 至 09-14)

5. 上海 AI 实验室书生·端砚升级 + W0 物理世界模型:视觉-力-触觉一体,具身大脑再进一阶

事件:9 月 13 日,上海人工智能实验室在浦江创新论坛升级发布「书生·端砚」科学发现平台并全面开放全栈服务,新增可信科研证据链支持核验复现;同期披露新发布的 W0 物理世界模型,可同时处理视觉、力、触觉三种信号——机器人靠近物体时用视觉定位,接触后用力与触觉反馈微调,采用「异步双频」架构让后台规划与实时动作并行,动作调整无需等待新规划周期。W0 已集成进「书生·端砚」平台,与书生科学基础模型 S2 协同支撑干湿实验闭环。

为什么值得关注:这是具身「世界模型 / 具身大脑」从「纯视觉预测」迈向「多模态物理感知」的关键一步——过去世界模型多停留在看与想,W0 把力与触觉纳入闭环,更接近真实操作所需的「感知-决策-执行」一致性。它与本周「世界模型自评闭环」(9/13 生数 Motus2 装评判器)、「跨本体架构」(9/12 宇树/蚂蚁灵波开源)形成技术合流:具身智能的竞争正从「本体硬件」上移到「能统一多模态物理信号的大脑」。需标注:报道未提供 W0 的基准数值,也未说明是否开源,具体能力以待实验室后续技术报告为准。

来源:新民晚报 / 上海人工智能实验室(2026-09-13)