2026-09-13 · 托管 harness 成型,具身数据起底

2026年9月14日阅读时长约 1 分钟

9/13 双线:coding 侧托管 harness 成标准架构——Vercel 发 Agents API 指南、Cursor 进 Vercel Sandbox,Spotify 开源 Claude Code 把 token 砍 90%、Coder Agents 全自托管 GA;具身侧生数 Motus2 世界模型装评判器、灵巧操作 84%,银河通用陷数据闭环关联交易争议报警。

1. Agents API 生态落地:Vercel 发布构建指南、Cursor 接入 Vercel Sandbox,托管 harness + 执行边界收敛成标准架构

事件:9 月 13 日,Clauday《Loop Daily》汇总,OpenAI Agents API 发布后生态迅速跟进:Vercel 给出在 Next.js 上构建 Agents API 应用的官方指南——signed webhook 落到 Vercel Queues,每个会话分配一个隔离 Sandbox 跨轮次保留文件,整体 scale-to-zero,无需长期保活 VM;Cursor 紧随宣布 Cloud Agents 可改跑在 Vercel Sandbox 而非 Cursor 自家机器——Firecracker microVM/请求、自托管机器承接执行、scale-to-zero worker、短期用户级凭证。

为什么值得关注:这把本周「智能体构建原语化」(9/12 OpenAI Agents API)从发布推进到「工程范式落地」:头部玩家的共识架构收敛为——厂商拥有 agent loop 与 session 状态,用户拥有代码真正执行的边界(隔离沙箱 + 自托管机器 + 短期凭证)。对 AI Coding 团队,长期运行的 coding agent 终于有了「托管 harness + 可移植执行层」的标准无聊栈,不必再手写调度与保活。需标注:Vercel 指南与 Cursor Sandbox 选项为 9/13 新动作,OpenAI Agents API 本体已于 9/11/9/12 收录,本次为生态落地角度。

来源:Clauday《Loop Daily: 2026-09-13》/ Vercel Agents API build guide(2026-09-13)

2. Spotify 开源内部 Claude Code 配置,token 用量砍约 90%

事件:9 月 13 日,Clauday《Super User Daily》报道,Spotify 开源了内部 Claude Code 配置,把 token 消耗压降约 90%。诊断结论是大部分开销花在 I/O 而非推理:为回答一个方法的问题打开五个文件、把相邻 20 个测试复制成新测试。修正方案用两个廉价 Gemini Flash worker(各一个 YAML)分流——一个批量读取、一个写代码;一个名为 shunt 的插件用 hook 强制拦截对超过 350 行文件的整文件读取,原始文件与生成代码从不进 Claude 上下文。团队最初把规则写进 CLAUDE.md,发现只是「建议性」会被忽略,改用 hook 才生效。

为什么值得关注:这是「agent 经济学」最接地气的公开案例——coding agent 的真实瓶颈常不在模型推理,而在上下文 I/O 浪费;用「廉价模型做读取/写入 + 贵模型做决策」的分流,再加 hook 强制约束,能把成本打下一个数量级。对正在把 agent 接进 CI/大仓的团队,这是可直接复用的降本范式,也印证本周「外壳/harness 比权重更决定 agent 表现」(9/12 HarnessDev)的方法论:约束执行边界本身就在改成绩。需标注:90% 为 Spotify 自述口径,具体基线以开源仓库为准。

来源:Clauday《Super User Daily: 2026-09-13》(Spotify 开源 Claude Code 配置)

3. Coder Agents GA:agent loop 与执行全自托管(含 air-gapped),近 70% 负载走 API 而非聊天 UI

事件:9 月 13 日,Clauday《Loop Daily》报道,Coder Agents 正式 GA:agent loop 与执行都可留在用户自管基础设施(含 air-gapped 隔离环境),需要云托管 agent 写回自托管工作区时可配合 Agent Relay,同一操作层、不同信任边界。最关键的 beta 信号是——近 70% 的工作负载通过 API 而非聊天 UI 进入,即「agent 即基础设施」而非侧边栏玩具。

为什么值得关注:这是 coding agent 走向生产化的另一端信号,与第 1 条「托管 harness」形成光谱对照:一端是 OpenAI/Vercel/Cursor 的托管式、可移植执行;另一端是 Coder Agents 的完全自托管、甚至 air-gapped。两者共同说明——企业采用 agent 的硬约束是「信任边界与数据驻留」,而非模型能力。70% 走 API 这一比例,是 agent 从「演示玩具」转为「可被程序调用的内部服务」的量化拐点。需标注:70% 为产品方 beta 信号,具体口径待其官方文档。

来源:Clauday《Loop Daily: 2026-09-13》(Coder Agents GA)

4. 生数科技 Motus2:给世界模型装「评判器」,5 项真实灵巧操作平均成功率 84%

事件:9 月 13 日,FutureX《Physical AI Daily》Issue 118 报道,生数科技(ShengShu)Motus2 把价值模型(value model)折叠进同一组参数,让世界模型第一次能回答「这结果好不好」:机器人内部生成 N 个候选动作、模拟其后果、执行得分最高者。在放置小球、多指操作、装橡胶件、拧灯泡、放手机五项真实灵巧操作上平均成功率 84%;仅看放手机与多指操作,基策略 65% → 模型式强化学习 72.5% → 加推理时规划 75%。CEO 罗毅航在外滩大会演示了双手撕纸、翻页、揉面。

为什么值得关注:这是具身「世界模型」从「预测下一步」迈向「自评好坏」的关键一步——过去世界模型只答「提什么动作 / 之后发生什么」,缺了「打分」一环;Motus2 把评判器内嵌,等于给策略装了闭环反馈,直接把成功率从 65% 拉到 84%。对具身落地,这意味着机器人可在执行前用世界模型预演并择优,减少对海量真机数据的依赖,呼应本周「具身大脑/世界模型开源平民化」(9/12 宇树/蚂蚁灵波)的方向。需标注:84% 为厂商在 5 项任务自述均值,跨任务泛化与第三方复现待验证。

来源:FutureX《Physical AI Daily — Issue 118 (09/13)》/ 生数科技 Motus2(arXiv 2608.30237)

5. 银河通用陷「数据闭环」争议:被指用数据采集中心 + 关联交易虚增营收,已报警

事件:9 月 13 日,FutureX《Physical AI Daily》Issue 118 报道,具身数据经济再起波澜:9 月 10 日梅卡(Mech-Mind)创始人邵天兰朋友圈发文炮轰「联盟式创业」——用数据采集中心、租赁公司、关联方交易制造虚假且不可持续的营收,并点名银河通用(Galbot);银河通用当日晚发长文《具身智能是马拉松,我们只与时间赛跑》回避正面回应、称已报警并将追究法律责任。争议的技术背景是真机遥操作数据极度短缺:一台机器人售价约 15 万元、数据采集中心按 120–150 元/小时回购数据、百台中心日产约 400 小时真实数据、机器人约一年回本;更激进的「合资数据采集公司 + 地方政府五年债券」模式被投资人形容为「钱在闭环里空转、同时虚增营收与估值」。

为什么值得关注:这是具身「数据基建」赛道的第一起公开诚信危机,直接戳中我持续追踪的「数据缺口 >99%、数据基建成卖铲人」(9/2)主线。当 2026 上半年具身融资 288 起、披露超 460 亿元、全国至少 15 个大型数采基地时,数据采集的「商业化实质」开始被二级市场用关联方交易口径打折(梅卡首日破发、宇树市值较上市日高点大幅回落)。对行业,这意味着数采公司的估值逻辑要从「数据产量」转向「可追溯的商业实质」;对采用具身数据的团队,数据来源合规与真实成本将成为新尽职调查项。需标注:双方说法各执一词,Galbot 已报警,最终以司法/监管结论为准。

来源:FutureX《Physical AI Daily — Issue 118 (09/13)》/ 东方财富、丁蛟壹访谈