2026-08-03 · Copilot 换脑,Karpathy 撞验证墙,机器人看视频学活
2026年8月3日阅读时长约 1 分钟
Karpathy 用 100 万 token、10 美元、2 小时让 Opus 5 造出 5,500 行代码的中土世界,却因模型无法验证自身输出而卡壳,与 MIT Sloan“三分之二财富差距源自提问措辞”共同指向“提问与验收比模型更关键”;GitHub Copilot 本月默认模型换成微软自研 Polaris 并剪断 OpenAI 依赖,Workspace 同步 GA;OpenRouter 周调用量前五全被中国模型包揽,北京把“驾驭层工程”写进全国首部省级智能体政策。具身侧银河通用 WAM-TTT 让机器人看手机视频即可学新技能,T-Rex 用独立触觉控制环把接触密集任务成功率从 35% 拉到 65%。
1. Karpathy 用 100 万 token 造了个中土世界,然后卡在了“它自己看不懂自己做了什么”
- 事件内容:
- 实验本身:8 月 3 日,Andrej Karpathy 把《指环王》开头的一段文字连同 100 万 token 的预算一起交给 Opus 5,要求它用 Three.js 渲染出这个世界。结果:约 2 小时、5,500 行代码、总成本约 10 美元,产出一个能跑起来的三维世界,里面有多个程序化放置并带动画的多边形资产。
- 失败的地方不在生成,在验收:模型无法验证自己的输出——它看不了自己生成的视频,也玩不了自己做的游戏,唯一的反馈通道是截图。而截图立刻暴露了多处错误与质量问题。换句话说,钱和 token 买到的是“更多的产出”,不是“更对的产出”。
- 这已经是连续第三天指向同一件事:Claude Code 每日简报把 8/1、8/2、8/3 三天的观察归纳为一个不对称——生成能力随预算线性扩展,判断能力不随预算扩展。给出的可操作建议很具体:跑大 token 预算任务时,必须给 agent 配上可自动判定、且模型能自主观测的信号——测试、解析脚本、lint 与类型检查。不能自动观测的验收标准,等于没有验收标准。
- 同一周还有一份实证补刀:MIT Sloan 8 月 2 日的研究让 1,000 名成年人各自写自己的 prompt,在 GPT-5.2 / GPT-5.6 / Gemini 3 Flash 上模拟 22 至 89 岁的财务决策。结果:女性与低金融素养用户到 60 岁时财富少约 5 万美元(4%),AI 使用经验较少者少约 10 万美元(6%);最关键的一条是——性别差距中有三分之二来自提问的措辞,只有三分之一来自模型差异。
- 值得关注原因:这两条放在一起,把“AI Coding 的产出质量到底由什么决定”回答得相当干脆:上游是提问,下游是验收,中间的模型反而是变量里最小的那个。团队里同样用 Claude Code、同样一份 CLAUDE.md,产出差距大到不像同一个工具,第一反应不该是换模型,而该是查 prompt 习惯和验收信号。这也正好接上昨天 Anthropic 那套做法——把“干活”和“验证”拆成两个不共享上下文的节点,本质就是给判断力单独开一条预算。Karpathy 的 10 美元实验之所以值得看,恰恰因为它失败得很干净:当 agent 唯一能看见的只有截图,它的天花板就是截图的分辨率。
- 来源:Claude Code Daily Briefing 2026-08-03(Karpathy 百万 token 实验 / MIT Sloan 研究) · AI Daily Digest 2026-08-03
2. GitHub Copilot 换了心脏:Polaris 本月成默认模型,OpenAI 那根线被剪了,Workspace 同步 GA
- 事件内容:
- 模型换血正式生效:从本月(2026 年 8 月)起,所有 GitHub Copilot 订阅者的默认模型自动切换为 Project Polaris——微软自研的端到端代码混合专家(MoE)模型,独占运行在 Azure 内部的自研 Maia AI 加速器上,默认路径不再调用 OpenAI API。该计划在 Build 2026(6 月 2 日)宣布,Individual / Business / Enterprise 席位自动迁移,企业租户可选一个三个月回退窗口(至 11 月)。
- 技术与商务细节:按语言/框架划分专家子模块,Rust、Haskell、Zig 等低资源语言收益最大;官方称 HumanEval 与 MBPP 超过 GPT-4 Turbo,但未披露 SWE-Bench 成绩。Pro / Pro+ 层级默认获得最多 10 万行的多文件上下文与自主测试生成。而账单侧:价格不变、不增加新 SKU——模型替换发生在既有合约之下。
- Copilot Workspace 同日 GA:Autopilot 模式跨整个仓库推理、提议多文件编辑、跑测试、解读结果并迭代,作用范围由一个 GitHub issue 或功能描述界定;Fleet 模式并行跑多个 issue,专门对付依赖升级、代码风格迁移、许可证合规扫描。配套的桌面 App 被 GitHub 称为“agent-native 桌面体验”,“My Work” 面板把所有活跃 agent 摊在一个界面上——一个在修分支上的 bug,一个在实现 API,一个在回应 PR review。Autonomous Agent Mode 本月起面向 Enterprise 推送:Copilot 可以不经逐步确认地写、测、提交整个特性分支,人类只在最后的 review-and-merge 关口出现,且这一关强制保留。两种模式都跑在本地或 GitHub Actions 沙箱里。
- GitHub 自己把赌注说得很直白:2027 年软件工程师的主要活动将是审查和批准 agent 完成的工作,而不是自己写。 独立评测者点出的未解风险只有一个但很致命:通过仓库上下文实施的 prompt injection,这是自主编码 agent 向生产分支提交代码时的首要已知攻击面。
- 值得关注原因:8 月 1 日这还只是一则“下月替换”的公告,今天它变成了已经生效的默认值——这是全球最大的开发者分发面第一次不再跑在租来的模型上。三层影响值得分开看:商业上,每一次经 OpenAI API 的补全对微软都是自家产品上的按 token 过路费,在数百万开发者全天候补全的规模下这是结构性拖累,自研模型 + 自研芯片让微软同时优化两端,这是一个穿着产品发布外衣的毛利决策;竞争上,Claude Code 与 Cursor 面对的对手从“OpenAI 的分发渠道”变成了“微软自己的 agent 平台”;工程上,最该盯的不是跑分,而是那条未解的 prompt injection——当 Autonomous Agent Mode 可以无逐步确认地提交整个分支,仓库里任何一段可被模型读到的文本都成了潜在指令面。这与 8 月 2 日那条“入侵源于模型对环境的错误信念而非恶意”是同一个结构性问题。
- 来源:AI Daily Digest 2026-08-03·Polaris Becomes Copilot's Default Model / Workspace GA · GitHub Blog · Copilot Workspace GA · Microsoft Build 2026 — Project Polaris
3. 中国侧同日三连:OpenRouter 调用量前五全被中国模型包揽,智谱重开 Coding Plan,北京把“驾驭层工程”写进了政策文本
- 事件内容:
- 调用量:全球多模型聚合平台 OpenRouter 最新一周大模型调用量榜单,前五名全部由中国企业研发。登顶的是小米 MiMo-V2.5,单周 10.5 万亿 Token,环比 +12%;DeepSeek 占据第二与第五,形成旗舰与轻量的高低搭配,其中 Pro 版在代码与复杂智能体任务上对标海外顶级闭源模型;最猛的是第三名——腾讯混元 3 于 7 月 6 日才开源,单周环比增幅超过 999%。
- 供给侧:智谱宣布,随着基础设施扩容,此前因 AI Coding 需求爆发而阶段性限额的 GLM Coding Plan 重新开放订阅;同时披露已落地1GW 级国产 AI 算力数据中心,全部采用国产 AI 芯片。超聚变 AI Lab 平台上线 DeepSeek-V4-Flash-0731 正式版,可 PC 端在线体验。
- 政策侧:8 月 3 日《人民日报》11 版刊发《北京推出措施加快智能体创新发展》,正式推广全国首部省级智能体专项政策《北京市关于加快智能体引领发展的若干措施》——4 个方面 10 条,关键技术攻关、共性平台与示范应用等重点项目择优给予最高 1 亿元资金支持。其中最值得开发者注意的是措辞:“强化智能体驾驭层共性技术攻关,支持实施驾驭层工程,围绕上下文工程优化、任务持久化、多智能体协作、系统可扩展等方向夯实智能体共性底座”,并提出打造**“灵玑”智能体基础设施**、建设高价值能力资源共享平台与智能体技能市场、支持研制 AI 原生超级软件与 AI 操作系统、推广 FDE(前沿部署工程师)驻场共创模式;产业侧单列支持以 OPC(AI 一人公司)为代表的创业新模式,提供一键填报、自动生成规范化公司章程等便利登记,并鼓励发展 Token 经济(Token 工厂、Token 券、智能体服务券)。发布会给出的底数:北京上半年 AI 领域融资超 950 亿元、占全国比重超三成;豆包月活突破 3.82 亿,日均 Token 调用量突破 180 万亿。
- 值得关注原因:这三件事拼起来是一条完整链路——国产算力(1GW 全国产芯片)→ 模型供给(GLM Coding Plan 解除限额、V4-Flash 正式版)→ 真实调用量(OpenRouter 前五全中国、单周 10.5 万亿 token)→ 政策承接(省级专项 + 最高 1 亿)。两个细节尤其值得记下:其一,智谱限额的原因是“AI Coding 需求爆发”——这是一条被具体产能约束佐证的需求信号,比任何榜单都硬;其二,“驾驭层工程”这个词几乎就是把 harness / context engineering 直接写进了政府文件,而上下文工程优化、任务持久化、多智能体协作四个方向,正好对应本周被反复验证的三条结论:上下文比模型更值得投资、判断力必须单独建节点、多 Agent 是取舍不是升级。政策文本罕见地和一线工程共识对上了频。至于 OPC(一人公司)——当政策开始为“一个人 + 一群 agent”这种组织形态设计注册流程和孵化服务,说明它已经不只是硅谷推特上的段子。
- 来源:极新早报 2026-08-03(OpenRouter 榜单 / 智谱 GLM Coding Plan / 超聚变上线 V4-Flash) · 人民日报 2026-08-03 11版·北京推出措施加快智能体创新发展 · 北京市政府·加快智能体引领发展若干措施全文 · 央广网·北京出台智能体专项政策 最高支持1亿元
4. 具身智能的部署成本被拆掉一半:银河通用 WAM-TTT 让机器人“看手机拍的视频”就能学新活
- 事件内容:
- 卡了整个行业的那道坎:机器人在实验室表现优异,一进真实场景就“失灵”。银河通用联合创始人张直政的比喻很到位——“厨师在学校学会了做菜,换到不同餐厅、不同家庭,锅具全换了,还能不能炒出同样水平的菜?”过去的解法是重新采集数据、重新训练模型,部署周期长、成本高,这正是人形机器人规模化部署最大的瓶颈。
- 新框架:银河通用近期发布 WAM-TTT(World Action Model Test-Time Training),称为全球首个面向具身智能世界模型的测试时后训练框架,首次实现机器人在部署阶段持续学习、持续适应。效果是:机器人只需“观看”少量人类操作视频,就能把已掌握的技能迁移到全新场景,不需要机器人本体数据,也不需要任何动作标注——普通人用手机拍一段示范,就能“教会”机器人。
- 底座:全栈自研的 “银河星脑”AstraBrain 是全球首个统一“大脑-小脑-神经控制”的端到端具身大模型;AstraBrain WAM 0.5(世界-动作模型)全球首次在统一隐空间中打通 VLA 与世界模型两条曾被视为对立的路线,从而能同时吸收带动作标签的遥操数据与无标注的互联网视频;通用小脑 AstraBrain-WBC 0.5 基于2 万小时人类动捕数据训练,并在真机上实现大量未见动作的零样本泛化。
- 已经在产线上跑的成绩:Galbot S1 双臂 50 公斤级重载、纯视觉柔性定位(不依赖二维码或反光板)、360° 全向避障。自今年 3 月在宁德时代宁德 HX 基地完成验收至今,已在量产线上 7×24 小时连续工作超过 3 个月,全程零遥操、全自主,承担模组与电池包环节物料转运——全球首次实现人形机器人在新能源智能制造产线的“常态化自主作业”。搬起 50 公斤料箱到卸货复位,全程不到 30 秒。此外已进入博世、西门子、丰田、现代、北汽、上汽、极氪、长城等真实产线;宁德时代旗下宁家服务成为其全球服务供应商,把覆盖 80 多国、1,300 余家的服务网点升级为具身智能机器人服务网络,确立全球首个具身智能后市场服务标准。零售侧,Galbot G1“迎宾小盖”已在中关村鼎好 DH3 大厦的全家便利店上岗。世界人形机器人运动会即将开幕,银河通用将参加包括场景赛在内的多项赛事。
- 值得关注原因:昨天 CRAIC 全尺寸赛“首次全程取消遥操”暴露的是能力差距,今天这条给的是成本解法,两者是同一个问题的两面。要害在于 WAM-TTT 把学习从“训练时”挪到了“部署时”——过去每进一个新场景就要重来一轮数采与训练,现在把适应过程放进现场,用一段人类视频完成。如果这条路成立,具身智能最贵的那笔账(真机遥操采数据)会被结构性压缩,这与昨天“无本体数据采集技术开始降本”指向完全一致。另外三点值得单独记:其一,纯视觉、不改产线——“工厂不再需要为了迁就机器去改造产线”,这是能不能算得过账的分水岭;其二,宁德时代是全球唯一给出具身智能“入场券”的动力电池巨头,而且是直接投资方,它的验收标准本身就是一次高压筛选;其三,张直政留下的问题才是真正的下一关——“同一套模型部署到上万台机器人,每台设备存在加工公差、长期磨损带来的硬件差异,如何用技术抹平这些差距”。这句话的分量,比任何一场演示都重。
- 来源:北京日报·【机器人发展看北京】具身智能“学会”全身协同(WAM-TTT 首发) · 北京日报客户端·告别“机械执行”,北京具身智能迈入全身协同新范式(2026-08-03) · 新京报·全球首次,银河通用在宁德时代实现常态化自主作业 · 甲子光年·机器人“真干活”,为什么宁德时代选择了银河通用
5. 战场转向手指尖:T-Rex 把触觉做成独立控制环,同日两家“数据+灵巧手”公司各拿 1 亿
- 事件内容:
- 论文(T-Rex,arXiv:2606.17055):UC Berkeley、Stanford、NVIDIA 联合出品,作者含李飞飞、Jim Fan、Yuke Zhu。最反直觉的发现是负向结果——把触觉朴素地接进 π0.5 VLA,性能反而下降。原因是时序错配:视觉是低频信号,而触觉每秒要做数百次微调,naive 融合等于让快信号被慢信号拖住。
- 解法:把触摸当作一条独立的控制环。数据上采集了 100 小时“触觉百科”,覆盖 200 多种日常物体、22 种接触原语,使用两只高精度手;表示上用时空触觉 VQ-VAE 把触觉压成数百个离散 token;架构上用 Mixture-of-Transformers 组织三个异步专家(latent / action / tactile),各跑各的频率。训练路径是人类第一人称视频先验 + 100 小时触觉中训。
- 结果:12 个接触密集型任务平均成功率 65%,基线 EgoScale 仅 35%;翻书任务 96%;在鸡蛋、杯子卸载这类易碎/易滑场景表现尤其突出。
- 同日两笔融资,方向高度一致:LiberAI(将闲科技)完成 1 亿元 Pre-A+ 轮,投资方包括三六零、国开金融、创新工场、CMC 资本、彬复资本、红杉中国等——聚焦 Physical AI,做原生多模态预训练与世界模型,用世界模型控制自研的 20 自由度灵巧手,构建“互联网人类视频 + 自研数据手套 + 真机数据”三层数据金字塔,其自研人类数据手套已解决精度、穿戴舒适性、抗电磁干扰三大难题并进入量产采集阶段。同日,昆腾动力完成 1 亿元种子轮(云启资本、商汤科技),做面向全行业的 Physical AI 底层平台。
- 值得关注原因:这三件事指向同一句判断——本体已经不是瓶颈了,触觉带宽和数据供给才是。T-Rex 那个负向结果尤其值得单拎出来:“加一个模态”从来不等于“能力增强”,频率不匹配的融合是净损失——这和 8 月 2 日《Nature Machine Intelligence》“多 Agent 不是升级、是有边界的取舍”完全同构,两条独立研究在两个领域给出了同一条工程纪律:新增组件必须先回答它以什么频率、在哪条回路里工作,否则先减后加。 而 65% vs 35% 的差距,说明触觉一旦被正确接入,收益是量级性的——尤其是在鸡蛋、杯子这类“视觉根本看不出该用多大力”的场景,这正是所有家庭与零售场景的日常。资本侧同样在投这条判断:LiberAI 的三层数据金字塔(互联网视频→数据手套→真机)与银河通用的 WAM-TTT、与昨天浙江清华柔电院的“无本体数据采集”,本质是同一个解法的三种版本——用尽可能便宜的人类数据,替换尽可能贵的真机遥操数据。数据手套进入量产采集,是这条路径从论文走向供应链的信号。
- 来源:AI Daily Digest 2026-08-03·T-Rex Gives Robot Hands Real-Time Tactile Intelligence(arXiv:2606.17055) · 极新早报 2026-08-03·LiberAI 1 亿元 Pre-A+ / 昆腾动力 1 亿元种子轮 · 国金证券·具身智能产业迈入催化密集期(2026-08-03)
今日观察
- AI Coding:今天的三条构成“能力—分发—供给”三层。条目 1 是能力的真实天花板——Karpathy 花 10 美元、2 小时、100 万 token 换来 5,500 行代码和一个跑得起来的中土世界,却卡在模型看不懂自己的产出;配合 MIT Sloan 那组“性别财富差距三分之二来自提问措辞”的数据,结论是上游的提问和下游的验收,比中间的模型更决定产出质量。条目 2 是分发面的易主——Project Polaris 本月起成为 Copilot 默认模型,微软自研模型跑在自研 Maia 芯片上,OpenAI 那根线被剪断;Workspace 同步 GA,Autonomous Agent Mode 进企业,GitHub 明说赌的是“2027 年工程师主要在 review agent 的活”,唯一未解的是仓库上下文 prompt injection。条目 3 是中国侧的完整链路——OpenRouter 周调用量前五全部中国模型(小米 MiMo-V2.5 单周 10.5 万亿 token 登顶、混元 3 环比 +999%),智谱因“AI Coding 需求爆发”限额后扩容重开订阅并落地 1GW 全国产芯片数据中心,北京把“驾驭层工程”(上下文工程优化/任务持久化/多智能体协作/系统可扩展)写进全国首部省级智能体政策,最高支持 1 亿元。三条并读:模型正在变成最不稀缺的那一环,稀缺的是提问质量、验收信号、分发入口和算力底座。
- 具身智能:两条都在打成本。条目 4 是部署成本——银河通用 WAM-TTT 把学习从训练时挪到部署时,机器人只看少量人类视频即可迁移技能,不要本体数据、不要动作标注,手机拍一段就能教;背后是 Galbot S1 在宁德时代产线 7×24 零遥操跑满 3 个月这个已被验证的底子。条目 5 是数据成本与感知带宽——T-Rex 用 100 小时触觉数据把 12 个接触密集任务从 35% 拉到 65%,同时给出一条硬纪律:朴素融合触觉反而降级,频率不匹配就是净损失;LiberAI 与昆腾动力同日各拿 1 亿,赌的都是“用便宜的人类数据替换昂贵的真机遥操数据”。昨天的 CRAIC 取消遥操暴露了能力差距,今天这两条给的是把差距填上的两条路:把适应搬到现场,把数据换成人类的。
