2026-08-15 · Anthropic 拟 2 万亿 IPO,具身评测标尺落地

2026年8月15日阅读时长约 1 分钟

8/15 主线:AI Coding——Anthropic 拟 10 月以 2 万亿美元估值 IPO(史上最大,Claude Code 年化收入破 25 亿)、Databricks Genie Code 专用数据 agent 准确率成本双胜通用 coding agent、DeepSeek Harness 峰谷定价 8/17 生效;具身——RoboColiseum 仿真评测平台开放(89.5% 对齐真机)、青心意创 Dino OS 具身角色基座模型跨本体一脑多用。


1. Anthropic 拟 10 月以 2 万亿美元估值 IPO:AI Coding 入口被资本市场定价

  • 事件内容
    • 8 月 13 日,多家 Anthropic 股东向《金融时报》透露,公司最快将于今年 10 月以 2 万亿美元或更高估值上市,若兑现将超越 SpaceX 1.77 万亿美元,成为史上规模最大的 IPO;公司已于 6 月 1 日向 SEC 秘密递交 S-1 招股书,进入静默期。
    • 估值核心支撑是营收爆发式增长:年化营收从 2025 年 1 月的 10 亿美元,一路爬升至 2026 年 5 月的 470 亿美元;2026 年 Q2 单季营收达 109 亿美元,并首次实现 5.59 亿美元调整后营业利润(比公司自测提前两年扭亏)。投资者预计年底年化营收将达 1000–1200 亿美元(年内 10 倍以上)。
    • 其中 Claude Code 单品年化收入运行率已突破 25 亿美元,成为开发者主流工具;5 月估值已超 OpenAI 达 9650 亿美元。
  • 值得关注原因:这是"AI Coding 核心入口"被资本市场定价的标志性事件——Claude Code 单品 25 亿美元 ARR 证明 coding agent 已从"工具"变成真实营收引擎;2 万亿估值对应约 17–20 倍市销率,市场交易的已不是当前业绩,而是 Anthropic 能否长期占据企业 AI 与 AI Coding 入口。需关注三处风险:① 美国商务部 6 月对 Fable 5 / Mythos 5 出口管制致当月增速放缓;② 与特朗普政府关系紧张、仍陷国防部供应链诉讼;③ 顶尖模型使用成本为 OpenAI 旗舰 2.5 倍以上,客户对高价日益敏感。
  • 来源界面新闻 · 2 万亿美元估值 · 华尔街见闻 · 史上最大 IPO · 金融界 · 营收 10 倍增长

2. Databricks Genie Code:专用数据 agent 准确率与成本双胜通用 coding agent

  • 事件内容
    • 8 月 9 日,Databricks 宣布其专用数据 agent Genie Code 在 401 个提炼自真实内部使用的任务基准上,达到 76.6% 准确率、单任务平均成本 0.55 美元,同时优于三个未具名的通用编程 agent(竞品准确率 55.9%–72.1%、成本 0.91–1.16 美元)。
    • 优势来源并非更大模型,而是语义搜索 + 持久记忆 + 工作区理解——让 agent 在昂贵探索前先收窄决策空间,避免通用 agent 在复杂 schema 与企业代码库上低效递归探索带来的超时、错误与高成本。所有 agent 在相同约束下(各自 harness、前沿模型、Databricks MCP、20 分钟预算)测试。
  • 值得关注原因:再次验证本周"harness / 上下文效率 > 模型规模"主线——专用 agent 靠深度上下文同时拿下准确率与成本,直接挑战"更高准确率需按比例更高算力"的假设。对 coding agent 厂商,垂直场景专精 + 持久记忆可能比堆通用能力更划算;对企业用户,专业 agent 的单位任务成本可低至通用 agent 的一半以下。需注意:数据均为自报、未独立验证,且未点名竞品,横向对比受限。
  • 来源The Agent Times · Genie Code 基准 · Databricks 官方博客

3. DeepSeek Harness 余波:33K stars、峰谷定价 8/17 生效,押注"基础设施而非模型"

  • 事件内容
    • DeepSeek Harness v0.1 开源后数小时 GitHub 破 33K stars;底层基于 Cordis 元框架,模型适配器、工具注册、Agent Loop、会话日志、沙箱、UI 全部插件化,MIT 协议、跨模型兼容(甚至内置 Claude / Codex 子代理桥接,默认关闭),并附 OS 级沙箱(Linux Landlock / macOS Seatbelt / Windows ACL 受限令牌)。
    • 商业侧:DeepSeek 宣布 API 峰谷定价——空闲时段价为高峰时段一半,8 月 17 日 00:00 生效(高峰时段为北京时间 9:00–12:00、14:00–18:00)。目前 README 明确暂不接收外部 PR,引导社区通过 GitHub Discussions 与自建插件参与。
  • 值得关注原因:延续昨日主线——DeepSeek 押注"基础设施层而非模型层"积累价值,把开源权重战略从模型延伸到周边工具链,争夺 agent 执行层标准话语权;33K stars 显示开发者买账,峰谷定价直接压低长任务 agent 的运行成本。需关注两点:① 暂不开源 PR 削弱社区共治,核心插件迭代仍由官方主导,"最激进设计"与"集中控制"并存;② 短期完全替代 Claude Code 仍不现实,更现实的行业意义是切入开发者生态入口。
  • 来源Singularity.Kiwi · 全插件运行时 · InfoQ · 一切皆插件 · 腾讯新闻 · 峰谷定价

4. RoboColiseum 仿真评测平台开放:具身智能终于有了一把"统一高考"标尺

  • 事件内容
    • 8 月 14 日,机器之心发布常态化具身智能仿真评测平台 RoboColiseum。其仿真与实机部署相关性达 89.5%、相同模型差异小于 10%,让仿真结果可可靠反映真机表现。
    • 平台围绕指令跟随、空间理解、扰动适应、通用操作 4 类能力子榜设置 78 个高保真任务,每项任务拆解为多子步骤以追溯失败原因;开发者 5 分钟注册提交、最快 30 分钟出分项成绩与推演视频,模型代码与权重无需上传(本地推理接入标准接口即可)。内测已吸引 40+ 海内外团队,并提供 ACoT-VLA / π0 / π0.5 / GR00T 等国际基座模型基线。
  • 值得关注原因:直击具身"评测标尺缺位"痛点——过去各家拿不同数据集、不同环境的成功率"自说自话",RoboColiseum 用统一、可复现、Sim2Real 高相关的标尺让模型同台比拼真实短板。对开发者,进入成本高、周期长的真机测试前可低成本筛选模型、缩短"训练—评测—改进—部署"迭代周期;对中国具身生态,等于牵头制定第一本"统一教材"。需关注基线模型持续更新与产学研的实际采用度。
  • 来源腾讯新闻 · 具身智能日报(含 RoboColiseum) · 机器之心 · RoboColiseum 发布

5. 青心意创发布 Dino OS:全球首个具身角色基座模型,实现跨本体"一脑多用"

  • 事件内容
    • 8 月 14 日,青心意创发布全球首个具身角色基座模型 Dino OS,采用 Infra / Brain / Module 三层架构:Infra 层以零拷贝数据序列化 + 共享内存通信消除模块间"传话"损耗,并内置算力隔离(紧急刹停指令不因模型"深度思考"而延迟);Brain 层"双脑闭环"——慢脑拆解任务与上下文、快脑提供即时社交反应、自研小脑毫秒级接管运动控制与力反馈,形成实时回灌闭环,打通思考与运动割裂Module 层将完整链路沉淀为可复用行为单元与统一接口,"一次开发、长期复用"。
    • 通过硬件抽象实现**"一脑多用" + 跨本体迁移**,开发周期从"年"缩短至"月",首载体 Amoo 已实现多模态实时感知;系统设计层预埋身份核验、内容安全过滤、未成年人模式等护栏。
  • 值得关注原因:具身智能后半场正从"卷硬件与模型"转向"可跨本体的整体系统能力"——Dino OS 把角色复原从一次性定制工程变为可迁移、可沉淀的系统资产,降低批量化门槛;"双脑闭环"让机器人交互从机械的"听到—执行"升级为类生物的"理解—行动—反馈"同步。对 IP / 陪伴 / 教育 / 看护场景,跨本体复用意味着同一角色 IP 可快速落地多款机器人。需关注首批商业化交付与真实场景下的稳定性表现。
  • 来源腾讯新闻 · 具身智能日报(含 Dino OS) · 天际科技投资 · Dino OS 三层架构