河马的CC商业实战 · 出品

河马观澜

今 日 深 读

01

特朗普的 EPA 想让数据中心「藏起」自己的空气污染

Trump's EPA wants to let data centers hide their air pollution

The Verge · Justine Calma · 中英对照 · 约 6 分钟

数据中心建设潮的下一个战场不在算力,在空气。EPA 拟废除沿用 50 年的「新源审查」公众评议程序,把告知义务下放给州和地方——xAI 的 Colossus 1 当年就是以「次要污染源」许可引发数千条公众意见的。近 200 家环保组织已提交反对,4900 多条评论待回应。AI 基建的社会成本开始进入制度性博弈。全文翻译。

开始阅读 →

02

“模型公司每赚100美元,云厂商拿走近40美元”

财联社(虎嗅转载) · 夏军雄 · 中文 · 约 8 分钟

接昨日 Token 统计学,今天看 AI 钱的流向。巴克莱 8 月 28 日的单位经济模型把 AI 实验室的账本拆到产品线级别:直接 API 推理利润率已超 80%,订阅产品只有约 70% 且是三类中最低(补贴换留存);「总额法 vs 净额法」的会计差异能让两家业务相似的实验室毛利率差出 17 个百分点——正如 Uber 与 Lyft。昨日那篇问「Token 怎么数」,这篇回答「Token 的钱谁赚走」。

开始阅读 →

03

机器人真正的分水岭:每单位新增真机数据,能换来多少泛化能力

九章具身-价值锚(虎嗅转载) · 苏清涛 · 中文 · 约 12 分钟

一篇用「认知深度 vs 视野广度」类比打通机器人研发战略的长文:行业共识是堆数据覆盖(Physical Intelligence、Figure、Skild),作者偏要论证反共识路径——把经验提炼成可复用结构(Sharpa、Field AI 的世界模型,Mujin、梅卡曼德的几何物理规则)。最后给出两把评价尺子:拆开五类泛化能力核验证据,追踪新任务成本曲线是否下降。信息密度极高,适合作为观察机器人公司的分析框架。

开始阅读 →

快 览

  1. 微软支持的数据中心被指长期无证运行燃气发电机(The Verge)—— 数据中心电力缺口的另一面:配本期深读 01 服用。
  2. 同样卖超 10 亿元,优必选和宇树的财务曲线为何反着来?(虎嗅)—— 人形机器人双雄的两种烧钱姿势,配本期深读 03 服用。
  3. 深度对话:AI for Science 爆发了,但真正的天花板还没到(虎嗅)—— 科学智能赛道的冷思考。
  4. 腾讯的战略是混元 4?WorkBuddy?AI token 工厂?(虎嗅)—— 接续上期 FDE 战局分析的腾讯侧观察。
  5. 智驾黑马,百万交付悬了(虎嗅)—— 智驾赛道的交付大考。
← 返回目录
深读 · 01

特朗普的 EPA 想让数据中心「藏起」自己的空气污染

Trump's EPA wants to let data centers hide their air pollution

The Verge · Justine Calma · 2026-08-28 · 约 6 分钟 · 原文链接

导读与要点(建议先读原文)
  • 改动内容:EPA 计划废除联邦规定——工业设施申请空气排放许可时必须公告并接受公众评议;是否告知公众将改由州和地方空气机构自行决定,倡议者担心许多机构会干脆跳过。
  • 针对「次要污染源」:EPA 称其「排放较低、影响有限」,但南方环境法律中心反驳这是名不副实的标签——xAI 田纳西州巨型数据中心 Colossus 1(号称「迄今最强 AI 训练系统」)2025 年就是以次要污染源许可申请的。
  • 前科:Colossus 1 的许可曾引发听证会和当地卫生部门公告下的数千条评论;SELC 与 NAACP 同年还因该场地安装未经许可的燃气轮机威胁起诉 xAI。
  • 官方理由与博弈:署长泽尔丁称「让离问题和公众最近的地方当局做决定」「砍掉繁文缛节」;反对者则强调空气污染跨州飘散,本就由联邦监管——近 200 家卫生与环保组织上周五提交意见要求撤回提案。
  • 进展:公众评议期已结束,4900 多条意见待 EPA 逐条回应后方可定稿。批判性阅读:本文信源以环保倡议方为主,EPA 仅获简短回应;「藏起污染」的标题本身带有明确立场,但程序变化的事实框架清晰。
Just as new data centers face growing backlash from neighboring communities, the US Environmental Protection Agency (EPA) is about to make it harder for people to weigh in on any pollution those centers create.
就在新建数据中心面临周边社区日益强烈的反对声浪之际,美国环境保护署(EPA)却准备让人们更难对这些设施造成的污染发表意见。
The EPA plans to toss out a federal rule requiring public notice and an opportunity to comment when certain industrial sites apply for an air permit. Advocates warn that the move would allow data center developers and other industries to break ground without giving nearby residents a say, or even a warning that construction is planned.
EPA 计划废除一项联邦规定:某些工业设施在申请空气排放许可时,必须发布公告并给予公众评议的机会。倡议人士警告,这一改动将让数据中心开发商和其他行业在不征询附近居民意见、甚至不告知施工计划的情况下直接动工。
"You can see why that would be so interesting to an administration that wants to rush through the construction of data centers," says Keri Powell, senior attorney and air program leader at the Southern Environmental Law Center (SELC). "What EPA would be allowing would be all of those facilities to go through and just not have to deal with the public, issue the permits in secret behind closed doors. Nobody knows what's happening until the bulldozers are out there."
「你看得出这对一个想让数据中心建设一路狂飙的政府来说有多大吸引力,」南方环境法律中心(SELC)高级律师、空气项目负责人凯丽·鲍威尔(Keri Powell)说。「EPA 这么做,等于允许所有这些设施一路绿灯,完全不必面对公众——许可证在紧闭的门后悄悄签发。等到推土机开到家门口,大家才知道发生了什么。」
The EPA's proposed changes apply to a permitting process that's been in place since the 1970s called New Source Review that applies to a wide range of facilities, from landfills and paper mills to power plant expansions. More recently with the rise of generative AI, these permits have also become a flashpoint for opposition to new data centers, as well as to power plants built to provide electricity for all those servers.
EPA 拟修改的是一套自上世纪 70 年代沿用至今的许可程序,名为「新源审查」(New Source Review),覆盖从垃圾填埋场、造纸厂到电厂扩建的各类设施。近年来随着生成式 AI 兴起,这类许可也成了反对新建数据中心——以及为成山的服务器供电而建的电厂——的导火索。
In July, the EPA announced that it would eliminate the federal public participation requirement for a large set of polluters and place that burden on states. The plan would leave it up to state and local air agencies to decide whether or not to notify the public about certain new sources of pollution — leaving advocates concerned that many of these agencies would forgo the process altogether. Air pollution is often regulated at the federal level because it can waft across the country, affecting residents in one state even if the source is in another.
今年 7 月,EPA 宣布将对一大批排污者取消联邦层面的公众参与要求,把这一责任下放给各州。按照该方案,是否就某些新增污染源告知公众,将由州和地方空气监管机构自行决定——倡议人士担心,许多机构会干脆整个跳过这一程序。空气污染之所以通常由联邦层面监管,是因为污染物会随风跨州飘散:污染源在一个州,受影响的居民可能在另一个州。
"The state and local authorities closest to the issues and the public should be making the decisions on the permitting process as much as possible, not Washington," EPA administrator Lee Zeldin said in a statement at the time. "We are cutting unnecessary and burdensome red tape."
EPA 署长李·泽尔丁(Lee Zeldin)当时在声明中说:「离问题和公众最近的州和地方当局,应该尽可能地对许可程序做决定,而不是华盛顿。我们是在砍掉不必要、负担沉重的繁文缛节。」
The change applies to so-called "minor" sources of pollution, which the EPA says in its announcement "have relatively low emissions and limited environmental impact." Powell's group contends that the "minor" label is a misnomer and that the permitting process routinely covers projects that can have significant consequences for their neighbors.
这项改动针对的是所谓的「次要」(minor)污染源——EPA 在公告中称它们「排放相对较低、环境影响有限」。鲍威尔所在的机构则反驳说,「次要」这个标签名不副实:这套许可程序覆盖的项目,日常就可能对周边居民产生重大影响。
Colossus 1, xAI's massive data center in Tennessee that the company billed as the "most powerful AI training system yet," applied for a minor source permit in 2025. That led to a hearing and elicited thousands of comments to a public notice posted by the local health department, Inside Climate News reported last year. The SELC and NAACP threatened to sue xAI for installing unpermitted gas turbines at the site the same year.
xAI 位于田纳西州的巨型数据中心 Colossus 1——该公司称其为「迄今最强大的 AI 训练系统」——在 2025 年申请的就是「次要污染源」许可。据 Inside Climate News 去年报道,这引发了一场听证会,当地卫生部门张贴的公告收到了数千条公众意见。同年,SELC 和美国全国有色人种协进会(NAACP)还曾因该场地安装未经许可的燃气轮机而威胁起诉 xAI。
SELC was one of nearly 200 health and environmental groups that filed comments last Friday asking the EPA to withdraw its proposal on New Source Review. They argue that by mandating public comment, residents can provide agencies with valuable insight on the repercussions of building a new data center or other industrial facility.
SELC 是上周五提交意见、要求 EPA 撤回新源审查修改提案的近 200 家卫生与环保组织之一。他们认为,正是通过强制性的公众评议,居民才能向监管机构提供关于新建数据中心或其他工业设施实际影响的宝贵认知。
"[The EPA's proposal] could deprive the agencies making decisions about these [pollution] sources the necessary lived experience data of those communities. Without that information, it is impossible for permitting agencies to evaluate the full, cumulative impact of these facilities," Kentucky Resources Council Senior Attorney Byron Gary said in a press release.
「(EPA 的提案)可能使负责就这些(污染)源做决策的机构,失去来自这些社区的必要的亲身生活经验数据。没有这些信息,许可机构就不可能评估这些设施完整的、累积的影响,」肯塔基资源委员会(Kentucky Resources Council)高级律师拜伦·加里(Byron Gary)在一份新闻稿中说。
The public comment period for the EPA's proposal ended last week, and EPA spokesperson Carolyn Holran says in an email to The Verge that they're still reviewing all the comments submitted — more than 4,900 that need to be addressed before the agency can finalize its rule.
EPA 提案的公众评议期已于上周结束。EPA 发言人卡罗琳·霍兰(Carolyn Holran)在发给 The Verge 的邮件中表示,他们仍在审阅所有提交的意见——超过 4900 条,该机构须逐条回应后才能最终敲定新规。

← 返回目录

← 返回目录
深读 · 02

“模型公司每赚100美元,云厂商拿走近40美元”

财联社(虎嗅转载) · 夏军雄 · 2026-08-29 · 约 8 分钟 · 原文链接

导读与要点(建议先读原文)
  • 总账:AI 模型公司每获得 100 美元收入,约 35-40 美元以推理算力费形式流向 AWS、Azure、GCP;云商从中获得 10-20 美元营业利润,营业利润率约 35%-45%(收入分成机制会人为抬高这一数字,预计 2028 年后逐步取消)。
  • 利润率跃升:AI 实验室付费推理业务的利润率从 2025 年的低双位数升至 2026 年的 50%-65%+,调整后毛利率同比提升 30-50 个百分点——企业客户和智能体工作流已成「必买型」产品。
  • 产品线拆解:直接 API 利润率最高(已超 80%,量化、推测解码、新平台持续释放空间);订阅产品(Claude Code、Codex)约 70% 最低——实验室补贴 Token 换留存,近期重置使用额度的频率明显增加。
  • 会计幻象:70% API 收入的「实验室 A」与 80% 订阅的「实验室 B」,调整后毛利率相差 17 个百分点(55% vs 38%);总额法 vs 净额法确认间接 API 收入,会让报表可比性越来越差——巴克莱将其类比 Uber 与 Lyft。
  • 大数与拐点:AI 实验室总收入预计从 2024 年 70 亿美元增至 2028 年 6900 亿美元;训练支出占收入比从 2024 年 96% 降至 2028 年 30%;云商 AI 收入与实验室收入之比从 153% 降至 73%——2028 年后实验室自建算力上线,三大云或将丢掉份额。批判性阅读:全文系对巴克莱研报的转述,「实验室 A/B」是假设模型而非点名公司,推演链条长、假设密集,宜作框架参考而非精确预测。

来源:微信公众号 财联社,作者:夏军雄

巴克莱最新研究显示,人工智能(AI)模型公司每获得100美元收入,其中约有35至40美元会以推理算力费用的形式流向三大云巨头,即亚马逊AWS、微软Azure和谷歌云平台(GCP)。

在这部分收入中,云服务商能够获得约10至20美元的营业利润,对应约35%至45%的营业利润率。

上述结论来自巴克莱8月28日发布的一份AI行业单位经济模型研究报告。

报告指出,AI实验室付费推理业务的利润率已经大幅攀升,从2025年的低双位数水平升至2026年的50%至65%甚至更高,调整后毛利率同比提升30至50个百分点。

利润率之所以大幅改善,主要是因为企业客户和智能体工作流已成为市场上的“必买型”产品。

巴克莱分析师认为,实际利润率可能甚至高于报告中的估算,但随着前沿模型竞争加剧以及算力供给持续增加,利润率预计将逐步回落。

两种截然不同的财务结构

为了拆解不同AI实验室之间的利润差异,巴克莱构建了两个假设性的前沿AI实验室模型。

其中,“实验室A”约70%的收入来自API业务,30%来自订阅业务;“实验室B”则相反,80%的收入依赖订阅业务,API收入占比仅为20%。

API业务天然拥有高于订阅模式的推理利润率。再叠加训练成本分摊方式以及合作伙伴收入分成机制的差异,两家实验室的调整后毛利率出现了高达17个百分点的差距:实验室A约为55%,实验室B则约为38%。

收入确认方式进一步放大了这种差异。

实验室A按照总额法确认间接API收入,而实验室B则采用净额法,或者干脆不确认由战略合作伙伴运营的间接API收入。

巴克莱将这种差异类比为两大网约车公司Uber和Lyft之间的财务报表差异:即便核心业务高度相似,仅仅由于会计处理方式不同,最终披露出来的收入和利润数据也可能存在巨大差别。

各产品线利润率分析

订阅产品,例如Anthropic的Claude Code与OpenAI的Codex,预计推理利润率约为70%,是三类主要产品线中最低的。

原因在于,AI实验室愿意通过补贴Token成本来提高用户留存率。订阅产品通常采用固定月费并设置使用上限的模式,而AI实验室近期重置使用额度的频率明显增加,这可能同时反映出用户留存压力以及模型效率改善带来的影响。

直接API是AI实验室最早形成规模化商业模式的业务,也是利润率最高的产品线。

使用Cursor和Figma等工具的开发者,会根据Token实际消耗量付费。巴克莱估计,目前API业务的推理利润率已经超过80%。

模型Token效率提高、API名义价格上涨,以及推理服务在基础设施层面的持续优化,包括量化技术、推测解码以及新一代计算平台等,都在继续释放利润率提升空间。

巴克莱指出,2026年第二季度API推理利润率实际上已经远高于其公开图表中所展示的水平,但该行预计,这一利润率未来某个阶段仍会出现一定程度的回落。

间接API给最终用户提供的使用体验与直接API基本相同,但其计费关系发生在用户与云服务商之间。

随着间接API收入占比不断提高,不同AI实验室在收入确认方式上的差异将进一步扩大,财务报表之间的可比性也会越来越低。

云厂商的利润结构

巴克莱的模型显示,AI实验室每获得100美元收入,实验室A对应的云服务商收入约为35美元。扣除基础设施成本后,云服务商能够获得约11.8美元利润,对应约34%的营业利润率。

而实验室B能够为云服务商创造更多收入,原因在于战略合作伙伴收入分成机制:约占收入的20%,同时受到累计上限约束。在这一情况下,云服务商对应收入约为41美元,利润约为19.1美元,营业利润率达到47%。

不过,巴克莱强调,收入分成机制会人为抬高云服务商表面上的利润率。如果剔除收入分成部分,云服务商单位Token实际获得的利润并没有不同。预计这一收入分成安排将在2028年之后逐步取消。

智能体订阅产品还可为云服务商创造额外价值。

智能体类订阅产品通常需要持续保存任务状态,并调用数据库、存储等其他云服务,因此能够为云厂商带来推理算力之外的额外收入。

此消彼长:三大云厂商AI算力份额或在2028年后回落

巴克莱预计,全球AI实验室总收入将从2024年的70亿美元,增长至2026年的1370亿美元,并进一步在2028年达到6900亿美元。

如果按年末年化经常性收入(ARR)计算,增长曲线则更加激进:到2026年底,AI实验室ARR预计将达到约2000亿美元;到2028年底进一步达到约7820亿美元。

目前,训练支出仍约占AI实验室收入的48%,这意味着AI实验室每获得接近1美元收入,背后大致也对应接近1美元流向云服务商。

然而,训练成本占收入的比例正在迅速下降。这一比例在2024年高达96%,预计将在2027年大幅降至35%,到2028年进一步降至30%。

换而言之,随着推理业务产生的利润逐步超过训练支出,AI实验室整体盈利能力将继续改善。

与此同时,云服务商AI收入相对于AI实验室收入的比例也在下降。这一比例预计将从2024年的153%,降至2026年的90%,到2028年进一步下降至73%。

巴克莱预计,未来两年AWS、Azure和GCP在AI实验室算力支出中的市场份额将大致保持稳定。

但从2028年开始,AI实验室此前已经签约或锁定的专属算力基础设施将陆续上线,并逐渐成为其更重要的算力来源。这可能意味着,未来无论是在AI训练还是推理市场中,三大云巨头都将逐步丢失部分市场份额。

← 返回目录

← 返回目录
深读 · 03

机器人真正的分水岭:每单位新增真机数据,能换来多少泛化能力

九章具身-价值锚(虎嗅转载) · 苏清涛 · 2026-08-29 · 约 12 分钟 · 原文链接

导读与要点(建议先读原文)
  • 核心命题:数据规模的重要性被夸大了——「案例库存」不等于「可迁移规律」;训练者能否把经验提炼成跨场景复用的对象关系、行动约束和失效条件,才决定系统学到的是案例还是规律。
  • 证据链:OpenAI 2021 年 PALMS 实验——80 条精选问答微调 GPT-3,40 个测试提示中 34 个与训练集不相似仍表现出目标行为,且模型越大小样本干预越有效;Google DeepMind 的 Gemini Robotics On-Device 新任务只需 50-100 次示教——背后是 RT-2 时代积累的互联网知识迁移。
  • 两条路径:扩大覆盖(Physical Intelligence、Figure、Skild——资源投向采集、遥操作、标注管线)vs 提高迁移效率(Sharpa 押全模态世界模型,「第一个场景 10 万小时没关系,第二个只要 100 小时就值」;Field AI 的信念世界模型随观测更新)。
  • 边界清晰场景的另一解:Mujin 不堆数据、把三维感知、解析逆运动学、碰撞约束写进控制系统,新箱型新位姿的适配成本压到接近零;梅卡曼德、星猿哲、仙工智能分别把操作、物流、移动能力封装成可复用产品。
  • 五类泛化能力要分开核验:操作对象切换、作业场景切换、任务目标切换、机器人形态切换、失效恢复——「还没有任何一家公司能被公开资料证明在形态、任务、场景同时切换时仍能泛化」。
  • 唯一的尺子:新任务成本曲线——完成的任务越多,适配下一个任务所需的新增真机数据和时间是否越少;警惕两种披露遮蔽(只报总数据量、只报示教次数)。批判性阅读:作者自述「没做过任何调研,凭直觉断定」,公司案例多引自公开宣传材料,Sharpa、Field AI 的迁移收益均无公开验证——框架价值大于事实结论。

来源:微信公众号 九章具身-价值锚,作者:苏清涛

从十五六岁开始一直到三十出头,我最焦虑的问题一直是自己的视野太窄。直到现在,我仍然认为自己的视野非常窄,不过,与以往不同的是,近些年,我不再觉得“视野窄”是个问题,我也没有任何这方面的焦虑。

因为,我渐渐发现,与视野的广度相比,认知深度才是关键。只有认知深度足够,我完全可以在短期内用少量数据快速泛化。

与此在逻辑上类似的是:我觉得,在机器人的训练中,数据规模的重要性是被夸大了,而数据处理能力的重要性却并没有得到足够的重视。

对这个问题,我没做过任何调研,但凭直觉断定:一个机器人公司,如果一开始就认定“数据规模是最重要的”,那他的策略就是围绕数据规模做文章(以体力活为主),而不会在泛化能力(脑力活)上下太多功夫;反之,如果某个机器人公司一开始就对数据规模没那么执念,那他们反而会采用一种“技术含量更高的”方式。

在机器人产业中,有哪些公司、哪些玩家,从一开始采取的思路就和我一样——不认为数据规模是最重要的,而是把重心放在了泛化能力上,甚至这种泛化能力是不依赖于足够多的数据规模就可以实现的?

这是我向Codex提出的一个问题。它真正指向的不是一张公司名单,而是一项更底层的研发战略选择:一家公司把什么当作首要目标,资源就会持续流向哪里。

要判断哪一种资源投向更有效,首先要把“短期内用少量数据快速泛化”作为一个完整的能力来看:一个人在面对新问题时,只需接收有限的新信息,就能判断哪些旧经验仍然适用、哪些条件已经改变,并把过去形成的规律迁移到当前问题,这才是认知深度在处理新问题时的表现。

同理,机器人在面对新任务时也是如此:真正值得观察的,不是它过去见过多少数据,而是这些经验能否让它用更少的新增真机数据、更短的时间完成适配。

一

经验抽象:从“记住案例”到总结出可复用的规律

回看我自己在过去17年的成长史,它就是一部“通用人工智能练成史”:早期写时评时,我写得很一般;后来写情感、成长和励志类文章,就很强了;再后来写技术、商业模式、战略和组织,也同样能够驾驭。

这并不是因为我在每个领域都重新积累了一套互不相干的知识。真正起作用的,是我在总结每件事、每个问题的经验教训时,从不满足于“就事论事”,而是要求自己务必做到高度抽象——能抽象表述的,绝不允许具体。因为,在我看来,一次经历只有被提炼成可以解释某一类问题的规律,它才算真正被吸收;否则,我就只是“记住了一个案例”。

过去几个月,我在给Agent提的关于规则撰写和解决方案的要求,又把这种方法推到了更极端的位置:

严禁“举例论证”;

不能从根源上解决问题的方案,毫无价值;

给用户提出“治标不治本”的建议,就等于犯罪。

这些要求只适用于规则和解决方案的撰写,不能直接充当机器人训练的技术结论,但它们揭示了同一个方法:经验的价值不在于被保存,而在于能否被提炼成可以反复调用的结构。

机器人的训练同样由人来设计,训练者能否把经验提炼成规律,会直接影响系统最终学到的是案例还是规律。能力较弱的人只满足于就事论事,他训练出来的系统只会记住“这个物体在这个位置应该怎样抓”,得到的是案例记忆;相比之下,能力较强的人则会死磕抽象,他训练出来的系统会继续追问一条轨迹背后有哪些可以跨场景复用的对象关系、行动约束和失效条件,让一次失败改变一类任务的处理方式。

这两种系统面对同样一批轨迹时,处理方式完全不同:一种把所有轨迹都当作“需要记住”的操作案例;另一种则区分每条轨迹提供的新信息,继续判断哪些轨迹暴露了任务边界、哪些失败提供了最多信息、哪些变化可以用几何或物理规律解释。前者留下的是越来越大的案例库存,后者留下的是可以迁移到新任务的规律。

数据处理能力,因此不只体现为筛选样本、清洗数据和提高标注效率,更体现为系统能否从具体轨迹中提炼出可以跨场景复用的规律。

二

路径分歧:扩大覆盖范围,还是提高迁移效率

究竟是增加案例库存,还是从具体轨迹中提炼出可以跨场景复用的规律,到了公司层面,这两种训练思路首先会表现为研发资源投向不同的方向。

现在开发通用机器人模型的前沿梯队,比如Google DeepMind、Figure AI、Physical Intelligence、Skild AI等,几乎都把泛化作为核心目标;它们的目标相同,真正需要分析的是它们分别如何实现泛化。

一条路径以扩大数据覆盖范围为先,代表公司是Physical Intelligence、Figure AI和Skild AI。这是目前行业里最普遍的做法,也是已经成为共识的一面:这条路径把持续扩大数据覆盖范围视为增强泛化能力最可靠的办法(它的逻辑很直白——让系统多见、多记。),因此,公司会把更多资源投向数据采集装置、遥操作、标注管线和场景覆盖。

另一条路径以提高迁移效率为先,Field AI和Mujin更接近这条路径。这条路径把提高系统“从既有经验中提炼可复用结构”的能力,视为增强泛化能力最可靠的办法。因此,这条路径首先追问:系统面对一个新任务时,能否用更少的新增真机数据完成适配;这次学习结束后,系统得到的能力能否继续降低下一类任务的学习成本。

这两条路径的分量并不对等。扩大覆盖来积累能力,几乎每家做通用机器人的公司都在做,所以稀缺性很低,也没有啥讨论价值;真正值得展开说的,是反共识的后一条路径:不过于依赖数据覆盖,而是把已经形成的原则迁移至覆盖样本没有覆盖到的问题。

后一条路径同样需要数据,甚至依赖大规模预训练、仿真和合成数据;区别在于,公司会把更多资源投向结构先验、不确定性判断和失效样本的利用,以减少昂贵、缓慢、无法复用的真机采集。

是否应该追求泛化,取决于产品要解决什么问题。

对只服务固定工位和明确任务的工业机器人公司来说,不追求开放世界中的泛化能力可能是理性选择。

但对另一类声称自己在做“通用机器人”的公司来说,如果它们不追求泛化能力,而是为每个新任务重新采集大批数据,那它就大错特错。因为,与任务相伴的数据增加得再多,也只能证明系统积累了更多专用案例,不能证明过去的投入已经转化成迁移能力。

三

能力检验:一次学习获得的能力能否迁移到“未见过的问题”

两条路径的差别,最终要由能力变化来检验。补充知识、扩展知识面、增加数据量都能扩大覆盖范围,让模型多见到案例、多记住事实,却未必改变它处理陌生问题的方式,这属于体力活;只有增强泛化能力,让系统通过一次学习提升处理多个“未见过的问题”的能力,这才是脑力活。

OpenAI在2021年发表的《Process for Adapting Language Models to Society(PALMS)with Values-Targeted Datasets》,展示了少量样本干预如何影响训练集没有覆盖的问题。研究者依据美国与国际人权法等来源设定行为价值,并用80条人工精选问答微调不同规模的GPT-3语言模型。

说服力在于测试设计本身。实验覆盖八类敏感主题,健康是其中之一;测试使用的40个提示中,有34个在训练集里找不到相似提示,经过80条问答微调的模型面对训练集没有直接覆盖的多类问题时,仍然表现出更符合目标价值的行为。OpenAI的研究说明提供了实验概览。

这个实验的价值,不在于模型“又记住了80条问答”,而在于它从这些样本中提取出了“跨主题适用”的行为原则,并把原则迁移到了训练集没有直接覆盖的表达和主题。

研究发现,模型越大,小样本干预越有效。模型规模与干预效果之间的正相关表明,模型能否把在少量样本中学到的原则迁移到训练集尚未覆盖的问题,依赖其在大规模预训练中形成的基础能力。

到了适配阶段,模型可能以两种方式处理新增数据:

一种是把它们作为新案例“逐项记住”,另一种是用它们激活和校准预训练阶段已经形成、可以跨问题复用的原则。前一种处理方式只能增加案例库存;后一种处理方式则可以提升模型把已有原则迁移到“这批样本尚未覆盖到”的问题的能力。

放到机器人身上,测试标准也随之改变。如果每增加一个任务都必须补一套对应数据,即使总数据量持续增长,系统积累的也可能仍是“案例库存”;如果系统在抓取任务中学到的接触、遮挡和失效恢复规律,能够改善它在没有训练过的装配任务中的表现,甚至迁移到新的机器人形态或新的场景,才说明这次训练产生了超出原任务的收益。

机器人模型能否减少适配新任务所需的新增真机数据,取决于它此前形成了多少可以迁移的能力。

Google DeepMind在介绍端侧机器人模型Gemini Robotics On-Device时提到一个数字:一个新任务只需约50至100次示教即可完成适配。这里的“示教”,是新增真机数据的一种具体形式。表面上,这是在说新增数据的数量;真正的信息却在数量背后:这50至100次示教之所以能承担起新任务的适配,是因为模型并非从零开始,而是带着既有能力来的。

这种能力从何而来?此前的机器人视觉语言动作模型RT-2已经给出过一层答案:模型能够把从互联网规模数据中学到的知识迁移到机器人动作上。有了这层能力打底,50至100次示教要补的,只是“这个具体任务在这个具体场景里该怎么做”的最后一截缺口,而不是从零建立系统的全部能力。需要的新增真机数据越少,说明模型此前形成的可迁移能力越多——这才是50至100次示教真正的含义。

把这层含义挑明之后,再看实际研发中许多公司的做法,也会更清楚。

扩大覆盖、让系统多见,本身就是这种普遍做法,没有太多讨论价值;真正有讨论价值的是:样本没有覆盖到的时候,系统靠什么继续判断和行动——能否回答这个问题,恰恰才是体现机器人能力强弱的分水岭。

四

方法差异:各家的差别,在复用的是什么

顺着这个问题再往下追:让系统在面对新任务时不必从零开始的那种“可复用结构”,到底是什么?

不论数据来自真机、互联网还是仿真,数量本身都不会自动产生结构;能产生结构的是系统对经验的提炼——从具体轨迹中提炼出可以跨场景复用的对象关系、行动约束和失效条件。

环境边界不清晰时,它只能表现为一种能随观测不断更新的世界模型;环境边界清晰时,这种结构可以被写成显式的几何和物理规则。Sharpa与Field AI代表前一种,Mujin代表后一种。

环境边界不清晰时:Sharpa和FieId AI把世界模型做成可复用结构

在把迁移效率当作核心策略的公司里,Sharpa是说得最直白的一家。

Sharpa由禾赛的三位创始人李一帆、孙恺与向少卿于2024年底创立,开发专注灵巧操作的通用机器人。它的打法是先“做穿”真实场景——第一个场景是让机器人在冰淇淋店里完成从点单到加小料的55个连续步骤——再用第一个场景换来的可复用结构,压低下一个场景的适配成本。

在接受媒体采访时,李一帆公开算的账是:

第一个场景哪怕花10万个小时也没关系,只要第二个场景只需要100个小时,(那就值得)。

Sharpa机器人进入的场景环境,边界不清晰:门店不为机器人改造任何东西,预先写规则行不通。Sharpa公司押注的可复用结构是全模态世界模型:预训练靠真实场景中的触觉、力觉等交互信息,后训练再让机器人在真实场景里遇到并解决的边界情况回流,持续提高世界模型的泛化能力。

当然了,这份迁移加速目前没有公开验证——李一帆自己也说,复制到下一个场景要多少小时,现在还不知道。

公开玩家里,Sharpa是唯一一家把公司策略完全押在迁移效率曲线上的。

同样把世界模型做成可复用结构的玩家,还有Field AI。这家美国创业公司打算把机器人带出结构化厂房,到户外、危险场地等非结构化的真实环境中承担通用任务。

在它要进入的这类环境里,预先写规则行不通:环境边界不清晰时,系统拿不到现成的结构,只能把一种能力本身做成可复用的结构——持续更新对世界的判断。

Field AI公开的技术方法以Belief World Model(信念世界模型)为核心,正是把这种能力做成工程实体:机器人根据不断获得的新观测更新这份判断,在离开固定工位、面对新的形态、任务或场景之后,靠它继续判断和行动。

但Field AI的公开资料强调的是机器人跨形态、跨任务、跨场景同时泛化的能力,可核验的技术细节和可独立比较的基准仍然有限,因而不能仅凭公司叙事就被认定已经实现全面通用智能。

两家使用世界模型的方式不同:

Sharpa把它做成从真实场景经验中训练出的全模态模型,带到下一个任务;Field AI用它随新观测持续更新对世界状态的估计。

环境边界清晰时:Mujin把几何和物理规则写进控制系统

Mujin是一家日本工业机器人公司,专为物流与制造业的拆垛、码垛、拣选等现场制作软件系统。

Mujin的思路是,不为每种工件和工位逐一编程,也不先采集海量行为克隆(让系统直接模仿人类操作轨迹)数据,而是把三维感知、解析逆运动学(直接求解机械臂各关节角度)、碰撞约束和实时运动规划直接写进控制系统,让机械臂直接规划并完成操作。

几何和物理约束一旦成为“系统自身的一部分”,面对新箱型或新位姿(新的摆放位置和姿态),系统的反应就是重新求解问题——环境边界清晰时,适配新任务所需的新增真机数据被压到接近于零。这正是容易被“端到端学习”叙事遮蔽的技术含量所在。

它的能力边界也同样清晰——Mujin主要解决的是工业操作中的对象变化、位姿变化和局部场景变化,不等于跨任意任务、任意机器人形态的开放世界通用智能。

这样的边界自有其价值:工业系统的价值由换型时间、重采集成本和部署成功率衡量。环境边界清晰时,决定部署成功率和换型成本的,正是系统能否稳定遵守约束,而不是它“能否处理开放世界中的任意问题”。

Mujin的方法不是孤例:梅卡曼德、星猿哲和仙工智能同样把几何和物理约束的一部分封装进可复用产品,只是封装的对象和落地的场景各不相同。

梅卡曼德把三维感知、抓取规划、碰撞检测和运动规划做成一套工业产品,可以适配多个品牌的机械臂,也不需要为每一种物体分别“注册”——即并非“先对物体单独扫描建模、录入系统,机械臂才认得它”。它与Mujin的共同点不是“都有机器视觉”,而是把感知和规划封装成可以跨对象复用的产品:不必针对新物体重新建模,不必针对新工位重新调参。

星猿哲的机制与梅卡曼德相近,但场景更集中,更像物流专用版本:在拆码垛场景中,其公开材料称“增加新箱型后不需要重新注册”——换一种新箱子,不必再为它单独扫描建模——说明它已经具备一定的对象泛化能力,只是这份证据被锁在单一场景里,不能证明它可以泛化到任意任务。

仙工智能则走了另一个方向:

它封装的不是操作而是移动——把适配多种移动机器人底盘的控制能力做成通用控制器,减少的是移动机器人部署中的重复适配,更接近控制平台,而不是操作型的Mujin。

五

评价标准:五类泛化能力与新任务成本曲线

方法上的差别回答的是“复用什么”,但复用了不等于证明了。评价一家公司的泛化能力,需要两把尺子:

一把是拆开五类具体能力,看它的公开证据支持的是哪一类;

另一把是核算获得能力的代价,看新任务的成本曲线是否还在下降。

公司宣称的“泛化”,指向五种不同的能力

各家宣称的“泛化”指向的能力并不相同,公开资料能证明的也各不相同,不能被一个标签抹平。泛化的本质是模型的泛化:在外部条件切换时,模型能否凭既有能力继续完成任务?

具体评价时,至少要分别核验以下五种情形:

第一,在操作对象切换时能否仍然泛化:面对新箱型、新零件或旧零件的新摆放姿态,系统是可以直接处理,还是必须重新注册、重新标注、重新采集?

第二,在作业场景切换时能否仍然泛化:面对光照、遮挡、地形和空间布局的变化,系统是可以直接运行,还是必须重新建图、重新采集和重新训练?云深处长期围绕四足机器人在电力巡检、消防侦察等任务中的应用,积累复杂地形中的移动能力,其资料主要能证明的就是这一类。

第三,在任务目标切换时能否仍然泛化:面对新的目标,系统是可以理解任务并组合出此前没有训练过的行动序列,还是只能把同一个动作换到新物体上?生数科技的Motubrain和智在无界都瞄准这一类,但实现办法不同:前者尝试把对环境的理解直接转成动作,后者先从人类视频中学习动作和物理先验,再用少量新增真机数据适配新任务。两者都还不足以列为已经成立的完整证据。

第四,在机器人形态切换时能否仍然泛化:面对机械臂、四足、轮足和人形机器人等不同形态,系统是可以直接复用同一套表征或策略,还是必须针对每种形态重新训练?逐际动力的公开资料展示了机械臂、轮足机器人和人形机器人等多种产品形态,但只有控制知识能够跨这些形态复用,多种形态才构成形态切换下泛化的证据(现有资料还不能证明它在任务和场景切换时也能仍然泛化)。

第五,在执行中遇到失效时能否恢复并继续:面对抓空、打滑、遮挡或环境突变,系统是可以依据新的观测重新规划并继续完成任务,还是只能停机?

能抓取没有预先注册的物体,不代表能完成训练时“没有见过”的任务;能在两种机器人形态上运行,也不代表能在开放环境中“从失败里恢复”。

把这些证据合起来看,还没有任何一家公司能被公开资料证明在形态、任务、场景同时切换时仍能泛化。

真正衡量泛化的是新任务成本曲线

一套完整的评价标准必须同时看两面。一面是区分系统具备哪类泛化能力;另一面是核算为获得这些能力所付出的代价:公司和研究者必须同时披露适配新任务所需的时间、新增真机数据、预训练数据、合成数据、人工编码规则与世界模型等结构先验和真实部署成功率。

实践中最常见的遮蔽有两种。只报总数据量,就看不出结构先验在其中起的作用,迁移收益因此被抹掉;只报“用了多少次示教”,背后的预训练数据和合成数据就看不见,训练成本因此被转移到看不见的地方——新增真机数据较少,并不等于整个系统使用的数据较少。

前沿玩家披露数字的方式,往往恰好是后一种遮蔽。Figure曾展示用8小时精选示教数据训练物流任务,但这项展示没有同步披露预训练数据规模、适配新任务所需的时间和真实部署成功率,因而不能单独证明“系统已经能把既有能力稳定迁移到其他任务”。

所以,衡量一个系统是否真正具备泛化能力,关键指标并不是任何单一披露数字,而是一条随任务数量变化的曲线:

完成的任务越多,适配下一个任务所需的新增真机数据和时间是否越少——曲线持续下降,说明过去的数据正在被提炼成可复用能力;曲线没有下降,则说明数据资产仍然只是越来越大的“案例库存”。

结语

机器人训练与人的认知相通于一点:让经验产生复利。对机器人公司而言,这种复利最终只有一个落点:任务越做越多,下一个任务越快、越便宜。这条曲线,也正是对“每单位新增真机数据,能换来多少泛化能力”最直接的回答。

在接下一个任务时,公司该先问的不是要为它采集多少数据,而是它能沉淀出什么可复用结构、让下一个任务的成本降多少。这样做的公司与不这样做的公司,几年后拉开的差距,不在今天谁的数据更多,而在谁的成本曲线下降得更快。

← 返回目录