河马的CC商业实战 · 出品

河马观澜

今 日 深 读

01

Token 定价的几种思考方式

Ways to think about token pricing

Benedict Evans · Benedict Evans · 中英对照 · 约 13 分钟

关于 AI 最值钱的那个问题:token 会不会变成下一个「比特」——万亿收入的低毛利基础设施?Benedict Evans 用光纤、移动数据、半导体三段产业史,把「供给紧缺何时结束、价值最终被谁拿走」讲到骨头里。全文翻译。

开始阅读 →

02

蒸馏风暴:AI 公司不愿公开谈论的技术竞赛

晚点LatePost · 程曼祺 · 中文 · 约 18 分钟

所有人都在做、所有人都不愿公开谈论的事。晚点访谈近十位模型研究员,把「蒸馏」从口水战里的指控,还原成一门有成本、有门槛、有争议的系统工程:它如何工业化,为什么不是银弹,以及张一鸣为什么逆势说「不」。

开始阅读 →

03

V 型反转逼近 4000 点,资金在算力与粮食之间做选择

8 月 18 日 A 股复盘综合述评

河马观澜综合(央广网、连板网等) · 河马观澜 · 中文 · 约 6 分钟

指数收在 3990 点、成交 2.4 万亿,表面风平浪静;水底下是主力净流出 669 亿、超 3200 只个股下跌。算力链调整的第一天,厄尔尼诺把农业股推上涨幅榜——市场在 4000 点关口前换了一条腿走路。

开始阅读 →

快 览

  1. Anthropic 年化收入飙至 650 亿美元(TechCrunch)—— 5 月还是 470 亿,去年底只有 90 亿;传 IPO 估值目标超 2 万亿美元,最快今秋上市。
  2. 英伟达 15 亿美元入股软银 SB Energy,再附 1050 亿信贷(AI News Briefing)—— 投向 OpenAI 俄亥俄 4.25GW 数据中心并锁定独家算力供应;「算力金融化」又添一单,配本期深读 01 读。
  3. Claude 公布隐形文本水印方案(AI News Briefing)—— 为符合欧盟 AI 法案采用 SynthID-Text;开源社区 11k Star 的破解工具已经等在那里了。
  4. 微软 8 月 18 日下线 Copilot 深度研究与播客智能体(DoNews)—— 大厂开始做减法,智能体功能的留存率考试开始了。
  5. 荣耀发布万元级「机器人手机」(财新科技)—— 手机厂向 AI 终端生态转型的密集动作之一,万元定价是真敢要。
  6. 超强厄尔尼诺预期引爆 A 股粮食概念(央广网)—— 种植业板块单日大涨 9.5%,成为算力链调整时的新主线候选,详见本期深读 03。
← 返回目录
深读 · 01

Token 定价的几种思考方式

Ways to think about token pricing

Benedict Evans · Benedict Evans · 2026-07-09 · 约 13 分钟 · 原文链接

导读与要点(建议先读原文)
  • 起点:关于 token 价格只有两件事确定——现在处于供给紧缺,且这种状态不稳定;所有变量都在变动,未来几年市场会洗牌到新的均衡。
  • 自下而上建模是徒劳的:像在 1998 年为宽带市场做五年预测,电子表格很漂亮,今年或许能对,但未知变量太多,预测不了长期市场结构。
  • 自上而下的四个问题:多少人愿意为站在前沿付费?前沿还会显著移动吗?前沿模型之间是否持续激烈竞争?高端用例的价值有多少被模型本身(而非外围的软件公司)捕获?
  • 移动数据类比:过去 20 年蜂窝流量增长几个数量级,成就年收入上万亿美元、资本开支 2000 亿美元的行业,但运营商股价原地踏步——价值全被更上层的人拿走了。
  • 半导体类比:Rock 定律让前沿玩家从几十家收敛到只剩台积电一家,但台积电 530 亿美元净利润还不到苹果的一半——垄断前沿也不等于捕获价值。
  • 结论:类比没有预测力,但历史证明结局的分布很宽;每一条让基础模型拥有定价权和战略杠杆的路径,都需要「尚未发生的事情」先发生——否则,随着供给紧缺缓解,前沿模型将滑向大宗商品化的基础设施。
There are only two things you can say with certainty about token prices: we're in a supply crunch, and this is unstable. All of the variables are in play, and the market will get shaken out over the next few years to arrive at a new equilibrium. Right now we have a lot of frantic analysis of 'time to power', but the question at the end of that remains whether the foundation models have sustainable pricing power, strategic leverage and value capture, or whether they become low-margin commodity infrastructure providers. At the moment, I think every dynamic we can see points to the latter.
关于 token 的价格,只有两件事是确定的:我们正处在供给紧缩之中,而这种状态不稳定。所有变量都在变动,未来几年市场会经历一轮出清,达到新的均衡。眼下到处是对"通电时间"(time to power)的狂热分析,但归根结底的问题仍然是:基础模型究竟有没有可持续的定价权、战略杠杆和价值捕获能力,还是会沦为低利润的大宗商品式基础设施供应商。就目前而言,我认为我们能看到的每一个动态都指向后者。
Clearly, the situation today is transitory. On the supply side, a trillion dollars or more of data centre capex is coming down the pipe (and plenty more semiconductor capex behind that), inference efficiency continues to improve very quickly, and new models are far more (or far less!) efficient in their token use. On the demand side, although the market has been capacity-constrained since 2022, the crunch in the first half of this year has been driven by sudden product-market fit in really just one use case, software development, and that's actually a pretty small field (imagine if we had product-market fit for a consumer use case with hundreds of millions of DAUs - today's infrastructure couldn't support it at any price). We don't know what the next use-cases to scale will be, nor when that would be, nor what their token needs would be.
显然,今天的局面是过渡性的。供给侧,上万亿美元的数据中心资本开支正在路上(后面还跟着更多半导体资本开支),推理效率还在快速进步,而新模型在 token 使用效率上可能高得多(也可能低得多!)。需求侧,尽管市场从 2022 年起就一直受产能约束,但今年上半年的紧缩其实只由一个用例突然找到产品市场契合(PMF)所驱动——软件开发,而这其实是个相当小的领域(想象一下:如果某个拥有几亿日活的消费级用例找到了 PMF,今天的基础设施开任何价都接不住)。我们不知道下一个规模化的用例是什么,不知道何时到来,也不知道它们需要多少 token。
Going up a level, it's been pretty widely reported that inference today has 40-50% gross margins: this includes depreciation of the associated server costs (or the cost of renting them), but we don't really know the asset life (five years? Seven years?) and obviously this doesn't include the cost of training the next model a couple of times a year, which is currently far larger than revenue. In principle, inference is a marginal cost and training is a fixed cost, so with high enough revenue you can reach profitability, but we don't know how training costs will change. On the other side of the table, it's unclear how much of the surge in use in the last few months has an ROI (or at least has an ROI that can be quantified to a CFO), let alone any future use cases, and hence what prices people might be prepared to pay for them.
往上一层看:据广泛报道,今天的推理业务有 40-50% 的毛利率——这已经扣除了相关服务器的折旧(或租用成本),但我们并不真正知道资产寿命(五年?七年?),而且这显然不包括每年训练几次下一代模型的成本,那目前远远超过收入。原则上,推理是边际成本、训练是固定成本,所以收入足够高就能盈利,但我们不知道训练成本会如何变化。桌子的另一边:过去几个月用量的激增里,有多少是有投资回报(ROI)的(至少是能向 CFO 量化的 ROI),并不清楚,未来的用例更是如此——因此人们愿意为它们付什么价,也无从谈起。
So, all the variables will move all over the place over the next 12 months, and move again over the next three to five years. How could we suggest where this will settle? How and where will supply, demand, price, capacity and capex get back into equilibrium?
所以,未来 12 个月所有变量都会剧烈变动,未来三五年还会再变。我们怎么可能预判它最终停在哪里?供给、需求、价格、产能和资本开支,将如何、在何处重新达到均衡?
In theory, you can model this bottom-up. You can make some assumptions around each of the variables I suggested above, and then try to model out how many chips there are now, how many chips with what performance TSMC and the rest of the semis industry might be able to deliver when, and how fast all of that can be brought online in data centers and how fast those can be powered. Then you can wonder about price discipline, and make some guesses about use cases. This will get you a number, but it will be rather like trying to build a five-year forecast for the broadband market in 1998: the spreadsheet will be very pretty, and you might even get close to the right number for this year, but there are too many unknown variables to make a useful forecast of a longer-term market structure.
理论上你可以自下而上地建模:对上面每个变量做一些假设,然后测算现在有多少芯片,台积电(TSMC)和整个半导体行业什么时候能交付多少、什么性能的芯片,这些芯片多快能装进数据中心、多快能通上电。然后再考虑价格纪律,对用例做些猜测。这样你能得到一个数字——但这很像在 1998 年做宽带市场的五年预测:表格会很漂亮,今年的数字说不定还蒙得挺准,但未知变量太多,无法对更远期的市场结构做出有用的预测。
In other words, we can say that token price is a function of supply and demand at a level between the sellers' marginal cost and the buyers' ROI, but we don't actually know what supply, demand, marginal cost or ROI will be.
换句话说:我们可以说,token 价格是供需的函数,落在卖方边际成本与买方 ROI 之间的某个位置——但供给、需求、边际成本和 ROI 到底是多少,我们其实全都不知道。
The other approach is to look from the top down: how do things like this tend to play out? What are the building blocks, and where can they go? Most of this conversation depends on what happens to this curve.
另一种方法是自上而下地看:这类事情通常如何演化?基本的构件有哪些,它们能走到哪里?这场讨论的大部分,都取决于价格-性能这条曲线会怎么变。
First, how many people will pay to be at the top right of the curve - to be at the frontier? At one extreme there are already use cases that already work just fine with a small, old, perhaps open source model that runs for 'free' on-prem or on your phone; at the other extreme there will be some that get better results from the latest, most expensive frontier model, consuming lots of tokens for lots of money; and then there will be many that are somewhere in between. So, how many use cases get better results from going how far up the cost curve, and how many have an ROI for that, and how much of the use is handled by models that are smaller, cheaper, good 'enough' and much more commoditised? The Panglossian view is that ROI might go up with more expensive frontier models because they have better results, but where does that really apply?
第一,有多少人愿意为站在曲线右上端——站在前沿——付钱?一个极端是:已经有很多用例,用一个小的、旧的、或许是开源的模型就能跑得很好,在本地或手机上"免费"运行;另一个极端是:有些用例只有用最新、最贵的前沿模型、烧大量 token 才能得到更好的结果;中间则是大片灰色地带。那么,有多少用例沿成本曲线往上走多远能得到更好结果?其中多少算得过 ROI 的账?又有多少用量,其实交给更小、更便宜、"够用"且商品化程度深得多的模型就行?乐观派(Panglossian)的看法是:更贵的前沿模型结果更好,ROI 反而可能上升——但这到底在哪些场景成立?
Second, does the frontier keep moving significantly? This is obviously the most basic science question in AI: how long does the frontier keep getting better, how long does that keep needing more and more compute, and does that continue to happen at a rate that keeps it ahead of downward pricing pressure from efficiency and capacity gains? Does the expensive head of the curve continue to be a thing?
第二,前沿还会继续显著前移吗?这显然是 AI 最根本的科学问题:前沿还能变好多久?这种变好还需要越来越多的算力吗?它进步的速度,能否一直跑在效率和产能提升带来的降价压力前面?曲线上那个昂贵的头部,还会继续存在吗?
Third, will there still be fierce competition between frontier models? Does the field shrink to fewer and fewer frontier models, perhaps with network effects emerging? Do frontier models diverge, with different models having much clearer leads in different fields? That could be another path to sustainable pricing power. Or do we continue with a mid-single-digit number of companies that are all making frontier models that all have generally equivalent capabilities? At the moment, everyone is using mostly the same science and mostly the same training data, and getting mostly the same results, and we don't yet know of a network effect or any other winner-takes-all effect that would let one company pull ahead, stay ahead, and do things that others could not, in some sustainable way. Does that change?
第三,前沿模型之间还会继续激烈竞争吗?这个赛场会收缩到越来越少的前沿模型、甚至出现网络效应吗?前沿模型会分化吗——不同模型在不同领域建立明显领先?那可能是另一条通往可持续定价权的路。还是我们继续维持现在这个四五家公司的格局,大家做出的前沿模型能力大体相当?眼下,所有人用的科学大致相同、训练数据大致相同、得到的结果也大致相同;我们还没看到任何网络效应或赢家通吃效应,能让某家公司以可持续的方式领先、保持领先、做出别人做不到的事。这会改变吗?
Fourth, how much of the value from those high-end use cases is captured by the frontier model itself? How much needs to be wrapped in tooling, process, proprietary data, go-to-market, networks, support, and everything else associated with a traditional software company, even if you do need the big expensive frontier model underneath? Can that model do the whole thing, or is the model, no matter how good, still a piece of infrastructure that you use to make the actual product? At the extreme, can the model itself invent and make all of those things, and would that let them charge by seat, by outcome or just take the profit? Or do even (or especially) the most sophisticated and high-value use-cases need to sit inside hundreds of new companies that can pick and choose which models to use?
第四,那些高端用例创造的价值,有多大比例会被前沿模型自己拿走?即便底层确实需要又大又贵的前沿模型,还有多少价值必须包裹在工具、流程、专有数据、市场通路、渠道、支持以及传统软件公司那一整套东西里?模型能包打天下吗?还是说,模型再好,也只是一块基础设施,真正的产品要在它上面做出来?极端一点:模型自己能不能发明并做出那一整套东西,从而按席位收费、按结果收费,甚至直接把利润拿走?还是说,哪怕(尤其)最复杂、最高价值的用例,也必须装在几百家可以在模型之间挑挑拣拣的新公司里?
None of these are binaries: they're all a question of degree, and they'll probably vary quite a lot by use case. But at one extreme, there are two or three giant minds that run half of everything and have massive pricing power, and at the other extreme LLMs look like databases - there'll be millions of them, some very big and some very small, and the value is in what you build on top - after all, every SaaS company is a 'database wrapper'. There's a future in which Anthropic (or a company we haven't heard of yet) wins the whole thing and can set its own terms, and a future in which dozens of routers run real-time auctions to allocate your tasks across hundreds of low-margin model-farms and a benchmark company takes a fee on every single one.
这些问题都不是非黑即白:全是程度问题,而且很可能因用例而异。但光谱的一端是:两三个巨型大脑驱动半个世界,握有巨大的定价权;另一端是:大模型活成数据库的样子——会有几百万个,有大有小,价值全在你于其上构建的东西里——毕竟每家 SaaS 公司都是"数据库套壳"。存在这样一种未来:Anthropic(或某家我们还没听说过的公司)通吃一切、自定规则;也存在另一种未来:几十个路由器(router)跑着实时竞价,把你的任务分配给几百家低利润的"模型农场",而某个基准测试公司在每一笔交易上抽成。
I don't think anyone can actually know the answer yet. I've said "we don't know" a lot, and that's very deliberate. Part of the concept of the 'S Curve' is that there's a stage early in the emergence of a new technology where it's clear that this is going to be huge but nothing else is clear at all - the mid 1990s for the internet, say, and 2008 or 2009 for mobile. There are places where you can take a view - for example, I've argued at length that I think chatbots are a poor interface that will struggle to capture value up the stack - but we should presume there are big questions that we can't see yet, let alone answer, and anyone picking one of the ten possible outcomes we can see and saying "it will be that one!" is just guessing.
我不认为现在有谁能真正知道答案。我反复说"我们不知道",这是刻意为之。S 曲线这个概念的一部分含义是:新技术出现的早期有这样一个阶段——它会很大,这一点很清楚,但除此之外一切都还不清楚。互联网在 90 年代中期是这样,移动互联网在 2008、2009 年是这样。有些地方你可以有自己的判断——比如我详细论述过,聊天机器人是一种糟糕的交互界面,很难向价值链上游捕获价值——但我们应该默认:还有一些大问题我们现在连看都看不到,更别提回答了。任何人在我们能看到的十种可能结局里挑一种说"就会是这个!",都只是在猜。
Meanwhile, there is structural uncertainty at the early stages of every big new technology, but the uncertainty now is different, because we don't have a good theoretical understanding of why these models work so well and so we don't know how much better they can get. In 1995, we didn't know how the internet would evolve but we knew that there were less than 100m PCs on earth (and they were expensive) and that telcos couldn't give everyone FTTH next year; in 2010 we didn't know what the next iPhone would be but we knew it wouldn't have retinal projection. We knew the physical limits in ways we don't really know with LLMs. Next month a new approach could cut inference compute needs by 90%, or double demand, or both.
与此同时,每一项重大新技术的早期都有结构性的不确定性,但这次的不确定性不同:我们并没有很好的理论去理解这些模型为什么如此有效,所以我们不知道它们还能好到什么程度。1995 年,我们不知道互联网会如何演化,但我们知道地球上的 PC 不到一亿台(而且很贵),电信运营商明年也不可能给家家户户拉上光纤;2010 年,我们不知道下一代 iPhone 长什么样,但我们知道它不会有视网膜投影。当时的我们知道物理极限在哪里,而对大模型我们并不知道。下个月,某种新方法可能把推理算力需求砍掉 90%,也可能让需求翻倍,或者两者同时发生。
All of this has people hunting for patterns to recognise (indeed, it's been observed that all conversations about AI end in a hunt for metaphors). It has become common to draw comparisons with fiber, which had a massive overbuild in the Dotcom bubble that looks a bit like the infrastructure build-out today. The narrow problem with that is that fiber construction was far ahead of demand, where AI compute construction is far behind demand, though, as above, we don't know what that supply/demand balance will look like in the future. But the more relevant objection, I think, is that fiber construction was mostly fixed cost (digging holes) rather than marginal cost (more equipment), whereas growth in compute needs means you need to buy more compute.
这一切都让人拼命寻找可参照的模式(确实有人观察到:所有关于 AI 的讨论最后都会变成寻找比喻)。一个流行的类比是光纤:互联网泡沫时期光纤被疯狂超建,看起来有点像今天的基础设施扩建。这个类比狭义上的问题是:光纤建设远远跑在需求前面,而 AI 算力建设远远落在需求后面——不过如前所述,未来的供需平衡是什么样我们并不知道。但我认为更关键的反驳是:光纤建设主要是固定成本(挖坑),而不是边际成本(添设备);而算力需求的增长意味着你得不停地买算力。
That makes mobile data a more fruitful comparison here. Mobile networks have marginal cost for capacity, and like AI they had an enormous surge in usage 15 years ago, that overwhelmed capacity and had carriers scrambling to add capacity and rebalance their pricing. Meanwhile, selling bits looks superficially similar to selling tokens: it's an opaque measure of marginal cost that doesn't map in any transparent or intuitive way to use cases or value, and needs to be replaced with bundles of some kind. But most importantly, in the last 20 years cellular data traffic has risen by several orders of magnitude, and this has become an enormous industry, with annual revenue of a trillion dollars and capex of $200 billion, but the stocks have gone nowhere, and all the value was captured by other people further up the stack. This, of course, is one of the core questions for AI: is this going to be low-margin commodity infrastructure with all the value captured by other people further up the stack?
所以移动数据是个更有启发性的类比。移动网络的容量有边际成本,而且和 AI 一样,15 年前经历过用量暴增、压垮产能、运营商手忙脚乱扩产能、重新定价的阶段。此外,卖比特和卖 token 表面上也很像:都是不透明的边际成本度量,不以任何透明或直觉的方式对应到用例或价值,最终都得打包成某种套餐来卖。但最重要的是:过去 20 年,蜂窝数据流量涨了好几个数量级,长成了一个年收入上万亿美元、年资本开支 2000 亿美元的庞大行业——可运营商的股价原地踏步,价值全被上游更靠上的环节拿走了。这当然是 AI 的核心问题之一:它会不会也变成低利润的大宗商品基础设施,价值全被上层的人捕获?
Semiconductor manufacturing also has echoes of AI, since unlike cellular it has something of the same escalating cost and complexity that we see in foundation models. Rock's Law pointed out that the cost of a cutting edge fab doubles every four years: over time the frontier of semiconductors became so hard and so expensive that the number of players dropped from dozens to a handful and now really only one, TSMC. That's another core question for AI: will this get so hard and so expensive that only a couple of people can do it, even without network effects? Equally, many semiconductor uses are further back along the same kind of price/performance curve I just discussed for AI. Even here, though, while TSMC has a de facto monopoly on the frontier, and nice margins, it doesn't actually capture a large share of value from the broader tech economy: net income last year was $53bn, less than half of Apple alone.
半导体制造也和 AI 有呼应,因为它和蜂窝网络不同,有着类似基础模型那种不断攀升的成本与复杂度。洛克定律(Rock's Law)指出:最先进晶圆厂的成本每四年翻一倍。久而久之,半导体前沿变得太难、太贵,玩家从几十家缩到几家,再到今天实质上只剩一家——台积电。这是 AI 的另一个核心问题:就算没有网络效应,这件事会不会难到、贵到只有两三家公司玩得起?同样地,半导体的很多用途也处在我刚说的那种价格-性能曲线的靠后位置。不过即便在这里,台积电虽然在前沿拥有事实垄断和不错的利润率,它从整个科技经济中捕获的价值份额其实并不大:去年净利润 530 亿美元,不到苹果一家的一半。
There are plenty of other comparisons one could make here: in the last six months Sam Altman has compared OpenAI both to Windows, a high-margin capital-light monopoly based on network effects, and electricity utilities, which are natural monopolies but also low-margin regulated utilities selling a pure commodity. One could also point to cloud (three leading players with good margins and clearly distinguished propositions, but again limited value-capture). But none of these have predictive value: analogies don't have predictive value. You can't prove whether something will have the same outcome as mobile by arguing how much it's like mobile: this was a mistake that many very clever people in tech made 15 years ago, claiming that Android would beat iOS because Android was 'open' and 'open' Wintel had beaten the 'closed' Mac in the 1990s (it's also the mistake that doomers make when they claim that AI is 'like' nuclear weapons). Everything is different: bits, tokens and transistors are different, each of these examples are different from each other, and AI will be different too.
还能找出很多别的类比:过去半年里,萨姆·奥特曼(Sam Altman)一会儿把 OpenAI 比作 Windows——基于网络效应的高利润、轻资产垄断,一会儿又比作电力公司——自然垄断,但同时也是低利润、受监管的、卖纯大宗商品的公用事业。也有人提云计算(三家领先者,利润率不错,定位清晰区隔,但价值捕获同样有限)。但这些都没有预测力:类比没有预测力。你不能通过论证"它多像移动通信"来证明它会和移动通信有同样的结局——15 年前科技圈很多绝顶聪明的人都犯过这个错,他们说 Android 会赢 iOS,因为 Android 是"开放"的,而"开放"的 Wintel 在 90 年代打败过"封闭"的 Mac(末日论者声称 AI"像"核武器,犯的也是同一个错)。每个东西都不一样:比特、token 和晶体管不一样,这些例子彼此也不一样,AI 也会不一样。
However, these examples do tell us, empirically, that something can be very important, very expensive, change the world, and be full of very sophisticated science and engineering, and yet have a wide range of possible outcomes. There isn't one inevitable path here: you can have price equilibrium at high margins and at low margins, and with and without market concentration, and you can't hand-wave that away by talking about AGI and saying "you don't understand exponentials!"
不过,这些例子确实从经验上告诉我们:一个东西可以非常重要、非常昂贵、改变世界、充满精密的科学与工程,同时仍然拥有范围很宽的可能结局。这里不存在唯一注定的路径:价格均衡可以在高利润达成,也可以在低利润达成;可以伴随市场集中,也可以不伴随。这不是你挥挥手搬出 AGI、说一句"你不懂指数!"就能打发掉的。
However, if one thread in everything I've written above is how much we don't yet know, the other thread is that every path to foundation models having market dominance, strategic leverage, value capture, winner-takes-all effects, or anything else other than becoming commodity infrastructure, requires something to change. Maybe frontier models will become less competitive - yet in the last six months, Mark Zuckerberg and Elon Musk jumped from zero back onto the leaderboards. Maybe network effects will emerge. Maybe chatbots can grow into products and don't need to be wrapped in software. Maybe one lab will start out-executing all the others and pull ahead on sheer product dynamism - Microsoft, Google, Facebook and Apple had to execute their way into a winning position before they had winner-takes-all effects. Maybe something else will happen.
不过,如果说上面这些文字的一条主线是"我们还有太多不知道",那另一条主线就是:基础模型要想拥有市场支配力、战略杠杆、价值捕获、赢家通吃效应——总之,要想不沦为大宗商品基础设施——每一条路都以"某些东西发生改变"为前提。也许前沿模型的竞争会变少——可过去半年,马克·扎克伯格和埃隆·马斯克(Elon Musk)从零起步又杀回了榜单。也许网络效应会浮现。也许聊天机器人能自己长成产品,不需要包在软件里。也许某个实验室会开始靠执行力碾压同行,凭纯粹的产品活力领先——微软、谷歌、Facebook 和苹果当年也都是先靠执行打出优势地位,才有后来的赢家通吃。也许,会发生别的什么事。
In particular, we have not one but two potential dei ex machina - Trump and China. China is reportedly considering regulating open source and some people close to Trump have floated this as well (though since Meta abandoned Llama the US has no leading open model), and export controls could expand and become systematic. Many people see the pleas for regulation from Anthropic and (sometimes) OpenAI as a front for regulatory capture, but either way, we can't presume this will remain an entirely free market.
特别是,我们面前还站着不止一个、而是两个潜在的"机械降神"(deus ex machina)——特朗普和中国。据报道,中国正在考虑监管开源,特朗普身边的一些人也放过类似的风(不过自从 Meta 放弃 Llama,美国已经没有领先的开源模型了);出口管制也可能扩大并系统化。很多人把 Anthropic(有时还有 OpenAI)呼吁监管看作监管俘获(regulatory capture)的幌子,但无论如何,我们不能默认这个市场会一直完全自由。
Even so, that brings me back to the same point: the current market dynamics point to a future in which, as today's supply crunch eases, frontier models move towards becoming commodity infrastructure, with all of the value built on top, and for a different outcome, something needs to happen that we don't see yet.
即便如此,我还是回到同一个结论:当前的市场动态指向这样一个未来——随着今天的供给紧缩缓解,前沿模型将走向大宗商品式基础设施,价值全部建在它的上层;想要不一样的结局,就需要发生一些我们现在还看不到的事情。

← 返回目录

← 返回目录
深读 · 02

蒸馏风暴:AI 公司不愿公开谈论的技术竞赛

晚点LatePost · 程曼祺 · 2026-08-13 · 约 18 分钟 · 原文链接

导读与要点(建议先读原文)
  • 事件线:Anthropic 两次指控中国公司以约 5 万个欺诈账户与 Claude 交互超 4480 万次;Google 把「蒸馏」与「攻击」并提;77 家公司联名反对仓促限制开源模型;张一鸣在字节 Seed 全员会明确「不蒸馏」。
  • 技术三脉络:软蒸馏到硬蒸馏(只看最终答案、黑盒即可);推理模型让思维链成为蒸馏原料——DeepSeek-R1 对照实验显示,80 万条蒸馏数据比 1 万步强化学习高出超 25 个百分点;「用 AI 加速 AI」让蒸馏全流程自动化。
  • 蒸馏不是银弹:同样 80 万条数据,蒸 Qwen2.5-32B 得 72.6%,蒸参数两倍的 Llama-3.3-70B 只有 70.0%——预训练底座才是性能的基础条件。
  • 壁垒判断:从业者共识是蒸馏只带来先发优势,不构成长期壁垒;大模型领域真正被认可的强壁垒是「数据飞轮」——模型够强、触达用户、独特数据回流、再训练更强的模型。
  • 道德分界线在黑盒还是白盒:被蒸馏的数据是模型作为产品的产物,且 Anthropic 自己刚因盗版图书诉讼和解 15 亿美元——不少美国从业者认为这是双标。
  • 张一鸣的赌注:蒸馏最多逼近教师模型、难以真正超越,且有组织惰性隐患;字节选择自建数据能力,成立与 Seed、Flow 平行的一级部门「AI 数据与安全」。批判性阅读:文中多数从业者匿名,立场分布无法验证;「不蒸馏」的公司自述同样缺少第三方佐证。

多数我们接触的从业者,并不认为这违背他们技术信念。

所有人都不愿意公开谈论它,但所有人都在默默地关注它。

有人认为,这是一种不体面的偷窃行为。也有人认为,这是少数领先者为了自身利益而污名化的对象,它本身只是一种优化手段。

过去数月,AI 领域的诸多线头指向同一个节点——蒸馏。

和它相关的变化与事件有:开源模型逼近最强闭源模型;美国 77 家公司签署公开信,反对仓促限制开源模型;Anthropic 两次指责中国公司以大量欺诈账户套取数据;15 亿美元的侵权诉讼和解;张一鸣在字节 Seed 全员会上关于 “不蒸馏” 的正面回应……

这种诞生多年的技术,在 2026 年反复被提及、讨论,也被误解和曲解。蒸馏到底是什么?大规模蒸馏如何实现?蒸馏能否成为一个模型研发团队的壁垒?它的代价又是什么?

我们访谈了来自不同公司的近十位模型领域研究员、从业者,也结合公开研究和技术报告,还原蒸馏的过去、现状,和它正在带来的更多改变。

蒸馏的起点:为了压缩,而非为了变强



蒸馏不是抄袭,不是窃取软件代码,它也无法直接获得另一个模型的权重和完整训练数据。

现在处于争议中的那种蒸馏,即让模型变强的蒸馏,技术上是一种获得高质量数据的方式:即反复向一个更强的 “教师模型” 提问,得到回答,再用这些 “题目—回答” 数据对训练另一个 “学生模型”,让后者达到相近的表现。

蒸馏的想法由来已久。2015 年,刚加入 Google Brain 不久的 Geoffrey Hinton,与当时 Google Brain 的负责人 Jeff Dean 和年轻研究员 Oriol Vinyals 一起发表了《神经网络中的知识蒸馏》

(

Distilling the Knowledge in a Neural Network

)

,第一次把之前出现的模型压缩

(

Model Compression,2006

)

等思路总结为蒸馏,Distillation。

那时距离 Google 提出 Transformer

(如今大语言模型的架构基础)

还有将近 2 年半,Hinton 他们把蒸馏的思路用到了图像识别模型:方法是,让学生模型学习教师模型输出的概率分布。比如识别猫是猫,这对深度学习是一个统计过程:0.7 是猫,0.2 是狐狸,0.1 是狗→ 是猫。

学生模型能看到教师输出的这组概率分布,这便是学到 “logits”,即所谓 “软蒸馏”

(logits 是一组原始分数,经过 Softmax 转换后即是概率分布)

。

软蒸馏通常是 “白盒蒸馏”:因为它需要教师模型的输出概率对学生模型完全开放。

这种蒸馏通常发生在同一组织内,它的出发点不是变强,而是 “压缩”——用较小参数的模型逼近更大参数模型的能力。这会损失一些性能,但能让推理更快、更便宜。

直到今天,“压缩” 仍是蒸馏最典型的用途之一。

比如在自动驾驶领域,就会先做出性能更强的云端大模型,再用蒸馏、剪枝等方法,让它变成能在车端芯片上跑的更小的模型。理想、小鹏等公司都有这类实践。

更近的例子是 2025 年年初的 DeepSeek-R1。当时 DeepSeek 还同时发布了六个小尺寸的蒸馏模型,它们的教师模型都是总参数 6710 亿的 R1 本身。学生模型中,4 个以阿里的 Qwen2.5 为底座,2 个以 Meta 的 Llama 3 为底座,参数量最小 15 亿,最大 700 亿。

DeepSeek 先让 R1 生成约 60 万条 “题目—推理过程—答案” 的推理数据和约 20 万条非推理数据,再在后训练阶段用这些数据去监督微调(SFT)6 个小的基座模型。这些模型都获得了更强的推理能力。

《晚点》曾报道

,2026 年春节后,R1 的核心作者之一郭达雅加入了字节 Seed。

“工业化规模的蒸馏攻击”

在为了压缩的目的中,蒸馏是一个中性的技术方法,而到 2026 年 2 月,Google 和 Anthropic 连续发文,将 “蒸馏” 和 “攻击” 并用,直指部分公司利用蒸馏进行不正当竞争。

Google 认为这是一种 IP 偷窃:

过去一年里,“蒸馏攻击” 作为一种窃取知识产权( intellectual property theft)的手段日益增多。

——GTIG AI Threat Tracker: Distillation, Experimentation, and (Continued) Integration of AI for Adversarial Use

Anthropic 分别在 2 月和 6 月称 DeepSeek、月之暗面(Kimi)、MiniMax 和阿里千问(Qwen),总计通过约 5 万个欺诈账户与 Claude 进行了超 4480 万次交互,试图提取 Claude 的能力。

(2 月:Detecting and preventing distillation attacks;6 月:Anthropic 致美国参议院的信。)

被提及的公司未作出正面回应。

对闭源领先模型的蒸馏何以大规模开展?变化的源头还是在于技术,可以看到 3 条脉络:

从软蒸馏到硬蒸馏,从白盒蒸馏到黑盒蒸馏

2016 年,在哈佛读博士的 Yoon Kim 和导师 Sasha Rush 提出了序列级知识蒸馏,把最初用在图像识别上的这种方法用到了翻译这一语言任务上。

序列级蒸馏不再学习模型每一步输出的概率分布,而是让教师模型先生成高质量译文,再让学生模型学习完整的 “原文-译文” 序列对。

提出这个技术,本来是为了压缩庞大的翻译模型,提高解码速度,但它也带来一个效果:就是让蒸馏不再需要知道教师模型逐步输出的概率分布,可以只看 “最终答案” 就实现蒸馏。

这就是 “硬蒸馏”,它可以黑盒进行,也就是通过调用 API,直接获得教师模型的回答即可。

Sasha Rush 后在 2025 年 3 月加入 AI 编程公司 Cursor。今年 6 月,Cursor 被 SpaceXAI(SpaceX 和 xAI 合并后的新名字)以 600 亿美元收购,团队也已并入。

推理模型的崛起

2024 年 9 月,就在 Scaling Law 撞墙的讨论弥漫之时,OpenAI 发布 o1 推理模型。o1 带来两个变化:

在后训练阶段做大规模强化学习(RL),可教会模型形成推理(resoning)策略;

在模型的推理(inference)阶段,即模型使用阶段,用更多测试时计算让模型在回答复杂问题时生成更长的思维链,可让模型表现继续提升。

这两个变化都能放大蒸馏的效果:首先大规模蒸馏是一种主要用在后训练阶段的方法,后训练重要性提升,蒸馏的投入回报也提升。同时,测试时计算让模型在产出最终回答外,也产出思维链和推理轨迹(包含思维链、工具调用、搜索过程和纠错过程等)等长推理过程。这些产出可被作为蒸馏的数据原料。

4 个月后,DeepSeek 在 R1 技术报告中公布的蒸馏过程,更详细展示了蒸馏让模型变强的机制。R1 有几个具体实践和发现:

首先,蒸馏过程主要使用的是 R1 生成的 “题目-推理过程-回答” 数据对。这是目前蒸馏最理想的状态,效果比只有 “题目-回答” 的数据对更好。

开放程度颇高的 DeepSeek 在发布 R1 时直接展示了完整思维链,“希望有助于社区蒸馏更好的小模型”。

而领先的闭源模型公司,OpenAI、Anthropic 和 Google DeepMind 都一直对用户隐藏完整的思维链和推理轨迹。

所以从业者提及蒸馏时常会说:“谁谁破解了谁的思维链”。

本周一(8 月 10 日),德国图宾根大学等机构的研究者发布了《从闭源大语言模型 API 中偷取推理轨迹》

(

Stealing Reasoning Traces from Proprietary LLM APIs

)

一文,展示了他们发现的还原推理轨迹的一些方法。

该研究的网页 stolen-thoughts.com

其实这早就不是秘密——即使闭源模型公司刻意隐藏,思维链和推理轨迹也可以通过技术手段被还原。

这本质是因为,它们都是模型输出的一部分,是模型使用阶段的产物,只要你去用一个模型,思维链和推理过程就会被生成,会留下痕迹。这仍属于黑盒蒸馏和硬蒸馏。

R1 对蒸馏的另一个发现是:在后训练阶段,直接蒸馏带来的提升大于让模型自己做强化学习。

DeepSeek 当时用 Qwen2.5-32B 做了一组对照实验:

在 Qwen-32B-Base 上做超过 1 万步大规模强化学习,得到的模型在 AIME 2024(评测数学解题能力)上得分 47.0%;

用 80 万条 R1 生成的数据监督微调 Qwen-32B-Base,得到的模型在 AIME 2024 上得分 72.6%,比 RL 方法高出超 25 个百分点。

我们证明了可以将大模型的推理模式蒸馏到小模型中,这比小模型通过强化学习习得的推理模式有更优的性能。——R1 技术报告

虽然这是一个特定实验下的结果,不一定能外推到所有情形,但仍是一个很有吸引力的发现。因为长步数强化学习的训练难度本就高于监督微调,它对 Infra 有更多要求,速度往往也更慢、算力成本更高。

DeepSeek 公开了一种让更小或性能更弱的模型,相对经济、高效,且确定性强的提升推理能力的方法。

多位从业者称,近期出现的一些实践是,在后训练阶段主要做监督微调,几乎不做或做很少的强化学习,也可以取得很好的效果。

也是在 DeepSeek-R1 之后的整个 2025 年至今,Anthropic、OpenAI 和 Google 等公司称,他们监测到的 “蒸馏攻击” 行为日益增加。

同期,对后训练的更多探索也推广了另一种不涉及争议的蒸馏实践:目前主要用于后训练能力合并的 on-policy(在线策略)蒸馏。

On-policy 和 off-policy(离线策略)蒸馏的区别在于数据由谁生成。前面提到的让模型学习另一个闭源模型的蒸馏,多数是 off-policy 蒸馏,数据由教师模型生成;而 on-policy 蒸馏是让学生模型生成推理和回答,教师模型提供反馈。反馈可以是逐个 token 生成的分布概率(白盒),也可以是对推理轨迹和回答作评判(黑盒)。

2025 年下半年至今,阿里 Qwen、Thinking Machines Lab、小米 MiMo 都贡献了 on-policy 蒸馏的实践和改进。

小米在今年初的 MiMo V2-Flash 技术报告中介绍了 MOPD(多教师 on-policy 蒸馏)方法,6 月又发布了单独的文章

(

Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training

)

:先分别训练数学、代码、工具调用等方向的教师模型,再让学生模型自己生成轨迹,按任务接受不同教师的反馈。它要解决的是一个后训练的新问题:如果直接把多个方向的能力混在一起做强化学习,常会互相干扰、此消彼长。

DeepSeek-V4

和

Kimi K3

技术报告中,都称在后训练阶段用 MOPD 思路合并了多个专家模型。

用 AI 加速 AI

蒸馏规模化的第三条脉络是,蒸馏本身也在随 AI 能力变强而更加自动化。

回到蒸馏的关键——“题目-推理过程-回答” 数据对。

首先,提问这个环节,可以从人变成 AI:2022 年以来的 Self-Instruct 等诸多研究都是在解决高质量提问少且贵的问题。

实践中,各公司可以先从获得授权的用户使用行为中筛选出高质量的真实提问,然后再基于这些真实提问扩增更多 AI 生成的提问,更高频地去问教师模型,获得更多回答。这就像,你先有一些酵母(真实数据),再用它发酵出更大的面团。

“题目-推理过程-回答” 的整体数据对也可以做这样的改写、扩增。

这本质上是现在 AI 领域的一种基础思维:用 AI 和模型来自动化和加速 AI 本身。

整个蒸馏流程里,还有很多具体步骤都可以用到 AI,比如从海量真实提问里筛选高质量题目,评估 “何谓高质量数据”,提升合成数据的多样性……有些环节可以用模型来做,有些可以用越来越强的 AI 编程能力更快构造和改进各种系统来加速和优化。

可以说,2025 年至今,大规模蒸馏的各种方法和实践积累逐渐成熟,它的效果和必要性也随后训练重要性的提升而愈加显现。

围绕 “蒸馏” 的讨论也逐步走出了 AI 技术圈,在传播中被简化、误解,乃至曲解。蒸馏不再是一个单纯的技术议题,它走向了风暴中心。

对蒸馏的误解:它不是银弹也不是秘密

梳理了蒸馏的大致原理后,我们有了更好的基础来展开关于蒸馏的各种讨论。

蒸馏不是银弹,不是决定模型性能的最重要环节

前文已反复提到,让大语言模型变强的蒸馏主要发生在后训练(也包括中训练)阶段。而一个模型的整体效果来自预训练到后训练的完整训练过程。一般认为,预训练的重要性更大。

所以蒸馏不是银弹,不是决定一个模型性能的最重要环节。

在 DeepSeek-R1 的技术报告中,同样是用 80 万条 R1 数据做蒸馏,Qwen2.5-32B 基座模型经过蒸馏后,在 AIME 2024 上得分 72.6%,高于 Llama-3.3-70B-Instruct 蒸馏后的 70.0%,而后者的参数是前者的两倍多。

在 K3 发布后,Ai2 研究员 Nathan Lambert 在回复 K3 登顶 Frontend Code Arena 榜单(评测前端代码能力)的一条推文时说:到这个时候,关于 “蒸馏” 的那套论调该停止了;人们该承认,中国也非常擅长造模型。

预训练达到一定水平,是 K3、GLM-5.2、DeepSeek-V4 等中国开源模型能取得目前性能的基础条件。

蒸馏需要相当多运营、经验和工程 know-how

蒸馏常被类比为一种捷径,捷径往往指向轻松、省力。但实际上,现在要大规模展开蒸馏是一个比较复杂的系统工程。

综合多位从业者的描述,大规模蒸馏有几个比较有难度的环节:

一是能稳定、高频、大量地调用领先模型和做用户运营。

一种被提及的做法是:建大量中转站,以折扣或其它方式吸引一批有真实使用行为的特定用户——他们可能是高级程序员或需要处理大量科研问题的理工科学生和研究者。在日常使用中,他们会自然而然地产生真实场景、真实任务下的高质量多轮提问,再得到模型的回答。这些提问及回答的数据按照一定方式筛选、处理后,可以作为发酵和扩增更多数据的源头。

这既考验团队的运营能力——是否知道高质量的用户在哪儿,以及如何触达;也考验构建这套系统的工程能力,比如能否让系统足够稳定;也需要一些生态能力,整个过程可能需要与第三方公司或机构合作。

二是团队自己来构造高质量题目和任务的能力。这需要对任务、对数据,对当前领先模型的性能边界有深入的理解。它和大模型训练本身所需的一些能力是重合的。

三是怎么用好数据。这需要建立一套数据管线——任务分布是否合理、怎么采样、筛选、过滤、去重、扩增、纠错,怎么定形式和配比。这套管线有一些可衡量的优化指标,比如从获得的原始数据中,最后有多少比例的数据能被用到后训练;扩增的效率和质量如何等。数据管线的质量既影响效果,也影响效率和成本。

持续做蒸馏也非常昂贵。关于业内公司今年在蒸馏上的花费和预算,有一些流传的说法,分布在上 1 亿美元到 10 亿美元不等。

一位 AI 领域投资人说:蒸馏不是一个简单的按钮,不是你点一下,模型性能就会突飞猛进。其中还有大量实现问题。蒸馏也需要计算投入回报比。

蒸馏是一个模型团队的壁垒吗?

那么,实现起来相对复杂的大规模蒸馏,能否成为一个模型研发团队的壁垒?

我们接触的多数从业者,不管他们来自传闻中做了蒸馏的公司,还是不做蒸馏的公司,想法都比较一致:对第一梯队的公司来说,蒸馏不构成长期壁垒。

像大模型的诸多技术一样,蒸馏的思路和实践会逐渐扩散。人员流动、开源分享、会议交流、想寻找更多客户的第三方服务方……AI 圈的人和信息时常流动。我们反复从研究员口中听到那句相似的感叹:大模型领域没有真正的秘密。

技术方法本身能带来的竞争优势,大部分是先发优势,先做的人会有更多经验,但它不是网络效应那样不可逾越、胜者通吃的强壁垒。

大模型领域,真正被认为有较强竞争壁垒的现象是 “数据飞轮”:如果某一个公司的模型足够强,能触达大量用户用它做高难度任务,它就会获得更多高质量数据回流,而且这些数据是独特的、非公开的、其它人没有的;这些数据经过一定的处理,又可以被用来帮助训练更强的模型,再吸引更多用户处理更难的任务。

在这个飞轮逻辑里,直接接触用户的应用有很大价值。比如根据用户协议和权限设置,Cursor、Devin、Manus 等应用可能可以获得比它们调用的模型更完整的数据和用户行为。

昨日(8 月 12 日)Grok 4.6 发布后,马斯克在回复 Devin 已接入 Grok 4.6 的推文时说:“Grok 4.7 会超越所有现在的模型。”“SpaceX 的训练语料库(training corpus)太棒、太独特了。”600 亿收购 Cursor,看来很值得。

不过数据飞轮也有自己的争议:模型和应用公司能获得数据,但能否用这些数据来训练?越难的任务、越高价值的场景,客户和用户是否会越倾向于自己掌握这些数据?同时,当模型的用户数量继续扩大,用户类型和场景会更加多元化,沙里淘金是否还值得?

有从业者认为:在一些偏生活助手和娱乐休闲的 AI 应用中,用户产生的绝大部分数据对训练更强的模型而言都是垃圾。

那条内心的评判线:黑盒还是白盒

关于蒸馏,最有意思的一个现象是:所有人都不愿意公开谈论它,但是多数我们接触的从业者,也并不从心底认为这是一个十分可耻的、违背他们技术信念的做法。

这条内心评判的分界线在于黑盒与白盒。

目前对闭源模型展开的蒸馏都是黑盒蒸馏,它获得的的数据,都是这些模型发布后在使用中产生的数据,是这个模型作为产品的产物。

那么其它公司为何不能作为用户去向这个模型提问,获得回答呢?何况,为了这些问题和回答,大家也付出了真金白银(当然,实践中会通过各种方式 “薅羊毛”,压低成本)。

这里面更有争议的部分是推理轨迹,大部分模型隐藏了完整的推理轨迹,蒸馏方需要通过一些技术手段去推测和还原。但推理轨迹仍是模型使用阶段的产物。

Anthropic、Google、OpenAI 会说:我的用户协议明确规定了,其他竞争对手不能为了训练和提升自己的模型来使用我的模型。

可是,是谁被《纽约时报》起诉,指控其未经许可,复制并使用了这家报纸历经 170 多年,由数代记者、评论员和作者积累的新闻档案库?是 OpenAI。

是谁从盗版平台下载了海量图书,不愿为其中任何一本付费,被数位美国作家集体诉讼,刚刚达成 15 亿美元的和解?是 Anthropic。

甚至一些美国 AI 从业者都认为 Anthropic 等公司十分双标。这有点像诺兰新片《奥德赛》中的情境:你把木马送进了特洛伊城,你的故乡如今也被海上来者侵袭。

大规模蒸馏,是新技术发展之后出现的新议题。很难因为几个公司说这违反了自己的用户协议,就让其他多数人心服口服地接受这是一个不可取、不道德,甚至可耻、邪恶的行为。

而且违反用户协议并不等于构成法律上的侵权,这还涉及其他法律规定和司法管辖权等问题。

最为广义的蒸馏,也就是使用数据来提升模型,已经变得无处不在。

一个广为传播的验证蒸馏的方式其实是无效的:当你问一个模型 “你是谁”?如果 A 模型说自己是 B 模型,这并不是 A 蒸馏了 B 的铁证。在预训练阶段,大家都会使用大量公开互联网数据,而其中已有很多是各模型自己生成的数据。

今年 7 月,英伟达创始人黄仁勋在接受 Axios 采访时被问及蒸馏,他说:“(广义的)蒸馏,向 AI 学习、向其他知识来源学习,这是智能的基本原理。”

对多数模型公司来说,包括一些美国模型公司,蒸馏的油门已经踩下,少有人会在短时间内主动放弃蒸馏。

为什么张一鸣选择不蒸馏

大多数公司不愿意公开谈论蒸馏,字节是一个例外。

在约半个月前(7 月底)的最近一次 Seed 全员会上,

字节创始人张一鸣明确说

:他反对蒸馏。

字节在蒸馏上经历过调整。2023 年底,字节是中国主要大模型厂商中,第一个被 OpenAI 指出,疑似不合规地使用 GPT 模型的输出来提升自己模型的公司。当时还没有大规模蒸馏。OpenAI 自己也说,字节对其 API 的使用量很小(minimal)。

字节后来回应,GPT 生成的数据曾被用于模型标注和评估,但相关数据已在 2023 年年中被从训练集里删除。

据《晚点》了解,这之后两年多里,包括蒸馏规模快速扩大的整个 2025 年,字节 Seed 没有蒸馏领先的闭源模型,而是通过其他方式获得数据,比如高薪聘请数学、计算机等理工科竞赛的获奖选手来构造和标注数据。

同期,TikTok 在美国的业务争议尚未解决。直到 2026 年 1 月底,TikTok 美国业务重组交易正式完成。

到 2026 年春节前后,Seed 一度经历摇摆。当时 OpenClaw 风行、Anthropic 收入激增,GLM-5 等中国开源模型用量大涨,编程能力提升的量变已引起质变,而字节的模型在编程能力上相对落后。

经过一段时间的抉择后,从张一鸣在 Seed 全员会的发言看,字节已经做出了选择,不蒸馏外部的领先模型。

据《晚点》独家报道,张一鸣在全员会上的观点是:

蒸馏能在短期内改善模型表现,但本质上仍是在复制 Claude 已有的能力。沿着这条路走,最多只能不断逼近对方,很难真正实现超越。

他也希望 Seed 可以从更底层的维度去构建自己在 AGI 上的壁垒。

即使不蒸馏意味着公司在技术上会短暂落后国内竞争对手,也不会采用这一捷径来推进字节的模型能力。

这引出对蒸馏的另一个讨论:蒸馏真的不能超越教师模型吗?

我们也问了多位从业者这个问题,回答比较相似:技术上并非不可能,但有潜在的组织隐患。

蒸馏有一些内在的技术问题,比如它可能使学生模型学到教师模型的一些错误、偏见、拒答习惯和表达模式。

但蒸馏只是模型训练的环节之一,完整的模型训练过程还有很多可以改进的环节:预训练数据、架构、算法、 Infra……多个优化累加,是否有可能让一个学生模型好于某个教师模型?

一些研究已显示,在某些具体任务上,学生模型可以超越教师模型。如 2024 年 12 月,微软发布 140 亿参数的 Phi-4,它的大量训练数据是 GPT-4o 等教师模型合成的。Phi-4 在两个 benchmark 上超过了 GPT-4o:

GPQA(研究生和博士级别的科学知识与推理能力):Phi-4 为 56.1%,GPT-4o 为 50.6%;

MATH(数学解题和推理能力):Phi-4 为 80.4%,GPT-4o 为 74.6%。

比较特别的是,作为一个小参数模型,Phi-4 也直接把教师模型生成的数据用到了预训练中,而真正训练数 T 参数的超大规模模型时,需要庞大数据的预训练环节很难用上蒸馏得来的数据,相比直接处理各种网页、代码、书籍,逐条调取教师模型生成数据缓慢而昂贵。

不过这也带来一个设想:当模型推理速度大幅提升、价格大幅降低时,蒸馏或者说借助更强模型构造的数据是否也可以更多进入预训练?

同时,多教师蒸馏等思路是否也可以用来让模型变强?理论上,一个学生模型可以同时学习 Claude 和 GPT 等不同的最强模型。这可能会带来一些新的技术问题,比如蒸馏不同的基座模型,可能会导致训练不稳定和不同能力之间的相互干扰。

更激进的一些想象还包括:那些最领先的公司能否通过自己蒸馏自己的模型,实现 “左脚踩右脚” 的原地飞升?

纯粹从研究视角看,“一个使用了蒸馏方法的模型能否超越教师模型” 至少是一个有待验证和探索的课题。

而张一鸣和字节用行动给出了他们的答案,他认为无法超越。

这可能和多位从业者提及的组织隐患有关。蒸馏是一种相对经济且见效快的方式。一个运动员当然可以既嗑兴奋剂,又勤于训练。但这在现实中往往难以两全,因为会侥幸,有惰性。

当一个团队一个阶段内的注意力和资源重心比较大比例地放在蒸馏上之后,那些探索更不确定、更长期方向的项目和个体可能得不到足够的资源和认可。

字节在下注:掌握不依赖外部对手的数据能力,能构建更稳健和长期的模型技术优势。

从今年 6 月起,据《智能涌现》报道,字节开始重组数据团队,成立了与 Seed 和 Flow 平行的一级 AI 部门 “AI 数据与安全”。

前文也已提到,多数人不认为蒸馏这套方法构成长期壁垒。大模型领域真正有可能形成强壁垒的是数据飞轮。

数据也已成为一个高价值的独立环节。如美国公司 Mercor,主要业务就是帮大模型公司找科学家、各学科博士等专业人士做数据构造、标注和模型评估任务。据报道,今年 7 月,Mercor 正在以 200 亿美元估值寻求新一轮融资。

在中国,也有以数据构造为起点的公司,估值已来到 30 亿美元。

在我们关于 “字节不做蒸馏” 的那条独家报道之下有这样一条留言:他(张一鸣)可能不是最懂技术的,但大概率是最懂人性的。

没人能轻易踩下刹车

当别人指责你犯错时,你回敬 “你不也曾这样吗?” 并不解决矛盾。

此时此刻,开源模型在性能上越发逼近最领先的闭源模型。而且客观事实是,最强的开源模型来自中国,最强的闭源模型来自美国。

此前,智谱已在 2025 年 1 月被美国商务部列入实体清单。同年底生效的《2026 财年情报授权法》则要求从美国情报系统、国家安全系统和相关供应商中移除 DeepSeek。

到今年 4 月,美国众议院国土安全委员会和美中战略竞争特别委员会开始调查美国企业使用中国模型的情况,问 Cursor 为何要把 Kimi K2.5 当做 Composer 的底座,问 Airbnb 为何要在客服业务中使用阿里 Qwen。

7 月 16 日 Kimi K3 发布后,据报道,美国政府正考虑限制乃至禁止部分中国开源模型。7 月 24 日,微软、英伟达、Meta、Fireworks AI 等 77 家公司和机构陆续联名签署公开信《开放权重与美国 AI 领导力》,反对仓促限制开源模型。

黄仁勋在 Twitter 的第一条推文就是分享这封公开信。

最近几个月的新限制手段仍在讨论中,尚未落地。

Anthropic、OpenAI 和 Google 等公司也正采取更严苛的技术手段识别和封禁疑似用于蒸馏的账号。比如 Anthropic 称,它已经建立了识别蒸馏流量的分类器和行为指纹系统,可以发现跨账号协同、重复提问以及套取思维链的行为;同时会加强对教育、研究和创业公司账号的身份验证。

前文提到的图宾根大学的 “stealing reasoning tracks” 研究中还原推理轨迹的方式,已被这个研究团队报告给相关闭源模型公司,在他们上传文章时,其中的部分方法已失效。

参与其中的各方都在做出自己的选择和准备,而接下来的变化会改变从算力、云服务、Infra、再到模型、应用和客户部署的整个产业链条。

风暴还在继续,下一个风眼不一定还是蒸馏,它本身也只是优化模型的方法之一。

这么多公司投入这么多资源,如此争先恐后地投入这场智能竞赛,是为了什么?今年上半年,是编程和 Agent 的爆发式增长,扭转了市场预期。再往后,如果大模型应用扩散的规模与速度无法接续,那么,模型研发竞赛的未来会如何波动?这是另一些人已经在关心的问题。

← 返回目录

← 返回目录
深读 · 03

V 型反转逼近 4000 点,资金在算力与粮食之间做选择

8 月 18 日 A 股复盘综合述评

河马观澜综合(央广网、连板网等) · 河马观澜 · 2026-08-18 · 约 6 分钟 · 原文链接

导读与要点(建议先读原文)
  • 大盘:上证指数收报 3990.30 点,微涨 0.19%,盘中 V 型反转;两市成交约 2.4 万亿元,较前一日放量约 133 亿。
  • 结构:主力资金净流出约 669 亿元,超 3200 只个股下跌——指数与赚钱效应背离,典型的权重护盘、个股分化。
  • 主线切换:种植业板块大涨 9.5%(超强厄尔尼诺预期催化粮食安全主题);信创午后拉升;算力租赁等前期热门方向调整。
  • 情绪指标:涨停 79 家,连板晋级率降至 13% 左右,短线情绪处于降温期,追高胜率下降。
  • 时间背景:8 月下旬进入中报密集披露期,市场定价锚正从题材叙事转向业绩验证。
  • 阅读方式:本文为公开市场信息的综合述评,所有数据以交易所和行情终端为准,不构成投资建议。

指数:3990 点的 V 型反转。 8 月 18 日,上证指数收报 3990.30 点,微涨 0.19%,盘中走出 V 型反转。两市成交约 2.4 万亿元,较前一日放量约 133 亿元。数字本身波澜不惊,但距离 4000 点整数关口只剩不到 10 个点——这是市场心理层面的重要位置,多空双方在关口前的拉锯正在加剧。

结构:指数平静,水面下分化剧烈。 主力资金全天净流出约 669 亿元;超 3200 只个股下跌,赚钱效应明显弱于指数表现;涨停 79 家,连板晋级率降至 13% 左右,短线情绪处于降温期。「指数红、个股绿」的组合,通常意味着权重股在护盘,而前期获利盘在借机兑现。晋级率降到 13% 说明连板接力的资金开始谨慎,追高模式的成功率显著下降。

主线:从算力到粮食的切换第一天。 前期领涨的算力租赁等 AI 基建方向出现调整。同一天,种植业板块大涨 9.5%——催化是超强厄尔尼诺预期,粮食安全主题成为新的资金出口;信创板块午后拉升,国产替代逻辑在科技内部轮动中接棒。

算力链的调整是单日休整还是阶段性见顶,目前无法判断;但「高位科技 + 低位主题」的跷跷板,是降温期市场的典型特征。本期深读 01(Benedict Evans 谈 token 定价)恰好提供了一个长周期视角:算力紧缺是真实的,但紧缺终将缓解,基建环节未必是价值最终的留存地。

接下来盯什么。 一,4000 点关口的攻防——整数关口叠加中报密集期,放量突破与冲高回落的信号意义完全不同。二,中报业绩验证——8 月下旬进入披露高峰,题材叙事让位于业绩定价,高位无业绩支撑的标的波动会加大。三,厄尔尼诺主线的持续性——农业股历史上持续性偏弱,观察成交能否连续放大。四,情绪指标修复——晋级率何时回到 30% 以上,是短线情绪回暖的先行信号。

(本文基于公开市场信息综合整理,数据以交易所及行情终端为准;仅为信息转述与复盘,不构成任何投资建议。)

← 返回目录