河马的CC商业实战 · 出品

河马观澜

今 日 深 读

01

聊天机器人的黄昏

The twilight of the chatbots

One Useful Thing · Ethan Mollick · 中英对照 · 约 12 分钟

沃顿教授 Mollick 的判断:聊天机器人时代正在落幕,工作正变成「管理 AI」。他用 OpenAI 内部研究和 Claude Code 用户数据说明:未来拉开差距的不是会不会写提示词,而是你的专业深度。全文翻译。

开始阅读 →

02

DeepSeek 涨价背后:中国正在把「智能」变成一种工业品

DeepSeek涨价背后:中国正在把“智能”变成一种工业品

虎嗅 · AI资本观 · 林见 · 中文 · 约 16 分钟

达拉斯一位开发者每月 700 美元的 AI 账单:干活最多的中国模型拿走不到三成。本文用 OpenRouter、Vercel、OECD、RAND 六组数据讲清楚一件事——中国模型赢得了使用,还没赢得账本。证据分级严谨,难得的硬核商业分析。

开始阅读 →

03

黑色星期三:沪指长阴失守 3900 点,超 5000 只个股下跌

8 月 19 日 A 股复盘综合述评

河马观澜综合(新浪财经、连板网等) · 河马观澜 · 中文 · 约 7 分钟

前一天还在聊 4000 点攻防,24 小时后沪指长阴失守 3900、超 5000 只个股下跌。隔夜美股暴跌引爆亚洲「黑色星期三」,AI 硬件链成为重灾区——恰好给本期前两篇深读提供了一个即时的市场注脚。

开始阅读 →

快 览

  1. 宇树科技上市首日收涨 460%(Tech Startups)—— 人形机器人第一股开盘一度涨 629%,收报 845 元、市值 3418 亿;同一天机器人板块集体回调,典型的新股抽血效应。
  2. OpenAI 自曝 Astra 模型触及「关键」网络安全能力级别(AI 要闻汇整)—— 已暂停部分相关工作;同批披露的另一条更惊艳:用约 2000 美元算力解出 10 道长期未解的数学难题,全部经 Lean 4 形式化验证。
  3. OpenAI 预览「零留存」安全监控 Private Safety Processing(Tech Startups)—— 在保住 API 零数据留存承诺的前提下识别滥用模式,背景是此前 Hugging Face 的模型沙箱逃逸事件。
  4. 英伟达 H200 开始到货中国(Tech Startups)—— 对华高端算力供应恢复的最新节点,恰逢国产算力链调整期。
  5. 英伟达洽谈入股数据标注公司 Mercor,估值约 200 亿美元(AI News Today)—— 昨天深读《蒸馏风暴》里刚出现过它:帮大模型公司找博士做数据构造,7 月还在融 200 亿估值的资。「卖数据」正在成为 AI 链上最贵的环节之一。
  6. 长江存储完成 IPO 辅导验收(财新)—— 国产存储龙头上市临近,估值预期拉高,半导体国产化又多一个可投标的。
  7. ChatGPT for Teens 全球上线(AI Insights)—— 年龄预测系统自动把疑似未成年用户分流到受限版本,禁恋爱角色扮演与自残话题,附家长「安静时段」控制。
← 返回目录
深读 · 01

聊天机器人的黄昏

The twilight of the chatbots

One Useful Thing · Ethan Mollick · 2026-06-30 · 约 12 分钟 · 原文链接

导读与要点(建议先读原文)
  • 能力曲线:METR、英国 AI 安全研究院、GDPval 等评估显示,AI 单次可完成的人类工作量正以超指数速度增长;Epoch 实测 Opus 4.7 独立工作 14 小时,完成人类工程师 2-17 周的软件包,token 成本仅 251 美元。
  • 双层格局:前沿模型属美国三家(Anthropic、OpenAI、Google);准前沿全是中国开放权重模型,落后 6-12 个月但运行便宜,也在自己的指数曲线上爬升。
  • 跑分会骗人:抽象图表掩盖了前沿的参差;模型在设计、风格乃至「判断力」上的差异难以基准化,任务越长,这些因素越重要。
  • 用法之变:从「协同智能」(人陪聊、逐步引导)转向「派活给智能体」;OpenAI 内部四分之一员工每周同时运行至少四个智能体,法务、HR 的采用率与程序员几乎相同。
  • 关键变量是专业积累而非职业:用 Claude Code 做编程任务,软件工程师的成功率与其他职业相当;领域经验越深,每个提示词换来的有用产出越多——用好智能体的最佳方式是把自己当管理者。
  • 为什么感觉在「跳变」:身处指数曲线内部,稳定的翻倍被体验为一连串冲击;制度以人和委员会的速度去追赶非人的能力曲线,这种动荡不会停止。批判性阅读:作者新书《Co-Existence》同题,论述天然偏向「变革已至」的立场。
If you feel like things are accelerating in AI, you are probably right. Better AI models from the leading American AI labs have been releasing more quickly than ever (though government interventions stopped access temporarily to two of the most powerful models, Claude Fable and GPT-5.6).
如果你觉得 AI 的进展在加速,你的感觉大概率是对的。美国头部 AI 实验室发布更强模型的节奏比以往任何时候都快(不过政府的干预曾暂时叫停了两个最强模型的访问——Claude Fable 和 GPT-5.6)。
But it isn't just release timing. The evidence points to accelerating capability gains as well (though the frontier stays jagged, and AIs remain weak in many places). This is especially obvious when we look at the ability of AIs to do real work. There are a few good assessments that try to measure how much human work AIs can do. Two of the most famous, from METR and the UK's official government AI Security Institute, estimate the amount of human programmer hours' worth of effort the AI can do with a single prompt. GDPval compares human experts in many fields to AI performance using professional judges. They are all increasing at a better than exponential rate.
但这不只是发布节奏的问题。证据表明,能力提升本身也在加速(尽管前沿依旧是参差的,AI 在很多方面仍然薄弱)。这一点在观察 AI 完成真实工作的能力时尤其明显。有几个不错的评估在尝试衡量 AI 能完成多少人类工作:最著名的两个——来自 METR 和英国官方的 AI 安全研究院(AI Security Institute)——估算的是 AI 用单个提示词能完成相当于人类程序员多少小时的工作量;GDPval 则用专业评审把各领域人类专家与 AI 的表现进行对比。这些指标全都在以超过指数级的速度增长。
Another organization doing similar experiments, Epoch, recently found Opus 4.7, working on its own for 14 hours, was able to build a software package that would take 2-17 weeks of human engineering work (it cost $251 in tokens). Again, AI systems cannot pass every test, nor are they always cheap to run, but they are definitely improving at a very rapid rate. In my own experiments, I found Fable was able to work autonomously for 9 hours to execute on very complex software projects that would have taken a team well over a week to do.
另一家做类似实验的机构 Epoch 最近发现:Opus 4.7 独立工作 14 小时,搭建出了一个需要人类工程师 2 到 17 周才能完成的软件包(token 成本 251 美元)。再说一次,AI 系统并不能通过所有测试,运行成本也不总是便宜,但它们确实在以极快的速度进步。在我自己的实验里,Fable 可以自主工作 9 个小时,执行那种需要一个团队花一周多才能完成的复杂软件项目。
So far, I have focused on the frontier models, those with the highest "intelligence." They are made by three American companies — Anthropic, OpenAI, and Google (though it has been a while since Google has released a new model). But there is a second set of near-frontier AI models that typically lag 6-12 months behind the frontier, all of which are from China. These are open weights models, which means that anyone can use or modify them after release (as opposed to the frontier models which are proprietary). That makes them quite cheap to operate. They, too, are climbing up an exponential improvement curve, though lagging the American closed models. You can see this in my graph of AI performance in a test called AA-Briefcase, which simulates a complex multi-week consulting engagement where AI has to do many kinds of analysis. The open-weights Chinese models (other countries produce open weights models, but none are near the frontier) are on their own exponential curve, behind closed US models.
到目前为止,我关注的都是前沿模型,也就是"智能"最高的那一批。它们由三家美国公司制造——Anthropic、OpenAI 和 Google(虽然 Google 已经有一阵子没发新模型了)。但还有第二组"准前沿"模型,通常落后前沿 6 到 12 个月,全部来自中国。这些是开放权重模型,发布后任何人都可以使用或修改(前沿模型则是专有的),因此运行成本相当低。它们也在沿自己的指数曲线爬升,只是落后于美国的闭源模型。在我那张 AA-Briefcase 测试的 AI 表现图里能清楚地看到这一点——这个测试模拟一个复杂的多周咨询项目,AI 需要完成多种分析。开放权重的中国模型(其他国家也有开放权重模型,但没有一个接近前沿)走在自己的指数曲线上,跟在美国闭源模型身后。
But abstract graphs only get you so far, and they can hide how jagged the frontier is (and also the fact that the open weights models, while very impressive, do not always perform as well as their benchmarks would indicate). To get real insight, you need to try using AI for different use cases and rigorously assess how good they are in the areas that matter to you. As a fun example, I created a test where AIs have to build an interactive simulation of a harbor evolving over time. You can play with all the result here. I think it gives an interesting perspective on how much models can differ from each other in areas like design, stylistic approach, and even judgement. As systems do ever longer tasks, these hard-to-benchmark factors become more important.
但抽象的图表能告诉你的有限,它会掩盖前沿究竟有多参差(也会掩盖一个事实:开放权重模型虽然令人印象深刻,实际表现并不总像跑分显示的那么好)。要获得真正的洞察,你得在不同用例里实际使用 AI,并严格评估它在你关心的领域里到底行不行。一个好玩的例子:我设计了一个测试,让各家 AI 构建一个港口随时间演变的交互模拟,你可以在网上把玩所有结果。它提供了一个有趣的视角,让你看到模型之间在设计、风格手法乃至判断力上的差异可以有多大。随着系统执行的任务越来越长,这些难以用基准测试衡量的因素正变得越来越重要。

我们使用 AI 的方式正在改变The way we use AI is changing

As AIs can do longer and longer tasks, the way people are using AI is changing. Until recently, the dominant way to use AI was as a co-intelligence. You would ask the AI to do something, check the results, and then ask for it to do the next step of your job. By careful prompting and human attention, you could guide AIs to do complex and long-term tasks.
随着 AI 能完成的任务越来越长,人们使用 AI 的方式正在改变。直到不久前,主流用法还是把 AI 当作"协同智能"(co-intelligence):你让 AI 做一件事,检查结果,再让它做下一步。通过精心设计的提示词和持续的人工关注,你可以引导 AI 完成复杂而长期的任务。
This approach to using AI is still common and useful, but, increasingly, it is not the way AI is being used for valuable work. Long-running, smart, and self-correcting AI systems do not need constant human intervention, and they require a different way of working (this is also the subject of my upcoming book, Co-Existence, which you might want to pre-order here). And, as opposed to chatbots, agents come with extra machinery: harnesses that give the AI access to tools and an environment to act in, and apps built for agents like Claude Code or OpenAI's Codex. As a result, the already increasing ability of AI models can be improved still further by a good harness or app.
这种用法依然常见且有用,但越来越多地,它已经不是 AI 完成高价值工作的方式了。能长时间运行、足够聪明、会自我纠错的 AI 系统不需要人类持续介入,它们要求一种不同的工作方式(这也是我即将出版的新书《Co-Existence》的主题)。而且与聊天机器人不同,智能体(agent)还带着额外的装备:让 AI 能调用工具、在环境中行动的"脚手架"(harness),以及为智能体打造的应用,比如 Claude Code 或 OpenAI 的 Codex。结果是,本就在增长的模型能力,还能被好的脚手架和应用进一步放大。
So work is increasingly about assigning work to agents, rather than working together with chatbots. A joint study by OpenAI and academic economists shows how quickly this is happening inside their own organization. Critically, it isn't just coders who are using agents. Legal, HR, and other non-tech functions have adopted agents at nearly the same rate. OpenAI may be a sort of canary in the coal mine for what will happen elsewhere in work.
于是,工作越来越变成"把任务派给智能体",而不是"和聊天机器人一起干活"。OpenAI 与学术界经济学家的一项联合研究展示了这种转变在他们自己组织内部发生得有多快。关键在于,用智能体的不只是程序员——法务、人力资源等非技术职能部门采用智能体的速度几乎一样快。OpenAI 或许是矿井里的金丝雀,预示着其他地方的职场即将发生什么。
Increasingly, work at OpenAI looks like managing AI. A quarter of OpenAI workers have at least four agents running at one time every week. And, as coding is done by AIs in specialized harnesses and apps, other roles start to become coders of a sort. And they are good at it. A separate study of Claude Code users found that software engineers had a similar success rate to other professions when actually using Claude code on coding tasks.
在 OpenAI,工作越来越像"管理 AI":四分之一的员工每周同时运行至少四个智能体。而且,当编程由 AI 在专门的脚手架和应用里完成后,其他岗位也开始变成某种意义上的"程序员",而且他们干得不错。另一项针对 Claude Code 用户的研究发现,在实际用 Claude Code 完成编程任务时,软件工程师的成功率与其他职业的人差不多。
What actually mattered was not the profession of the user, but their expertise. The more domain experience someone had, the more successful they were in using Claude Code in that domain. And, even more interestingly, the more useful output they got from Claude from each prompt. We are moving from a world where non-experts use chatbots to fill in gaps to one in which experts use agents to get work done. And the best way to use agents is to think of yourself as a manager.
真正重要的不是用户的职业,而是他们的专业积累。一个人在某个领域的经验越深,用 Claude Code 处理该领域任务的成功率就越高;更有意思的是,每个提示词换来的有用产出也越多。我们正在从一个"非专家用聊天机器人填补短板"的世界,走向一个"专家用智能体完成工作"的世界。而用好智能体的最佳方式,是把自己当成一名管理者。

一个历史时刻A moment in time

Being on an exponential means each change over a fixed window is larger than the one before it. If your organization wrote an AI plan any time before the winter of 2025, it described a system that could do a couple of hours of work with a fairly high error rate. A few months later, you can get sixteen hours or more of work from a single prompt. This is why AI keeps feeling like it is making leaps, even though it is a curve on a graph, we keep experiencing a steady doubling of capability as a series of shocks. We are very bad at feeling exponentials from the inside, and we are currently inside one.
身处指数曲线之上,意味着每个固定窗口里的变化都比上一个更大。如果你的组织在 2025 年冬天之前的任何时候写过一份 AI 规划,它描述的系统大概只能以相当高的错误率完成几个小时的工作;几个月之后,一个提示词就能换来十六个小时甚至更久的工作量。这就是为什么 AI 总让人感觉在"跳变"——尽管它只是图表上的一条曲线,我们却把稳定的能力翻倍体验成一连串冲击。身处指数曲线内部的人非常不擅长感知它,而我们现在就在这样一条曲线里面。
I think this also explains the turbulence around AI better than the usual stories about hype. AI is not capable of being a real cybersecurity threat until suddenly it is, causing sudden and improvised policy changes at the highest level of government. Markets discount whether AI might threaten to undermine a business model until suddenly it can, leading to massive swings in stocks. These lurches these get read as signs of an immature field that will eventually settle into something stable. I don't think it is going to settle anytime soon. The instability is what happens when institutions that move at the speed of people (or worse, committees) try to track a capability curve that is very much not human in nature. And as long as we are on some sort of exponential, and for as long as it lasts, the gap only widens.
我认为,比起常见的"炒作"叙事,这更好地解释了围绕 AI 的种种动荡。AI 原本够不上真正的网络安全威胁,直到突然之间它就具备了这种能力,引发最高层政府仓促而临时性的政策变动;市场原本不把 AI 颠覆某种商业模式的可能性计入价格,直到突然之间必须计入,于是股价剧烈波动。这些颠簸被解读为一个不成熟领域终将稳定下来的征兆,但我不认为它短期内会稳定。这种不稳定,是行动速度以人(甚至更糟,以委员会)为单位的制度,试图追赶一条本质上非人的能力曲线时必然发生的事。只要我们还在某条指数曲线上,只要这条曲线还在延续,这个鸿沟就只会越拉越大。

← 返回目录

← 返回目录
深读 · 02

DeepSeek 涨价背后:中国正在把「智能」变成一种工业品

DeepSeek涨价背后:中国正在把“智能”变成一种工业品

虎嗅 · AI资本观 · 林见 · 2026-08-17 · 约 16 分钟 · 原文链接

导读与要点(建议先读原文)
  • 引爆点:8 月 17 日 DeepSeek V4 全系峰谷新价生效,V4 Pro 输出每百万 token 从 6 元升至高峰 27 元——IPO 前夜的一次定价权实验:价格不再只向下走,开发者还会不会留下。
  • 使用与付钱的背离:OpenRouter 样本里中国模型 token 份额已超美国;Vercel 6 月数据里,开放权重模型处理 29% 的 token 却只对应不到 4% 的支出,Anthropic 以 32% 的 token 拿走 61% 的支出。
  • 杰文斯悖论:Agentic 类请求单次消耗 token 约为人类对话的 15 倍;低价没有把高价模型赶走,反而先扩大了机器劳动的整个市场规模。
  • 原厂失位问题:开放权重经 AWS Bedrock、路由平台、企业自部署到达用户,原厂未必拿到合同、数据和追加销售——对照 IBM 以 340 亿美元收购 Red Hat:买的不是代码,是围绕开放软件建立的企业关系。
  • 四种商业实验:MiniMax 海外收入占 73% 但毛利率仅 25.4%、经调整净亏 2.5 亿美元;阿里让模型为云和应用引流(AI 相关收入年化超 358 亿元);Kimi 主攻第一方 API(传年化收入超 3 亿美元、七成来自 API);DeepSeek 开始测试涨价。
  • 反例与结论:视频模型里字节 Seedance 以 34% 的生成量拿走 49% 的支出——能卖什么价由能力差异和可替代性决定,不由国籍决定;「把智能做便宜」与「把模型公司做值钱」是两件不同的事。

导读:

今天(8月17日)零点,DeepSeek V4全系列新的峰谷价格正式生效。

过去一年多,中国模型不断压低前沿智能的价格,也把自己送进了全球开发者的工作流:在OpenRouter样本中,中国模型的Token份额已经超过美国;在Vercel,开放权重模型处理29%的Token,却只对应不到4%的支出。涨价因此不只是一张价格表的变化,更是一场定价权实验。

中国正在把智能变成可规模采购的工业品,下一道更难的问题是:做了更多工作之后,能否把客户、利润和公司价值也留下来?

每个月,住在美国达拉斯的开发者Ruben Garcia Jr.,要为一支看不见的“AI团队”支付大约700美元。

据Rest of World今年6月的报道,其中500美元付给Claude和ChatGPT,负责最复杂的规划和复核;另外200美元付给MiniMax、Kimi和小米MiMo,承担编码、语音识别等大约90%的任务。

这张账单里,没有哪个模型包办一切。它们像一个临时组成的项目组:有的处理大量日常工作,有的只在关键时刻出场。干活最多的中国模型,只拿走不到三成预算;负责少数难题的美国模型,拿走七成多。

一张私人账单当然不能代表市场。但过去一年半,越来越多平台数据开始拼出相似的画面。

2025年1月20日,DeepSeek R1正式发布。那时,世界还在集中试用中国模型;到了2026年夏天,它们已经稳定出现在开发者的日常账单里。

数据平台Our World in Data分析模型聚合平台OpenRouter的日度Top 50发现,从2025年1月到2026年5月,中国模型条目由5个增至20个。OpenRouter对今年1月1日至6月14日超过450万亿Token的请求日志分析则显示,到6月初,中国模型的Token份额已经超过美国模型。

这仍然只是OpenRouter这一聚合平台里的Token量,不等于能力、收入或全球市场份额,但趋势足够明显。

另一家美国开发者云平台Vercel,看到的是已经进入应用生产环境的一部分调用。它的AI Gateway位于应用与模型提供商之间,每月路由数十万亿Token。这不是公开跑分,而是开发团队已经交给模型执行的工作。

截至8月15日,Vercel最新一期生产指数统计的是2026年6月:开放权重模型处理了29%的Token,却只对应不到4%的支出;四家美国头部模型公司拿走95%的支出。

Anthropic最为极端——32%的Token,对应61%的支出;在编码Agent、后台Agent和应用生成等出错代价更高的场景里,它拿到的支出份额都不低于72%。

这里的“支出”按公开牌价估算,不是模型公司的审计收入。但它与Garcia的私人账单指向同一件事:中国模型正在做更多工作,美国模型仍在拿走更多钱。

今天(8月17日)零点,DeepSeek V4全系列新的峰谷价格正式生效。四天前,V4 Pro正式版上线时,公司已经预告了这次调价。以V4 Pro输出为例,每百万Token从6元升至闲时13.5元、高峰27元。

过去一年多,DeepSeek让全行业重新解释模型为什么可以这么便宜;在即将IPO的当下,它开始测试另一件事:价格不再只向下走,开发者还会不会留下。

到了2026年夏天,几条分散的线索汇到一起:一张美国开发者的私人账单、两个平台持续数月的调用数据,以及DeepSeek一次刚刚生效的向上调价。

它们共同抛出一个比榜单更难的问题:

中国模型已经证明世界愿意使用它们,接下来能不能把使用量变成定价权、客户和利润?

01中国模型,把智能推向工业化

1865年,英国经济学家威廉·斯坦利·杰文斯研究煤炭时,注意到一个反常现象:蒸汽机变得更节能,并没有让英国少烧煤。效率提高降低了使用蒸汽动力的成本,工厂、铁路和农业反而在更多地方采用它,煤的总消耗继续上升。

后来的人把这个机制称为“杰文斯悖论”。

它不保证在每个行业都成立,却为今天留下了一个好问题:当一种生产要素的单价大幅下降,人们只是少花钱完成原来的工作,还是会创造出过去根本买不起的新需求?

大模型正在把后一种可能变成现实。价格下降,不只让同一轮对话便宜几分钱,还让过去根本不值得购买的机器工作变得经济。

OpenRouter根据工具调用率、对话轮次和时间间隔等信号,按API key的主导用途把流量分成人类对话、混合使用和Agentic三类,而不是逐条判断请求。在这套分类下,Agentic类的单次请求平均消耗Token约为人类对话类的15倍。

聊天机器人回答完一句话就可以停下;Agent还要拆任务、读资料、写代码、调用工具、检查结果,失败以后再重试。任务一旦连续运行,价格差就会决定它值不值得自动化。

美国Agent平台Lindy的创始人Flo Crivello今年把一部分工作从Anthropic转向DeepSeek。他的说法很直白:不是每封邮件都需要请“上帝”来写。Garcia则把中国模型放在大量执行环节,把最难的规划和复核留给Claude与ChatGPT。

这不是一张永久工位表,只是企业按2026年夏天的能力、价格和出错代价排出的班次——便宜模型处理大量中间步骤,昂贵模型守住少数关键环节。低价没有把高价模型立刻赶走,反而先扩大了整个机器劳动市场。

Vercel的6月数据正好记录了这个过程:平台Token量环比增长29%,支出也增长27%,平均Token价格大致持平。市场没有简单地从贵变便宜,它先长出了更多工作,再给不同工作分配不同价格。

这些新增的机器工作共同指向一种变化:

中国正在把智能变成一种工业品。

这里的“工业品”不是廉价品,更不是给中国模型安排一个永久的低端位置。它指的是一种能力开始稳定、规模化地进入生产。钢铁成为工业品以后,普通钢材和特种合金仍有不同价格;智能也会出现自己的基础原料和高价能力。

把一项原本只属于少数人的前沿技术,变成可以大规模采购和部署的生产投入,本身就是技术革命跨过的一道里程碑。中国模型在这一阶段的价值,不只是把价格打下来,而是把更多原本买不起的机器工作带进市场。

下一步,是把这种规模变成更难替换、也更值钱的位置。

02模型出了海,客户留在谁手里

但工业品一旦可以被更多人部署,新的问题也会出现:模型走到了世界各地,客户关系和账单却未必一起跟着原厂。

一辆中国电动车出口到欧洲,品牌、供应链和售后关系大体仍然可见。一个开放权重模型“出口”以后,路径要曲折得多。

权重可以被下载、微调和量化,运行在美国云、欧洲数据中心或客户自己的服务器上。最终用户可能每天都在使用Qwen或DeepSeek,却从未访问中国公司的官网,也没有向原厂开过账户。

Airbnb就是一个很有象征性的例子。美国国会议员曾调查它使用Qwen的情况。首席执行官Brian Chesky随后解释,Airbnb不是阿里的客户,也没有把用户数据交给中国公司。模型来自中国,运行环境、数据关系和企业合同却留在另一套技术栈里。

AWS的模型托管服务Amazon Bedrock已经提供DeepSeek、MiniMax、Kimi和Qwen等模型。AWS强调,客户数据不会分享给模型提供商。对企业采购部门,这是安全与便利;对模型公司,它意味着全球使用不一定自动变成第一方客户。

这不等于原厂一定没有收入:云市场可以另收软件费,合作协议也可能另有安排;更确定的是,调用者未必成为原厂的直接客户,使用数据也不会自动回流。

跟着一次调用走,钱可能直接进入中国模型公司的API账户;也可能先交给AWS、路由平台或推理服务商;如果企业下载权重自行部署,原厂甚至未必从这次使用中得到直接收入。谁签下合同、掌握使用数据、承诺服务稳定,谁就更接近下一次追加销售。

开源软件经历过类似的价值迁移。Linux几乎无处不在,IBM在2018年仍愿意用约340亿美元收购Red Hat;它买的不是一份谁都能下载的代码,而是围绕开放软件建立的企业关系。

但大模型不能机械照搬Linux。权重可以复制,推理仍要消耗GPU、电力、带宽和工程资源;每一次回答都有物理成本。原厂如果能把模型跑得更快、更稳、更便宜,开放完全可以成为获客方式,而不是放弃生意。

DeepSeek早在2024年就上线了磁盘上下文缓存。按公司披露,在高度重复的长提示词场景里,128K输入的首Token延迟可从13秒降到500毫秒,优化后成本最多节省90%。这不是第三方审计结论,却说明架构、缓存和调度可以直接改变一项API生意的成本。

今年5月,经济合作与发展组织(OECD)在一份面向G7的讨论报告中测算了企业自建推理的成本。

它发现,月用量不足1亿Token的小型场景,自建GPU没有清晰的经济优势;月用量约10亿Token,回本仍需约30个月;只有进入百亿级乃至500亿级Token,回本时间才可能缩短到两个月左右或一个月。

开放权重给了企业选择权,却没有免费送来一座高利用率的数据中心。

同一个模型,经不同服务商交付,也可能变成不同的生意。今年5月,模型API监测服务AI Ping团队发布了一篇预印本。

在2025年第四季度样本构造的两组场景里,换一种路由,可让Qwen3-32B成本下降37.8%,也可让DeepSeek-V3.2的平均吞吐量比直接调用官方接口提高约90%。样本不代表完整市场;它至少说明,原厂不一定最便宜,云厂商也不会天然最划算。

模型走得越远,原厂与客户之间站的人可能越多。

开放没有让商业消失,只是把竞争从一份权重拉长到整条服务链:推理效率、企业合同、数据边界、合规责任和客户关系,都开始决定最后的钱落在哪里。

03中国模型的四种商业实验,争同一张客户单

智能一旦走向工业化,商业问题就会落到具体公司身上。中国公司当然也意识到原厂失位问题,并做出不止一种答案。

当下,可以用MiniMax、阿里、Kimi和DeepSeek四家公司的典型探索来看得更清楚。

注意,OpenRouter当然装不下中国模型的全部商业选择。腾讯混元HY3、小米MiMo和智谱AI的GLM已留下明显使用量。百度、腾讯则更强调把模型嵌入搜索、微信生态、企业Agent和云服务,让能力、场景与收费入口尽量留在同一体系。榜单上的高低,不能替这些路径排座次。

选择以上四家公司,不是为了另排一张“中国前四”,而是它们刚好留下四类可读的公开账本:审计年报、集团财报与预测、管理层与媒体信源、使用和价格数据——它们代表四种仍在进行的商业实验。

MiniMax交出了目前最硬的一本账,也交出了一张昂贵的成本单。它的2025年年报经过审计:全年收入7903.8万美元,其中中国大陆以外收入5766.3万美元,占73%。对MiniMax而言,“海外”已经从排名变成了收入。

同一份年报还写着代价:毛利率25.4%,研发费用2.5277亿美元,经调整净亏损2.5086亿美元。MiniMax一边经营Talkie、海螺AI等应用,一边销售模型API和企业服务,试图自己握住用户和订阅;它也必须同时承担获客、内容、推理和下一轮训练。

阿里是四家公司中最有条件把模型扩散变成“别处收入”的一家。Qwen开放得越广,越可能为Model Studio和阿里云带来客户;模型调用越多,云和自研芯片越有机会收费;消费者在应用里完成的任务,还可以继续进入电商与其他服务。

截至2026年1月21日,Qwen系列在开源AI社区Hugging Face累计下载超过10亿。这个里程碑已经过去近七个月,也不是付费客户数;它说明模型已被大量写入代码、框架和工作流。

截至2026年3月31日的季度,AI相关产品收入占阿里云外部收入的30%,年化超过358亿元人民币,Model Studio客户数同比增长8倍。公司5月预计,AI模型与应用服务的年化经常性收入将在截至6月30日的季度突破100亿元,到年底超过300亿元。

这些数字属于阿里全栈AI与云业务,后两项还是公司预测,不能改写成Qwen海外收入。它们能证明的是:即使开放模型本身难以单独收费,阿里的云、芯片和应用仍有机会把价值接住。

Kimi走得最直接,也最容易接受商业验证:让海外开发者为第一方API付钱。月之暗面管理层称,Kimi进入200多个国家和地区,海外付费用户增长400%,API收入增长400%,但没有公开基数和完整期间。

《每日经济新闻》6月30日又援引接近公司的机构人士称,Kimi在本轮融资沟通中披露,6月中旬年化经常性收入超过3亿美元,其中API占七成以上。

这不是公司公告或审计数字,只能作为强信号。K3发布后,公司一度因算力容量暂停新增订阅,说明兴趣可以迅速变成真实负载;负载之后,还要看客户能留下多久,推理和获客之后剩下多少毛利。

最后是DeepSeek。四家公司中,它的反差也最大:

DeepSeek的商业账本最薄,全球影响却最醒目。

Vercel数据显示,它在6月占到22.6%的网关Token;OpenRouter对今年1月1日至6月14日的日志分析还显示,DeepSeek的份额从1月约9%升至截至6月14日约18%,V4发布后的增量主要来自Agentic类Token。两组数据都能证明使用,仍然不能说明有多少收入回到DeepSeek。

7月,彭博与路透社先后援引知情人士称,DeepSeek已开始为潜在的境内IPO做准备,最快可能在今年递交申请;公司没有公开确认。若它真的走向公开市场,全球影响力最终要接受账本检验。

在这样的节点,今天凌晨生效的V4涨价,比又一张能力榜更接近它的商业答案。

很多DeepSeek调用由第三方托管,品牌、工作量和公司收入之间隔着分发网络。V4价格上升以后,官方API能留住多少调用,第三方托管渠道是否继续扩张,会让人看见定价权究竟属于模型,还是属于模型与客户之间的服务商。

四家公司面对的是同一道题:MiniMax让海外收入进入审计报表,阿里让模型为云和应用引流,Kimi争取第一方API,DeepSeek开始测试价格。

它们已经解决“世界愿不愿意用”,还没有共同解决“使用最终值多少钱”。

持续向全球读者解释中国科技产业的Hello China Tech创始人、分析师赵波(Poe Zhao)对此有一个判断:中国模型正在成为全球AI基础设施的一部分;接下来的考验,是能否把使用变成收入、信任和持久分发。

04中国模型,不只有低价

如果只看“29%的Token、不到4%的支出”,再看Garcia那张把大量日常工作交给中国模型的账单,很容易形成一个直觉:中国模型正在成为全球AI流水线上的“便宜工人”。

这个直觉抓住了2026年夏天文本模型的一张截面,却不能替未来排好座次。还是在Vercel的6月数据里,视频模型就呈现出相反的结构:

字节跳动Seedance生成约34%的视频,却拿走49%的视频支出;Seedance、快手可灵和阿里Wan合计获得约三分之二的视频模型支出。马斯克旗下xAI的Grok Imagine生成量更高,支出份额反而只有19%。

视频市场还很早,生成次数也不能与文本Token直接比较。但这个反例足够清楚:

能卖到什么价格,不由国籍决定,而由能力差异、任务结果和可替代性决定。谁能提供别人暂时做不到的东西,谁就可能进入高价层。

世界也不只有美国开发者。

过去一年,中国模型的全球采用还发生了另一层变化:从被看见,走向被调用。

今年1月,美国智库兰德公司(RAND)发布的一份报告分析了135个国家和地区的大模型网站访问。DeepSeek R1发布后,中国模型的全球访问份额在两个月内从3%跳到13%,随后回落到2025年8月的大约6%。

这是网站访问,不包括API、自托管和企业内部使用。它记录了“DeepSeek时刻”带来的注意力冲击,而不是全球AI市场被重新分割。

到2026年2月,DataReportal援引的Similarweb数据给出了更复杂的消费端画面:在中国以外,DeepSeek网站以4940万月度独立访客位列全球生成式AI网站第三;App月活为5330万,位列第四,却较2025年初上线初期下降近40%。网站仍居前列,App热度已经回落;消费端热度并没有一路上升。

开发者调用则是另一条曲线。

Development Data Partnership发布、由世界银行Data Lab团队制作的一项分析,把观察时间推进到2026年2月。底层OpenRouter API日志记录请求来源国家、模型和Token量;发布方剔除了月Token不足100万或模型分类覆盖率不足80%的国家—月份。

通过门槛的186个国家和地区合计处理约41.4万亿Token。AI资本观据公开交互结果复算,中国模型约占43.0%;其中173个地理样本达到或超过10%,152个达到或超过20%。

这也不只是低预算市场的选择。在来自德国的OpenRouter Token中,中国模型约占60.9%;加拿大为53.6%,美国为42.9%,日本为38.7%。

这不是全球市场份额,也不能与RAND的网站访问数据拼成一条连续曲线。它证明的是另一件事:在OpenRouter这个平台里,中国模型已经进入许多国家的开发者工作流,而且并不只出现在低预算市场。

而这种扩散,对不同国家意味着不同的价值:

对一家美国创业公司,便宜模型可能只是削减成本的工具;

对算力和美元预算有限的国家、大学和企业,它可能是第一次能够本地部署、微调并控制数据的前沿级能力。

这种全球化与汽车、电池和光伏不同。中国制造过去把成本、产能、供应链和产品一起带到世界;复制模型权重的边际成本远低于复制一条实体供应链,推理费用又由部署者承担,合同、数据和客户关系都可以留在当地。模型扩散得更快,也更容易与原公司脱钩。

从顶级通用模型看,当前竞争已经形成中美双中心。斯坦福大学AI研究院(Stanford HAI)称,截至今年3月,美国顶级模型相对中国顶级模型的领先缩小到2.7%,两国从2025年初开始数次交换领先位置。

能力差距收窄,资本差距仍然巨大。

同一份2026 AI Index报告显示,美国2025年私人AI投资达到2859亿美元,中国为124亿美元,相差23倍以上。这个统计可能低估中国政府引导资金,却不会抹去资源结构的悬殊。

于是,2026年夏天出现了一种暂时的分工:美国头部模型公司更多守住能力上限、企业信任和高价值支出,中国模型公司更多争夺成本曲线、开放标准和全球可获得性。前者决定最难的任务目前更多交给谁,后者决定多少人能够开始使用机器智能。

“暂时”两个字很重要。

R1出现以前,很少有人料到一家中国公司会在几个月内改写全球模型价格和开放生态;Seedance又说明,中国模型并不只能留在低价层。下一次架构突破、芯片变化,或者模型从屏幕进入机器人和物理世界,都可能重新分配今天的高价与低价、开放与封闭、执行与签字。

一项技术进入工业化进程,再不是一场已经排好座次的比赛。它只是让更多产品进入同一个市场,然后不断重写什么还算稀缺。

05资本市场该重算哪本账

如果模型正在成为工业投入,资本市场也需要换一套读数方法。

能力仍然是起点。模型没有跨过“足够好”的门槛,价格再低也不会带来长期采用。

但能力之后,要看它完成了多少真实工作;工作量之后,要看企业愿不愿意把出错代价更高的任务交给它;最后才是公司账本:谁签下客户,谁承担推理成本,谁获得毛利,谁有钱继续训练下一代模型。

Token、下载量和财报回答的是三件不同的事:模型进入多少系统,客户把钱付给谁,公司最后留下多少。把这三层接起来,才看得清全球采用究竟形成了影响力,还是形成了可以持续投资的公司价值。

中国AI模型的两条曲线,正在这里分开。

无论看能力榜、国家分布、实际调用还是视频模型的高价位置,中国模型都已进入全球第一梯队;在OpenRouter的2026年样本中,它们的Token份额甚至已经超过美国模型。但从第一方客户、企业合同、毛利、现金流到持续投入下一代模型的资本规模,中国公司与美国头部公司的距离显然更远。

技术差距与公司价值差距,从来不是同一个尺度。

接下来真正值得盯的,不是哪款模型又领先半分,而是几件更慢的事:支出份额能否追上Token份额,中国公司能否获得海外企业的直接合同,出错代价更高的任务是否开始转移,云与应用收入能否覆盖下一轮训练。

通用基础模型也只是今天最显眼的一层。编码、医疗、金融、科研、视频和机器人会需要不同模型;它们未必出现在OpenRouter总榜。专有数据、行业认证、工作流集成和结果责任,可能在通用模型越来越像原料以后,重新制造稀缺性。

Garcia每月700美元的账单,不是中美AI竞争的最终记分牌,只是重组早期的第一张发票。下一张发票上,中国模型可能从执行者变成签字者;OpenAI已在7月下调两款模型价格,美国头部公司也在反向争夺规模市场。

更常见的结果或许没那么戏剧化:没有一个模型统治世界,最大的公司未必拥有最聪明的模型,而可能最懂得何时调用谁、握住客户结果并愿意承担责任。

中国模型已经完成了此前最难的一步:让世界相信,接近前沿的机器智能不必永远稀缺,也不必永远由几家美国公司按同一个价格出售。

但把智能做便宜,与把一家模型公司做值钱,是两件不同的事。前者依靠能力、效率和开放,后者还需要客户、分发、合同、毛利和责任。前者改变世界能够负担多少智能,后者决定这种改变最终写进谁的财务报表。

中国模型已经先一步抵达世界。现在,轮到账本追上它们了。

(完)

说明:本文基于公开资料进行研究与表达,不构成投资建议。平台数据仅代表各自样本;公司披露、管理层表述、媒体信源、研究预印本与审计财务数据均按来源和证据等级区分。

参考资料:

1.Vercel:AI Gateway Production Index—July 2026。发布于2026年7月13日,统计6月Token、按公开牌价估算的支出、高后果任务及视频模型数据,不等于模型公司的审计收入。

2.OpenRouter:AI Model Rankings、Daily token totals数据口径、DeepSeek V4与Agent调用分析。本文复算截至2026年8月14日的平台周榜、月榜;Token不等于能力、收入或全球市场份额。

3.DeepSeek:2025年1月20日R1发布及历次更新、2026年8月13日V4 Pro与8月17日峰谷定价、磁盘上下文缓存说明。缓存性能与节省比例为公司披露。

4.Rest of World:When Americans choose Chinese AI。Garcia账单、Lindy模型切换及Poe Zhao对中国模型全球采用的判断。

5.开放模型成本与服务层:OECD Benefits of AI openness、AI Ping团队的托管开放模型API测量研究。后者为2026年5月预印本,基于2025年第四季度样本,不代表完整市场。

6.分发与企业数据边界:Amazon Bedrock支持的模型、Bedrock Marketplace软件费机制、AWS关于Qwen与DeepSeek的数据边界、Airbnb对Qwen使用的公开说明。

7.中国大厂的模型商业化路径:阿里巴巴截至2026年3月31日季度及FY2026业绩、云与AI业务更新,以及百度2026年第一季度业绩、腾讯Hy3产品与业务整合说明。阿里下载、云AI收入与Model Studio客户为公司披露,后续ARR为公司预测;百度、腾讯资料用于说明其模型与既有产品、云及企业场景的整合路径。

8.Kimi与MiniMax:月之暗面管理层公开口径、《每日经济新闻》援引机构人士的ARR口径、K3需求与容量事件、MiniMax 2025年年度报告。Kimi数据不是审计财务披露;MiniMax为审计年报。

9.全球采用的不同样本:RAND的[U.S.-China Competition for Artificial Intelligence Markets]覆盖135个国家和地区的网站访问;Development Data Partnership发布、由世界银行Data Lab团队制作的[OpenRouter LLM Usage Analysis]及[全球地图]覆盖2025年2月至2026年2月的平台API日志;DataReportal的[Digital 2026 Mid-Year Global Update]援引Similarweb网站与App数据。三者口径不同,不能拼接成一条连续趋势

10.全球竞争与历史参照:Our World in Data的OpenRouter Top 50来源分析、Stanford HAI 2026 AI Index、OpenAI 2026年7月降价说明、Jevons《The Coal Question》、IBM收购Red Hat公告。

← 返回目录

← 返回目录
深读 · 03

黑色星期三:沪指长阴失守 3900 点,超 5000 只个股下跌

8 月 19 日 A 股复盘综合述评

河马观澜综合(新浪财经、连板网等) · 河马观澜 · 2026-08-19 · 约 7 分钟 · 原文链接

导读与要点(建议先读原文)
  • 大盘:上证指数收报 3894.42 点、跌 2.40%;深证成指跌 5.01%,创业板指跌 6.26%,科创 50 跌 6.89%;成交约 2.51 万亿元,放量约 1103 亿——放量下跌。
  • 外因:隔夜美股大跌引发亚洲「黑色星期三」,韩国综合指数盘中一度熔断,全球 AI 产业链全线暴跌;A 股 CPO、半导体、MLCC、玻纤领跌。
  • 冰点数据:全市场 449 只上涨、5069 只下跌,超 360 股跌逾 10%;涨停 36 家、跌停 118 家,首板晋级率仅 6%(历史均值约 16%)。
  • 护盘信号:四大宽基 ETF 尾盘半小时成交激增约 385 亿元,疑似资金借道 ETF 抄底;融资余额前一日仍增 52 亿至 2.67 万亿,杠杆资金尚未踩踏。
  • 反差:宇树科技上市首日收涨 460%(开盘一度 +629%),同日机器人概念股批量跌停;煤炭、地产、农业、银行等避险方向逆势走强。
  • 机构口径:普遍定性为外围冲击下的放量调整,中金认为 7 月底以来的修复行情仍有望延续、外部冲击偏短期。不构成投资建议。

指数:近百点长阴,4000 点攻防战变成 3900 点保卫战。 8 月 19 日,上证指数低开低走,收报 3894.42 点、跌 2.40%;深证成指跌 5.01%,创业板指跌 6.26%,科创 50 跌 6.89%,上证 50 相对抗跌、跌 1.53%。前一天市场还在讨论 4000 点整数关口的攻防,一天之后,需要保卫的数字变成了 3900。

外因:隔夜美股大跌引爆亚洲「黑色星期三」。 韩国综合指数盘中一度触发熔断,AI 产业链在全球范围全线暴跌。A 股的 AI 硬件方向首当其冲:CPO、半导体、MLCC、玻纤领跌,直接拖累双创指数跌超 6%。这是一次典型的外部冲击传导,而非内部利空的集中释放。

结构:放量下跌,情绪进入冰点。 两市成交约 2.51 万亿元,较前一日放量约 1103 亿——下跌中放量,说明抛压得到了充分释放而非缩量阴跌。全市场仅 449 只上涨、5069 只下跌,超 360 股跌逾 10%;涨停 36 家、跌停 118 家,首板晋级率仅 6%(历史均值约 16%)。短线情绪从前一天的「降温期」直接跌入冰点。

护盘信号:尾盘宽基 ETF 爆量。 四大宽基 ETF 尾盘半小时成交激增约 385 亿元,疑似资金借道 ETF 抄底或护盘。两融方面,前一日融资余额仍增加 52 亿元至 2.67 万亿元,杠杆资金尚未出现踩踏迹象。

反差一幕:宇树上市首日涨 460%,机器人板块却大跌。 人形机器人第一股开盘一度涨 629%,收报 845 元、市值 3418 亿元;同一天,卧龙电驱、中大力德等机器人概念股跌停。新股抽血叠加高位兑现,题材内部剧烈分化。避险方向逆势走强:煤炭(焦炭涨价)、房地产(公积金条例修改)、大农业(粮食危机预期)、银行。

怎么看:外部冲击与内部结构的叠加。 机构普遍把此次定性为外围大跌冲击下的放量调整,中金认为 A 股自 7 月底以来的修复行情仍有望延续、外部冲击偏短期、阶段性。但值得注意的细节是:中报密集期里,最先被抛售的恰恰是前期涨幅最大、最依赖叙事的 AI 硬件链。当市场开始重新审视「故事值多少钱」,本期深读 01(AI 能力曲线的真实速度)和深读 02(中国模型的商业化账本)讨论的正是这个问题的两个侧面。

(本文基于公开市场信息综合整理,数据以交易所及行情终端为准;仅为信息转述与复盘,不构成任何投资建议。)

← 返回目录