河马的CC商业实战 · 出品
CC 精选 · 商业深读 · 2026年8月23日 周日 · 第 9 期
今 日 深 读
It's Greg Brockman's OpenAI now
IPO 前夕,OpenAI 高管走马灯式出走:CRO 上任八个月闪辞、COO 离开去「做点新东西」。The Verge 这篇人物稿指出,所有空出来的权力都流向了同一个人——总裁布罗克曼。奥特曼仍是 CEO,但日常运营已经换了人。全文翻译。
开始阅读 →
Codex开始“反杀”Claude Code了吗?-虎嗅网
Codex 活跃用户突破 2000 万、四周增速是 Claude Code 的 4 倍——AI 编程的攻防战反转了吗?这篇文章把两条增长曲线拆开看:一个在消化「程序员只有这么多」的天花板,一个在吃 ChatGPT 数亿用户的入口红利。
开始阅读 →
越会用 AI 的人,学习能力退化得越快
26811 名中学生、30 个月跟踪:用 AI 后作业涨 18%,月考跌 20%。《经济学人》本周报道的这项研究补上了「AI 会不会让人变笨」争论中最硬的一份证据——而且同样的曲线,已经在医生、写作者、程序员身上画了四次。
开始阅读 →
快 览
It's Greg Brockman's OpenAI now
Codex开始“反杀”Claude Code了吗?-虎嗅网
来源:微信公众号「字母AI」,作者:袁心玥
Codex的活跃用户,到2000万了。
OpenAI Codex负责人Tibo昨天在X上确认,Codex本周已经突破2000万活跃用户。此前CNBC获得的OpenAI内部数据也显示,公司AI编程与工作类Agent产品已经达到约2000万周活。
这个数字延续了过去一个多月的高速增长。7月,OpenAI曾连续公布Codex与ChatGPT Work的600万、700万、800万、900万乃至1000万用户里程碑。
用户增长之外,OpenAI的企业业务也在明显提速。据CNBC披露,从本季度开始至今,按照当前收入水平年化计算,OpenAI企业业务的收入规模已经增长约50%,明显快于公司整体35%的增幅。
另一边,今年春天几乎定义了AI Coding热潮的Claude Code,开始慢了下来。
数据追踪平台TickerTrends最新追踪显示,截至8月10日,Claude Code过去四周的增长率已经降至5.2%;而OpenAI Codex同期增长20.8%,接近前者的4倍。
几个月前,两条曲线还完全不是现在的样子。今年2月到6月,Claude Code一路狂飙,把对手远远甩在身后。但进入7月,它的增长曲线第一次明显走平;而原本落后的Codex加足了马力。
Claude Code在AI Coding里的统治力,正在受到冲击。
Claude Code的增长神话,终于撞上了一条再普通不过的商业规律:用户是有限的。
今年2月,Claude Code的年化收入还只有25亿美元左右。随后几个月,这个数字几乎是一路往上蹿:3月底超过60亿美元,4月底突破100亿美元,到6月已经超过140亿美元。
短短四个月,翻了五倍多。
那段时间,Anthropic自己也在不断给这场狂飙加戏。5月,公司披露Claude已经能完成Anthropic内部超过80%的代码;6月又开始讨论递归式自我改进、“AI构建AI”,以及Agent如何从执行一个Bug修复任务,一路走向自己判断该解决什么问题。
Claude Code几乎成了Anthropic展示“AI如何改变软件开发”的最佳样板。
然后,7月来了。
TickerTrends的追踪数据显示,7月6日,Claude Code的年化收入约为142.6亿美元;一周后143.8亿美元;7月20日144.7亿美元;到了7月27日,甚至短暂回落到143.5亿美元。8月3日回到145亿美元,直到8月10日才重新跳到151.2亿美元。
钱还在赚,收入并没有真的掉下去。
但那个每隔几周就要刷新一次纪录、动不动几十个百分点增长的Claude Code,突然掉进了现实世界里那个紧巴巴的个位数增长区间。
截至8月10日,Claude Code过去四周相比此前四周只增长了5.2%。
这事儿本身并不难理解:Claude Code最早吃到的就是最容易被AI Agent转化的一批人。
程序员本来就坐在电脑前,有清晰的任务、有代码库、有测试结果,甚至连“AI到底有没有把活干完”都比其他知识工作更容易验证。产品足够好以后,开发者很快就会涌进来,并形成很强的使用习惯。
《The Information》今年7月底采访多家企业发现,即使Claude Code越来越贵,许多工程师依然不愿意换。在Weave追踪的200多家企业中,今年上半年Claude Code单用户成本翻了两倍多,活跃用户却增加到原来的3倍。Workato的AI编程使用量中,Claude Code占到80%,Codex只有20%。
Claude Code不只抢到了第一批用户,也抢到了开发者的默认选项。
但程序员终究只有这么多,越往后,剩下的人越难转化。早期爱尝鲜的开发者已经装了Claude Code;重度用户一天能用十几个小时。Anthropic今年6月的研究甚至显示,Claude Code用户平均每周已经使用约20小时。
一个产品渗透到这种程度之后,还想永远按照早期速度扩张,本来就不现实。
过去一年,coding已经成为Anthropic最重要的商业支点之一:Claude Code直接贡献收入,Cursor、Cognition、GitHub Copilot等客户通过API调用Claude,本质上也在放大Anthropic在编程场景里的优势。
Claude Code今天的增速放缓,并不意味着它哪里突然出了问题,更可能的情况是:最容易吃的一块市场,已经被它吃得差不多了。
Anthropic自己当然也知道这一点。
过去几个月,它一直在试图把Claude Code验证过的工作方式搬出程序员群体。
Cowork让用户把文件、浏览器和各种工具交给Claude完成多步骤工作;6月推出的Claude Tag甚至被Anthropic直接称为“Claude Code的一次演化”,希望把这种Agent式工作方式带进产品、客服、数据分析等团队。Anthropic自己的Economic Index也开始把Claude Code和Cowork放在一起研究,观察Agent如何从软件开发扩散到更广泛的知识工作。
只是截至目前,公开数据里还没有出现第二条像早期Claude Code那么夸张的增长曲线。
Anthropic最好讲的第一个故事,已经讲到了后半程。
偏偏就在这个时候,之前一直追在后面的Codex,开始跑快了。
Claude Code慢下来的同时,TickerTrends看到的另一条曲线,正在往上走。
截至8月10日,其模型估算的Codex年化收入指标过去四周增长20.8%,接近Claude Code同期5.2%的4倍。7月初,Claude Code的估算规模还是Codex的2.4倍;五周以后,这个差距已经缩小到约1.7倍。
但这里需要先打一个很重要的补丁:TickerTrends并没有直接追踪到Codex赚了多少钱。
Claude Code这条曲线至少还有一个官方锚点:Anthropic今年2月披露,其年化收入已经超过25亿美元,TickerTrends再根据自己的数据往后外推。
Codex则没有这样的官方收入数字。TickerTrends的做法,是先估算OpenAI的企业年化收入,再假设其中45%归属于Codex,由此得到88.3亿美元以及20.8%的增长率。
即便如此,趋势是真实存在的。OpenAI自己的管理层也已经把Codex列为近期收入加速的重要驱动因素之一。
更直接的证据,来自OpenAI自己的用户数据。
6月2日,OpenAI官方披露,Codex周活用户已经超过500万,相比2月桌面应用上线时增长超过6倍。
而且它的用户群体不只程序员。当时,知识工作者已经占Codex用户的约20%,包括分析师、营销人员、运营、设计师、研究员、投资人和银行从业者;这部分用户的增长速度,甚至超过开发者的3倍。
GPT-5.6发布之后,OpenAI曾经连续几天公布Codex与ChatGPT Work的用户里程碑:600万、700万、800万、900万……那几天,这个数字几乎以每天100万的速度往上涨。
7月21日,OpenAI宣布Codex与ChatGPT Work合计已经达到约1000万周活用户。
一个月不到,这个数字又翻了一倍。
CNBC最新获得的OpenAI内部数据显示,公司的“AI编程与工作类Agent产品”已经达到约2000万周活用户。
不过,在OpenAI把Codex合并到ChatGPT这个入口之后,产品的口径变得非常模糊,很难再用一个单独的“Codex用户数”,去衡量它和Claude Code之间的竞争。
OpenAI和Anthropic本来就在走两条不同的路。
Anthropic是从Claude Code往外扩,先拿下程序员,再把Claude Code验证过的Agent工作方式搬到Cowork、Claude Tag和更广泛的知识工作里。Anthropic自己对Cowork的定义,就是把Claude Code已经证明过的执行能力带给更多人。
OpenAI则正好反过来。Codex最早也是从程序员切入,但从今年6月开始,它就在不断吸收分析师、营销、运营、研究等非开发者用户;GPT-5.6发布之后,OpenAI又把Codex和ChatGPT Work一起收进ChatGPT这个更大的入口里。如今ChatGPT桌面端已经明确分成Chat、Work和Codex几个工作入口,其中Work负责长时间、多步骤的知识工作,Codex继续负责软件开发,但两者共享同一套Agent使用额度。
Anthropic是在把Claude Code向外扩,OpenAI是在把Codex往ChatGPT里收。
如果严格比较Coding Agent,应该看Codex对Claude Code;但如果讨论OpenAI现在公布的2000万AI编程与工作类Agent用户,那么Anthropic一侧更接近的参照,其实应该是Claude Code+Claude Cowork,甚至再加上Claude Tag这类从Code演化出来的Agent产品。
如果把镜头从Codex和Claude Code拉回两家公司,局面突然又反了过来。
2025年底,OpenAI的年化收入运行率已经超过200亿美元,是Anthropic约90亿美元的两倍以上。
半年多以后,领先者换了人。
截至7月底,Anthropic的年化收入运行率已经突破650亿美元,OpenAI最新披露的年化收入水平则超过400亿美元。
按650亿美元和400亿美元的下限计算,Anthropic目前的年化收入水平至少领先约六成。
甚至只看Anthropic自己,仅从5月底到7月底,Anthropic就新增了超过180亿美元年化收入,两个月新增的体量,已经接近OpenAI去年年底的整个年化收入规模。
另外,《华尔街日报》获得的两家公司非公开财务数据显示,今年二季度,OpenAI收入为67亿美元,环比增长18%;Anthropic同期收入则超过一倍,达到116亿美元,第一次在单季度收入上超过OpenAI。
尽管两家公司的收入确认口径并不完全一致,例如Anthropic会把通过云合作伙伴销售Claude产生的部分收入计入自身收入,而OpenAI的处理方式不同,这些数字并不是完全严格的一对一比较。
但从公司层面看,Claude Code的增速变化,目前还远不足以撼动Anthropic已经建立起来的收入优势。
一个很重要的原因在于,Claude Code本来就不是Anthropic收入的全部,甚至不是大头。
Anthropic真正的收入主力,仍然是向企业和第三方产品出售Claude模型能力。Cursor、Cognition、GitHub Copilot等产品通过API调用Claude,企业客户直接采购模型服务,这些收入加在一起,才构成了Anthropic最主要的商业基本盘。公司此前甚至预计,到2028年,API及相关企业应用收入仍会贡献超过80%的收入。
Claude Code的意义,更像是把Anthropic在coding场景里的模型优势变成一个直接面向用户的产品,同时又反过来强化企业和第三方对Claude模型的需求。
换句话说,哪怕Claude Code最陡的增长阶段过去了,但Anthropic靠coding建立起来的收入优势并没有消失。
而这也是Codex,或者说OpenAI,真正想要追赶的地方。
Codex从诞生起就是一款软件工程Agent,和Claude Code争夺的是同一批开发者和企业工程团队。只不过Claude Code先跑了出来,也率先证明了一件事:coding不仅是一个高频AI使用场景,还可以长成一门庞大的企业生意。
现在,OpenAI正在补这段差距,并表现出明显的企业化动作。
今年4月,OpenAI专门推出Codex Labs,并与大型系统集成商合作,要把Codex推进数千家工程组织;当时Codex周活开发者已经从月初超过300万涨到两周后的400万以上。OpenAI列举的客户场景也几乎全部是企业软件工程:测试、代码审查、功能开发、大型代码库理解、事故响应。
至少从最新的收入表现来看,这条路已经走出了一些效果。据CNBC披露,本季度开始至今,OpenAI整体收入的年化运行率增长约35%,企业业务则增长超过50%。
Codex最近的用户增长很漂亮,但2000万用户到底能转化为多少企业业务——或者说,到底值多少钱——才是接下来真正决定竞争格局的数字。
因为ChatGPT本来就拥有数亿级用户入口。把Codex塞进ChatGPT、共享额度、降低门槛,当然有可能迅速做大用户规模。可这些新增用户里,有多少是真正高频使用的专业开发者,又有多少最终能够转化成高客单价的企业客户,目前还没有公开数据给出答案。
如果OpenAI接下来也能把Codex迅速增长的用户和使用量,转化成同样迅速增长的企业收入,两家公司之间的竞争格局完全可能再翻一次。
至于该如何转化,可能还是要回归到那个最底层的变量:模型。
OpenAI手里还有尚未发布的Astra,按照目前披露的信息,它在Agent编程和网络安全能力上已经出现明显跃升,甚至因为可能触及最高级别的网络安全风险阈值,OpenAI不得不放慢开发,加强安全测试。Anthropic那边,最近关于Fable 5.1的传闻也越来越多,有报道称公司已经开始内部测试这一版本。
Claude Code和Codex能够成为今天这样的产品,前提都是Claude和OpenAI的基础模型已经足够好用。
产品入口、企业销售、用户习惯可以放大这种优势,但一旦下一代模型拉开明显的能力差距,产品层面的领先关系也可能被重新改写。
产品可以建立壁垒,但对OpenAI和Anthropic来说,最核心的资产始终还是模型。
越会用 AI 的人,学习能力退化得越快
来源:微信公众号「极客公园」,作者:张勇毅,编辑:靖宇
这应该是过去三年被讨论最多的一个迷思之一,从ChatGPT走红那天就有。吵了三年多,两边都拿不出像样的证据:
担心的人只有体感,不担心的人只有立场。
8月18日,《经济学人》给这场争论补上了迄今最硬的一份证据。
报道的主角是2.7万名中国中学生。用上AI之后,他们的作业分数平均涨了18%,写一份作业的时间从64分钟缩到45分钟。到这里全是好消息,直到月考卷子发下来:闭卷考试里,这批学生的成绩比不用AI的同学低了20%。
作业分曾是最可靠的「晴雨表」:作业越好,考试越好。而在用AI的学生中间,作业分越高,基本等于AI用得越深。于是曲线变成了:用得越狠的孩子,考试跌得越惨。
作业分,第一次开始撒谎。
作业分超过100的人之中,不用AI的人分数上涨到了112,用AI之后一路跳水到64。
《经济学人》的数据底稿,是斯德哥尔摩大学和香港大学三位经济学家6月挂出的论文,标题就叫《生成式AI学习惩罚》。
样本来自中国中部一个县,人口超过一百万。论文特意强调它的普通:像沿海之外的大多数中国县城。26811名初高中生,5所初中、4所高中,装下当地九成中学生,从2022年9月跟到2025年6月,整整30个月。
这个县的作业在线上提交,系统记下每个人的用时;月考、中考、高考的成绩都进数据库——写多快、考多好,第一次成了直接测量的硬数据。谁在用AI,则来自回收率超过96%的全员问卷。
2022年9月,用AI的学生几乎为零。到2025年6月,这个数字是80%。这条曲线有两次明显跳升,分别踩在DeepSeek V2.5和R1的发布点上。工具全是熟面孔:豆包、DeepSeek、文心一言、通义千问。
结论就是开头那组数字:作业+18%,用时−30%,月考−20%,相当于1.4个标准差。惩罚在各科并不均匀:社科类最重,跌27%;数学22%;英语17%;语文最轻,9%。初中生比高中生惨四成,男生比女生惨。
看来变笨这件事也不优待聪明人:恰恰是原来成绩最好的那批孩子,跌得最狠。
升学考试的账要算得更小心。6月底这项研究在中文互联网刷屏时,传播最广的说法是「中考暴跌24%、高考暴跌18%」。论文里的原意克制得多:这是用满两年以上学生的完整惩罚,全体AI用户的平均效应只有7%左右。
但这份「克制」本身才是更坏的消息:惩罚需要两年才长满。作者们专门点了一句,眼下那些几星期、几个月的短期研究,都在系统性低估AI的学习成本。
这项研究6月刚出现时,英文讨论中其实还有一个安慰性的结论:有两成学生用AI但不外包作业,成绩没受损。所以问题不在AI,在用法。
论文确实说了前半句。它给「外包」下了一个数值上的定义:作业用时少于50分钟算「内包」,少于45分钟才算是真「外包」。
刚开始用AI的学生里,外包的占58%。而那些照常花时间写作业、只拿AI当家教的孩子,考试成绩和不用AI的同学几乎没有差别。
论文甚至发现,在50到65分钟的重叠区间里,两类孩子花同样的时间,考出几乎一样的分数。AI本身不带毒性,毒性全在省下来的那段时间里。
如果论文停在这里,它就是一篇「工具无罪、用法有罪」的标准论文。
但论文其实更深一步地探讨了这个问题:用满5个月之后,外包的比例从58%涨到81%,完全外包从34%涨到50%。那批花65分钟以上认真写作业的「模范用户」,全部是刚上手不到5个月的新手。
以及采纳满6个月之后,没有一个AI学生的作业用时还超过65分钟。
26811人的样本里,「好好用AI」不是一种稳定的用法,是一个维持不到半年的过渡状态。论文作者的解释很短:AI挤掉的,是强度最高的那部分努力。
它不是又一篇「AI让成绩变差」的论文,它是在撕掉一个安慰的遮羞布:只要教会孩子正确使用,一切都会好起来。
数据给出的回答是,没有人能一直正确使用:毕竟作业分在涨,家长在群里点赞,老师看到的提交记录越来越整齐。每一个反馈都其实都在潜移默化中,形成一个畸形的激励机制:你做得很好,再快一点也没关系。
看到这里,这个研究似乎跟传统我们理解中、大脑已经发育健全的成年人关系不大。但同样的曲线,过去一年多,在成年人身上已经画了四次。
《柳叶刀·胃肠病学和肝病学》去年8月发表了一项波兰研究:四家内镜中心的19名资深医生,人均做过2000例以上肠镜,用了几个月AI辅助检查之后,回到没有AI的状态,腺瘤检出率从28.4%掉到22.4%,相对下降20%。
和中学生的月考,同一个数字。
这是医学界第一次在真实临床里测到「用AI之后,人的手艺生疏了」,主角还是这个星球上最不该被怀疑基本功的一群人。
第二次在写作者身上。麻省理工媒体实验室去年6月的脑电实验里,54名学生戴着电极帽写作文。用ChatGPT那组的神经连接强度垫底,比纯靠自己写的那组最多低了55%;写完不久,83%的人连自己文章里的一句话都复述不出来。
研究团队给这个现象起了个名字:认知负债。
第三次在办公室里。微软研究院和卡内基梅隆大学去年调查了319名知识工作者,结论一句话就能说完:对AI输出越有信心的人,自己动脑核查的投入越少。
第四次在程序员身上。研究机构METR去年的对照实验里,资深程序员用上AI实测变慢了,自己却觉得快了20%。今年2月它想复测,没做成,原因写在报告里:大多数开发者已经拒绝在没有AI的情况下工作。
和那个再也没人肯花65分钟写作业的教室,一模一样。
临床、脑电、问卷、对照实验,四次预警说的是同一件事:AI在场,产出变好;AI离场,能力变差。
回到开头那个吵了三年多的问题。这些研究给出的答案,比一句「会变笨」更难受:AI没有降低任何人的智商,它是把「变聪明」的那道工序抽走了。分数照涨,产出照交,只是那份本该在64分钟里长出来的能力,没有长。
认知科学管这个叫「认知卸载」:把本该在自己脑子里跑的过程,交给外部工具。卸载不新鲜,计算器和导航都是。新鲜的是位置:AI接走的不是运算和记路,是打草稿、试错、推演,恰好是心智模型长出来的那道工序。
落到日常工作上,这变化听着甚至像升级:从「写代码」变成「审代码」,从执行者变成把关人。
但把关的前提,是脑子里有一份自己的底稿。没亲手推演过的人,审的其实是个黑箱,AI的逻辑链一旦错在深处,他连该从哪里起疑都不知道。学生的版本更简单:作业是草稿,考试是Debug。草稿外包出去,Debug那天就露馅。
区别只有一个。学生每个月都有一场闭卷考试,把这条曲线摆到台面上。而大多数成年人的工作,没有月考。
论文的最后留了一点余地。把时间拉长看,AI学习惩罚正在收窄:同样用满5个月,2023年初的学生平均损失25%,2025年6月只有16%。
师生在适应,工具侧其实也有人想办法,比如逼AI给答案时同步展示推演过程。但按作者们的判断,损失在变小,却没有归零的迹象。
9月1日开学。全国的教室里,这场26811人的实验,会以更大的样本重跑一遍。
以后看到孩子的作业天天100分,也许得先问一句:这100分是孩子挣来的,还是豆包挣来的。
下一次把方案交给老板之前,这个问题,不妨也先问自己一遍。