模型迭代速度越快,Token价格就越低。
9月10日,DeepSeek推出了V4.1 Flash,并进一步降低了Flash系列API的收费。在非繁忙时段,每百万Token的缓存命中输入价格降至0.02元,未命中输入为1元,输出为4元;繁忙时段价格翻倍。官方表示,新模型在性能、成本、速度和总用时上全面超越V4 Pro,并计划在9月14日后将部分Pro请求转为Flash。这改变了行业的定价规则:过去,模型能力提升支撑更高价格;现在,能力提升反而成为降价的理由。
同日,智谱股价下跌10.34%,MiniMax下跌8.98%。截至9月11日收盘,两家公司9月以来累计跌幅分别为33.64%和22.98%。智谱2026年上半年收入9.54亿元,同比增长399.7%,超过2025年全年;MiniMax同期收入1.17亿美元,同比增长283.1%,也超过去年全年。在业绩会上,两家公司进一步提升了增长预期:智谱披露8月ARR约为16亿美元,MiniMax披露8月ARR超过8亿美元。
三天前,华尔街投行杰富瑞将智谱2026年至2029年的收入预测上调37%至119%,同时下调了亏损预测。按照常规逻辑,未来收入更多、亏损更少,估值应随之提高。但杰富瑞却将智谱目标价从1299.8港元下调至1183.79港元,并将智谱开放平台及API业务的估值标准,从预计2026年ARR的50倍降至30倍。按同样一元ARR计算,过去估值50元,现在只给30元。
扛不住波动的ARR估值
智谱2026年上半年收入9.54亿元,同比增长399.7%,超过2025年全年收入;但同期亏损仍达20.72亿元。其收入结构也发生明显变化:开放平台及API业务上半年收入8.25亿元,同比增长2735.7%,占总收入的86.5%,取代本地化部署成为主要收入来源。
MiniMax情况类似。公司上半年收入1.166亿美元,同比增长283.1%,超过2025年全年收入。其中,开放平台及其他AI企业服务收入7390万美元,同比增长703.1%,占总收入的63.4%。但同期经调整净亏损达2.93亿美元,毛利率仅17.9%。两家公司都在从一次性交付、定制项目和AI原生产品,转向更依赖API调用和企业服务。
这条路的好处是收入增长更快,更容易形成规模效应。代价是,收入直接暴露在Token价格变化之下。价格下降后,调用量必须以更快速度增长,才能抵消单价下跌。智谱管理层在半年报后的业绩交流会上透露,8月ARR约为16亿美元。MiniMax也披露,8月ARR超过8亿美元。
ARR是模型公司目前最受关注的指标。它将最近一个月的收入按当前速度年化,能快速反映业务是否加速。但它只是大模型变现的加速度表,半年报收入则更像里程表。前者告诉市场公司最近跑得多快,后者说明公司已跑了多远。只要价格、客户结构或调用量变化,ARR就可能迅速波动。这也是智谱财报后市场出现分歧的原因:乐观者看到API调用量快速增长,平台正形成新收入曲线;谨慎者关注调用可持续性、价格下降后收入留存,以及ARR何时稳定转化为财务报表收入。高增长未消失,但增长质量成为焦点。
据杰富瑞测算,智谱两家主要客户各贡献超过2.5亿美元ARR,合计至少占31%。其中任何一家减少调用,都会直接改变按当月收入推算的年化ARR规模。就在DeepSeek调价前几天,媒体援引杰富瑞报告称,该行将智谱2026年至2029年收入预测上调37%至119%,同时下调亏损预测。但在同一份报告中,杰富瑞将智谱目标价从1299.8港元下调至1183.79港元,并将开放平台及API业务估值倍数从预期2026年ARR的50倍下调至30倍。收入预测上调,目标价却下调,看似矛盾,实际反映市场正改变估值方法。此前,资本市场愿为高速增长支付更高倍数,只要ARR增长足够快,价格不是最重要问题。现在,市场开始怀疑这些收入是否还值原价。从50倍ARR降到30倍,估值倍数下调40%。在其他条件不变时,公司需将ARR再提高约67%,才能抵消估值倍数下降的影响。
Token的定价权在谁手里?
智谱目前确实拥有一定定价权。2026年一季度,公司将API调用价格提高83%,调用量仍增长400%。这构成智谱中报中最强的一组商业化数据。GLM进入代码开发和智能体等更复杂任务后,客户愿为更高模型能力支付更多费用。业绩会上公司还披露,截至8月31日,智谱MaaS平台Token调用量较年初增长超过40倍,API平均售价提高约101%,付费日活用户增长603%。但智谱整个平台在一段时间内量价齐升,而非GLM-5.2一款模型提价一倍后,销量增长40倍。
GLM-5.2于6月15日发布,此后两个多月,智谱又推出GLM-5.3和GLM-5.3-Flash。据智谱介绍,GLM-5.3-Flash模型拥有320B总参数,每次推理只激活18B参数。其能力超过GLM-5.2,API价格却只有GLM-5.3的十分之一。中报收入统计截至6月30日,40倍Token调用量和603%的付费日活增幅却统计至8月31日。GLM-5.3-Flash上线同日,阿里上线Qwen3.8-Flash。随后半个月,腾讯和DeepSeek也相继推出轻量、高吞吐模型。几家公司争夺的不是一个低价产品档位,而是最容易形成海量调用的API市场。
代码开发、办公智能体等高频任务,并不需要每次使用价格最高的旗舰模型。速度更快、价格更低、能力足够的Flash,反而更适合承接大规模调用。目前,三款模型的普通输入和输出价格已相差不大,拉开差距的是缓存输入。所谓缓存输入,是指模型再次读取已处理过的系统指令、历史对话或代码库。以DeepSeek非高峰价格计算,首次处理100万Token收费1元,再次读取相同内容只收0.02元。对模型公司而言,两次读取都产生Token使用量,带来的收入却相差50倍。这意味着,若大量调用来自低价Flash和缓存内容,API收入未必按同样速度增长。
昨天还只有旗舰模型能完成的任务,今天已被Flash压到低价区。模型刚刚建立的能力溢价,很快就成了全行业的公开报价。这让智谱的“Token增长40倍”有了另一种解释。未来,客户即使没有离开智谱,只是从GLM-5.3换到价格只有十分之一的Flash,同样数量的Token也只能换来更少收入。更何况,竞争对手也在提供低价替代。模型API的接口相对标准,这些选择之间的技术边界已越来越低。智谱、MiniMax、DeepSeek和阿里云均提供OpenAI兼容接口。开发者更换API密钥和基础地址,再重新测试准确率、速度和稳定性,即可迁移模型,无需重建整套应用。因此,智谱接下来必须同时跑赢两场比赛:调用量增长要快过单价下降,推理成本下降还要快过报价下降。只要一项掉队,每一元ARR留下的毛利就会变少。
智谱们的独立模型厂难做
智谱与MiniMax曾代表两条完全不同的大模型商业化路线。智谱从清华技术背景和政企客户起步,依靠本地化部署进入政府、金融和能源行业。MiniMax则以Talkie、海螺AI等产品触达全球消费者,收入主要来自订阅和应用内付费。2025年,智谱73.7%的收入来自本地化部署,MiniMax约67%的收入来自AI原生产品。到了2026年上半年,智谱开放平台及API收入占比已达86.5%。MiniMax开放平台及其他AI企业服务收入占比也从30.3%升至63.4%,首次超过AI原生产品。管理层披露,B端业务已贡献约80%的ARR。两家公司最快的增长,都不再来自原来的优势业务,而是企业和开发者消耗的Token。
而当两家公司都被归入Token供应商,一家的估值折价就会成为另一家的参照。Kimi K3发布后,摩根大通将智谱和MiniMax的长期估值倍数由30倍降至20倍。9月,杰富瑞又把智谱API业务的ARR倍数由50倍降至30倍。即使上调收入预测的华泰证券,也把智谱2029年市销率由27倍降至20倍。估值倍数的连续下调,正是在缩短市场愿意预付的时间。
智谱上市时的高估值,至少包含三重期待:它是港股稀缺的纯大模型标的,也是海外模型受限时的国产替代选择。GLM-5.2进入代码和智能体等高价值任务后,智谱涨价仍能增加调用,又让市场看到单代模型领先带来的定价权。半年后,这三重期待都不再稀缺。更多独立模型公司传出上市计划,投资者不再只有智谱和MiniMax两个入口。DeepSeek、Kimi、千问、腾讯和MiniMax也都能满足部分国产模型需求。国产替代仍然成立,却不再专属于智谱。新一轮Flash价格战把最后一层溢价也压短了。一款模型的领先可能只维持几个月,甚至更短。产品优势越来越难直接换算成未来数年的定价权。
模型行业的增长正在变得更便宜。过去,模型公司可以用更强能力获得更高价格;现在,技术进步和价格下降同时发生。能力差距缩小后,客户更易在不同模型间切换,API价格也成为采购决策的重要因素。这对独立模型公司尤其重要。大厂拥有算力、云平台和分发渠道,可将模型视为生态一部分。独立模型公司则必须证明,自己不仅能把模型做出来,还能在价格持续下降的环境中,保住客户、扩大调用量,并改善利润率。智谱和MiniMax的高增长并未结束,但资本市场已不再只为增长本身付费。
本文来自微信公众号“数智奔流”,作者:熵野,编辑:沈校,36氪经授权发布。

张伟
作为一名资深玩家,我对比过多家娱乐平台。开云中国的官方下载渠道确实让人放心,安装包轻巧不占空间,运行流畅无卡顿。客服响应也很快,体验非常棒。
李娜
开云平台的内容审核严格,所有资源都符合国家规定,用起来很踏实。而且技术支持团队7×16小时在线,有问题随时解决,这点让我很满意。