WAIC 游记(上篇):站在 DATA CENTER INFRA 看 AI 产业链
🗺️换个方式读:立体展馆动线点进展馆逐层逐展位看,每个展位都能跳回这里的对应小节打开动画版 →2026 年 7 月 17–20 日 · 上海世博展览馆 · 本篇 H1 展馆,约 3.8 万字 / 阅读约 75 分钟
读者结论(AI 评阅)
这篇的价值是视角差,信息量倒在其次。绝大多数 WAIC 观展笔记是从模型往下看,谁的参数更大、谁的榜单更高;这篇是从配电柜往上看的。作者的本职是数据中心基础设施销售,所以他会在意别人不写的东西:一个 CDU 的价格占整个机房设备的百分之几、集装箱出海为什么能把海外一年的交付压到 5 个月、以及「算力硬件占掉七成成本、光 GPU 就是四五成」这件事怎么把机电预算挤成零头。这个位置让他对「卖铲子」和「用铲子」两端同时有体感,也是全文最好看的地方。
代价是另一半:越往应用层走,判断越依赖二手信息,数字密度上去了、亲历感下来了。阿里和腾讯那两节读起来更像整理过的行研,而 Vertiv 和道客那两节,是只有站在展台前问过产品经理的人才写得出来的。
如果你只读三节:01 Vertiv(散热账 vs 商业账)、04 道客(CUDA 的壁垒到底卡在哪一层)、10 阿里(全栈五层为什么决定选择权)。
(本节由 AI 作为读者通读全文后生成,不代表作者观点。)
TL;DR
- 液冷的技术壁垒卡在认证、产品形态和工程交付这三样上。各家能靠收购快速进场,说明研发本身不是门槛。
- 单柜功率一旦越过风冷上限,商业账就得让位给散热账:液冷在机房设备里只占个位数的百分比,相对 GPU 价格微不足道,纠结投资回报是算错了题。
- 数据中心出海的瓶颈是土地、认证、货代和人力,技术反倒是最不愁的。集装箱式产品化交付(Vertiv SmartRun)对的就是这几样,能把海外 1 年的周期压到 5 个月。
- 算力硬件(卡 + 服务器 + 网络)占掉 AI 数据中心成本的七成,光 GPU 一项就是四五成,机电设备只是零头。
- CUDA 卡在操作系统之上、模型之下:每一代大模型都绕不开它,十几年堆出来的这层生态才是英伟达最硬的护城河。
- Agent = Harness + Model,同一个模型在不同 Harness 下表现能差出一个身位。2026 年真正的产品差异在工程层。
- 全栈才有选择权:INFRA→芯片→云→大模型→Agentic 五层齐备的只有阿里和 Google;阿里能把模型矩阵铺满,靠的是先有这五层。
- AI 产品化最明确的信号是席位收费:把 token、调用次数、模型选择全部收进黑盒,给用户把填空题换成选择题。
- 模型层的毛利最脆弱:它建立在「前沿能力独占」上,没有制程、没有产能,守不住任何物理约束,开源一追近,利润回落得比涨上去还快。
阅读指引
本文按参观动线组织,不按产业链层级重排:重排会毁掉亲历感,而亲历感是这类文章相对行研报告的唯一优势。逻辑串联交给每卷的卷首导读。
带 💡 技术 和 📊 数据 的折叠块是深挖,跳过不影响主线;带 🍿 场外 的是花絮和吐槽;术语速查在附录 B。只读不折叠的部分,全文是连贯的。
正文里的 [n] 对应文末参考文献。图片说明写在图下的小括号里。
涉及在职身份的商务细节已做脱敏处理,保留量级与判断、去掉可识别信息;没有公开出处的数字都标了「据我了解 / 我的估算」。
关于作者,以及叠甲
我本人:Vertiv 大客户销售、同济大学 AI 专业研究生在读,自动化专业出身。更多详情请移步 arthurzhou.ai。
利益相关声明:本文第 01 节写的是我任职的公司。涉及 Vertiv 产品的部分,请当作从业者视角而非中立评测来读;文中提到的所有产品规格均以公开资料为准,不代表公司立场。
本日志用于个人记录和思考,目的是锻炼商业逻辑思考和上下游理解,同时训练自身的逻辑表达并缓解 FOMO。太超纲的内容我会尽量类比,并叫 Claude 来帮我学习和阐释。
如有不同见解,还请与我交谈,并留下和善的言论。欢迎随时约 coffee chat,一起进步。
🍿 我进入莫比乌斯环了说是
写得越慢,越追不上 AI 的变化;追不上,要写的就越多;要写的越多,就写得越慢。
(图 1 写 → 追 → 变 → 多,一条没有正反面的带子。AI 生成)
参观与成稿顺序
本文按实际参观动线走,成稿顺序在馆内做了微调(同一馆内按逻辑聚拢,跨馆顺序不变)。
| 展馆 | 位置 | 内容 | 本篇 |
|---|---|---|---|
| H1 | 一层 | 产业应用与大模型生态 | ✅ 本篇 |
| H2 | 一层 | 算力硬科技与基础设施(华为、瑞芯微、中科曙光、润建股份、豆包手机) | 下篇 |
| H3 | 二层 | 具身智能与机器人(银河通用、宇树、乐聚、灵心巧手、蚂蚁灵波、智元、人形机器人上海) | 下篇 |
| H4 | 地下一层 | 微盟、脑机接口 | 下篇 |
实际动线是 H1 → H3 → H2 → H4。
这是我第三次参加 WAIC,习惯是第一天下午进场,人少,能安静看产品;第二天上午看直播,学政府风向和大佬对话。
Part 1 · H1 产业应用与大模型生态
本卷你会看到:12 家厂商按当天的动线一家家看下来,「卖铲子的」和「用铲子的」会来回交替出现:Vertiv 之后紧接着就是深信服和合合,然后又拐回道客。所以先记住各家站在哪一层就行:卖铲子的是 Vertiv、道客,云与引擎是阿里、百度,模型层是商汤、MiniMax、Kimi、MOSS,应用层是深信服、合合、金山、腾讯。
这一卷最反直觉的两点:一是越靠近应用层的厂商,展台越朴素,Kimi 只摆了几台电脑和人聊天,卖铲子的反倒恨不得把整套机柜搬进来;二是利润流向和硬件投入是反着的,算力硬件占掉数据中心七成成本、光 GPU 一项就是四五成,增量利润却不成比例地流向了模型层。
本文涉及的产业分层如下[1]。
(图 2 AI Infra 全景分层图,来源见 [1])
H1 覆盖的层级[2]:
(图 3 H1 展馆在 AI Infra 分层中的覆盖范围,来源见 [2])
01 Vertiv(维谛技术)|纳斯达克数据中心第一股,覆盖从 110kV 到柜内电源的「电与暖」,眼下的两张牌是液冷 CDU 和集装箱出海
Vertiv 是纳斯达克数据中心第一股,也是我打工的地方。其产品覆盖面之广,几乎包含了所有数据中心基础设施部分,电暖为主要产品。
最近时间大火的产品,应该是 800V、CDU 和配套的工程产品 SmartRun,以及 One Core 理念。关于细分产品的细节,详见文末附录 D;如需更详细的介绍和技术交流,可以直接与我联系。
先把这个行业的骨架摆出来:
(图 4 数据中心基础设施架构:电力链 × 暖通链 × IT 负载,AI 绘制)
- 预见2026:《2026年中国IDC(互联网数据中心)行业全景图谱》(附市场规模、竞争格局和发展趋势等)_行业研究报告 - 前瞻网[3]
(图 5 IDC 产业链结构梳理:上游是基建及设备提供方(配电、冷却、机柜、光模块、交换机),中游是 IDC 服务商,下游是互联网、云计算、金融、政府等客户,来源见 [3])
(图 6 IDC 产业链生态图谱:上游硬件与软件设备一栏里就有 Vertiv,中游是三大运营商、第三方 IDC 运营商与云厂商,来源见 [3])
数据中心基础设施所在的定位如图所示,其重要性不言而喻。它是 AI 黄金产业中卖铲子的一环,属于基础设施建设领域,位于传统制造业行业,以工业设备为主。但目前产品的技术壁垒在不断缩减。
个人看来,数据中心的爆发节点是 2025 年初(春节前后)的 DeepSeek 爆火。我仍记得领导的商业嗅觉的灵敏度:过完年后的第一周,就在全力寻找 DeepSeek 大模型训练的机房位于哪一家 Colo(第三方租赁为主的数据中心),事实也应验。
随着注意力机制那篇论文的问世(Attention Is All You Need),业界开始把 Transformer 架构用起来训练模型。训练这一侧,从 GPT-3 开始参数量爆炸,3 到 4 的迭代用了几乎 100X 的训练当量。而推理侧的需求也跟着一起被撑了起来。OpenAI 的伪 OPEN 技术独裁也不免激发了国内外的竞争。
时间快速地过,训练环节也有了 Chinchilla 定律,大家在找训练和推理的平衡点。23-25 年间最大的新闻,就是英伟达系列 GPU 的爆发,让大家看到图形处理并行计算对于计算 token 训练的超高产出及未来。于是,军备竞赛开始了。
可能和互联网爆发之初一样,如何能快速地抢占资源、占位是第一优先级。
从阿里远超预计投资的 3800 亿元云 + AI 基建计划,到字节的三叶草计划,基础设施的资源就是先机的资源。
对于数据中心来讲,业务是必须存在的。虽然大家很久不提数据中心的重要性,但我的理念认为,数据中心一直是那个安全性 0000…… 前面的那个 1,和保险同理。
目前 AI 的爆火增加了数据中心的应用范围和承载量,更加大了它的重要性。数据中心基础设施建设的重要性随着 GPU 的价格飞速上升,供配电等传统领域的设备也披上了一层镀金衣,为 AI 加码。GPU 能否最高效地产出 token,也是 INFRA 领域所有人的最终命题(最终还是绕不开资本家的最高效压榨:引入商业定律)。
数据中心的竞争态势,我要说一个暴论:目前已经从最早的卷技术、卷产品、卷信息,卷到了卷价格和卷资源。竞争焦点脱离了数据中心产品本身的安全性,变成了每个职业经理人的 KPI 闭环和急不可待的降本增效目标。
我熟悉的 Vertiv 涉及的 INFRA 领域分为电和暖,从 110kV 的电站,一路接到末端 GB300 GPU 单卡 1.1~1.4kW、整机架 130~140kW 的 TDP。正因为末端已经是这个量级,后面「单柜 70kW 就得上液冷」才不是危言耸听。
以不同稀疏规格和算力以及产出比大概略算,一度电大概能产出几万到几十万个 token(换个说法:百万 token 大约要烧 15~20 度电)。这也是电力如此重要的原因,也是中美竞争中中国最大的优势所在,甚至有 token 出海的逻辑。
每度电到底能产出多少 token、以及 token 出海的商业逻辑,详见文末附录 C。
💡 从 110kV 到柜内电源,「电」和「暖」具体是哪些设备(全链条清单)
电的环节:110 - 220 - 变压器 - 中压柜 - 配电柜 - 低压柜 - UPS - 馈线柜 - 母线柜 - 列头柜 - 服务器电源 - 柜内电源。
整体架构有 2N / N+1 / DR / RR / 4N3。
柴发为 2N 母线的 backup;铅酸(海外锂电)为 UPS 的 backup。
暖通按系统区分为两类。水系统:干冷器、冷塔、冷机,末端;氟系统:冷凝器,末端。
CDU 可以按水或水氟系统一起考虑。目前海外主流适配 GB300 的是 1350kW 的集中式 CDU,适配 Rubin 的是 2.3MW 的 CDU,另外还有 in-rack 的 121kW(规格均以 Vertiv 举例了解)。
CDU 价格水涨船高,也是因为 TDP 散热的问题。当单机柜功率突破了风冷(氟泵列间风冷)40~50kW 的实际上限时(行业公认的传统风冷口径其实只有 20~30kW/柜),就需要考虑液冷的配比。而一旦过了这个点,账就得换一本算:液冷系统的价格占比大约为数据中心基础设备的 5% 当量,相较于 GB 等系列的 GPU 价格微不足道,先要保证的是机柜能不能稳定跑起来。下面这块折叠是完整的推演。
💡 单柜超 70kW 之后,为什么商业账就不用算了,只剩散热账(技术账)
一般为 70:30 或 80:20(液冷带走 70~80% 的热,剩下的还得靠风冷兜;维谛自家白皮书的口径是冷板能带走机架 70~75% 的热量),做大于 70kW 的热设计方案。这个配比,我一开始也是从商业逻辑去怀疑的。
咨询 Vertiv 技术总监得到的结论和思考的迸发,可以分享给大家:液冷系统的价格占比大约为数据中心基础设备的 5% 当量,相较于 GB 等系列的 GPU 价格微不足道。在业务上,能否保证服务器机柜的运行才是最重要的。当突破了 70kW 的单机柜功率时,需要考虑的是如何保证机柜的最高效解决散热和运行,而不是思考商业逻辑的闭环,也就是系统的造价是否划算。
PUE 的红线其实一直都在。数据中心从 21 年一直宣传的 3060 双碳目标(2030 年前碳达峰、2060 年前碳中和),发展到现在的 AI 为国家战略储备的当下,2024 年 7 月发改委等四部门还发了《数据中心绿色低碳发展专项行动计划》(发改环资〔2024〕970 号),北京更是从 2026 年起对低能效数据中心征收差别电价。真正变的是 PUE 已经不再是唯一的 KPI 了(以往由于需要获取窗口指导以及政策补贴和审批资格,它几乎是唯一的那把尺子),现在更以实用为主。当然,液冷系统的引入也是把 PUE 毫无疑问地拉进了 1.1~1.2 的区间,浸没式还能再往 1.1 以内压。
暖通的发展变化,一直是快于电力系统变化的落地的。我思考数据中心电气和暖通变化有两个依据:一个看各友商在鼓吹什么技术内容,一个看同专业同行的同事工作量是否有变化。
最近的趋势就是 400V、800V 和 SST 被老黄那张 800VDC / 1MW 机柜的路线图带火(NVIDIA 官方口径是 800 VDC 覆盖 100kW 到 1MW 以上、2027 年随 Kyber 机架规模量产;真正端出来的最高规格是 Rubin Ultra / Kyber 的 600kW,1MW 还在后面),变为电气最前沿的追求。直流系统和交流系统作为大厂技术竞争创新 KPI 的当下,恰逢国内 UPS 推进模块机 UPS 这一颗粒度更细的产品,将整机打散作为元器件卖。
UPS 是什么、模块化 UPS 又把什么打散了,详见文末附录 E。
又不巧的是,字节数据中心开始对几大类进行集采:柴发、UPS、中压柜。彻底击穿整个 UPS 行业,把 UPS 变成了数据中心电气链条的一颗螺丝。行业大体是这样,一直推陈出新才是迭代的常态,而 UPS 白菜似乎来的太快了一些(以我的工作年限来对比)。
电气的产品格局,追求直流系统直接转接到适配直流服务器,以及柜内 OCP 规格下的 PSU 等;直流系统也包含了 400V-800V 和 SST。在我看来,无论是什么电气架构,都脱离不了芯片的使用场景:在国内 Atlas 950 SuperPoD 单机柜业内估算 70kW 的当下,没有芯片的高功率需求,800V 和 SST 仍需至少 2 年和 4 年的光景才能落地。
转移到暖通视角,我听暖通 SA 和产品经理的抱怨比电气同事的多了不只一倍,甚至有社媒交到的法国暖通博士希望进入数据中心做液冷的想法。液冷的爆火如期而至,却又有点空中楼阁(对于国内来说)。
和前言电气产品一样,液冷也是随着芯片的需求而暴增。关键的是,冷却做不好,确实对芯片来说减少了产出(违反了企业家定律)。
暖通系统的花样之多,几乎等同于把制冷四大件像排列组合里的 A(n,m) 那样排来排去:压缩机、冷凝器、节流装置(膨胀阀/毛细管)、蒸发器。太多了,直接看图吧。冷机涉猎太少,就不展开了。
(图 7 制冷循环四大件与暖通产品形态,AI 生成的示意图)
暖通系统的复习笔记,详见文末附录 F。
暖通产品的花样,基本体现在四大件不同形式上,所以每变化一次就有新的技术路线和叫法诞生。经常是产品经理介绍我司产品名称技术理念的时候,客户打断我们并表示:这个和冷冻水/氟系统有哪些区别和变化?
随着暖通产品形式的更新,好消息是暖通同学不缺话题和方向了,坏消息是活干不完。
暖通的 CDU 一枝独秀,作为 GPU 的核心伙伴,一直没有退居热度的二线。当然,此赛道绝对是能动学院的流体力学的绝佳选择。
讲到工程的交付,不得不提 Vertiv 的 SmartRun 和 One Core 理念。SmartRun 是 Vertiv Global 基于目前云/AI 厂商对于数据中心快速建设的需求,做出来的预制化集装箱交付方案:机电系统在工厂里集成、测试完再运到现场,把现场施工的活压到最低。
集装箱类产品出海要解决的几个问题,关键词是:海外的土地难获批、产品认证难、出海资源、价格高以及交付周期长。
土地获批不同国内:国内可以通过跟进政府政策来解决,国外一般需要提前 1 年甚至更长时间的布局来找到好的位置。而数据中心的选址需要考虑的因素众多,包括但不限于气候条件、政府补贴、峰谷价差、人员支持、时延影响等。所以数据中心一般都是集群的形式:大家都看好了这个地块,也是因为符合以上所有条件,value for price。
数据中心选址到底要看哪几条,详见文末附录 G。
产品认证也是老大难。国内产品的出海关键要突破欧盟 CE(底下压着 LVD 低电压指令 + EMC + RoHS)和北美 NRTL(UL 只是其中最有名的一家,同等效力的还有 ETL、CSA)这两大体系,再往下还有 IECEE CB 体系和各国的本地强制认证(日本 PSE、韩国 KC、澳新 RCM、中东 SASO……);而作电力撬块的认证归属、以及是否符合当地政府的技术要求,又是一关。不菲的认证价格面对难以落地的业务,也是让人望而却步。
出海资源的对接,需要考虑货代、出海形式、报关报批、DDP / DAP / DPU 交付等多种形式。如果需要设备商报关,又需要切换成与 Global 公司的签约。税务和报关问题一般都由公司单独成立的海外对接部门专门解决,可见问题之难。
价格高,一般指海外的人力水平远低于国内:人力价格是国内的 3 倍之高,产出效率又不及国内的一半。如果让中国工程师合理出海建设海外数据中心,也是一个难题。数据中心听着再高大上,也在传统制造领域,而这个领域,china no.1。
交付周期长考虑几个原因。数据中心国内的建设一般都是 T+6,以土建楼栋搭好开始计算,+6 为设备验收交付给业主的时间;而国外动辄 1 年的交付周期,甚至可以错过两次 COMPUTEX 的大会。也就意味着你的建设技术架构还没变,服务器的 GPU 卡都已经发布两个规格了,这又不得不去更换技术方案,去做最新的卡的适配(关于此点商务逻辑可以转到第 2 part,参观 H2 芯片馆我的理解和逻辑)。
这几件事最后都要落到一本账上,所以先把大数摆出来:算力硬件(卡 + 服务器 + 网络)本就占据数据中心绝大的成本,高达 70%,光 GPU 一项就是四五成,机电设备只是零头。下面这块折叠是完整的成本账。
📊 数据中心的钱到底花在哪:算力硬件占掉 70%,机电只是零头(成本账)
数据中心还要考虑设备的折旧率。国内不考虑折旧率的情况下,年化都到了 7%;IRR 会随着考虑基础设施和 GPU 设备本身下降得更严重,可能从 9 年回本变成 18-20 年才可以回本(以租赁业务模型考虑;可对照的公开口径是回收期 8.5 年上下、税后 IRR 10%–15%)。不能快速上业务转成收入,资方的人每次的拷打都很真实。
以海外建设 1GW 的数据中心、以 GB300 为指标,整体成本来到了 470 亿美元。这个数先把口径说清楚:470 亿美元 ÷ 1GW ≈ 47 USD/W,也就是 47000 USD/kW,是含 GPU 的全口径;下面这组数字是另一本账,只算机电分包,不含卡也不含土建,两组数各看各的,别放在一起相减。
只算机电分包的话:国内 Hyperscale 与 Colo 数据中心的机电分包建设成本,不含税约 2000 USD/kW;马来西亚约 5000 USD/kW;日本约 12000 USD/kW;美国约 20000 USD/kW(这组是我了解的行业口径,只算机电;公开报告给的都是含土建的整体造价,只能做量级上的对照:Turner & Townsend 2025 年数据中心建设成本指数给东京 15.2 USD/W、硅谷 13.3 USD/W,Cushman & Wakefield 2026 年 4 月给马来西亚 960 万–1200 万美元/MW,美国 AI 数据中心 2026 年的整体口径落在 1500 万–2000 万美元/MW)。
同一件机电的活,中国和美国之间差了十倍。十倍不是设备本身差十倍,是基建能力和设备产能的差距——成套设备的排产、供应链的价格、施工队伍的效率,这几样恰好都是中国最不缺的。也正因为这个价差摆在那里,DAYONE 这类把中国的供应链和建设能力搬去海外做数据中心的公司才会备受海外资本欢迎:它是万国数据(GDS)的海外业务分拆出来的独立公司,总部在新加坡,按公开报道已在 2026 年 8 月向美国 SEC 秘密递表,拟募资约 50 亿美元、目标估值最高约 200 亿美元,最快下个季度挂牌,并在考虑新交所 + 纳斯达克双重上市(Bloomberg、Reuters 口径,交易所尚未最终敲定)。
但,如果出海项目来讲,国内的设备 +20-30% 的价格,配合 2 倍于国内的人工,换算整体的成本上浮 30%;而租金却来到了:某 Colo 商出海价格 85 美金含税每月每千瓦,不含土地不含电——国内的对照价格则在每 kW 每月 250 元以内。成本上浮三成、租金翻几倍,这笔账本身就是出海的理由。
所以,如何快速上柜并转化成收益就是第一优先级。所以,集装箱出海的重要性和性价比不言而喻。
产品化的 SmartRun 的交付周期就短得多。以出海为例:2 个月以内的设备交付,2 个月的集成安装,1 个月的出海,完全可以对标国内 T+6 的建设周期。当然,如何解决当地的人力情况也是一大难题,出海 Colo 和部分供应商的代理商都会积极地去解决。
SmartRun 现场照片:
(图 8 Vertiv 展台的 SmartRun 预制化模块,两侧机柜夹出一条能走进去的冷通道)
Thinking
实际参观完工厂和液冷展览会,在我看来,技术壁垒多在产品的大厂认证盖章、产品的形态以及工程的交付。各大家能收购液冷标的、或者频繁在液冷赛道做出成绩,也说明本身的研发技术壁垒并没有很深——大多没有液冷专业出身做 CDU 的产品,而是水系统研发转为负责 CDU 赛道。
DC 出海前方一片蓝海,要扬帆起航了。
02 深信服科技|把开源 FastGPT 做成 To B 商业版(AgentBuilder),入口是可视化工作流,落点还是自家云
FastGPT:FastGPT - 企业级 AI 智能体构建平台 | 开源 RAG 系统
深信服将开源的 FastGPT 商业化,做了一个 To B 的版本。现场看下来是这么几块:
导入知识作数据库。 可以将公司数据库导入作一个定向的内容提取,加快回答效率和准确度。
可视化工作流(👍)。 搭建工作流 flow,让界面清晰可见,将重复的任务变成自动的,将复杂的任务变成可复盘的。很像 Obsidian 的思维导图,WORKFLOW 可视化版,AI native 一人公司和 sub agent 的导图版本,可以很清晰地梳理工作逻辑和找到重要步骤,很有性价比。
(图 9 FastGPT 的可视化工作流编排界面:一条「简历筛选助手_Excel」的 flow,从流程开始、判断是否上传、批量执行一路串到指定回复)
(图 10 现场大屏上打开的「合同审查助手(基础版)」编排页,左栏是 AI 对话、知识库检索、Agent、表单输入、HTTP 请求这些可拖拽节点)
数据智能分析。 现场的产品经理演示了合同审查助手,如何扫描合同识别文字、签字、数据、表格并上传到内容。但是了解到是接入了其他家的 OCR MCP(可能是百度开源的 PaddleOCR 或者合合信息的),所以扫描质量全看 MCP 接入的 OCR 质量,这点略尴尬。
💡 剩下两块都是标配:把钉钉的功能塞进企业微信里(能力清单)
工作流编排。 像钉钉的功能塞到企业微信里,将定制化功能集成到你的工作流里,增加部分非标,比如在对话前进行合规检查等操作。
API 集成。 标配了,算是开放接口,可以直接嵌入到你的工作 PaaS 里。
流程图截取自官网如下:
(图 11 FastGPT Functional Architecture:知识库走预处理器进语言模型做 QA 拆分与文本分段,再经向量模型写入 PostgreSQL;对话侧由 Flow Controller 调用编排流程,把问句向量化后做相似度检索,截自 FastGPT 官网)
(图 12 展台展板:「FastGPT 深信服商业版(AgentBuilder)· 0 专家 好效果」)
Thinking
主要应用于作数字化转型的企业,本地部署数据库,以托管或者 AI 平台拉近客户需求,本质还是会售卖深信服自有的云计算业务。
以上平台 To B 需要区分不同行业的应用模式。但如果只做 RAG 和私有化部署,为什么不直接自己找 FastGPT 的人去调?还是在做 MaaS 的前哨。
03 合合信息(扫描全能王)|C 端扫描能力已经够用,B 端「启信慧眼」想做 AI 版企查查
还是 To C 的内容居多。最新的技术宣传的是将古代挂画以更清晰的方式扫描成电子档留存,很适合做博物馆或者展览游览电子笔记。
一开始我以为是将书法的内容可以扫描成现代文字,结果是变成更清晰的电子版了(😓)。可以去反光、保真,有更好的留存表现效果。其实我还是关注扫描发票或者报销单的清晰度和速度,已经很够用了。
(图 13 合合信息展台的古画数字化:两块竖屏并排,右边是扫描后的青绿山水长卷,左边是同批的书法文献,底下玻璃柜里摆着纸质原件对照)
To B 应用:启信慧眼,AI 企查查。
可以直接问他们企业的官方数据信息,可以实时接入工信部公开的数据,快速定位和穿透股权图,方便做寻源和了解企业关联。
🍿 由此想到的一个反例:数据库要手动更新的银行 AI 查询系统
(这样我想到了去年农业银行推出的金融查询系统,和华东师范大学合作的 AI 平台。整体功能和想法是通过 AI 快速拉取企业年报财报去做调研咨询并给出评价,但最致命的数据库却需要每次手动更新。)
Thinking
To C 端的好坏取决于价格:如果能以低于企查查和爱企查的价格去做 AI 搜索和更多的功能开放,会有更好的效果。
本质国内查询类的软件,还是牌照生意。
04 上海道客 DaoCloud|K8s 与推理引擎供应商,卡在 CUDA 之上、多算力池之间的那层「胶水」
K8s 技术供应商、加速推理服务、调度平台,软硬件的「胶水」。
想要做好推理,除 CUDA 架构外,引擎是必不可少的,可以给多端云、多算力池做调配。很像是 token 中转站,但是引擎版中转站。
道客在我的印象里是做硬件起家,现在同步开展引擎赛道;不过外界通常把它认作云原生 / K8s 软件出身,两种说法并存,也可能是我记混了。
有一个前提:其实 NVIDIA 更高的护城河,不是晶圆的堆叠和 nm 的精度,而是 CUDA 推理架构的技术壁垒。每一代大模型、或者其他推理与计算,都是基于 CUDA 这套闭源架构语言编制的——它不开源、也只跑自家的卡,别家没法拿过来改,只能另起一套再倒回来追适配。所以每一家大模型基本都绕不开对 CUDA 的适配。
💡 CUDA 卡在操作系统之上:十几年生态堆出来的那个位置(技术账)
CUDA 的生态恰好位于操作系统之上,这么多年不断有软件开发者和公司进行适配。基于强大的 GB 系列的卡和 CUDA 架构,才有了现在的 LLM 爆炸的时代。PyTorch、TensorFlow 对 CUDA 有深度优化(cuDNN、cuBLAS),这两个库同样是闭源的。适配做得越久,上层生态越是沉在这套闭源栈里,真正的门槛也就越是卡在生态位上,而不是卡在制程上。
这也是 DeepSeek 为何要执意开启对昇腾芯片的适配——也是想要打开 CUDA 做训练的护城河。个人看来,这一步并没有走通;也许这也是 DeepSeek V4PRO 晚发布的原因,最后还是用了英伟达的 GB 系列训练,可见 CUDA 对大模型的训练的重要性(猜测,需矫正)。
(图 14 NVIDIA 自己画的软件栈分层:CUDA(红框那条)夹在「操作系统与系统软件」之上、NVIDIA 与第三方的库和框架之下,最底层才是 CPU / GPU / DPU)
而引擎 K8s(使用 Minikube 创建集群 | Kubernetes[4])就是在 CUDA 之上,主要以管理编排为主。
(图 15 道客的「架构现代化」架构视图:最底层是 Kubernetes 发行版(原生计算 / 网络 / 存储 / 观测采集),往上叠容器管理、多云编排、微服务引擎与网格服务、中间件、可观测和安全,最顶层才是应用工作台)
(图 16 DaoCloud Enterprise 5.0 白金版产品架构:云原生底座之上分多云编排、数据服务、微服务治理、可观测性、应用商店 / 虚拟机 / 应用交付,底下横跨公有云、私有云、信创异构(鲲鹏 / 飞腾 / 海光 / 龙芯 / 兆芯 / 麒麟 / 统信 / 欧拉)与云边协同)
(图 17 道客展台上摊开的一台笔记本,页面是 d.run Token Factory:左侧列着高性能网络、LLM-D 分布式推理编排、KV Cache 管理、vLLM / SGLang / TRT-LLM 推理引擎,右侧是官方给的加速对比数字,旁边立着 NVIDIA Dynamo 的展牌)
Thinking
我咨询产品老师,目前国内想要突破 CUDA 的架构护城河还需要多久,以他们的角度,仍有较长的路要走。
同样的大模型在不同的引擎下的表现也不同。我在此领域十分外行,仅能阐述到此。
05 百度|最早下场的互联网大厂,却「总是赶不上热乎的」
讲到百度,个人的偏见如下。
百度一直是互联网技术最早的风头走向,也是最快下场的互联网大厂,但是后续的劲头一直是不如人意。
文心一言 2023 年 3 月 16 日发布时挂的是「百度是全球大厂中第一个做出对标 ChatGPT 产品的企业」这个 title(李彦宏在发布会上的原话,当年媒体则普遍以「首个中国版 ChatGPT」相称)。但个人观感是现在的声量已经明显小于第一梯队,公开数据也大致对得上:C 端按 QuestMobile 的口径,2025 年 9 月文心一言月活 530.91 万,同期豆包 1.72 亿、DeepSeek 1.45 亿;到 2026 年 6 月,AI 原生 App 月活前三是豆包 3.82 亿、千问 1.67 亿、DeepSeek 1.30 亿,百度系已经不在榜单前列。云侧按 IDC 2026 年 5 月发布的《中国企业级 MaaS 市场最新格局分析报告》,2025 年中国公有云上大模型调用量 1944 万亿 tokens,火山引擎 49.5%、阿里云 28%、百度智能云 10%;而半年前的 2025 上半年口径里,百度智能云还有 17%(同期火山引擎 49.2%、阿里云 27%)。
甚至在我所在的 DC 行业,百度数据中心也是极早推出了冰川相变系统、磁悬浮多联的暖通方案;业内不少专家也是出自百度基础设施部门。
🍿 圈里流传的一个段子:Dario 限制中国用户,是因为当年在百度实习过?(玩笑话)
AI 圈里流传过一个段子:说 Anthropic 老板 Dario 之所以如此限制中国 AI 用户,是因为他早年在百度实习过——至于那几个月受了什么非人的折磨,段子里没说。当然只是玩笑,公开资料里他实习几个月就走了,真实原因和这段经历没什么关系。
无论如何,百度的现状是唏嘘的,总是赶不上热乎的。个人看来,Perplexity 这类 AI 搜索引擎替代掉百度的一部分场景,是时间问题。
互联网最大的好处,是经年累月的生态和影响力让人使用成为习惯,很难戒掉;但是坏处是(这里是我的偏见),降本增笑的员工总会躺在功劳簿上,慢慢磨去大家的脾气。当听话又好用的初创 AI 公司让你免费尝尝鲜的时候,你就会想,百度?旧人罢了,old and inefficiency。所以积极打破舒适圈尝鲜才会有感触。
回到产品侧,我除了想去领小礼品外真的没有多看百度的 MaaS 等软件。最吸引我的 PaddleOCR 也没有出现:这个领先全球的开源 OCR,简直是扫描界大模型的精华。
引用 OpenDataLab 评测网站:
(图 18 OCR 评测榜单:PaddleOCR-VL-1.6 以 96.34 总分排第一,后面依次是 MinerU2.5-Pro、GLM-OCR 和 PaddleOCR-VL-1.5,分列文本、公式、表格、表格结构、阅读顺序五个维度,截自 OpenDataLab 评测榜单)
学习 OCR 架构图:引用 CSDN【大模型基础】OCR 技术全解析:从原理到实践的深度指南 - CSDN 博客[5]
(图 19 OCR 的完整技术架构:数据输入层进来后经预处理层(去噪、增强、倾斜校正、二值化、版面分析),到核心模型层的文本检测(DBNet)与文本识别(Transformer+CTC),再经后处理层的语法纠错、格式标准化、语义修正,最后落到文档数字化、票据识别报销、身份核验等应用层,来源见 [5])
把上面这张图压一压,主干其实只有一条流水线:
(图 20 OCR 技术架构简图,AI 绘制)
昆仑芯一直是只听其声,此次也没有过多了解,重点都在 H2 馆的华为 950POD 去了。
💡 昆仑芯复习:P800 对标 A100、M100 转推理,出货量与寒武纪并列国产第三
昆仑芯复习如下:
简单来说,P800 对标 NVIDIA A100,在 FP16 下 345 TFLOPS;目前 M100 对标 H20,主用于推理。P800 的公开规格是 96GB HBM、FP16 345 TFLOPS,稠密口径(昆仑芯官网并未公布完整参数,该数字来自 TechInsights 的 die 分析,本届 WAIC 的现场报道也是同一组数),对照 A100 的 FP16 张量核心 312 TFLOPS 稠密、H20 的 148 TFLOPS,对标 A100 这个说法站得住。M100 是 2025 年 11 月百度世界大会官宣的第四代芯片,官方定位就是面向大规模推理场景优化,全国产供应链,计划 2026 年初上市,实物则是在本届 WAIC(2026-07-20)才第一次公开展出,对标的正是 H20;再往后是计划 2027 年初上市、面向超大规模多模态训推的 M300。
据 IDC 数据,2025 年中国 AI 加速卡总出货约 400 万张,其中国产厂商合计出货约 165 万张,占比 41%。昆仑芯与寒武纪各出货约 11.6 万张,并列国产第三,仅次于华为昇腾(81.2 万张)和阿里平头哥(26.5 万张)。
(图 21 IDC 的两张口径:左图是 2025 年中国 AI 服务器按加速卡类型划分的市场占比(GPU 58% / 非 GPU 42%),右图是国产芯片厂商 AI 加速卡在国内数据中心的适配数量占比:华为 49%、平头哥 16%、昆仑芯与寒武纪各 7%,来源:IDC)
昆仑芯架构采用的是自研的 XPU 架构。
引用官网架构图如下:
(图 22 昆仑芯 SDK 的软件栈全景:最底下是昆仑芯 AI 加速器与操作系统(Ubuntu / CentOS / Debian / BC-Linux / 统信 UOS / 麒麟 Kylin),中间是运行层、SDK(XTDK、XTRANSCUDA、XTRITON)和专业库(XDNN、XECV、XCCL 等),往上对接 PyTorch / TensorFlow / PaddlePaddle、DeepSpeed / Megatron、TensorRT-LLM / vLLM / SGLang,最后是模型与应用,截自昆仑芯官网)
另外,虽然服务器 POD 没有仔细研究,但是这个 CDU 的 logo 着实吸引了我的注意力。不知道是不是受到一个好朋友执念的影响,还是将图片拍摄了下来,用于学习 CDU 架构图和缅怀。
(图 23 CDU 柜门上的本地控制屏,一屏给全:一次/二次侧进出水温、系统压差、流量、调节阀开度、双路 PSU 状态,右下角印着厂商 logo)
(图 24 百度智能云展台的 AIRack 机柜阵列,展板写着「智能时代基础设施」)
(图 25 同一排机柜的近景,柜顶是成对的红蓝液冷软管和快接头,红热蓝冷)
PS,蓝蓝绿绿的,有点辣眼睛。
Thinking
百度的现状是唏嘘的:最早下场,后续的劲头却一直不如人意,总是赶不上热乎的。互联网经年累月的生态和影响力让使用成为习惯,很难戒掉——这是护城河;但我的偏见是,降本增笑的员工躺在功劳簿上,护城河也会慢慢被磨平。当听话又好用的初创 AI 公司让你免费尝尝鲜,「百度?旧人罢了,old and inefficiency」就是用户用脚投票的那一刻;Perplexity 这类 AI 搜索接管一部分场景,个人看来是时间问题。所以,积极打破舒适圈尝鲜才会有感触。
06 商汤科技|AI 奠基者的时间差:曾经「最懂中文」,优势被通用大模型抹平
讲到商汤,就离不开商汤的背景。创始人是中国 AI 奠基人之一。个人看来,商汤的产品节奏比新一批大模型创业公司慢半拍,具体原因不好判断,但从对外发布的密度上能感觉出来。
最能直接了解到商汤产品,ToC 端能接触到的最多的就是酒店的机器人和扫码入住的读取器。ToB 侧目前有自己的多模态和各个领域专精的大模型以及 token plan,和部分云服务。
商汤在大模型领域也昙花一现过。商汤日日新曾经被称为最懂以中文为输入输出条件下的大模型,但个人的理解是,随着模型整体能力上来,中文语料上的先发优势被摊薄了:任何语言在传输理解上都是相差不多的,曾经的优势也有些荡然无存。(这只是我的观察:MoE 管的是参数路由、KV Cache 管的是推理侧的显存与加速,这两件事和「中文优势被抹平」之间并没有直接的因果链。)
图片生成这条线商汤倒没停:就在这届 WAIC 上(2026-07-18),日日新发布了 SenseNova U1 Pro,官方给它的定位已经从单纯的图片生成大模型改成了「面向长程任务的原生多模态智能体基座」。最高 8K 原生分辨率输出,曝光期就是奔着 GPT-Image-2 去的,正式版与 API 计划 2026 年 8 月向公众开放。只是由于国情原因,国内的大模型语料库需要加以限制,再加之最好的大模型方向是通用大模型,这条线走得没有通用模型那么快而已。
目前日日新的 token plan 可接入的模型如下,还在起步阶段:
💡 token plan 目前只开了三个模型:两个 SenseNova 轻量版 + 一个 DeepSeek Flash
(图 26 日日新开放平台 token plan 的可接入模型清单:SenseNova 6.7 Flash-Lite、SenseNova U1 Fast、DeepSeek V4 Flash,三者均按每 5 小时的调用次数限流。截图自商汤日日新开放平台)
LITE 轻量级模型 BENCHMARK 评分:
(图 27 SenseNova 6.7 Flash-Lite 的十项 benchmark 对比:PinchBench、ClawEval、τ³-bench、Deep Planning、NovaPPTBench、AIDABench、GPQA-diamond、AA-LCR、MathVision、OCRBenchV2,对手是同体量的 Step 3.5 Flash、GLM-5、KIMI K2.5/K2.6、GPT 5.4、Gemini 3.1 Pro、Opus 4.6。榜单与对手均为厂商自选口径,截自商汤官方物料)
Thinking
创始人是中国 AI 奠基人之一,但个人看来,产品节奏一直慢过新一批创业公司——奠基者的身份没换来节奏。曾经「最懂中文」的日日新,优势随着通用大模型的推进有些荡然无存;图片生成这条线倒是没停,U1 Pro 就是这届 WAIC 发的旗舰,只是在语料限制和「最好的方向是通用大模型」这两条之下,走得没有主战场那么快;现在能对外开的 token plan,还在起步阶段。革命尚未成功。
07 腾讯|AI 押产品不押模型:IMA 抢知识库入口,游戏 Agent 还在起步
现在使用最多的企鹅业务就是他们的 IMA。背靠微信,很难不依赖文件类的 AI 个人数据知识库;而且可以直接放一些写的很棒的公众号文章进去,这样也不会让自己过目就忘,仅在 scroll down。
并且 IMA 作为可以链接腾讯侧所有产品的平台,可以接入的开放 MCP 很多——腾讯家的会议、文档、企微,还有飞书等等。目前我也通过 IMA 记录了很多 AI 的上下游知识。别的不说,当个工作文档的网盘就很好用了;再配个 Copilot,通过 AI 提炼就能在一众项目文件里发现你要的东西,这个强烈建议。
后续的商业模式变现也很方便:养成了知识库的习惯,就要开始对 Copilot 和存储内容收费了(公开的知识库目前是免费存放的)。随着用户的增加和黏度的上升,这种 AI 私域型产品也会冲击类似知识星球等传统社群软件。
个人看来,腾讯在模型侧的存在感弱于其他几家大厂,这里说的是模型本身,不含产品端。混元大模型 Hy3 还在宣传他们的 MoE 技术架构;在 OpenRouter 上的调用量倒是非常之大,估计也是因为挂了 free。
这里得把两件事分开:跑分(BENCH)是能力排名,调用量是用量排名,Hy3 冲得高的是后者不是前者;榜上靠前的模型普遍都带 free 标记,这本身就说明问题。
参考混元的参数:
💡 混元 Hy3:2950 亿参数 / 210 亿激活的 MoE,独立评测 41 分,落在开源权重第一梯队的后半段
目前 Hy3 采用 2950 亿参数、210 亿激活参数的 MoE 架构,支持 256K 上下文和快慢思考;独立 Artificial Analysis 评测给它 41 分,属于领先的开源权重模型,但低于 GLM-5.2 Max 的 51 分,也低于 Kimi K2.6 的 45 分(AA 智能指数会随版本重算历史分,这里的取数时间是 2026 年 8 月)。Hy3 本身还是纯文本模型,图像、视频能力不在该模型内。
(图 28 OpenRouter 的周度 LLM 调用量榜:Hy3(tencent)以 4.79T tokens 排第三、周环比 +43%,前两名是 DeepSeek V4 Flash 的 7.43T 和 MiMo-V2.5 的 7.23T;榜上带 free 标记的模型普遍靠前。截自 OpenRouter LLM Leaderboard)
腾讯 AI 的 WAIC 展台也多以产品应用端呈现。导致有些落后的原因,我猜测为:
1、更注重用户习惯的培养,倾向于打造全家桶 AI 产品:腾讯文档、企业微信、IMA、腾讯会议等;
2、投入的分配和别家不一样:腾讯 2025 年在「AI 新产品」上的投入超 180 亿元(光 Q4 单季就超 70 亿),2026 年预计至少翻倍;但全年资本开支其实是 792 亿元——钱并不少,只是没像别家那样把资源集中砸在一个语言模型上;
3、集中发力在办公 MaaS 平台,如 WorkBuddy 和 CodeBuddy,希望通过降低门槛获客;
4、覆盖面太广,同时做语言、图像、视频、3D、机器人、云服务和大量内部业务,资源不像一些创业公司那样集中押注一个语言模型。
(图 29 腾讯展台的「智能体应用 Deploy Your Agents」主墙:中间三块屏分别是 QClaw、WorkBuddy(企业职场 AI 智能体工作台)和 CodeBuddy(AI 原生编程开发智能体),顶部横条挂着一整排可接入的智能体应用图标。产品端的家底基本都在这面墙上了)
我对企鹅最感兴趣的就是他们的游戏 AI Agent 部分,毕竟宇宙第一游戏公司。但从展台现场的演示和讲解看,目前的腾讯游戏 AI Agent 可实现的功能较为基础,主要以拓展 agent 的受众为目的,可以通过简单的指令实现游戏制作,并有对游戏制作流程的可视化。
我本以为现在腾讯会直接以游戏引擎为 AI 的主攻方向去做拓展,比如基于 Unity 或者虚幻引擎等,可以自动建模、搭建空间、动作、3D 生成以及特效生成全流程。但是想到这个工作量不大可能在这个小 Agent 上实现,而且调用的 MCP 或者工作流过于繁杂,不现实。
这个很像 CAD 画图软件。我记得大学有位同学提出的选题就是这个方向,AI 实现 AutoCAD AI 工作流。但和设计院的专家沟通下来,实际工程上:第一,实现自动画图是有可能的,但是难度较高;第二,最重要的是实现甲方的想法,但 AI 理解不到,或者没法按项目的实际情况去“被牵引”,最后还是要回归到人的技术,即使 AI 可以实现。
回到游戏引擎的 AI 落地。我一直坚定看好游戏公司:从大时代后,游戏行业一直是默默吃肉的行业,每年的增长都在中上游[6]。
而游戏 AI 的落地也是属于 AI 产品化获客的最终范式。因为 AI 时代,要么打破原有体系架构、植入 AI 环节,要么使用 AI 搭建全新 native 范式替代原有架构,最终目的都是通过 AI 作为工具产品化后获客转化并盈利;而产品化或者植入架构的最好落地之一就是游戏,也是属于后 AI 时代软件和硬件结合的 EDGE AI 行业的一环,真正能影响人的习惯。
恰好,前一段时间 Unity 收使用费的新闻爆出过,大家才知道利润如此丰厚、时效性如此之强,费用可以收到 20 年前使用 Unity 底层架构搭建的老游戏。
这件事的完整时间线值得摆出来当佐证:2023 年 9 月 12 日,Unity 宣布 Runtime Fee,不按收入抽成、直接按安装量收钱,最高每次安装 0.20 美元,2024 年 1 月 1 日起生效;门槛是 Personal / Plus 版年收入 20 万美元且累计安装 20 万次,Pro / Enterprise 版年收入 100 万美元且累计安装 100 万次。最要命的一条是它追溯适用于已经发行的老游戏:你十年前用 Unity 做的那款游戏,今天还有人在装,你就得开始交钱。开发者当场炸锅,集体抵制、扬言换引擎,Unity 甚至因为收到威胁临时关闭了办公室。11 天后的 9 月 23 日,Marc Whitten 出面道歉并大幅回撤:Personal 版完全免费不收费,门槛提到 100 万美元,且只对 2023 LTS 及之后版本构建的游戏生效,2022 LTS 及更早版本做的游戏全部豁免——存量老游戏实际上被摘了出去。
再一年后的 2024 年 9 月 12 日,Unity 官方博客宣布彻底取消 Runtime Fee,回到按席位订阅,代价是 Pro 版涨价 8% 到每席位每年 2,200 美元、Enterprise 版涨价 25%,2025 年 1 月 1 日生效,Personal 版的免费收入上限则从 10 万提到 20 万美元。
所以这条新闻最后是以回撤收场的,拿它直接当「收费韧性」的证据要打个折扣。但我觉得它暴露出来的东西反而更值钱:一家引擎公司敢把手伸到 20 年前的存量装机上去收费,说明引擎在存量资产上本来就是有定价能力的——这次只是没收成,不是收不了。而这正是我看好游戏 AI 落地的原因:如果哪家公司可以让 AI 引擎植入后时代游戏中,除了引擎的固定收费外,还有了 AI 的落地费用,更加加大了 AI 的使用和利润的转化。
至于 Unity 在中国的资本动作,公开消息的方向其实和「上市」相反:2026 年 3 月有报道称 Unity 正在评估中国业务的各种战略选项、包括潜在出售,目标估值可能超 10 亿美元,腾讯、阿里、字节、米哈游都在潜在买家名单上(多数本来就是 Unity 中国的现有股东),磋商仍处早期;境内上市则没有任何公开计划。
既然聊到值多少钱,就把这门生意的几组数摆出来。Unity 是美股上市公司,财报是公开信息,下面凡是有公开出处的都标了来源。
• Unity 的毛利:我记录的是「大于 60%」,公开财报比这更高。Unity 2025 财年营收 18.496 亿美元,GAAP 毛利率 74%、经调整毛利率 83%(2025 年四季度单季分别是 74% 和 82%);2026 年一季度营收 5.082 亿美元、经调整毛利率仍是 82%,只是 GAAP 口径因为 ironSource 广告网络关停和 Supersonic 剥离一次性计提了 2.787 亿美元减值,被砸到 31%。所以「利润如此丰厚」这个判断成立,实际数字还要再高十几个点(Unity 2025 年报、2026 年一季报)。
• 游戏行业 7000 亿美元:这个数得先说清楚是哪个口径。Newzoo 只统计玩家花在游戏内容上的钱,2025 年是 2016 亿美元,首次破 2000 亿、同比约 +9%(PC +12%、移动 +10.7%、主机 +2.8%);Grand View 的泛游戏市场口径 2025 年 3349 亿美元、2026 年 3748 亿美元,要到 2033 年才 7520 亿;Statista 的口径最宽,把主机、PC、移动、云游戏、游戏硬件、游戏直播、游戏内广告、游戏网络全算进去,2026 年 5779 亿美元、年增 8.0%。所以,我记录的 7000 亿不是「今天的游戏软件市场」,它对得上的是最宽的泛游戏产业口径再往后外推两三年;和 Newzoo 的 2000 亿差 3.5 倍,差的就是硬件、直播、广告这些根本不进 Newzoo 表的部分。下面几条分解,分母按这个泛口径看。
• 制作环节占 20%、市场规模 1400 亿美元;其中人力 1300 亿美元、服务器硬件 100 亿美元:这组分解是我记录的口径,公开渠道没有对应的拆分,放在这里只看结构比例:制作环节里九成以上是人力,硬件几乎不占钱。
• 引擎 10 亿美元左右:这一条和公开数据最贴。第三方给的全球游戏引擎市场是 2025 年 36.5 亿美元、2026 年 43.3 亿美元(Precedence Research);Unity 自己的引擎业务 Create Solutions,2025 财年收入 6.45 亿美元。所以「10 亿美元量级」对得上单家引擎公司的引擎收入,全市场大约是它的三到四倍。
把这组数并排看,游戏引擎这门生意的形状就出来了:整个产业几千亿美元的盘子,真正落到引擎手里的只有几十亿美元(按 Newzoo 的两千亿口径算约 2%,按泛游戏口径算连 1% 都不到),可它守着 70%–80% 的毛利。收得少、赚得狠,赚的是那个位置的钱。而它的 AI 部分到底值多少钱,只能拿公开口径去对标。
📊 Unity 的 AI 部分要对标谁:Anthropic 的 ARR 曲线,和垂类 Agent 的估值倍数
下面这几组数的时点都截至 2026 年 8 月:
Anthropic ARR 2025 年 90 亿美元,2026 年 5 月,ARR 440 亿美元,9000 亿美元估值
• 智谱(GLM)2025 年收入 7.24 亿元人民币、约 1 亿美金(7:3,同比 +132%),2026 年预计 3.5 亿美金(这条预测是圈内说法,公开渠道没有对应口径;可对照的公开数据是 2026 年 3 月智谱披露年度经常性收入已达 17 亿元人民币、约 2.4 亿美元,API 调用量 6 个月增长 15 倍);市值这条线更夸张:2026 年 1 月港股上市首日 579 亿港元,2026 年 5 月摸高 8800 亿港元(约 1130 亿美元,已超美团和网易),6 月 24 日最高 9693 亿港元、一度越过万亿港元
• 群核科技 2025 年收入 8.20 亿元人民币(约 1.15 亿美元),订阅占 96.9%;而被资本市场寄予厚望的空间智能(SpatialVerse)业务全年只卖了 520 万元人民币、占总营收 0.6%、客户仅 16 家。所以「基本没有 token 收入、收费能力差」这句话有财报口径撑着,不是我的偏见(钛媒体《拆解群核:一年只卖 520 万的 AI 故事,凭什么值 636 亿?》);市值 2026 年 4 月上市后两天冲到 636 亿港元、盘中最高对应 837 亿港元,到 2026 年 8 月 7 日已跌回发行价、较高点跌近八成(约 130 亿港元)
• 垂类 Agent 估值会更高(数据截至 2026 年 8 月):
• Harvey(法律):ARR~$350M,在谈估值~$15.5B,约 44x PS(三个月前的上一轮是 $11B 估值 / $200M 融资)
• Cursor(代码):ARR $2B(2026.2),最后一轮独立私募估值 $29.3B(2025.11,彼时 ARR 已 $1B+,同期口径约 29x PS),2026 年 6 月被 SpaceX 以 $60B 全股票收购、待监管批准
• Abridge(医疗):ARR~$180M(这是我记录的口径,Sacra 的公开口径则是 2024 年底 $60M、2025 年 5 月约 $100M),估值~$5.3B(2025.6 Series E),29x PS
Thinking
坚定看好 EDGE AI 及应用。腾讯的选择其实是清楚的:模型侧的存在感弱于其他几家大厂,但产品侧把 IMA、文档、企微、会议连成了全家桶,先培养用户习惯,再谈模型能力。而我最感兴趣的那条线——游戏 AI Agent——目前还停在「拓展 agent 受众」的基础功能上,没有走到引擎级;从 CAD 的前车之鉴看,难的从来不是自动画图,而是甲方的想法 AI 理解不到,最后还是要回归到人的技术。但游戏 AI 的落地依然是 AI 产品化获客的最终范式:Unity 那套 Runtime Fee 最后是被开发者抵制掉的,可它敢把手伸到 20 年前的老游戏上,本身就说明引擎在存量资产上有定价能力——谁能把 AI 植进引擎,谁就能在引擎的固定收费之外,再叠一层 AI 的落地费用。何况引擎只占整个游戏产业百分之一二的盘子,却守着 70%–80% 的毛利,这个位置本来就值钱。
08 金山办公|灵犀 AI 与席位收费法:办公 SaaS 自带的受众,就是 AI 的销售渠道
金山办公算是带着好朋友体验了一下,现在的 AI 应用产品已经以何种方式来呈现。
在上一届 AI 大会,我仍然记得 AI 产品以 DeepSeek V3 一体机为亮眼产品。我其实非常不解这种模式,特别是仅有 32B 的模型,为什么还要花几万块去购置并不高端的算力;但是了解到 ToG 的模式和内嵌的办公或者对国家政务 Agent 的内容,一下就搞清楚了。
今年,对金山办公感兴趣的是他们的办公 AI 产品,灵犀 AI 办公:内嵌的许多开源的大模型可以选,GLM、DeepSeek、Seedance 等等,以席位来收费;功能上基本等同于 Claude 内嵌在 Excel 去帮你完成汇报差不多。
办公软件等 SaaS 产品能直接吸引庞大的受众,也会无形增加了 AI 的销售渠道。
做材料、整理、写 PPT 等能力,我觉得重要度有限。更重要的是如何将理解和学习的东西逻辑化思考和表达,并符合受听者公司/客户想要的主旨思想;这些最后都会落到同一件事上——信息传达方式的迭代,只会越来越快、越来越高效。
AI 作为使用工具有两个范式:1、打破原有产品架构塞入 AI 工具继续运行;2、AI native 一人公司或使用 AI 重塑整个架构。最终目的都是加入 AI 的使用形成新的应用端或其他形式,来吸引客户去转化为 MAU 和 DAU,完成留存和变现。
价格范式如下:
(图 30 订阅页上的四档价格:体验版限时免费、每月 800 灵点,标准版 ¥48/月、5,000 灵点,进阶版 ¥128/月、14,000 灵点,旗舰版 ¥398/月、48,000 灵点;四档之间真正的差别只有两样:每月发多少「灵点」,以及能不能用 Pro / Max 模式,云空间一律给 1T。截自订阅页,价格随活动浮动,以官网为准)
补一句面向企业那一侧的公开口径:灵犀专业版 2026-07-15 发布时还在邀请码内测,席位价格未公布;官方的说法是传统订阅制与按调用量计费会长期并存,用量大的企业可以自带 Token,也可以通过金山办公采购增值 Token(金山办公 CEO 会后群访,2026-07-17)。作为参照系,WPS 个人会员的年费档位大致在 ¥89–250/年(会员 / 超级会员 / AI 会员三档),单月购买约 15–40 元。
所以如何结合 AI 和 AI 多 agent 流的安排就尤其重要了。其中我观察到,AI 产品化最大的标志也就是所谓的席位收费法,我是最先在飞书上感受到的。
🍿 我自己的踩坑路径:从折腾自建 OpenClaw,到直接买飞书的 claw 云服务
一开始 OpenClaw 爆火后,我就开始直接去尝试用飞书接入 OpenClaw,完成了第一次的通讯。后来看到不少关于自建 OpenClaw 部署安全性的讨论,加上没时间折腾多个 harness 在不同端的落地,就选择了飞书的 claw 云服务,同时购入了飞书的 AI 妙搭会员。
一开始我很纳闷,为什么每个月会以 1000 点/月形式发放我的使用。对于个人用户来讲,这其实模糊了使用的 token、调用的次数、使用量等等详细信息,而且没法详细地知道调用的模型情况,一开始我很不舒服。
后来以产品形式去理解学习就豁然开朗了:这也是产品进程的标准之一,把复杂度收进黑盒。用户看到的是一个价格和一个额度,看不到底下换了哪个模型、开了多大强度,于是易于接受,功能可选。从选择众多模型 API、MAX/THINKING 强度、实现目的、Agent 选择,变成了两档会员——给人选择题而不是填空题,会更简单地搭建业务模式和雏形。不得不说,真的是成功的。
回到灵犀 AI,看到 WPS 内嵌 AI 来干活,和席位的分配,未来的办公范式已然出现在面前。如果可以结合豆包手机等应用终端再加个远控渠道,24h 的数字人不需要了,这将会比微信 on call 的状态更恐怖,每个人的人均产出将会是过去的 2 倍甚至更高(这是个人体感,公开研究给出的多是单任务级别的提效幅度)。当然,也会淘汰掉不熟悉应用的人。
(图 31 金山办公展台的主视觉「AI-Native@Work / AI 原生办公」,吊旗从左到右是 WPS 365 企业大脑、WPS Comate 与灵犀 AI 原生办公 AGENT)
Thinking
自费 AI - 效率变高 - 任务变多 - 承压增加 - 挤压就业空间 - 创造新形式。
席位收费法之所以是 AI 产品化最大的标志,是因为它把众多模型 API、MAX/THINKING 强度、Agent 选择压缩成了两档会员——给人选择题而不是填空题,业务模式才搭得起来;而办公 SaaS 本身自带庞大受众,等于无形中给 AI 送了一条销售渠道。看到 WPS 内嵌 AI 来干活和席位的分配,未来的办公范式已然出现在面前,它当然也会淘汰掉不熟悉应用的人。不考虑个人学习和突破舒适圈的成本,我们每个人学习 AI 都是在给现在加速,迭代技术。
09 MiniMax|视频模型出海爆红,情感陪伴撑用户量、生产力产品撑 ARPU
MiniMax 目前有四部产品:基模、Vibe Coding 平台、海螺 AI、星野。
MiniMax 最早是以视频大模型在海外爆火的,同时也进入了国内赛道。上一次 WAIC,我甚至都不清楚他们的影响力。视频模型的重要性值得单开一章分析和学习。
他们已于 2026 年 1 月 9 日在港股上市,所以下面这一节的数字,凡是招股书里有的都取招股书口径。据我了解,他们的计划是 9 月份公布 M3 之后的下一代大模型(这条目前还没有官方口径)。
M3 是 2026 年 6 月 1 日发布的,主要是 MSA 机制(MiniMax Sparse Attention,论文 arXiv:2606.13392),和 Kimi K3 的 KDA 架构有一致的目的:解决 KV Cache,减少推理消耗,加速计算过程。官方给的效果是:支持 100 万 token 上下文,在最大长度下每个 token 的计算量只有上一代的约 1/20,prefill 阶段加速 9 倍以上、decode 阶段加速 15 倍以上——换句话说,它把「上下文长度」从一个成本项变成了一个可以继续往上加的维度。
(图 32 MiniMax Sparse Attention 的官方结构图:上半是索引分支(Idx Q1/Q2 → Idx KV → Block Max Pool → Block score → Top-k indices),下半是稀疏分支(Q1–Q6 按 Top-k 索引只去取被选中的 KV 块),两条分支最后汇到 Output Projection,整块仍套在 GQA 的注意力框架里)
把上面这张图按流程展开,就是五步:
(图 33 MSA 注意力机制流程,索引分支负责「定位」,稀疏分支负责「计算」。AI 生成)
💡 MSA 怎么把「每次要读的 token」砍下来:一条索引分支 + 一条稀疏分支
MSA 基于 GQA 的注意力框架,流程大致分四步:
- 在隐藏层先做初筛,用最大池化减少 attention 要看的范围,生成 QKV 和索引 QKV;
- 用索引 QKV 做相似度计算,然后切块(给不同的 token 做压缩和分组),并给出分数;
- 对不同块的分数做 Top-K,选出最相似的块;
- 根据索引块去真实 KV 中取出对应块,再做 GQA 注意力。
合起来看就是两条分支的分工:索引分支负责找到应该看哪一部分,稀疏分支用于看内容中重点的部分,从而减少了每次需要阅读的 token 量。
Vibe Coding 平台算是基于大模型的扩展,竞争对手有 QoderWork、CodeBuddy、Trae 等。后面有对 MaaS 市场的理解,此部分不再啰嗦。
再看星野,它对应的是情感需求市场:对标海外有 Character.AI,国内的盘子是 Talkie + 星野。但要注意它的转向信号——情感陪伴的付费用户 ARPU 远低于生产力产品,而海螺 AI 的收入占比在一年里大幅上移(数字见下)。
📊 情感陪伴的用户量和它的 ARPU 差了一个数量级
以下国内数据全部取自 MiniMax 港股招股书,口径截至 2025 年 9 月 30 日。
- 海外:Character.AI 4500 万活跃用户,2025 年收入约 5000 万美元、同比 +66%(2024 年为 3000 万美元)。用户数这一条的口径要留意:Business of Apps 的原文是「45 million active users in 2025」,既没写是不是月活,也没有「9 月」这个时点;DemandSage 引 Similarweb 的 MAU 则只有 2000 万出头,两者差一倍多,所以这里按「活跃用户」计。
- 国内的用户盘子:MiniMax 累计个人用户 2.12 亿、覆盖 200 多个国家和地区,其中 Talkie + 星野就占了 1.47 亿,海螺 AI 4235 万,MiniMax App 1906 万。也就是说,情感陪伴一条线扛起了全公司近七成的用户。月活这一条,我记录的是 2005 万,招股书的口径是全部 AI 原生产品合计 2762 万(同比 +44%;2023 年 310 万、2024 年 1910 万)。付费用户 177.2 万,同比 +262%(2023 年约 12 万、2024 年约 65 万)。
- ARPU 对比:情感陪伴(Talkie + 星野)付费用户 ARPPU 只有 5 美元;生产力产品海螺 AI 是 56 美元,正好是 Talkie 的 11.2 倍;MiniMax App 是 73 美元;B 端是另一个量级——2025 年前三季度开放平台与企业服务收入 1542 万美元、付费客户约 2500 家(2023 年才约 100 家),折算下来单客户约 6168 美元,和我记录的 6167 美元基本吻合。
- 结构变化:海螺 AI 收入占比从 2024 年的 7.7% 涨到 2025 年前三季度的 32.6%,同期 Talkie + 星野从 63.7% 掉到 35.1%。同一时间公司总收入从 2023 年的 346 万美元、2024 年的 3052 万美元(+782%),做到 2025 年前三季度的 5344 万美元(+175%)。
- 为什么必须转:招股书里最刺眼的一组数是毛利率——2025 年前三季度 C 端只有 4.7%,B 端是 69.4%。用户量在 C 端,钱在 B 端,这就是它把重心往生产力和企业服务挪的全部理由。
一开始我的想法是,情感需求的 AI 必将大放异彩。理由是现在社会基本遵循《认知盈余》书中提到的那套:人们大多拥有 8h 自由时间可以支配,可以享受娱乐,或者做创造性产出。
在消费、创造和分享的当下,情绪价值基本上是不可或缺的。无论是基于马斯洛需求理论还是社会达尔文主义,物欲膨胀的现在,金钱之外的满足感是最稀缺的。
抛开政府的伦理限制和未成年风险引导不谈,AI 情感陪伴的软件可以很低成本地获客,并像乙女游戏和追星活动一样,自动筛选出高净值的客户,并且粘度极高。
个人想法:在此逻辑下,情感需求 AI 软件的工程可以有两个思路。
- 完全自主创造:让 AI 回归它最强的能力,就是语义释义和逻辑推导,自由捏造角色。(是否类似酒馆文字角色扮演游戏?)
- 模拟主流乙游方式:照着《恋与制作人》等头部游戏走,用 AI 用量和多种多样的人物吸引用户消费、打造市场。
AI 的量变不一定引起质变,但是珠玉在先,且语音克隆如此成熟的现在,无论是打造完美老公还是完美女友,成本皆不会太高。
当然,产品还是要回归市场,市场还是要依附于政策。从 Character.AI 早期被起诉、诉讼中指控其智能体涉及未成年人自伤这类极危险红线行为开始,政府对此一直是抵制态度。如果转型,也是目前情感陪伴需求向的关键:是做私域,还是保有技术转换赛道,都是需要和政府以及公众博弈的部分。
但是 AI 形象的部分,目前除提供情感需求外,也不免包含蒸馏一个人的思路。
我曾在过年期间体验过一个初创应用 Elys,本质是社交平台植入 AI 分身:每个人有自己的分身,AI 分身会通过你的阅读浏览喜好、评论方式以及你的自身信息输入,蒸馏出一个简单的模型,替你 24H 冲浪。社交媒体重在分享的一环,由 AI 替代我们去发生。
所以 Elys 这个软件最后更像是一个观测站,观察 AI 们的大乱斗。如果复制了 100% 的你的信息和习惯的 AI 分身诞生了,AI 分身本身是否具有人格?
视频模型难在多维时间下保持生成的持续性。技术上不再展开,简单写下商业理解:
在基模赛道之外,视频模型是最快变现的两个赛道之一,另一个是 Coding。目前快手旗下可灵 AI 正在走分拆独立上市的路:2026 年 6 月传出 Pre-IPO 轮投前估值 180 亿美元(约 1220 亿元人民币),计划 2027 年初向港交所递交申报材料。
撑住这个估值的就是那个「4 倍」:ARR 在一年里从 1 亿美元做到接近 5 亿美元,翻了 4 倍;对应的是 2025 年全年收入约 10.4 亿元人民币(四个季度分别是 1.5 亿、2.5 亿、3 亿、3.4 亿),到 2026 年一季度单季就超过 6.5 亿元、同比 +300%,5 月全球 MAU 1318 万、累计用户超 6000 万。按投前估值除年化收入,Price/ARR 约 36 倍。视频大模型的估值就是这么被验证的。
(图 34 可灵分拆这件事的六个维度汇总:分拆与融资(Pre-IPO 20–30 亿美元、估值约 180–200 亿美元,腾讯参投,计划 12 个月内启动赴港上市)、收入爬坡(2025 全年约 1.4 亿美元 → 2026Q1 单季超 6.5 亿元人民币)、ARR 轨迹(一年 4 倍)、收入结构(订阅会员贡献近 70%,2026Q1 大部分收入来自海外)、用户与生态(MAU 破 1200 万)、成本侧(视频是多模态里最重的算力场景)。每行都标了时点与口径)
显而易见的,视频模型大量地冲击了短剧市场。最近演员戚薇也宣布 AI 化自己的形象用于出演短剧,这无疑加重了对传统行业市场的冲击。
短剧市场通过庞大的中文语义背景下的文学作品(特别是网络小说)生成内容,将文字带不来的实在多巴胺冲击感以画面呈现,而 AI 的应用使得成本下降 70% 还多。公开口径比这个数还狠:DataEye 剧查查的统计是 AI 短剧的制作成本只有真人短剧的十分之一,真人短剧一部约 150 万元,AI 短剧不到 20 万元,等于降了九成。但省下来的钱没落进兜里:同期投流成本同比涨超 100%,全行业日均投放 1.5 亿到 1.7 亿元,千次播放收入从约 60 元跌到 15–30 元。制作端的门槛被 AI 削平了,成本就整体挪到了流量端。
且在 To B 赛道,视频的生成应用于广告业、自媒体等等,都有了不菲的应用结果。这也是字节急速追赶的原因之一:Seedance 在海螺 AI 之后奋起直追,也是由于市场反馈极其出色。
插一句,AI Agent 对话里复习到的几点:
Manus 的形态值得单说。Manus 是最早意识到通用大模型才是最终模型、通用 Agent 也是最终形式的一家,也是最早做成 chatbot 样式实现 cowork 的应用。
- 不同 .md 区分的 agent 能力不会有本质区分;
- Agent 最重要的是上下文的注意力;
- Agent 自身安排比起人类安排多个 agent 更有效;
- 通用语义输入和理解。
这几点都是未来的类 Vibe Coding 产品的形式,也是为什么 Meta 看好的原因。2025 年 12 月 30 日,Meta 宣布收购 Manus 的母公司蝴蝶效应(Butterfly Effect Pte. Ltd.),对价约 20 亿美元,是 Meta 史上第三大收购。彼时 Manus 的 ARR 约 1.25 亿美元(2025 年 8 月还只有 9000 万),而它 2025 年 4 月 B 轮的估值才 5 亿美元左右,半年多翻了四倍;投资方名单里有 Benchmark(B 轮领投)、腾讯、红杉中国、真格。Meta 当时的说法是这笔交易带来了「数百万付费用户」,会继续独立运营 Manus 并把技术并进 Meta AI。
后面这一段才是这件事真正的落点:蝴蝶效应早在 2025 年年中就把总部从北京、武汉迁去了新加坡,交易照样没走成。2026 年 1 月 8 日商务部启动审查,3 月发改委约谈两位创始人,4 月 27 日外商投资安全审查办公室正式否决、要求撤销该交易,理由是国家安全与技术出口合规;Meta 从 2026 年 6 月开始解除交易,创始团队在谈的回购价格约 10 亿美元。当然,由于补贴、政府政策问题,隔绝中国身份的政治因素被限制,不在此篇讨论之内——只是这一单已经把那条线画得足够清楚了:产品可以出海,公司主体可以搬走,技术的归属权搬不走。
Thinking
通用大模型才是最终模型,通用 Agent 也是最终形式——Manus 最早意识到这件事,所以它能在半年多里从 5 亿美元估值走到 20 亿美元的收购对价;而这单最后被监管否掉、原样退回,也说明这条赛道上技术之外还有一层账要算。
回看 MiniMax 这四条产品线,逻辑其实是一致的:情感陪伴负责把用户量和粘性做起来,生产力产品负责把 ARPU 拉上去;而在基模之外,视频和 Coding 是最快能变现的两个赛道。至于差距最终在哪拉开,答案也写在上面那几条里——上下文的注意力,和 Agent 自己安排任务的能力。
10 阿里巴巴|唯二拥有 INFRA→芯片→云→大模型→Agent 全栈的厂商
阿里巴巴这一节内容太多,甚至可以单开一章。
但开头得先说件不好听的:阿里巴巴最近几年过得并不好,就像芒格说的一样,认为阿里巴巴不是科技公司而是零售商。2023 年 2 月的 Daily Journal 年会上,他的原话是「我把阿里巴巴当成我犯过最严重的错误之一……我被它在中国互联网里的位置迷住了,却没停下来意识到,他们仍然是个该死的零售商(they're still a God damn retailer)」。最近市场也印证了这一点,原因主要为:
入口战争的失败。10 年前的互联网大战就是抢夺每个用户的习惯,并通过这种方式转化为 MAU 和 DAU 变现。而阿里由于只有电商平台,社交和休闲最大的入口被字节和腾讯把握,现在电商又被 PDD、JD 等威胁,以及小红书等新的赛道。没有入口也就导致最大的消费渠道没有建立。阿里收购雅虎、建立来往社交 APP、收购微博、UC 浏览器、虾米音乐、优酷等,都是因为入口流量焦虑。
而现在,AI 来了。
发展的路程由人与计算机交互:通过人和鼠标用传统 Search 方式,如 Google 和百度,到移动互联网时代,在手机上通过人和手指间完成与机器的交互;现在用自然语言告诉 AI 可以简化以上所有步骤并完成入口。
这个入口可以带来的机会太大了,改变人的行为习惯,引流到自家的平台完成衣食住行的消费。这就是超级入口,也是转型的关键。所以才会有豆包和千问的春晚大战,目的就是为了抢夺这个入口。
2026 年春节这一战是全公开的:千问 App 投入 30 亿元,独家冠名河南、东方、浙江、江苏四台卫视春晚并参与节目共创;字节的火山引擎拿下央视春晚「独家 AI 云合作伙伴」,支撑节目创作、线上互动与直播技术,豆包在春晚期间连做三轮抽奖;同期腾讯 10 亿、百度 5 亿的红包计划也全部压在同一个入口上。(同理,豆包手机的爆火和被各家抵制也是这个逻辑,详细内容会在第二篇,AI 与硬件的结合中详谈。)
为了抢占这个入口,改写传统互联网战争的规则,科技的积累必不可少,而阿里的最强三板斧(阿里云、通义实验室、平头哥)有了最强的转型和拼杀条件:
阿里云
三板斧里先从云开始。了解了阿里云的产品,就可以更好地了解云计算架构。
用了阿里云平台的产品,最大的感受就是复杂和全面:太多了,有点不知道选哪个。
这一块按这个顺序走:先看阿里的架构与 IDC,再看云、大模型与 Agentic 社区,最后落到阿里的产品。
先说结论:agent 和大模型目前短暂的转化,都是为了更好地卖云而服务,和卖 IaaS 的目的一致——都是为了保有最好利润的 SaaS 和 PaaS 层。
中间这两步跳得快,补一下:硬件行业的利润是可见和确定的,一台设备卖多少钱、毛利几个点,摊开来就是那么多;软件不一样,软件会让这部分模糊化,而且复利——同一套能力嵌得越深、复制给越多的客户,边际成本越低、粘性越高,能在这方面攫取的收益是滚起来的。
所以卖 agent、卖大模型这两件事,短期看是在卖模型,中期看是把客户拉上云;上了云之后真正能长期收钱、还越收越多的,恰恰是 SaaS 和 PaaS 这两层,也就是下面那张表里「越往上利润越高」的那一头。
如今 MaaS 战场的开发,也让大家转移注意力,抢占这个赛道的客户去了,这个赛道带来的上下游效应不容小觑。而阿里恰好就是中国最强的云计算厂商,同时也是具备 INFRA—芯片—云—大模型与 MaaS—Agentic 五层架构唯二的厂家,另一家是 Google。
(图 35 Artificial Analysis 画的 AI 价值链玩家分布:纵向四层是应用、自研基础模型、自研云推理、加速硬件,颜色越深代表布局越强。整张表里四层全深、被虚线框出来的只有 Google 和 Alibaba 两列。来源:Artificial Analysis)
拥有了全栈的架构,才有选择的权力。这也是阿里能把大模型也做得全面的原因之一:从最小的模型到通用模型,开源闭源,视频音频文字图片,应有尽有。
再看阿里的 IDC 情况。阿里云在王坚院士的奠基下,算是中国云计算的开发者和开拓者,同时也是最大的保有量。阿里云的架构、IDC 的建设,对整个行业都是十分重要的。
目前阿里的 IDC 建设速度和规模也是持续跟进 global 的建设:全球 29 个地域、92 个可用区(阿里云公开口径),其中国内 15 个省份共有 60 个机房。
IDC 架构也走到了 CUBE DC 5.0 这一代,PUE 均 ≤1.1(公开口径是风冷 PUE ≤1.15、液冷 PUE ≤1.10):风液同源的冷却方案,把机电做成方舱式的产品化交付,供电、冷却、安防、智能化、消防五大系统的整体模块化率从早年的 30% 提到 90%,交付周期压缩到 100 天、综合成本再降 10% 以上。按容量分档,5.0A 是 31/34.4MW 这一档,5.0P 是 105MW 这一档。
云计算的核心也是转移 CAPEX 为 OPEX,再加上弹性和免自建。从云计算的定义即可了解:高弹性、按需采买、高可靠性,可视化、可量化收益,这些都是帮业主解决直接需求的。
上云的原因有多种,对应的服务也很多。
IaaS / PaaS / SaaS:想管哪一层,决定了利润在哪
传统 IaaS、PaaS、SaaS 的云计算业务,就是看业主想管哪一层级的生意,越往上利润越高。
| 层级 | 卖什么 | 阿里云对应产品 |
|---|---|---|
| IaaS(Infrastructure as a Service) | 卖资源 | 计算 ECS、存储 OSS/NAS、网络 VPC、DDoS 防护等 |
| PaaS(Platform as a Service) | 卖产品能力 | 容器 ACK、数据库瑶池、大数据计算、中间件 MSE,以及 Oracle、ServiceNow 这类 |
| SaaS(Software as a Service) | 卖直接结果 | 机器学习推理平台 PAI、百炼平台、Qwen,以及瓴羊、钉钉 |
目前阿里云的传统云计算市场非常强势,AI 云这个大盘子上做 To B 的生意也是第一。但要注意,大盘第一和调用量第一不是同一家——调用量的第一名还是字节。
📊 传统云第一、AI 云大盘第一,但调用量第一是字节
- 传统 IaaS:根据 Gartner《Market Share: IaaS, Worldwide, 2025》(2026-04 发布),阿里云在中国大陆 32.8%、排名第一,收入同比 +34.4%;亚太最大的 IaaS,22.5% 的份额;全球第四(7.7%)。
- AI 云大盘:阿里做 To B 的生意是第一,Omdia 的份额为 38.1%,超过第二到第四名之和;但要注意这个口径是「中国 AI 云市场」,即 AI IaaS + MaaS 合计(2025 年总盘 567 亿元,其中 IaaS 占 69%、MaaS 占 31%),不是单独的 MaaS 收入份额。而火山以豆包和 Seedance 为突围点,To C 的市场做得更好,Trae 作为 coding 平台也更早吸引大家使用。换到大模型调用量这个口径就完全是另一个故事:IDC 数据 2025 年中国公有云大模型调用量 1944 万亿 tokens,火山引擎 49.5% 第一,阿里云 28% 第二、百度智能云 10% 第三。
- 市场盘子:MaaS 的市场十分爆炸:IDC 口径 2025 年中国公有云 MaaS 市场已经做到 307 亿元,2026 年预测约 1860 亿元(IDC 自己也提醒这是高增长情景,依赖多模态成熟、Agent 规模化落地、算力供给与合规稳定这几个前提)。作为对照,2024 年 10 月那版 IDC 预测还只敢写 2024 上半年 2.5 亿元、2028 年 38 亿元、CAGR 64.8%,一年半就被现实推翻了,这个反差本身比任何增长率都说明问题。
- 财报:FY2026Q4 云智能集团收入约 416.26 亿、同比 +38%(其中外部商业化收入 +40%,两个口径别混);AI 相关收入约 89.71 亿/季、连续第 11 个季度三位数同比增长、占外部商业化收入首破 30%。
之所以去翻岗位,是因为一家云厂商怎么切市场,招聘页比任何一页 PPT 都直接。下面三张都是招聘官网公开可查的检索结果,检索时点为 2026 年 7 月:阿里云社招在 AI 销售领域设了 MTE 这个序列,赛道特别垂类,包括政府、金融、游戏、MNC、SNB、出海、具身智能、汽车等等。
(图 36 招聘官网按「AI 销售」检索,结果条显示在招 17 个岗位,来源见 [7])
(图 37 同一站点按「MTE」检索,在招 10 个岗位,来源见 [7])
(图 38 同一站点按「商业技术工程师」检索,在招 73 个岗位;同一批垂类,换个关键词数量差了七倍。来源见 [7])
把三次检索并排看:商业技术工程师 73 岗、AI 销售 17 岗、MTE 10 岗。垂类覆盖和上面列的一致;数量上售前技术序列远多于销售序列,而 MTE 作为独立关键词反而最少。招聘页是动态加载的,数字以截图时点为准。例如「阿里云智能-商业技术工程师(游戏方向)-上海」这个岗位[7]。
Harness 与 Agent:MaaS 平台在抢什么
截至写稿当日,MaaS 平台上腾讯 WorkBuddy 异军突起,靠着免费的调用额度和极强的生态开始吸揽客户。
由于我三大家的产品用得都不是很多,体验都截取自其他人的感受。一般 Vibe Coding 使用的感受取决于 Harness 工程优化的差异,比如 PLAN mode、全局记忆等内容。
Harness 本身是软件工程,而工程考察的就是系统的设计框架。引用《一文搞懂 Harness Engineering:六层架构、上下文管理与一线团队实战》[8]:
Agent = Harness + Model,其中 Harness 的六层是:Agent.md — MCP 工具 — 任务编排 — 记忆管理 — 评估验证 — 全局约束。
(图 39 把 Agent 拆成两半的那张图:中间橙色的 Model 是「CPU」、是能力的来源,外面一圈系统提示词、工具调用、文件系统、沙箱环境、记忆系统、上下文管理、编排逻辑、钩子中间件、反馈回路、约束机制统称 Harness,也就是「OS」,来源见 [8])
(图 40 三层包含关系:Prompt Engineering ⊂ Context Engineering ⊂ Harness Engineering,分别解决表达、信息、执行三个问题;底下那句「模型决定上限,Harness 决定底线」基本可以当本节的注脚,来源见 [8])
(图 41 易观分析《中国桌面端 AI 原生办公智能体平台访问量》2026 年 6 月口径:WorkBuddy 2097 万次月访问遥遥领先,其后是 TRAE IDE 国内版 1279 万、QoderWork 788 万、CodeBuddy 656 万、QClaw 354 万,往下断崖。「异军突起」是有数的。来源:易观分析)
在进到通义实验室的模型之前,先说一件事:面对眼花缭乱的 AI,有一个类似于云计算业务的选择方式来定位 AI 对你的帮助,也是看你需求的是什么。AI 需要被定义,先找出需要解决的问题是哪一步,再决定交给 AI 什么:
- 问题 + 上下文:传统 RAG 即可解决,也是大多数人使用的一层,豆包 / ChatGPT / DeepSeek;
- 材料 + 材料边界:第一层的传统软件在有材料的情况下也可以解决回答,同时 plus 有 Perplexity;
- 任务 + 清晰步骤和路径:Vibe Coding 平台,正式进入 agent 的调用,Manus / WorkBuddy / Trae 等;
- 项目 + 开发环境:基于项目持续推进,围绕材料,Cursor、Claude Code、Codex;
- 系统 + 复杂环境和任务交接:多系统、多项目,OpenClaw 和 Hermess 自主接管流程,植入记忆。
上面这五档是站在使用者这一侧问「你要 AI 帮你到哪一步」。换到企业那一侧,同一个问题要问两遍。第一遍问的是家底怎么搬——上云本身也分四种范式:保持现状 = Retain / 平迁上云 = Rehost / 优化上云 = Replatform / 重构上云 = Refactor,从左往右动得越多,收益越大,代价也越大。
第二遍问的是搬完之后 AI 铺到哪一步。MaaS 的 To B 范式一般走 L1—L2—L3 三级:
- L1:POC(项目试点)和 MVP(最小可行性产品),评测短时间的 ROI,搭建框架验证可行性;
- L2:业务拓展,把 AI 铺到 30% 的核心业务流程,可以将 L1 横向复制、深度优化,以及适配不同场景;
- L3:基于 AI 搭建组织和技术架构,战略整合规划,产品基于 AI 创新,并分阶段验证:市场验证、产品迭代、商业化落地、规模化转换;同时搭建 API 和 MCP 市场,丰富应用模式,对 AI 的本体进行可量化和监控的复盘,并灵活调配。
三套分类是同一个问题的三个切面:个人问「交给 AI 什么」,企业先问「搬到什么程度」,再问「铺到什么阶段」。
当然现在还是抢市场大战:不同大模型和 MaaS 平台以更低的折扣挖 MNC(泛企业)客户来扩张市场,也是证明了 MaaS 市场处于初期。而且传统 BTE 的 sale 也随着 MaaS 的产品要求,开始兼顾 MTE 的指标。
至于 AI 应用本身怎么分类,我看到过一张 AI-CAF 的四象限图:横轴是「效率提升 ↔ 产品创新」,纵轴是「内部应用(面向员工/流程)↔ 外部业务应用(面向客户/市场)」,切出服务优化型、产品创新型、内部提效型、能力进化型四类。落到具体场景也很好对号入座:智能客服、营销助手在左上,AI SaaS、AI 硬件、具身智能在右上,流程自动化、智能法务在左下,智能商业分析、产品需求预测在右下。
(图 42 AI-CAF 的四象限:横轴效率提升↔产品创新,纵轴内部应用↔外部业务应用,四个象限分别是服务优化型、产品创新型、内部提效型、能力进化型,每格下面列了七八个典型场景。这张图我是转引来的,原始出处没标明)
通义实验室
第二把斧是通义实验室,落到产品上就是千问。
再看基础模型梯队。千问模型有 51 个之多,最能打的 Qwen3.8 Max 也在前列。
而且阿里的模型也涵盖了所有领域:视频模型、音频模型、coding 模型、flash 小模型、通用大模型,开源闭源都是最大的包含,benchmark 跑分也很前列。下面三张都截自 Artificial Analysis,取数为写稿当日(2026 年 8 月):
(图 43 Artificial Analysis 的「智能指数 vs 价格」散点,只筛 Alibaba 一家:51 个模型全在图上,Qwen3.8 Max 单独站在右上角约 57 分、每百万 token 约 1 美元的位置,绿色的「最优象限」和虚线的帕累托前沿把 Qwen3.7 Plus、3.6 Plus、3.6 Max Preview 串成一条线。一家厂商自己就铺满了一整张性价比曲线)
(图 44 换成全厂商横向比:上半是同一张智能指数 vs 单价散点,Qwen3.8 Max 落在 $0.90/百万 token 一档、指数 53 上下;下半的榜单前九名依次是 Claude Opus 5、Claude Fable 5、GPT-5.6 Sol、Kimi K3、GPT-5.6 Terra、GPT-5.5、Grok 4.5、Claude Opus 4.7)
(图 45 Artificial Analysis 的独立评测总表:上半屏是 GDPval-AA v2、τ²-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR 这几项分榜的柱状图,下半屏的 AA-Briefcase、AutomationBench-AA、Harvey LAB-AA、IFBench 等只截到了标题,图表没加载出来,所以是大片空白;看单项排名比看一个总分有用得多)
Qwen3.8 Max(发布于 2026 年 8 月 3 日,截至写稿当日仍是最新)总参数量 2.4 万亿(2.4T),单次激活 95B,上下文长度 100 万 tokens,原生支持视觉理解。
技术架构的革新学习自公众号 Zartbot[9],技术结论如下:从整体来看,Qwen3.8 基本在无任何额外提示情况下的自主执行能力和 Opus 4.8 持平;没有进一步到 Fable 5 的水平,是它还暂时没学会使用 OR-Tools 的能力。
顺手补一句 OR-Tools 是什么:Google OR-Tools 是开源的运筹优化求解器工具箱,专解「一堆硬约束下,从海量组合里挑最优解」的题——排班、装箱、路径规划、车间调度,主引擎 CP-SAT 是约束规划求解器,Python 直接调。为什么「会不会用它」是道分水岭?组合优化恰是大模型最不擅长的:按概率往下写字,不回溯、不证明最优,题一大就只能猜个合理答案,越自信越离谱。强模型不硬算,而是认出「这是个组合优化问题」,把变量、约束、目标翻译成求解器读得懂的模型,交给 CP-SAT 去算,自己只管建模和验收。
关于基模之争,目前还在抢占赛道阶段,而且有极强的长尾效应。SemiAnalysis《TokenBudgeting》给出的分布是:中位数才 $136/人/年、90 分位 $7,300、99 分位 $9 万——$1,430 落在 75-90 分位。
(图 46 把「AI 到底花多少钱」摊平的一张对照表:Qoder CN 企业版席位约 ¥99-199/席/月、GitHub Copilot Business/Enterprise $19/$39、M365 Copilot 与 Cursor Business $30/$40、Claude Code 企业重度实付 $150-250/月、百炼上 Qwen 的 token 单价;下半是企业侧的三条大数:人均 AI 支出中位 $136/年,Agent 让重复性职能成本降 40-70%、ROI 回收 <3 个月,Gartner 口径 2026 年全球 AI 支出 $2.52 万亿、+44%。每行都标了来源)
且利润流向基模层级而不是硬件层。以 A 厂举例:Anthropic 年化收入从 $9B 冲到 $44B+(ARR $44B 是截至 2026 年 5 月的口径),毛利率从 38% 升至 70%(这是 SemiAnalysis 对推理毛利的第三方估算,Anthropic 从未确认)——增量利润不成比例地流向模型实验室,而非硬件层。
Blackwell 单卡 token 产出是一年前 Hopper 的 30 倍,VR NVL72 对 H100 吞吐最高 FP4 32 倍。根据 SemiAnalysis 报告中的测算,VR NVL72 成本定价下限约 $4.92/GPU·小时,价值定价上限 $9.63–12.25/小时——NVIDIA 明明有大幅提价空间却没有用尽,这是定价权与提价行为的分离。
少赚的差价换来生态扩张速度与反垄断安全边际,本质是把「看不见的利润」存进了未来市占率。
但在基模的毛利上是最脆弱的一层。它建立在「前沿能力独占」上,没有制程、没有产能、没有物理护城河,一旦开源模型追近,利润会以比上移更快的速度回落。
平头哥:灵骏 M890 与八卦
第三把斧是平头哥。讲芯片之前,先插一段八卦。
🍿 7.23 那天,二手平台上的海外模型订阅一夜清零
我说一个八卦。7.23 的一天,我按往常的操作一样,打开二手平台希望购买并充值 Claude5X 的订阅代充,但是非常非常诧异和震惊的是,在我问讯了 30+ 的店家都得知没货后,我的思路就变了:打听到有某互联网大厂前来扫货,一句话——有多少要多少;号商猜测,估计是组成资源池反代做资源池使用,只能说好大的手笔。
这件事我一直记着。供给一紧,最先没货的永远是我们散户这一档,比财报和研报都早。
中美之争股票上一起坑我就算了,为什么大模型战争也要波及我们这些投机倒把、费劲辛苦想用上 Claude 的穷苦人士,没有 Claude 的日子一天都不想上班。。
下面两张是当天的聊天列表截图,商家昵称、聊天内容和报价已经全部打码,留着只为那个「满屏 Claude、全部没货」的观感。
(图 47 当天下午的消息列表:右侧一整列全是 Claude 相关的商品缩略图,左边是清一色的「暂时没有」。商家昵称已打码)
(图 48 同一个列表往下翻,构成还是一样——「暂时没有哦」「不好意思」「昨天就被扫光了」,这一屏就是那天全部的答复。商家昵称已打码)
此次展出有最出名的平头哥,最实用的 AI 录音卡钉钉(甚至价格比 PDD 还便宜点),有百炼 coding 平台,有传统云的瑶池存储,有现在的开源 3.8 Max(更新后)、QoderWork 等等,真的是看不过来。
💡 未来的 POD 节点为什么大概率是 64~128 卡(灵骏 M890 + Scale-up/out + DeepSeek V4 带宽推算)
灵骏真武 M890 超节点,可满足 10T MoE 模型推理:
| 指标 | 参数 |
|---|---|
| FP16 算力 | 0.36 PFLOPS |
| FP8 算力 | 0.722 PFLOPS(推测略弱于 950) |
| HBM 容量 | 144GB |
| 互联带宽 | 800GB/s,单向 400GB/s = 3.2Tb/s |
| 功耗 | 400W |
| 对标 H200 | 80%–100% |
表里的 FP16 算力、FP8 算力、功耗和「对标 H200」这四项来自现场沟通,官方没有公布对应数字:我记录的 FP16 是 0.36 PFLOPS,目前唯一给出具体数字的第三方写的是 0.6 PFLOPS,两者是两个口径;对标基准上,我在现场听到的是 H200,而官方与国内外媒体给的是 H20(上代真武 810E 的口径是「整体性能与 H20 相当」,M890 号称 3 倍于 810E)。官方公开的规格则是:单卡 144GB HBM(较上代 810E 的 96GB +50%)、片间互联 800GB/s(上代 700GB/s)、原生支持 FP32 到 FP4 全精度、性能为 810E 的 3 倍、单柜集成 128 颗芯片;超节点侧开箱即用 64 卡、显存 9TB,官方称支持十万亿参数级 MoE 推理,并已跑通 2.4 万亿参数的 Qwen3.8。换算过来,400GB/s × 8 = 3.2Tb/s。
再说 GPU 的 Scale-up(纵向)和 Scale-out(横向):
- Scale-up:单个计算 POD 内的 GPU 互联,也就是保证 GPU chips 之间的高效协同,靠 NVLink、UCIe 等技术;
- Scale-out:多个 POD 互联成计算集群,靠拓扑和协议优化,基于 RoCE 和 RDMA 等。
比如 NVIDIA DGX SuperPOD[10] 就通过该方案实现多节点 GPU 集群的协同计算。目前,主流 AI 基础设施常采用「节点内 Scale-up + 节点间 Scale-out」的混合架构,既保障单节点内的高效计算,又能支撑超大规模的分布式训练需求。(引用:《GPU Scale-up/Scale-out 全解析:架构原理、场景选型与工业级部署方案》[11])
(图 49 Scale-up 与 Scale-out 的逐项对比表:应用场景、架构特征、硬件选型(NVLink/UCIe 对 InfiniBand/RoCE)、软件框架(NCCL 对 PyTorch Distributed/Megatron-LM)、关键性能指标、成本与部署门槛、典型案例。单节点 8/16/32 卡与集群数百上千卡的分野,这张表里列得最清楚。来源见 [11])
根据 Zartbot 博主引用的结论:未来 2~3 年内,128 卡的 Scale-up 已经足够使用了。DeepSeek V4 论文中提到的,是同一件事的另一面:
(图 50 DeepSeek V4 论文给出的算力/带宽比上限:C/B ≤ 2d = 6144 FLOPs/Byte,来源:DeepSeek V4 论文)
也就是每 GB/s 带宽可支持最大 6.1 TFLOPs 的算力而不受到带宽限制。反过来推:大概 800GB/s 的 Scale-up 带宽,配合的算力接近 5 PFLOPs,已经逼近理论限制。所以未来的 POD 节点大概率就是 64~128 卡。
题外话:钉talk 与 AI 硬件
钉钉 talk 火了很久了。考虑到重量和话筒数量,以及模型转录精度和模板适用性,我犹豫再三,最后买了 PLAUD,之后和 Claude 一起完善了这部分提取内容的工作流,同时计划使用 Obsidian 接入这些生成结果作为笔记。AI chain 可以想见,详见第二章《AI 时代的思考》。
吐槽一句,现在处于产品应用的初期,各个使用模式的适配还需要自己深度地去折腾。这个很有极客思想,但也对用户的使用增加了太多不便利性。
(图 51 自用的录音转录提示词模板库,按学习/认知这条线分成几张卡:L1 行业速成认知卡、L2 AI/DC 陪练与事实核查、L3 演讲/课程主旨提炼。卡面正文已打码,这里只留模板的结构层:分几层、每层解决什么问题)
其实这类产品是大模型应用在硬件端获利转化的最好尝试,利润高的离谱(这句是体感,没有公开的拆机成本或厂商毛利可以对照)。
本质是接入各家 ASR(语音转文字)的模型,结合硬件的录音功能转化为文字。其实下一步就可以直接给出结果,但是为了其产品化,将过程增加一步到各自的录音平台,比如飞书的纪要,或者钉钉的 AI 转录部分。目的都是做了下一步:AI 大模型软件的收费和客流获取。对于这种产品简直是一举多得:既保有利润,又增加拓客赛道,又在大模型费用上再收一笔费。
AI 时代,如何和硬件结合改变人的生活与习惯,就是 AI 产品的最终目的。
同时,这种 AI 纪要的出现,让我们能更逻辑化地复盘内容。注意力仍然是现世最珍贵的资源,对于每个人来讲,AI 纪要会替代掉一部分不需要带脑子的会议记录部分,省省脑细胞。但同时,也需要独特的时间去对自己的逻辑化总结和表达能力进行后训练(AFTER TRAIN)和微调(SFT)。
Thinking
入口战争输掉的那一局,是这一节所有事情的起点:没有社交和休闲的入口,最大的消费渠道就建立不起来;而 AI 把入口重新洗了一遍牌,三板斧才是阿里能上桌的本钱。
拥有了全栈的架构,才有选择的权力——这是阿里这一节从头到尾的那条线:卖 agent、卖大模型,短期都是为了更好地卖云,为了保住 SaaS 和 PaaS 那两层利润。软件比硬件更值得守,也是因为硬件的利润是可见和确定的,而软件会把它模糊化并且复利。
但同一条线也解释了它的脆弱处:利润确实在往基模层走,而基模的毛利是最脆弱的一层,没有制程、没有产能、没有物理护城河,开源一旦追近,利润回落会比它上移更快。
落到个人这一端,结论其实是同一个:AI 时代,如何和硬件结合、改变人的生活与习惯,就是 AI 产品的最终目的。AI 纪要能替你省掉不需要带脑子的那部分脑细胞,但省下来的时间得花回自己身上——对自己的逻辑化总结和表达能力做一次后训练。
11 月之暗面 Kimi|开源 3T 超大杯,硬实力顶格,单价也顶格
Kimi 就在展会开幕前一天大放异彩,延续了 GLM-5.2 的震撼。K3 的发布一举打破了白宫科技顾问和 Anthropic 那套蒸馏假话:Anthropic 的 Fable 7 月 1 号才公开可用,K3 两周后(7 月 16 日)就发了,多位第三方专家直说这个时间线上纯蒸馏根本做不出来;开源的 3T 超大杯直接塞嘴里——开源的还能蒸馏闭源的不成?这个也是我听到近期最好笑的笑话。
但是同样,用户代价也是相当之大的。K3 可以说是最贵的国内通用大模型,我使用 OpenCode GO 套餐体验,3min 跑完 5H 的消耗量。穷,是我的问题。
(图 52 同一个套餐、同一天的花费:8 月 2 日 kimi-k3 $3.35,deepseek-v4-pro $0.33。同样的活,差了整整一个数量级)
(图 53 跑完之后的用量条:滚动用量 100%、重置还要等 1 小时 16 分,而每周用量才 49%、每月用量 45%。限流卡的是滚动窗口,不是月度额度)
关于硬实力,K3 在 Moonshot 自己摆出来的六项 agentic 榜单上把 Opus 4.8 全线压住(Terminal-Bench 2.1 88.3 vs 84.6、FrontierSWE 81.2 vs 66.7、DeepSWE 67.5 vs 59.0、GDPval-AA Elo 1668 vs 1600……),Artificial Analysis 智能指数 57 分排全球第三,和 Opus 4.8、GPT-5.5 同一档;但 Opus 那边还挂着 SWE-bench Verified 88.6%、SWE-bench Pro 69.2%、USAMO 2026 96.7% 这几项 K3 尚未对齐的成绩,两边 harness 也不一样,所以说「掰腕子掰赢了」比说「碾压」准。
KDA + AttnRes 把 KV Cache 压缩了 12.5 倍:K3 的 93 层里 69 层是 KDA(线性注意力,固定大小的循环状态,不随序列长度增长)、24 层是 Gated MLA(保留可增长的压缩 KV cache)。而 KV Cache 的压缩率之所以直接决定 token 的成本,是因为每一次调用都涉及到数据的读取。
Kimi K3 此次主要优化三个方面的问题:1、参数量;2、上下文;3、模型深度。下面这段整理自 B 站 UP 主「算法魔法师」的《扒透 Kimi K3 三大核心架构:看懂下一代大模型路线》。
💡 K3 的三大架构:更大、更长、更深,各自用什么换来的
大模型如何继续变大:基于 MoE 专家架构,应用 Latent MoE,增加一个压缩空间来解决负载不均衡和通信差的问题。相较于 NVIDIA Nemotron 3 Super,思路是增加专家数量、降低激活比例。
上下文如何继续变长:KDA,将历史信息压缩成一个动态笔记,实时更新和计算,代价是可能会丢失一些信息;实际做法是穿插使用 MLA 和 KDA。
网络如何变深:Kimi Attention Residuals,将 Transformer 残差连接从固定单位权重累加,替换为可学习的 softmax 深度注意力。此过程相较于以前的残差连接(前一层的输出为后一层的输入)会忽略浅层的贡献;而 Transformer 的大部分内容其实可以被剪枝且损失极小。
结果:跨阶段缓存 + 两阶段推理;训练开销小于 4%,推理延迟小于 2%。
三件事合起来,完成了 RNN—Transformer 的序列维度转变。个人理解为:将 RNN 历史进行一次压缩上下文,而 Transformer 还是选择性访问所有历史位置。
2.8T 的参数(准确说是 2.78T 总参数、104.2B 激活),1M 的上下文。Kimi 一直以长上下文著称,1M 的上下文足以直接输入一整套小说。上下文在 AI 时代的重要性不言而喻,也是区分其他大模型的关键:上下文守住 1M 这一档的同时,参数量已经从 B 时代跃进到了 T 时代。
部署这块也值得学一学:我看到有人直接用 64 张 B200 部署了 K3(Threads @3cpj,2026-07)。
💡 64 张 B200 跑 K3 的三档账:能跑起来 / 生产可用 / 用得最爽
| 档位 | 硬件成本 | 说明 |
|---|---|---|
| 预计能跑起来 | 800 万 | 勉强拉得起来 |
| 生产级别 | 1500 万 | 可对外提供服务 |
| 用得最爽 | 2000 万以上 | 还没算电费 |
不考虑使用电费,就已经来到如此高度。这个量级在公开报道里对得上:光 64 卡这一档的采购就超过 240 万美元(约合人民币 1700 万以上),整机功耗约 45kW,已经是机房级用电(unwire.hk,2026-07-21)。
如果调参优化得比较好的话,直接用 80 张 RTX 5090 就能拿下:80 张 32GB 凑出 2560GB 显存,硬件成本 20 万–25 万美元(约合人民币 150 万–180 万),月电费一万美元出头,第一天没调优时单串流 20 token/s(电脑王阿达,2026-07)。标准最好为 22×H100——这也正是 MXFP4 原生权重的最低配置,22 卡集群按单卡 2.5 万–3 万美元算,约 55 万–70 万美元。
(图 54 另一份「最小可用 K3 推理集群」的物料账(FP4 精度、支持短对话):20 张 H100 80GB 共 60 万美元、2 套 DGX H100 系统 40 万、InfiniBand NDR 网络 5 万、NVMe 存储 0.8 万、机柜级液冷与电力 3 万,合计 108.8 万美元。注意它把服务器、网络、机柜都算进去了,和上面那张只报总价的三档账不是一个口径)
(图 55 自建与调 API 的每百万 token 成本对比:Kimi 官方 API $0.50,自建 22×H100 约 $0.12、8×H100(TP+EP)约 $0.15,而 Claude Opus 4.8 API $15、GPT-5.6 API $10;右列换算成每月 10 亿 token 的账单。原表注明是基于公有云 GPU 报价的估算)
再看租的这一头。K3 官方 API:输入 $3/百万 token(缓存命中 $0.3)、输出 $15/百万 token,上下文 1M(Moonshot 官方定价页,2026-08 查)。Artificial Analysis 收录了 10 家第三方供应商,各家价差最高约 1.8 倍,最快吞吐约 174 token/s。自建那一侧的参照价是:B200 按需时租中位约 $6.1/卡·时(spot 最低约 $3.2,AWS/GCP 要 $14–16),照此换算 64 张 B200 的月租大约在 $15–28 万区间(按 spot 下限到按需中位两头折算,取数 2026-08)。
(图 56 Artificial Analysis 的各家云 GPU 按需时租:B200 一档 AWS $14.2、CoreWeave $9.6、Lambda $6.7、Nebius $6.5、RunPod $5.9,H100 一档从 $3.0 到 $12.3 不等,同一张卡在不同云上差三四倍;正文的「按需中位约 $6.1」就取自这张表。来源:Artificial Analysis)
本地部署的完整硬件要求见 OpenModelMap 的 Kimi K3 Hardware Requirements — GPU, VRAM & Server Config[12]。
Kimi 的展台超级简单。大模型公司如此朴素,甚至只放了几台电脑,和大家去聊天,奖品也是知乎等联名提供的。大家大多不是专业模型技术出身,也只能泛泛地去聊。
Thinking
大模型公司的展台可以朴素到只放几台电脑,和来的人泛泛聊两句——因为它真正要卖的东西本来就不在展台上。
K3 这一版把参数量、上下文、模型深度三件事同时推了一格,而长上下文仍然是 Kimi 区别于其他大模型的关键:1M 的上下文一次能吞下一整套小说,参数量则跨进了 T 时代。代价则写在账单上——它是最贵的国内通用大模型,OpenCode GO 套餐 3min 跑完 5H 的消耗量。穷,是我的问题。
12 复旦 MOSS|160 亿参数就能本地跑的开源矩阵,最有意思的是实时视频理解
MOSS 算是巧合偶遇之下碰到的大模型初创公司,来自复旦 NLP 团队(仓库描述:OpenMOSS/MOSS: An open-source tool-augmented conversational language model from Fudan University)。
它体量很小,很适合本地化部署。以 2023 年 4 月开源的 moss-moon 系列举例:模型具有 160 亿参数,在 FP16 精度下可在单张 A100/A800 或两张 3090 显卡运行,在 INT4/8 精度下可在单张 3090 显卡运行。
现场发现最有趣的是视频实时识别的功能,我也很久没有接触到这类的应用产品了。
看到他们那条实时视频理解的线(现场展板上我记录的名字是 MOSS-Video-and-Audio,官方仓库里对应的应该是 2026 年 4 月放出的 MOSS-Video-Preview / MOSS-VL-Realtime,旁边还有 MOSS-Audio、MOVA 这一串),我第一时间想到的就是蚂蚁灵波,以及具身智能那边在做的 VLA。目的是一样的,识别图像和音频并给出理解。VLA 的路线是 LLM → VLM(Vision-Language Model)→ VLA(Vision-Language-Action Model)。
(图 57 展台上的 MOSS 系列模型墙:语音这条线从 MOSS-TTSD、MOSS-TTS-v1.5 一路排到 MOSS-TTS-Nano(0.1B、纯 CPU 可跑)、MOSS-Transcribe 与 Diarize 系列(长音频转录、说话人分离,号称在 OpenASR Leaderboard 开源第一),再往下是 VoiceGenerator、MOVA、MOSS-SoundEffect、MOSS-Audio、MOSS-Music,最后一格才是 MOSS-VL-Realtime。一面墙,摆下了整个开源矩阵)
视频加音频这条线应该和 Vision-Action 不一致,算是弱化版的 VA。但是在应用端,我觉得已经很有趣了:我第一时间想到的产品是数字人的反应,通过 VA 的方式来呈现。
我在实际的体验过程中感受十分神奇。现在 VA 可以实时识别摄像头前人做的事情并给出反馈;同时小参数量的模型可以植入多个终端,在不同视频识别下也表现得很出色,很赞。
(图 58 实时视频理解的体验机:左侧是摄像头正在看的画面,右侧是模型同步给出的文字理解,延迟低到你一抬手它就接上话。右侧旁观者已打码)
最主要的是,MOSS 的这个取名一下就想到了《流浪地球》里的机器人——要人类永远保持理智是一种奢求。
Thinking
看到这么多方向的开源矩阵的模型,我觉得实现 MOSS 现在来看也是轻而易举,无非是边界和功能方向的设定——难的从来不是造出来,是边界划在哪。
通过大模型突破传统物理学和数学的障碍,近在咫尺 MAYBE。
H1 篇小结 · 从 INFRA 看回模型层
走完 H1 这一馆,感受最强的一点是:同一条产业链上,各层的焦虑完全不同。
基础设施这层,焦虑的是交付。技术早就不是壁垒了:液冷的研发深度撑不起壁垒,各家靠收购就能进场。真正卡人的是认证盖章、产品形态和工程交付,是海外那块地要提前一年去谈,是 CE/UL 认证那张纸,是国外人力成本三倍而效率一半。全是供应链上的事,没有一件发生在实验室里。所以 Vertiv 把机房做成集装箱,把海外一年的交付压到 5 个月。
云和引擎焦虑的是位置。道客那位产品老师说突破 CUDA 还有很长的路要走,这话听着谦虚,实际是精确的:CUDA 卡在操作系统之上、模型之下,靠十几年软件生态一层层堆出来,绕不过去,也砸不动。决定胜负的,是别人在你的平台上积了多少代码,自己写多少反而其次。
模型层的焦虑是保鲜。SemiAnalysis 那组数字说得很清楚:增量利润越过硬件层,不成比例地流进了模型实验室。但这也是最脆弱的一层毛利,它建立在「前沿能力独占」上,没有制程、没有产能,守不住任何物理约束。开源一追近,利润回落得比涨上去还快。K3 开源 3T 参数直接塞嘴里的那天,这个逻辑就摆上了台面。
应用层的焦虑最直白:入口。所有人都在抢同一件事,让用户养成习惯:腾讯用 IMA 抢知识库,金山用席位收费把 token 黑盒掉,深信服用可视化工作流降低门槛。这层拼的是留存。
四层串起来,有一条线贯穿:越往上,壁垒越薄,离钱却越近。基础设施最重、最难被替代,也最难拿到溢价;模型层最轻、最容易被追上,却拿走了最多的增量利润。没什么谁对谁错,产业阶段就摆在这里:军备竞赛期,稀缺的是能力;产能,反倒不缺。
但阶段会变。等模型能力拉平的那一天,利润会重新往有物理约束的地方沉。
下篇预告:H1 这一馆除了维谛这种做基础设施的公司,拜访的主要还是软件端:云、基础数据模型这些。H2 要拜访的公司管的是芯片层,也就是云的上游(基础模型则在云的下游),所以下篇聚焦芯片层和 AI 级硬件的应用。整篇报告的逻辑和框架也就摆在这里:视角是站在 INFRA 看 AI,结构上按 H1 管 H2、H3 来看;到 H2 那部分,还会辅以我对 LPU 和 NPU 的学习和研究,这部分在正文里也会提。
附录
附录 A · 参观路线与时间安排
参观路线图:

(图 59 H1 平面图(参观路线))

(图 60 H2 平面图(参观路线))

(图 61 H3 平面图(参观路线))
参观日志及路线:H1-H3-H2-H4。本次展会是我第三次参加 WAIC,往年是走马观花去见证未来和新格局,观察产业形态和影响;我的习惯是第一天下午参加大会,趁人少学习产品,第二天上午观看直播,学习政府风向以及大佬对话。
本次政府对 AI 的风向,参考小王 Albert 的一条视频,看 7 月的 AI part。
第二天参观 H2 展馆,受到了前一晚应酬宿醉的影响,没有详尽学习,也影响了撰写日志的进度;同时由于自身对于芯片行业十分不了解,且不清楚半导体的关键技术迭代,H2 的撰写要边学边写。最近还在出差,我尽量加速赶完。
CDU 延伸阅读:微信公众号上的一篇 CDU 专题长文。这是我写 01 节 CDU 那几段时翻过的材料,作为延伸阅读附在这里。
附录 B · 术语对照表
| 缩写 | 全称 | 一句话 |
|---|---|---|
| ⭐ CDU | Coolant Distribution Unit | 液冷的「心脏」,把冷却液按压力和流量分到每个机柜 |
| ⭐ HVDC / 800V | High Voltage Direct Current | 电不再来回转换、直供服务器,少一道转换就少一道损耗 |
| ⭐ DC / IDC | (Internet) Data Center | 放服务器的楼;管电和管冷是它仅有的两条命脉 |
| ⭐ Colo | Colocation | 机房租赁:房东建好机电,你把服务器搬进去按功率交租 |
| ⭐ Attention | 注意力机制 | 让模型自己决定该重点看输入里的哪几个词,大模型的地基 |
| ⭐ Transformer | — | 2017 年那篇论文提出的模型骨架,今天的大模型都长在它上面 |
| Chinchilla 定律 | Chinchilla Scaling Law | 参数和数据要配平;光堆参数不喂够数据,等于买了卡不开机 |
| ⭐ GPU / NPU / XPU / LPU | Graphics / Neural / eXtended / Language Processing Unit | 并行算力芯片。GPU 最通用,后三者是各家为 AI 专做的变体 |
| ⭐ Token | — | 模型处理文字的最小计费单位,约等于半个到一个汉字 |
| ⭐ TDP | Thermal Design Power | 芯片的额定发热量,暖通照它设计,一切散热方案的第一块骨牌 |
| 稀疏 | Sparsity | 每次只让一部分参数或注意力干活,省算力,代价是精度还回去一点 |
| ⭐ UPS | Uninterruptible Power Supply | 市电停到柴发起来那几十秒的「充电宝」,它断了就全停 |
| 母线 / 母线槽 | Busway | 机房里的「插排轨道」,一条铜排沿列走,机柜就近取电 |
| 列头柜 | End-of-Row PDU | 一列机柜共用的配电兼计量柜,这列出问题先查它 |
| ⭐ 2N / N+1 / DR / RR / 4N3 | 供配电冗余架构等级 | 从「整套双份」到「多路共享备份」,越贵越不怕停 |
| 柴发 | 柴油发电机组 | 市电全停后的最后靠山;UPS 撑的那几十秒就是在等它起来 |
| 干冷器 / 冷塔 / 冷机 | Dry Cooler / Cooling Tower / Chiller | 三种把热甩到室外的方式:吹风、蒸发、开压缩机硬降温 |
| 氟泵列间 | 氟泵列间空调 | 排在机柜之间的空调,风冷路线的天花板,单柜约 50–60kW |
| ⭐ 液冷 / 冷板 | Liquid Cooling / Cold Plate | 用液体贴着芯片带走热;风吹不动的功率密度只能靠它 |
| ⭐ PUE | Power Usage Effectiveness | 总电耗 ÷ IT 电耗,越接近 1 越省电,上液冷能压到 1.1 |
| SST | Solid State Transformer | 固态变压器,用电力电子替掉铁疙瘩,体积小可调,但落地还早 |
| OCP | Open Compute Project | Meta 牵头的开放服务器/机柜标准,让机柜像乐高一样通用 |
| PSU | Power Supply Unit | 服务器里那块电源模块;机柜功率一上去,它先卡脖子 |
| ⭐ PoD | Point of Delivery | 算力的最小交付单元:一整套 GPU + 网络 + 供电打包成「一坨」 |
| CE / UL 认证 | CE Marking / Underwriters Laboratories | 进欧盟和北美的强制安规门票,没有等于产品出不了海 |
| DDP / DAP | Delivered Duty Paid / Delivered At Place | 外贸交货条款:DDP 卖方包税送到门,DAP 关税买方自己扛 |
| T+6 | — | 国内交付惯例:土建封顶后 6 个月机电装完交钥匙,海外常要 12 个月+ |
| ⭐ IRR | Internal Rate of Return | 项目回本速度的年化收益率,资方拷问机房的第一个数 |
| ⭐ RAG | Retrieval-Augmented Generation | 回答前先去知识库查资料,企业 AI 的第一层,也最同质化 |
| ⭐ Agent | 智能体 | 会自己拆任务、调工具、跑完再交活的 AI,不只是聊天 |
| OCR | Optical Character Recognition | 把图片里的字变成可编辑文本,扫描件和发票的入口技术 |
| ⭐ MCP | Model Context Protocol | 模型调外部工具的「USB 口」,接一次到处都能用 |
| To B / To C / To G | 面向企业 / 个人 / 政府 | 同一个模型,三套定价、三套交付、三套销售打法 |
| ⭐ IaaS / PaaS / SaaS / MaaS | Infrastructure / Platform / Software / Model as a Service | 云的四层:卖资源、卖平台、卖结果、卖模型调用,越往上毛利越高 |
| ⭐ CUDA | Compute Unified Device Architecture | 英伟达的 GPU 编程底座;十几年生态才是它真正的壁垒 |
| cuDNN / cuBLAS | CUDA Deep Neural Network / Basic Linear Algebra Subprograms | 英伟达手工调优过的算子库,框架跑得快主要靠这两个 |
| ⭐ K8s | Kubernetes | 容器编排系统,机房里的「排班表」,决定哪个任务上哪张卡 |
| ⭐ PFLOPS / TFLOPS | Peta / Tera FLOPS | 每秒浮点运算次数,芯片的「马力」;1 P = 1000 T |
| FP16 / FP8 / FP4 | 浮点数精度 | 一个数用几位存。位数减半,速度翻倍、显存减半、精度打点折 |
| ⭐ MoE | Mixture of Experts | 把模型拆成一堆专家,每次只叫醒几个,所以总参数能做到极大 |
| ⭐ KV Cache | Key-Value Cache | 把算过的上文缓存住别重算;上下文越长,它越吃显存 |
| 多模态 | Multimodal | 一个模型同时吃得下文字、图片、音频、视频 |
| 总参数 / 激活参数 | Total / Active Parameters | MoE 时代要一起看:前者决定显存,后者决定每次推理花多少钱 |
| ⭐ 上下文长度 | Context Length | 一次能记住多少内容;从 256K 到 1M,等于从一叠资料到一整套小说 |
| benchmark | 跑分 / 基准测试 | 标准题库上的考试成绩,能用来选型,但不等于好用 |
| ⭐ ARR | Annual Recurring Revenue | 年化经常性收入,订阅制公司的「营收心跳」,估值就看它 |
| PS | Price-to-Sales(市销率) | 估值 ÷ 年收入。AI 公司还没利润,只能拿它吵贵不贵 |
| B / T | Billion / Trillion(参数规模单位) | 十亿 / 万亿。32B 塞得进一张卡,2.8T 要一整个机柜 |
| ⭐ 席位收费 | Per-Seat Pricing | 按人头而不是按调用量收费,是 AI 从卖 token 转向卖生产力的信号 |
| MAU / DAU | Monthly / Daily Active Users | 月活、日活;DAU÷MAU 越高,说明产品越接近「每天都得用」 |
| ⭐ Harness | — | 模型外的工程层:工具、编排、记忆、上下文。Agent=Harness+Model |
| ⭐ Vibe Coding | — | 用自然语言把需求说清楚让 AI 写完代码,人只负责验收 |
| 基模 | Foundation Model(基础模型) | 从零训出来的通用底座,上面才长得出各种垂直应用 |
| MSA | Mixture of Sparse Attention | MiniMax 的稀疏注意力:先粗筛出该看的段落,再回去细看 |
| ⭐ KDA | Kimi Delta Attention | Kimi 的路子:把历史压成一份动态笔记随时更新,省显存但会丢细节 |
| GQA | Grouped Query Attention | 让多个查询头共用一组 KV,最常见的省显存改法 |
| ARPU | Average Revenue Per User | 每用户平均收入;情感陪伴 5 美元、企业客户 6000+,差距全在这 |
| ⭐ 蒸馏 | Distillation | 让小模型模仿大模型的输出,用几分之一的成本逼近它的表现 |
| CAPEX / OPEX | Capital / Operating Expenditure | 自建机房是 CAPEX,按月付云费是 OPEX,上云本质就是这一换 |
| CAGR | Compound Annual Growth Rate | 复合年增长率,把几年的增长折成「平均每年涨多少」 |
| POC / MVP | Proof of Concept / Minimum Viable Product | 先验证跑不跑得通,再做最小可卖版本,是 AI 项目的第一级台阶 |
| ⭐ Retain / Rehost / Replatform / Refactor | 上云四种姿势 | 不动、平搬、换底座、重写;投入和收益依次递增 |
| ⭐ OR-Tools | Google Operations Research Tools | 排班、装箱、路径这类「找最优解」问题的开源求解器(正文 10 阿里节有简说) |
| ⭐ Scale-up / Scale-out | 纵向 / 横向扩展 | 一个 PoD 内把卡连紧(NVLink)vs 把 PoD 连成集群(RoCE) |
| ⭐ NVLink | — | 英伟达的卡间高速直连,比走网络快一个数量级,Scale-up 的主力 |
| ⭐ RoCE | RDMA over Converged Ethernet | 在普通以太网上跑 RDMA,比 InfiniBand 便宜,国内大集群的主流 |
| ⭐ RDMA | Remote Direct Memory Access | 服务器之间绕开 CPU 直接读写对方内存,延迟低一大截 |
| ⭐ HBM | High Bandwidth Memory | 贴在 GPU 边上的高速显存;推理时它常常比算力先见底 |
| 超节点 | Super Node / Rack-scale System | 把几十上百张卡用高速总线做成「一台大机器」的机柜级产品 |
| TTS | Text-to-Speech | 文字转语音;反过来把录音转成文字的叫 ASR/STT,录音笔用的是后者 |
| ⭐ 后训练 / SFT | Post-training / Supervised Fine-Tuning | 预训练之后的补课:拿标注数据把通用模型调成会干活的 |
| Latent MoE | — | 给专家路由加一层压缩空间,缓解负载不均和通信开销 |
| MLA | Multi-head Latent Attention | DeepSeek 那套:KV 先压到低维再存,压缩比比 GQA 更狠 |
| 残差连接 | Residual Connection | 给深层网络架「电梯」,让浅层信息不被后面几十层稀释掉 |
| 剪枝 | Pruning | 砍掉几乎不起作用的连接换速度;Transformer 能砍掉不少还不掉分 |
| RNN | Recurrent Neural Network | Transformer 之前的路线:顺着往下读,把历史压成一个状态 |
| ⭐ 量化 / INT4 / INT8 | Quantization | 把权重从浮点降成整数,显存砍掉一半到四分之三,精度略降 |
| ⭐ LLM / VLM / VLA | Large Language / Vision-Language / Vision-Language-Action Model | 会说 → 会看 → 会动手,具身智能的三级台阶 |
附录 C · 每度电能产出多少 token,以及 token 出海的商业逻辑
先把量级立住:公开测算里,生成 100 万个 token 的平均耗电量约 15–20 度(中国电力企业管理《从「卖电」转向「卖 Token」》,chinapower.org.cn/detail/456250.html),反推约 5 万–6.7 万 token/度;学术实测 Llama 3 405B 在 H100 上约 163–236 焦耳/token,折约 1.5 万–2.2 万 token/度,小模型可以到几十万(grokipedia.com/page/Energy_per_Token)。两头夹一下,一度电的产出量级就是「几万到几十万 token」。
行业目前没有权威的绝对基准,「tokens per watt」正在变成新指标:NVIDIA/CoreWeave 只公布相对值,比如 Vera Rubin NVL72 跑 DeepSeek-R1 的 tokens/s/MW 是 GB200 NVL72 的 10 倍(coreweave.com 博客,2026-07)。指标从「每瓦算力」走向「每瓦 token」,电已经成了产出的分母。
出海的商业逻辑因此可以写成一条链:中国的电价、建设速度和供应链决定了单位 token 的生产成本更低;海外的机柜租金和算力价格更高;只要「电价差 × 交付速度差」大于「出海的认证、物流、人力溢价」,把算力(或直接把 token)卖出去就成立。集装箱化交付压缩的,正是不等式右边的成本。
附录 D · Vertiv 细分产品简说(公开资料口径)
800V/HVDC:面向下一代高密机柜的直流供电组合,与行业 800VDC 路线图对齐(Vertiv 2025-10-13 新闻稿:组合产品 2026 下半年起陆续发布,对齐 NVIDIA 2027 年 Rubin Ultra 平台)。方向是把交流链条里的多级转换合并,缩短从电网到芯片的路径。
CoolChip CDU:冷却液分配单元的公开产品线覆盖 70 / 121 / 600 / 1350 / 2300 kW 多档(in-rack 到集中式,vertiv.com 产品目录)。CDU 是液冷系统的「心脏」,负责把冷量按需分配到各机柜。
SmartRun:预制集装箱化交付,机电系统在工厂内集成、测试完再运抵现场,把海外动辄一年的建设周期压缩到五个月上下,同时绕开现场人力贵、效率低的问题。
One Core:整机房级的一体化理念,电力、制冷、监控按同一套架构预集成,目标是把「工程项目」变成「产品交付」。
(注:以上全部为公开资料口径;任何涉及具体客户、报价或选型对应关系的内容均未写入。)
附录 E · UPS 是什么,模块化 UPS 又是什么
UPS(不间断电源)解决的是市电断电到柴发接管之间的那几十秒:市电正常时整流-逆变输出并给电池充电,断电瞬间由电池顶住负载,柴油发电机起来后再接管。数据中心里柴发是母线级的 backup,电池(铅酸为主,海外多用锂电)是 UPS 的 backup,配合 2N / N+1 等冗余架构。
模块化 UPS 把整机拆成若干可热插拔的功率模块:坏一个换一个,容量能按需扩,颗粒度比塔式机细得多。也正因为「把整机打散当元器件卖」,单价和毛利被拉低;再叠上大客户按品类集采,整个 UPS 行业的定价权都被压薄了。正文说「UPS 白菜化」,产品侧的背景就是这个。
附录 F · 暖通系统复习笔记
制冷循环四大件:压缩机(把低压气态制冷剂压成高压高温)→ 冷凝器(对外放热,变液态)→ 节流装置(常见形态是膨胀阀,降压降温)→ 蒸发器(吸热汽化,带走机房热量)→ 回到压缩机。记住顺序就记住了一切暖通产品的骨架。
按载冷介质分两大系统:水系统(冷机/冷塔/干冷器做冷源,水做输运)和氟系统(制冷剂直接到末端,冷凝器在外)。液冷时代加了第三个角色:CDU,在一次侧(楼宇冷冻水)和二次侧(进机柜的冷却液)之间做隔离与分配,可并入水系统或水氟混合系统。
所有让人眼花的暖通产品名,几乎都是四大件在不同位置、不同组合上的变体,所以客户听完新品介绍,总要问一句「这和冷冻水/氟系统有什么区别」。示意图见正文(AI 生成的那张四大件循环图)。
附录 G · 数据中心选址要看什么
电:电价水平与峰谷价差(电费占运营成本大头)、电网容量与扩容排队、绿电指标。
气候:年均温与湿度决定自然冷源时长,直接影响 PUE 和制冷投资。
政策:能评与 PUE 红线、地方补贴与窗口指导、审批速度。
网络:到骨干节点的时延、运营商资源;时延敏感业务(推理服务)对这条更挑。
人与地:运维人才供给、土地价格与地质条件(承重、水源、洪涝)。
这些条件同时满足的地块稀缺,所以数据中心天然成集群:大家看好的是同一批地。
参考文献
共 12 条,按正文首次出现顺序编号。访问日期 2026-08-11。
[1] About Us | AI Infrastructure Map. AI Infra Map(aiinframap.com). https://aiinframap.com/about
[2] AIinfra Map · CH01 · 全景图. aiinframap.vercel.app. https://aiinframap.vercel.app/ch01-overview.html
[3] 预见2026:《2026年中国IDC(互联网数据中心)行业全景图谱》(附市场规模、竞争格局和发展趋势等)_行业研究报告 - 前瞻网. qianzhan.com. https://qianzhan.com/analyst/detail/220/260429-16bd92f7.html
[4] 使用 Minikube 创建集群 | Kubernetes. kubernetes.io. https://kubernetes.io/zh-cn/docs/tutorials/kubernetes-basics/create-cluster/cluster-intro
[5] 【大模型基础】OCR技术全解析:从原理到实践的深度指南-CSDN博客. blog.csdn.net. https://blog.csdn.net/weixin_42969320/article/details/155875670
[6] 2025游戏行业多维增长 业内预计2026行业景气再提升 | 2025年终大盘点. 财联社. https://m.cls.cn/detail/2243678
[7] 阿里云智能-商业技术工程师(游戏方向)-上海. https://careers.aliyun.com/off-campus/position-list
[8] 一文搞懂 Harness Engineering:六层架构、上下文管理与一线团队实战 | JavaGuide. javaguide.cn. https://javaguide.cn/ai/agent/harness-engineering.html
[9] 谈谈 WAIC 和 Qwen 3.8. 微信公众号 Zartbot. https://mp.weixin.qq.com/s/jZc-3-h2pIYnhFPhLSlTQQ
[10] DGX SuperPOD: AI Infrastructure for Enterprise Deployments | NVIDIA. https://www.nvidia.com/en-us/data-center/dgx-superpod/
[11] GPU Scale-up/Scale-out全解析:架构原理、场景选型与工业级部署方案 - 知乎. https://zhuanlan.zhihu.com/p/1980587409814077874
[12] Kimi K3 Hardware Requirements — GPU, VRAM & Server Config | OpenModelMap | OpenModelMap. openmodelmap.com. https://openmodelmap.com/kimi-k3/hardware?lang=zh