2.8 万亿参数说送就送,月之暗面这笔账怎么算的?

7月27日晚,月之暗面如约把Kimiink> K3的完整模型权重挂上了Hugging Face、GitHub和ModelScope。2.8 万亿参数,全球第一个摸到3万亿门槛的开放权重模型,任何人都可以免费下载、本地部署、二次开发。

十天前,马斯克刚在K3的评测报道下留了句“Impressive”,转头就在社交平台上宣布:xAI的2万亿参数新模型下周完成初训,“可能超越 ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>”。ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>官方只回了一句:“欢迎马斯克加入2万亿俱乐部。”

然后,它直接把俱乐部的门拆了:你们还在比谁的参数大?不好意思,最大的那个,我白送。

这显然不是情怀。翻翻月之暗面过去一个月的动向:6月中旬ARR(年度经常性收入)突破3亿美元,API 收入占比超过七成。7月19日暂停C端新用户订阅。上一轮200亿美元估值的融资刚交割,新一轮投前估值已经喊到315亿美元。

心细的开发者看到,在Hugging Face约1.56TB的模型文件旁边,一份只有3.07KB的许可证,透露了更多商业信息。

按照ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> K3 License,如果一家企业经营“模型即服务”业务,且企业及其关联方在任意连续12个月内的合计收入超过2000万美元,在将K3及其衍生模型用于商业目的前,必须与月之暗面另行签署协议。

这份许可证把K3的话题从技术拉回了生意。

01 月之暗面不想给云厂商免费打工

开放模型一直存在一个尴尬:模型公司承担训练成本,云厂商却可能拿走后续收入。这也是百度李彦宏早些时候提到开源模型没有前景的根本原因。

按照MIT许可证,云厂商可以下载模型、优化推理、包装成API,再利用已有客户、算力和销售渠道收费。模型公司获得下载量和行业声量,客户关系、调用数据和账单却留在云平台。模型迭代越快,实验室越容易变成云厂商的上游研发部门。

K3的许可证中“模型即服务”指的是允许第三方对输入、参数或训练数据进行实质性控制。把K3能力嵌进自家产品某个具体功能里,或者只是简单转发请求到别的平台,都不算在内。

换句话说,月之暗面没打算拦研发者和大多数企业用户,它拦的是那些下载权重、封装成API,再用自己的品牌和定价对外销售推理服务的云厂商和推理平台。

海外已经有专注开源基础设施的分析人士,把这道门槛和十年前的往事相提并论。

MongoDB、Confluent当年也是先靠宽松许可证扩大规模采用。等到亚马逊等云厂商把它们的开源数据库直接包装成收费云服务,原开发商却拿不到分成,它们才被迫转向限制转售的SSPL、BSL许可证。

先用开放换规模,再用规则拿回议价权。从超大规模云厂商,到Fireworks、Together这类专注模型托管的推理平台,理论上都被2000万美元的门槛纳入其中。K3面对的是与MongoDB、Confluent相似的商业挑战,但选择了更温和的法律路径:不直接禁止MaaS转售,而是要求达到收入门槛的经营者另行签约。

开放模型行业已经从“比谁先开源”“比谁开源得彻底”,走到了“比谁能从开放生态里拿回定价权”的阶段。

同样是7月放出权重,智谱GLM-5.2和ink data-id="14638" data-name="DeepSeek" data-logo="https://img.36dianping.com/20250909/v2_8b4cc3a29754422f94db009a5e5c9a8f_oswg209762oswg430oswg430_img_000" data-classify-list="辅助写作,AI助理,文本生成" data-refer-type="20">DeepSeekink> V4 Pro用的还是干净的MIT协议,不加任何转售门槛。当然,这也未必是因为它们更慷慨。

至于月之暗面口中可以豁免这条门槛的“认证推理伙伴”,标准和名单目前谁都说不清楚,许可证原文也没有给出定义。

02 从“卷参数”到“卷场景”

许可证只是K3的商业选择。回到模型本身,K3、ink data-id="14638" data-name="DeepSeek" data-logo="https://img.36dianping.com/20250909/v2_8b4cc3a29754422f94db009a5e5c9a8f_oswg209762oswg430oswg430_img_000" data-classify-list="辅助写作,AI助理,文本生成" data-refer-type="20">DeepSeekink>、GLM和ink data-id="13438" data-name="千问" data-logo="https://img.36dianping.com/20250909/v2_ab9ccd231d1247a28821b0595221be8b_oswg15379oswg268oswg268_img_000" data-classify-list="文本生成,辅助写作,摘要总结" data-refer-type="20">千问ink>也已经走上了四条不同的路线。

K3走的是“大而全”。它拥有2.8万亿总参数、100万token上下文和原生视觉理解能力。官方演示中,K3从零编写了一套GPU编译器,还参与芯片设计、生成3D开放世界游戏。但输入每百万token 3美元,输出15美元,单任务平均成本约0.94美元,是四家中最贵的一个。

ink data-id="14638" data-name="DeepSeek" data-logo="https://img.36dianping.com/20250909/v2_8b4cc3a29754422f94db009a5e5c9a8f_oswg209762oswg430oswg430_img_000" data-classify-list="辅助写作,AI助理,文本生成" data-refer-type="20">DeepSeekink> V4 Pro走的是相反路线。它的总参数达到1.6万亿,激活参数却压到约490亿。输入和输出价格分别为0.435美元和0.87美元,单任务成本约0.04美元。

ink data-id="14638" data-name="DeepSeek" data-logo="https://img.36dianping.com/20250909/v2_8b4cc3a29754422f94db009a5e5c9a8f_oswg209762oswg430oswg430_img_000" data-classify-list="辅助写作,AI助理,文本生成" data-refer-type="20">DeepSeekink>还引入了峰谷定价,9点至12点、14点至18点翻倍收费,错峰使用则能节省一半。这与它一贯的打法一致,参数可以大,但激活规模和使用成本必须尽可能低。

智谱GLM-5.2选择了第三条路。它采用升级版ink data-id="14638" data-name="DeepSeek" data-logo="https://img.36dianping.com/20250909/v2_8b4cc3a29754422f94db009a5e5c9a8f_oswg209762oswg430oswg430_img_000" data-classify-list="辅助写作,AI助理,文本生成" data-refer-type="20">DeepSeekink> Sparse Attention,把百万token上下文的推理开销压到通用硬件可以承受的范围。再配合约400亿的单token激活参数,首字延迟做到三家中最短。

GLM-5.2的输入、输出价格分别为1.4美元和4.4美元,落在K3与ink data-id="14638" data-name="DeepSeek" data-logo="https://img.36dianping.com/20250909/v2_8b4cc3a29754422f94db009a5e5c9a8f_oswg209762oswg430oswg430_img_000" data-classify-list="辅助写作,AI助理,文本生成" data-refer-type="20">DeepSeekink>之间,重点争夺编码和Agent场景里的响应速度。

阿里ink data-id="13438" data-name="千问" data-logo="https://img.36dianping.com/20250909/v2_ab9ccd231d1247a28821b0595221be8b_oswg15379oswg268oswg268_img_000" data-classify-list="文本生成,辅助写作,摘要总结" data-refer-type="20">千问ink>不追求单点极致,追的是覆盖面。上百种语言和更完整的多模态能力,使它更像一套面向企业客户的通用底座,而不是专门用来跑分的旗舰产品。

不过ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>也让阿里坐不住了,K3 发布三天后,阿里预告Qwen3.8-Max,2.4 万亿参数,明确说也要开放权重。过去一年,开源模型的规模天花板有9个月是 ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> 顶上去的。现在,旗舰级开放权重正在变成中国大模型厂商的标配动作。

四条路线已经无法再用一个维度排座次。“卷参数”开始转向“卷场景”:长文本看K3,性价比看ink data-id="14638" data-name="DeepSeek" data-logo="https://img.36dianping.com/20250909/v2_8b4cc3a29754422f94db009a5e5c9a8f_oswg209762oswg430oswg430_img_000" data-classify-list="辅助写作,AI助理,文本生成" data-refer-type="20">DeepSeekink>,响应速度看GLM,覆盖面看ink data-id="13438" data-name="千问" data-logo="https://img.36dianping.com/20250909/v2_ab9ccd231d1247a28821b0595221be8b_oswg15379oswg268oswg268_img_000" data-classify-list="文本生成,辅助写作,摘要总结" data-refer-type="20">千问ink>。

差异化也不意味着谁能高枕无忧。ink data-id="14638" data-name="DeepSeek" data-logo="https://img.36dianping.com/20250909/v2_8b4cc3a29754422f94db009a5e5c9a8f_oswg209762oswg430oswg430_img_000" data-classify-list="辅助写作,AI助理,文本生成" data-refer-type="20">DeepSeekink>、GLM和ink data-id="13438" data-name="千问" data-logo="https://img.36dianping.com/20250909/v2_ab9ccd231d1247a28821b0595221be8b_oswg15379oswg268oswg268_img_000" data-classify-list="文本生成,辅助写作,摘要总结" data-refer-type="20">千问ink>随时可能继续强化各自的长板,K3在价格上的劣势也不会自动消失。

03 闭源模型的溢价被挤压

真正让这一轮开放模型显得扎眼的,是跑分与价格的综合对比。

在第三方评测机构Artificial Analysis的智能指数榜单上,K3拿到约57分。排在它前面的是Claude Fable 5和GPT-5.6 Sol,分数分别约为60分和59分;Claude Opus 4.8则以约56分紧随其后。

这是第一次有开放权重模型把成绩做到与顶级闭源模型相差两三分的位置。在Arena前端代码榜单上,K3上线24小时内冲到第一,超过Claude Fable 5,较上一代提升17个位次。

更关键的是,这些接近世界顶尖的成绩,对应的价格明显低于多数闭源旗舰。

K3单任务平均成本约0.94美元,约为Claude Opus 4.8的一半。如果闭源模型的溢价建立在“只有我们能做到这个水平”之上,那么当一个开放权重模型把差距压缩到两三分,价格却只有其一半左右,这套溢价逻辑的解释空间就在迅速收窄。

微软 CEO 纳德拉管这叫“反向信息悖论”,买闭源模型其实付了两次钱,一次付账单,一次把喂给模型的业务know-how也送了出去。

今年1月,纽约一家法院要求 OpenAI 交出 2000 万条脱敏用户对话,更是给所有企业提了个醒:数据在别人服务器上,就由不得你了。K3给的,正是那个“数据不出墙”的选项。

04 权重只是开胃菜,真正的战场在推理层

开放权重这件事,在这个阵营里已经不算新闻。ink data-id="14638" data-name="DeepSeek" data-logo="https://img.36dianping.com/20250909/v2_8b4cc3a29754422f94db009a5e5c9a8f_oswg209762oswg430oswg430_img_000" data-classify-list="辅助写作,AI助理,文本生成" data-refer-type="20">DeepSeekink>、GLM和ink data-id="13438" data-name="千问" data-logo="https://img.36dianping.com/20250909/v2_ab9ccd231d1247a28821b0595221be8b_oswg15379oswg268oswg268_img_000" data-classify-list="文本生成,辅助写作,摘要总结" data-refer-type="20">千问ink>的旗舰模型早已挂上Hugging Face,下载、商用和微调都不是问题。

K3这次真正带来新鲜感的,反而是权重之外的部分。

由于KDA改变了传统的前缀缓存机制,月之暗面把自己的缓存实现直接贡献给了vLLM项目。权重上线当天,vLLM和SGLang两大主流推理引擎同步提供部署方案。AMD团队完成了MI355X芯片的首日适配,云平台Modal上线了K3托管服务,Inferact则训练并开源了适配K3的DSpark投机解码器。

vLLM给出的最简部署配置,是8张英伟达B300或8张AMD MI355X。这两款都是尚未大规模铺货的顶级数据中心芯片,所需算力远非个人开发者能够触及。

这意味着,月之暗面想要的不只是“模型更大”这个头条。它还想在推理框架和部署工具链中占据一个位置。

权重谁都可以开放。但如果开发者使用的服务方案、缓存实现和投机解码器都围绕你的架构开发,更换模型的成本就不再只是“换一个文件”那么简单。

许可证中“通过认证推理伙伴使用可以豁免转售条款”的设计,又给了月之暗面一个开关:谁能进入这套生态,谁需要先坐下来谈判,可以由它筛选。

放出权重是一次性动作,嵌入工具链才有可能真正留住开发者。这也是为什么,K3这次开放权重更适合被理解为一个开始,而不是终点。

但自定义规则同样有代价。大企业选择开放模型,看重的不只是能力和成本,还包括许可证是否简单、稳定。MIT和Apache 2.0之所以受欢迎,正是因为法务部门容易判断使用边界。

K3增加了收入门槛、关联方口径、MaaS定义和认证伙伴等条件,企业部署前需要投入更多合规审查。如果GLM、ink data-id="14638" data-name="DeepSeek" data-logo="https://img.36dianping.com/20250909/v2_8b4cc3a29754422f94db009a5e5c9a8f_oswg209762oswg430oswg430_img_000" data-classify-list="辅助写作,AI助理,文本生成" data-refer-type="20">DeepSeekink>或ink data-id="13438" data-name="千问" data-logo="https://img.36dianping.com/20250909/v2_ab9ccd231d1247a28821b0595221be8b_oswg15379oswg268oswg268_img_000" data-classify-list="文本生成,辅助写作,摘要总结" data-refer-type="20">千问ink>推出能力相近、许可证却更简单的替代品,平台完全可能绕开K3。

开放模型原本就有较低的切换成本。一次发布带来的技术领先,很难长期支撑一套自定义规则。

据传,K3.1已经在路上,最快下个月就会发布,“开源—验证—迭代”这套打法,可能才刚刚开始被验证。

本文来自微信公众号 “强调Next”(ID:leo89203898),作者:新见,36氪经授权发布。

发布时间:2026-07-28 12:07