
Kimiink>创始人杨植麟。图片经由AI生成
ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> K3最近大火,美国科技圈的一些人开始反思:为什么杨植麟卡内基梅隆博士毕业后,不留在美国创业?
作为年度最强开源模型,ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> K3的参数量达到了3T级别,并在各大基准测试中“屠榜”,一部分榜单表现甚至超越Fable 5这种美国实验室的最前沿模型。
在算力不足的情况下,通过算法、工程的优化,叠加参数的扩展,不仅追上前沿闭源模型的性能,打破Scaling Law“撞墙”一说,甚至还引发了一部分硅谷巨头的焦虑与恐慌。
OpenAI战略负责人迪恩·W·鲍尔说:“开源模型会阻碍人工智能领域的进一步资本支出。”
这不难理解,大家都在探索AGI,你来做的话需要10块钱,而别人只需要1块。那么,你就需要论证多出来的9块钱的必要性、合理性。对于年度资本开支7000亿美元的硅谷巨头来说,如果答案是否定的,人工智能产业将迎来一轮史无前例的“泡沫破裂”。
不过,“搅局”的同时,ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>很快遇到了自己的第一个难题:算力焦虑。
01、一封充满算力焦虑的信
7月19日晚间,ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>发通知信暂停新用户接入,暂时性关上了新用户体验ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> K3的通道。
通知信大意是:热度高、需求超预期、存量算力不够且逼近极限。不得不暂停C端新用户订阅,将已有算力分配给存量用户,直至新算力到位再陆续开放更多订阅名额。
“暂停”增量用户接入与“Token Plan”限售,虽然都源于算力紧缺,但二者略有不同。
过去,国内模型推理算力不够,通过“Token Plan”限售的方式开一个口子提供服务,起码意味着有供给空间,也能够在后续通过API接入转化重度用户。直接“暂停”接入,把增量用户拒之门外,意味着算力供给上没有任何腾挪的空间,可见现阶段ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>的算力紧缺程度。
“它自己的算力都没法批量获取,现在这么多用户想用都没法开通付费账户,这严重影响商业变现和用户口碑。”一位资深科技投资人说。
长期关注中国科技产业发展的上海财经大学教授胡延平认为,ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>暂停新用户接入的原因是算力准备不足,而非ROI没有转正。“因为算力约束,接不住泼天的用户,目前比ROI转正更重要的是接住用户。”
关于ROI的问题,胡延平认为只从“算力/token”来看问题,有可能出现用户token消耗越多亏损越大的情况,只有从“算力成本效率/token”来分析,才能看清算力约束的真实涵义。
“类似ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>接不住用户这种情况,除了需要有更合理的资费、更多的算力卡,更重要的是要有能效比、量效比更高的算力卡和算力集群。”一位接近ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>的知情人士透露,暂停新会员订阅后,找算力成为他们的头号任务。
“我们已经在非常努力地通过模型性能的优化和算力供给来解决问题。”ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>企业业务负责人黄震昕日前在沟通会上说。
ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>在寻找算力的同时,智谱1GW纯国产算力的消息却被释放出来。这也引发多位国产算力从业者的讨论,核心在于智谱从哪里能够获得如此天量规模的算力。
以刚刚在2026世界人工智能大会(WAIC)上亮相的华为昇腾Atlas 950超节点为例,仅按64卡机柜100KW功耗上限来换算,不考虑交换等设备,1GW相当于10000个Atlas 950机柜,即640000张NPU。再假设单卡价格是20万元,整个1GW的订单,仅算力部分就将超过1200亿元。
即便考虑国产卡价格差异,按照平均单价10万元算,1GW纯国产算力,也将是一笔超600亿元的算力大单。若消息准确,对国产算力来说将是一个巨大利好。
02、先找路,再找钱
“从目前披露的信息看,K3暂未呈现出范式级的全新架构。”期智研究院研究员李彪告诉腾讯科技。
KDA和AttnRes此前已有论文,本次更值得关注的是将这些模块与极稀疏MoE、低精度训练和大规模并行系统整合,并扩展到2.8万亿参数。 “由于K3完整技术报告尚未发布,目前仍难以评估其全部技术增量。”李彪补充说。
《ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> K3不是中国的Fable 5》一文中提到,KDA让序列计算更便宜,AttnRes让深度信息流更智能,Stable LatentMoE让参数容量更庞大——三者共同构成了ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> K3的架构骨架。算得更省、流得更顺、装得更多,共同成就了2.8万亿参数的ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> K3,以及它在开源生态和整个大模型领域的影响力。
“ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> K3 再次说明‘size still matters’。”李彪强调说。
他认为,模型规模仍是提升前沿能力的重要变量,但规模能否有效转化为能力,取决于架构、数据配比、优化方法和基础设施的共同配合。“对于2.8万亿参数的极稀疏MoE模型,当前更显性的工程约束来自功耗、通信开销、专家负载均衡和集群可靠性。从其能够支撑2.8万亿参数MoE训练来看,ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>应该在底层Infra上做了不错的优化。”
另一位学术研究员也认同训练过程中Infra、工程能力的重要性,“大家思路都大差不差,归根结底变成软件工程了。”
前述科技投资人告诉腾讯科技,中国公司再一次在较短时间内把开源模型推到接近全球闭源旗舰模型的水平,“我觉得还是非常厉害。它给我的冲击是Scaling Law还在继续;当前最前沿的模型训练配方,中国公司也可以快速掌握。”
如果把上述研究员、有投资人的观点综合到一起,可以归结为:ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>通过Infra、工程的手段,找到了一条持续Scaling Law的路,这不仅是ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>自己的路,也是中国开源模型生态的路。
所以,ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> K3亮相后不久,2.4万亿参数的Qwen 3.8预览版也宣布上线了。
当可靠的Scaling Law路径有了,剩下就是找钱的问题。
在一级市场,过去半年ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>一直是“当红炸子鸡”,融资相关的传闻不断。根据外媒披露的数据,ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>计划8月启动上市前最后一轮融资谈判,目标估值为500亿美元。这相当于ink data-id="14638" data-name="DeepSeek" data-logo="https://img.36dianping.com/20250909/v2_8b4cc3a29754422f94db009a5e5c9a8f_oswg209762oswg430oswg430_img_000" data-classify-list="辅助写作,AI助理,文本生成" data-refer-type="20">DeepSeekink>的上一轮融资完成后的估值。同期,ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>也拆VIE架构,加速赴港上市流程,冲击继智谱、ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink>之后在港股上市的“大模型第三股”。
如果时间倒退至2025年12月31日,彼时杨植麟发内部信确认完成了5亿美元的C轮融资。
“当前现金持有量超过100亿元。相比于二级市场,我们判断还可以从一级市场募集更大量资金,事实上,我们B/C轮融资金额就超过绝大部分IPO募资及上市公司的定向增发。所以我们短期不着急上市。”杨植麟在内部信中说。
资料显示,ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>的C轮完成后,投后估值43亿美元,对比外媒报道最新的Pre-IPO轮500亿美元估值,半年涨幅近12倍。
半年之前,杨植麟判断可以从一级市场拿到更多的钱,这个点后续被时间验证了,但100亿元的现金在7个月之后,在ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> K3被迫暂停新用户接入之后来看,显然不够用。
03、中国芯片的第二场战争
“ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> K3目前证明的是技术能力进入前沿,还没有完全证明推理经济性、产品体验和商业模式同样成立。”前述科技投资人说。
根据Artifacial Analysis的“智能指数”评测,ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> K3在全部9项测试中总共产生了约1.3亿个输出Token,高吞吐量导致跑完整套评测的总账单高达2709.75美元。相比之下,同类参评模型的中位数仅为6300万个。
拆分成单一任务,ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> K3的平均花费仅为0.94美元,GPT-5.6 Sol为1.04美元,Claude Opus 4.8为1.8美元。
单看定价,ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> K3的token已经不便宜了。而ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>自身关于这个问题的解释是:中国开源模型不应该被贴上性价比标签,SOTA模型应该有自己的定价权。
不过,对于用户而言,追逐性价比就是追逐更高经济性。放在ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> K3身上,如果Token输出量压缩一半,那么成本也就对应会压缩一半。这与胡延平教授提出的量效比高度一致。
他说,如果不考虑量效比,长期竞争会是问题,“某些时间点会出现token不经济”。
胡延平以英伟达为例,强调在H200上,token的ROI下可能是亏的,但升级为B300可能分分秒秒都是“印钞机”。这其实给国产算力提出了一个新的要求,既要给国产模型保证算力供给,也要在硬件层面释放token的经济性。
SemiAnalysis 5月份报告显示,在ink data-id="14626" data-name="MiniMax" data-logo="https://img.36dianping.com/20260427/v2_ff68b8ca5e0f498f81709fddf9f76930_oswg239168oswg1000oswg1000_img_jpg" data-classify-list="AI助理" data-refer-type="20">MiniMaxink>-M2.5的8K/1K负载下,B200 NVFP4凭借硬件与内核优化,在高吞吐交互下(单用户速度提升至110 tok/s/user),每百万token为0.09美元。作为对比,H100 FP8在统一的条件下,每百万token 0.74美元,实现了超过8倍的每美元性能提升(性价比)。

高交互负载下,B200 NVFP4 较 H100 FP8 运行Minimax 2.5成本对比
关于国产算力的进化,今年的世界人工智能大会(WAIC)出现了一些比较好的趋势。最典型的就是2025年的华为CloudMatrix 384和2026年的Atlas 950两代超节点的进化——单柜从32卡到64卡,计算密度翻倍;计算柜也从12个增至16个。机柜内部采用高密度铜缆电互联,机柜间采用全光互联,从支持千亿参数模型的训练,扩展至万亿参数模型的低精度训练和混合推理。
这种变化,不去现场看,不做对比,很难直观地感受到差异。
《2026,中国芯片为国产模型“托底”》里提到了国产算力进化背后的一些花絮,其中最具代表性的是国产算力从业者都表现出了不同程度的喜悦、开心,这里面有几个原因:公司上市,很大一部分员工获得了股权激励;同时,市场开始为中国芯片重新定价,逐步放大这种财富效应。
如果说上市是中国芯片的第一场战争,那么接住国产大模型的需求,为其token成本托底,将成为关键的第二战。
本文来自微信公众号“腾讯科技”,作者:苏扬,36氪经授权发布。
发布时间:2026-07-23 19:07