训练烧掉几千万,权重挂上 Hugging Face 任人下载——不是慈善,是广告。钱从广告之后,四扇门收回来
几千万训出来的东西挂在门口任人拿——不是慈善,是广告。
2025 年 1 月,DeepSeek 把 R1 的权重挂上了 Hugging Face。MIT 协议:下载、商用、二次开发、再发布,全部免费,一行附加条款都没有。
这个模型当时什么阵仗,全世界都看见了。性能对标 OpenAI 的 o1,App 一度冲上美区 App Store 免费榜第一,英伟达因此单日跌掉近 6000 亿美元市值。论文里写的训练成本:2048 张 H800,跑满两个月,GPU 账单 557 万美元。这还只是一轮预训练的钱。前期的实验、试错、人员、基建全另算,外界估算的总投入是这个数字的十倍量级。
阿里在送 Qwen,一轮一轮地送,累计送出四百多个模型。Meta 送过 Llama,连送四代。2025 年 8 月,连 OpenAI 都把 gpt-oss 系列挂了出来,Apache 2.0,同样分文不取。到 2026 年,国产开源大模型全球累计下载已经突破 100 亿次。
这就怪了。商业世界的常识是:研发成果是公司最值钱的资产。芯片公司把版图锁进保险柜,药企把分子式当命根子。大模型厂商反着来,把几千万砸出来的东西放在门口,还写上"随便拿"。
天下有这种生意吗?
有,而且不新鲜。超市门口的试吃、软件的免费试用期——免费的东西从来不是给你享用的,是让你进门的。
本文的主线就一句话:免费的大模型权重,是厂商投出去的广告。钱在广告之后,从四扇门收回来:推理服务、原厂服务、闭源旗舰、算力捆绑。
先看广告这半句为什么成立。
传统 to B 软件怎么获客?销售团队、行业展会、白皮书、POC 试点,一单生意从陌拜到签约隔半年到一年,企业软件公司的销售费用常常吃掉收入的三四成。即便这样,买方永远在怀疑:演示是不是特意排练过的?跑分是不是挑着做的?
开源权重的路径完全不同。权重放出去,开发者下载,在笔记本上跑,接进自己的项目。用顺了,项目带进公司;公司要上生产,生产要稳定,稳定要付费。中间没有销售,只有引力。
关键差别在信任。销售讲出来的信任要花钱买——请客、试点、担保、背书。用出来的信任不要钱——那是开发者自己一行代码一行代码试出来的。前者叫采购流程,后者叫习惯。
Hugging Face 上的数字说明了这套广告的触达效率:Qwen 全系列累计下载超 30 亿次,衍生模型十几万个。社区拿 Qwen 微调出的新模型,比大多数厂商官方发布的总数还多。30 亿次下载,就是 30 亿次零成本、高精准的广告触达,而且每一次都自带后续动作:下载,部署,写进项目。
这套打法有先例。先例值 340 亿美元。九十年代,Red Hat 靠免费 Linux 起家,把免费的代码变成企业敢用的东西,市场教育一分钱没花——用过 Linux 的工程师自己找上了门。2019 年,IBM 用 340 亿美元收购了这家"卖免费软件"的公司。收购那年,Red Hat 年收入约 33 亿美元。免费的 Linux 帮它省下的市场教育费,最后都写进了收购价里。
广告这半句站住了。但广告只是花钱的开始,钱从哪回来?
第一扇门,从 API 进来。
客户不是人傻钱多。答案是:自部署的账,算不下来。
先算一笔账。自己部署一个 671B 参数的模型,要什么家底。
DeepSeek 官方欢迎企业大规模自部署,条件明码标价:2k 卡 GPU 起步,带存储集群。这是"大规模"的门槛。小玩法则要八张 H200 起步,像样的在线服务要几十张卡,外加机房、电费,还有一支 7×24 待命的推理优化团队。模型跑起来只是开始——每次新版本权重发布,每次推理引擎升级,都要重新压一遍性能。
| 项目 | 自己部署 671B | 调用 API |
|---|---|---|
| GPU | 2k 卡集群起步 | 无 |
| 团队 | 推理优化工程师常驻 | 无 |
| 电费机房 | 每年百万级起 | 无 |
| 计费方式 | 固定成本,闲置也烧钱 | 按量付费,凌晨不花钱 |
对绝大多数公司,这笔账算不下来。所以第一个答案很直白:不是客户想付钱,是自部署太贵。免费权重给了客户"随时可以走"的底气,但生产环境的账单让他留了下来。
第二个答案:原厂的 API,往往就是最便宜的。还是看 DeepSeek。MLA 架构把 KV Cache 压到传统架构的几分之一,缓存命中的计费压到每百万 token 几分钱。架构优化省下的钱,直接换成定价上的攻击性——别人的成本线,是它的价格线。梁文锋接受采访时说过,这个定价有利润空间,不是赔本赚吆喝。分析机构给 DeepSeek 的 API 业务算过账,毛利率的估算在七成上下。
铁证在财报里。智谱 2026 年中报:GLM-5.3-Flash 开放权重、API 定价压到竞品的一小部分,换来的是什么?开放平台及 API 业务收入 8.25 亿元,同比增长 27 倍,占总收入 86.5%;MaaS 平台年化收入 16 亿美元;API 毛利率从负转正到 24.6%。中报里最扎眼的一行:Token 调用量较年初增长超 40 倍,API 平均售价还涨了 101%。量价齐升——开源引流、API 收钱这条闭环,第一次被财报完整验证。
还有个细节值得单独说。2026 年 8 月,DeepSeek 给 V4-Pro 的官方 API 涨了价,高峰输出 27 元/百万 token,是旧价的 4.5 倍。同一时间,第三方托管商拿着开放权重,把价格打到官方的四分之一。原厂凭什么敢涨价?因为原厂卖的从来不只是 token——是最新版本,是推理成本的持续压缩,是把应用建在你生态上的黏性。定价权在成本和生态手里,不在权重手里。
第一扇门收得稳。但有一类客户,卡也有,钱也有,就是数据不能出门。银行、政企、涉密单位,模型必须进内网。这部分人的钱,怎么收?
权重都白送了,机器在客户自己机房里。钱在哪?
权重都白送了,客户拿去自己部署,原厂还能收什么钱?
这个问题,Red Hat 三十年前就回答过。答案分三层。
第一层:有些版本,本来就是收费的。Red Hat 的 Fedora 社区版免费,RHEL 企业版收订阅费。社区版是试验田,企业版是稳定、认证、有 SLA 的商品。同一个 Linux,两条产品线。大模型行业照搬:Mistral 把 7B、8B 级别的小模型用 Apache 2.0 放出去攒口碑,企业版模型和商用条款单独收费。
第二层:部署本身就是生意。私有化部署一个旗舰模型,合同几百上千万起步。原厂派工程师进场:集群规划、推理引擎选型、性能压测、安全加固、合规审计,全程陪跑。收的不是代码费——代码已经免费了。收的是手艺费。客户缺的从来不是权重,是把权重跑稳的人。会调 vLLM 和 SGLang 的工程师现在什么行情,招聘网站上一搜便知。
第三层,Red Hat 真正的护城河:订阅。部署完不算完。版本升级、漏洞修补、SLA 响应、微调支持,按年收费。CIO 的账很简单:机器可以免费,责任不能免费。生产环境凌晨三点出事故,得有一个能打通的电话。Red Hat 被收购那年,33 亿美元年收入里,九成上下来自订阅。
Mistral 把这套打法搬进了大模型:小模型开源,企业服务收费,到 2026 年 ARR 做到 4 亿美元上下。国内同一条路上的玩家更多——智谱、百川的企业版合同,本质都是 Red Hat 模式:权重进内网,服务费进账户。
第二扇门看完了。但回头看第二章末尾那个细节:DeepSeek 涨价的是 V4-Pro,开源的是 V4.1 Flash,两件事发生在同一个月。送的和卖的,从来不是同一个模型。这就是第三扇门。
厂商开源的和收费的,是两条产品线。
把各家厂商的开源名单和收费名单并排放,规律自己会浮出来。
阿里:Qwen 的 Flash 系列开源,Max 系列闭源、API 独占,输入 12 元、输出 36 元每百万 token。官方模型页写得明白——商业版"相比开源版,具有更新的能力和优化"。
DeepSeek:V4.1 Flash 开源,MIT 协议;V4-Pro 只能走 API,高峰输出 27 元/百万 token。
智谱:GLM-5.3-Flash 开放权重、定价压到竞品的一小部分;GLM-5.3 闭源收费。
Mistral:小模型 Apache 2.0,旗舰 Mistral Large 闭源。连 OpenAI 都进了这个名单:2025 年 8 月开源 gpt-oss,GPT-5.6 照旧闭源、照旧按最高价卖。
五家厂商,五条产品线,一个共同动作:广告款开源,当季新款关起门收钱。
这个分层的妙处在于两头都占。开源款挂出去拉新、攒生态、压低整个市场的价格锚——它是广告位。闭源款是货架,最新能力、最大参数、最好跑分都摆在这里,企业要上限,只能来付费。智谱的中报把这个结构演得明明白白:Flash 开源引流,调用量涨 40 倍;闭源款上探价格,平均售价涨 101%。量在免费款上做,钱在闭源款上收。
所以"免费的大模型"这个说法,本身要修正一下:免费的是广告位上的型号。旗舰从来没有免费过,它只是换了种卖法——从卖授权,变成卖调用。
第三扇门是产品线的设计。第四扇门更隐蔽,藏在硬件里。
卖 GPU 的也开始送模型了。图什么?
2026 年最反常识的一幕:卖芯片的英伟达,亲自下场做开源大模型。
Nemotron 3 系列,旗舰总参数 5500 亿,权重、训练配方、部署手册全放出来,免费商用。英伟达还宣布未来五年砸 260 亿美元做开源模型。卖铲子的开始送金子了,图什么?
看两个细节。
第一个:Nemotron 是原生用 NVFP4 精度训练的。这是英伟达 Blackwell 架构的自家格式,在 B200 上推理速度是 H100 的四倍。换到 AMD 的卡或谷歌 TPU 上跑,优化全失效,性能断崖式下跌。模型免费,但想跑出宣传里的性能,得买英伟达的新卡。
第二个:英伟达 2026 财年数据中心业务收入 1937 亿美元,占总营收近九成。模型对它来说是什么?一台算力需求发生器。开源模型门槛越低,部署 AI 的企业越多,GPU 卖得越多。黄仁勋的账:模型免费,硬件收钱。剃须刀白送,刀片收钱——刀片只此一家。
这套账不只英伟达在算。阿里的 Qwen 开源,收的也不是模型钱,是算力钱:开发者用 Qwen 上手,企业要微调、要训练、要托管,这些动作发生在阿里云上,GPU 租赁、百炼平台、训练服务的账单跟着涨。财报里那句"阿里云 AI 相关产品收入连续多个季度三位数增长",翻译过来就是:权重免费,算力收钱。
云厂商送模型,芯片厂送模型,逻辑是同一个:模型是入口,算力是生意。你的注意力在模型上,你的账单在算力上。
四扇门都看完了。现在把整个账本摊开:训练砸进去几千万,权重白送,广告效应、API 毛利、服务合同、闭源旗舰、算力捆绑——这笔账,到底算不算得平?
六家厂商,六本账。送东西的动机不一样,算账的方式也不一样。
| 厂商 | 白送了什么 | 收回来什么 | 账算得平吗 |
|---|---|---|---|
| DeepSeek | Flash 系列权重,MIT | API 毛利七成上下 | 平 |
| 阿里 / Qwen | 四百多个模型 | 云收入三位数增长 | 平,且更大 |
| 智谱 | GLM-Flash 权重 | API 收入 27 倍,ARR 16 亿美元 | 平,有财报 |
| Mistral | 小模型 Apache 2.0 | 企业服务 ARR 4 亿美元 | 平 |
| 英伟达 | Nemotron 全家桶 | 数据中心 1937 亿美元 | 平,且是放大器 |
| Meta / Llama | 权重(商用有门槛) | 不收钱 | 另一本账 |
五家的账直接算得平。Meta 是特例,要单独讲。
Meta 送 Llama,一分钱不收。它的账本在别处:一年 1600 亿美元上下的广告收入。对 Meta,模型不是生意,注意力才是。Llama 的价值是防御——让最强的模型永远不只攥在一两家闭源公司手里,让"模型层"永远收不起 Meta 的税。
2024 年曝光的扎克伯格内部邮件,把这本账写得明明白白。大意是:如果开放生态赢了,Meta 能直接汲取社区的全部创新,一分钱不用多花,还不被任何平台锁死;如果闭源赢了,Meta 未来的每一张卡、每一个用户,都要给别人交税。送出去几十亿训练成本的 Llama,买到的是"不交模型税"的保险。Meta 觉得划算,于是连送四代。
旁证还有一个,来自"别人家的权重"。Fireworks、Together 这些第三方推理商,专门托管开放权重卖 API——模型是别人免费发的,生意是自己的。到 2026 年,Fireworks 的 ARR 破了 10 亿美元。别人的免费权重都能养出十亿美元的生意,原厂守着自家权重的账本,只会更从容。更大的背景是:2026 年夏天,开源模型的 Token 调用份额首次反超闭源,站上 62%。免费不是行业的边角料,是行业的主干道。
账合上了。回到开头的问题:几千万训出来的模型直接白送,钱从哪进来?四个答案。推理服务:客户算过自部署的账,留在了 API 门口。原厂服务:要自己部署的客户,买企业版、买部署、买订阅——Red Hat 三十年前就把路修平了。闭源旗舰:免费名单上永远没有最新款,广告位和货架分开摆。算力捆绑:模型免费,GPU 和云的账单跟着涨。
一句话收束主线:免费的是权重,收费的是确定性。开发者要的是白嫖的便宜,厂商卖的是生产的管道。中间那段路,叫转化。
所以,下次看到某个模型开源,MIT 协议,权重随便下,别只当是捡了便宜。它挂在 Hugging Face 上,等的是你的下一个项目。等项目进了生产,你们总会再见——那时你手里拿的,是采购单。
或者换个问题:哪天开源模型开始收"企业版权重授权费",你会付吗?
别急着摇头。Kimi K3 的条款里已经写着:年收入超过 2000 万美元,请来签协议。