开源与闭源 | 大模型 | 做产品
开源与闭源
「开源模型」这个说法借用了软件行业的词,但含义差得很远。软件开源你能看到全部源代码;模型开源,你通常只拿到权重——一堆训练好的数字。
你会遇到的现象
-
以为「开源」等于免费,算完自部署的账才发现比调 API 贵
-
下载了权重,却发现许可证不允许你这种商用方式
-
老板说「用开源的,数据安全」,但没人算过要买几张卡
开的到底是什么
一个模型由三部分构成:训练数据、权重、训练代码与配方。
所谓「开源模型」,绝大多数情况下只公开了中间那一块——权重。训练数据几乎从不公开(涉及版权和商业机密),完整的训练配方多数也不给。
这意味着:**你能用它,但复现不出它,也搞不清它到底学过什么。**所以业内更准确的叫法是「开放权重」(open-weight),而不是开源。你在训练数据那一节看到的那些偏向和缺口,在开放权重模型上同样存在,而且更难查证。
相对地,闭源模型连权重都不给,你只能通过 API 调用。你不知道它具体是什么结构、多大参数,厂商换了模型你也未必察觉得到。
许可证要看什么
「公开」不等于「随便用」。下载之前,让法务或者你自己确认三件事。
**一、能不能商用。**有些许可证只允许研究用途,商用要单独授权。
**二、有没有规模限制。**有的许可证写了用户量或收入的门槛,超过就要另外谈授权——这条最容易被忽略,等产品做大了才发现,那时候换模型的成本已经很高了。
**三、产出物和衍生模型归谁。**你用它微调出来的模型能不能自己发布、能不能闭源,不同许可证规定不一样。
许可证种类很多,宽松的接近标准开源协议,严格的更像「有条件的免费使用授权」。别看厂商宣传页上那句「完全开源」,去读许可证原文。
自部署的真实账
这是最容易算错的地方。很多人把「不用付 API 费」直接等同于「免费」。
实际要付的是这些:显卡(买或租,大模型往往需要多张高端卡)、电力与机房、运维人力(部署、监控、故障恢复、版本升级)、并发能力(要支撑多少人同时用,就要备多少冗余)。
关键在于,**这些成本大部分是固定的,跟你用不用无关。**API 是用多少付多少,半夜没人用就不花钱;自部署的卡在那放着,闲着也在烧钱。
所以结论几乎总是:**调用量低的时候,自部署单位成本高得离谱;只有量大到能把固定成本摊薄,才可能划算。**而「量大」的门槛,通常比团队预估的高不少。
另外还有一笔隐性账:能力差距。开放权重模型和头部闭源模型之间通常仍有差距,而且你要自己承担跟进新版本的工作——闭源 API 是厂商升级了你自动受益。
把「开源 = 省钱」这个等号去掉,再看这张图
总成本 调用量 →
回本点
调 API:用多少付多少 自部署:固定成本,闲着也在烧钱
这一整段里,自部署的 单位成本高得离谱
「量大」的门槛通常比团队预估的高不少。先用 API 跑一段时间,拿真实用量算一遍多久回本——算不明白就说明还不到时候。
显卡、电力机房、运维人力、并发冗余,这些成本大部分是固定的,跟你用不用无关。开源真正卖给你的是控制权:数据不出门、模型不会消失、版本你自己定——不是便宜。
什么时候才该自部署
符合下面任意一条,自部署才真正成立。
**一、数据绝对不能出门。**医疗、金融、政务、军工这类场景,合规要求压过一切成本考虑。这是自部署最正当、也最常见的理由。
**二、调用量大到能摊薄固定成本。**先用 API 跑一段时间,拿真实用量算一遍:按现在的量,自部署多久能回本?算不明白就说明还不到时候。
**三、需要深度定制。**要做大规模微调、改模型结构、或者部署到没有网络的环境,这些闭源 API 做不到。
**四、必须消除供应商风险。**不接受模型某天被下线、涨价或限流。这条对长周期的 B 端合同尤其重要。
如果一条都不占,那就用 API。**把「开源=省钱」这个等号去掉,你会做出更清醒的决定。**开源真正卖给你的是控制权:数据不出门、模型不会消失、版本你自己定——这在选择接入渠道时也是同一套逻辑。
还有个折中方案值得知道:**用云厂商托管的开放权重模型。**模型是开放权重的,但由云平台负责部署运维,你按调用量付费。拿到了模型选择的自由,又不用自己扛运维——对多数团队来说,这是比自建机房更现实的一条路。
从哪里拿到模型 五种渠道各自的控制权和责任边界,自部署只是其中一种。
训练数据从哪来 权重公开但数据不公开,意味着它学过什么你查不到。
主流模型厂商的差异 开放权重阵营和闭源阵营的性格差别,以及怎么放进同一张选型表。
