人工智能 / ARTICLE

开放模型的实力天平,不止一张排行榜

开放模型的强弱不能只看榜单。从许可证条款、推理成本到下游工具链,真正决定格局的往往是那几个不显眼的地方。

开放模型的强弱格局,最近又被拿出来重新算了一遍。Interconnects 发了一篇题为《The current balance of power in open models》的文章,随后在 Hacker News 上积累了 79 分和 25 条评论。热度算不上爆炸,但这类话题的读者往往就是真正要做选型决策的人。

标题里的 “balance of power” 是国际政治用语,放在模型上并不违和。它问的不是哪家分数高,而是几方各握着什么筹码,谁的筹码更难被替代。

“开放”两个字承担了太多

把 Llama、Mistral、Qwen、DeepSeek、Gemma 这些名字放进同一个篮子,说它们是“开源模型”,会掩盖掉不少实际差别。权重能不能下载,只是第一层。往下还有:训练数据和训练代码是否公开,许可证允许什么、禁止什么,商用有没有月活或营收门槛,微调之后的模型能不能再分发。

这些条款直接决定一家公司能不能把模型塞进自己的产品里。一个权重开放但商用受限的模型,和一个 Apache 2.0 的模型,对于要落地的人来说几乎是两种东西。讨论开放格局时如果不先区分这一层,后面的比较很容易变成空谈。

排行榜测不出来的部分

评测分数是最容易拿到、也最容易误导的指标。测试集污染、提示词写法、中英文表现落差、长上下文里的实际衰减,都会让同一个模型在不同榜单上差出一截。更麻烦的是,通用问答强不等于代码强,代码强不等于能稳定调用工具。

对使用方来说,另一条线往往更重要:推理成本。开放权重的好处是你能自己部署,代价是运维、显存和延迟都要自己扛。当闭源 API 的价格持续下探,这条成本曲线能压到什么位置,比多拿两分更能决定选型结果。

推天平的是谁

大概能分出三类推动者。大厂用开放权重换生态、换开发者习惯,也换招人时的话语权;创业公司把开放当差异化手段,因为闭源赛道拼算力拼不过;国家和地区层面的投入则是另一股力量,中国团队在这一层尤其活跃,Qwen 和 DeepSeek 的迭代节奏就是例子。

还有容易被忽略的下游:微调社区、推理框架、本地部署工具。模型能不能被真正用起来,很大程度上取决于这些工具链跟不跟得上。权重放出来而没人接得住,和没放出来差别不大。

讨论里反复出现的两个误读

Hacker News 上这类帖子的评论区,通常会出现两种简化。一是把“权重可下载”等同于“开源”,忽略许可证和训练资料的差别;二是把单个模型的能力等同于整个开放生态的实力,忽略工具、算力和人才。

这两种简化都会让判断偏掉。真正的格局变化,往往先出现在许可证措辞和工具链支持上,而不是排行榜的名次上。

想看清天平往哪边斜,与其等下一份榜单,不如盯三件事:许可证有没有变松,权重之外还开放了什么,以及下游工具链有没有跟着动。这三样动了,格局才算真的动了。

END