Nathan Lambert 撰文分析开源模型的中美实力格局
The current balance of power in open models
精选理由
作者基于自己持续追踪的下载量、基准和 arXiv 数据,给出开源权重模型中美竞争格局的全景与政策视角。
AI 摘要
Nathan Lambert 发布其向美国国会汇报的开源模型现状综述,指出中国开源权重模型已在下载量、基准成绩和学术采用上领先,自 2025 年 7 月起在 Hugging Face 下载量上领先约 1.6B(总 3.2B,为美国两倍)。
正文 · AI 翻译
我最近受邀向一群国会议员和工作人员做简报,从美中竞争的视角介绍开放权重模型的现状。我在此分享我准备的发言稿,作为一份面向更广泛受众的开放模型国情咨文。
回顾:什么是开源模型、开放权重模型与闭源模型?
开放语言模型是指其权重公开可供审查或下游使用的 AI 模型。它们最常与所谓的“闭源”AI 模型形成对比。闭源模型仅通过应用程序编程接口(API)提供访问——开发者可以用它直接查询模型,例如 GPT-4 或 Claude Opus 4.5——或通过产品提供访问,例如 ChatGPT 和 Claude Code。
开放语言模型主要分为两类:开放权重模型和开源模型。开放权重模型是最常见的形式,例如 Meta 的 Llama、阿里巴巴的 Qwen、Google 的 Gemma 或 DeepSeek 的模型等热门模型。这些模型受许可证约束——许可证是规定下游使用允许范围的治理文件——并且通常附带 Transformers、VLLM、SGLANG 等库中的推理代码。自大约 2025 年 4 月以来,中国 AI 公司一直是开放权重模型领域明显的领先者。
真正的“开源”模型与此类似,因为它们包含权重、许可证和推理代码,但它们还包含复现该模型所需的完整信息——训练代码和训练数据。最知名的开源模型都是在美国构建的,近期由 Allen Institute for AI 的 Olmo 模型系列领衔,我在那里工作的最近 2.5 年里帮助构建了这些模型。其他知名的开源模型同样由美国的非营利组织构建,包括 OpenAthena 的 Marin 模型和 EleutherAI 的 Pythia 模型。
开放权重、开源,以及一个模型的其他各种标签——包括主要通过 API 提供的闭源模型——都存在于一个光谱之上。例如,Nvidia 的 Nemotron 模型比大多数开放权重模型开放得多,以宽松许可证发布了大量训练数据,但它们并非完全开源,因为它们没有发布全部数据。闭源模型同样存在于一个光谱之上,取决于 API 披露哪些信息以及使用条款。
美国与中国开放权重模型之间的竞争状况(单位经济性、技术能力等)
我们正生活在一个GLM-5.2和Kimi K3——一些最新的领先中国模型——已经使开放模型的商业可行性发生了阶跃式变化的时代,它们在智能体能力上跨过了一个类似的阈值,正如 Anthropic 的 Claude Code 在 2025 年 12 月所跨过的那样。
美国曾是开放语言模型的早期领跑者,主要通过 Meta 的 Llama 系列模型,这些模型被广泛用于研究和商业任务。大约 18 个月前,中国的开放权重模型在这两个关键领域超越了美国的开放权重模型。体现这一点的简单指标是 Hugging Face 下载量,中国在 2025 年 7 月取得领先,主要得益于阿里巴巴 Qwen 系列模型的成功。我个人维护着追踪这些数据的工具,自从我在 2025 年 8 月首次发布 American Truly Open Models (ATOM) Project 以来,中国的 下载领先优势已增长到约 1.6B——总下载量达 3.2B,是美国总量的两倍。
在热门能力基准测试上,例如 Artificial Analysis Intelligence Index(AAII),中国的开放权重模型对美国同类模型拥有明显领先优势。截至本文撰写之时(2026 年 9 月 14 日),排名前三的中国模型是 Z.ai 的 GLM-5.3 和 GLM-5.3-Flash,以及月之暗面的 Kimi K3,得分分别为 45、42 和 44。相比之下,领先的美国模型是 Thinking Machines 的 Inkling 和 Inkling Small,得分均为 26,以及 Nvidia 的 Nemotron 3 Ultra,得分为 23。排名最高的美国模型发布于 2026 年 6 月和 7 月,更新频率低于中国同类模型。例如,中国实验室比美国公司早 2-6 个月发布了得分高于这些美国模型的模型(如 GLM-5 或 DeepSeek V4 Pro)。有更多美国公司在发布模型,包括 Arcee AI、Poolside 和 IBM 等名字,但它们并未迅速缩小这一性能差距。其他基准测试也讲述了类似的故事。
在 Artificial Analysis Index 上排名最高的美国开放模型落后于另外 15 个中国制造的模型。
综合来看,中国的开放权重模型大约落后美国闭源前沿模型 2-5 个月,而美国的开放权重模型大约落后 OpenAI 和 Anthropic 这类模型 6-9 个月。中国实验室在具有明确用户需求的任务上差距最小,例如智能体编程,而在更开放式的科学任务上差距更大,例如物理或生物学。
尽管中国实验室的资源比美国同行更少,它们为何仍能产出这些强大的模型,这仍是一个悬而未决的争论,并且深受不同工作文化的影响,但同时也受到几个关键技术因素的影响。中国实验室发布模型的速度更快,并且聚焦于分布略窄的任务,这使它们在公开基准测试上略有加分。发布更快有助于它们获得更高分数,因为所有实验室都在持续进步,所以一旦你“完成”一个待发布的模型,它就是那个特定时间点的性能快照——那个时间点更晚的实验室往往得分更高。尽管如此,中国实验室构建的模型确实强大,对美国产业构成了真正的竞争。随着闭源实验室修补其 API 产品中可被用于知识蒸馏的漏洞,这种竞争不会显著减弱。
知识蒸馏在新领域中影响最大,并且并不会让创建一个全面强大的最终模型变得轻而易举。我估计,如果知识蒸馏被完全阻止,例如通过 Anthropic 和 OpenAI 的客户身份识别(KYC)工具,那么从最强的美国模型到中国开放权重模型的差距也只会增加 1-2 个月。
例如,中国实验室在 2026 年对为训练数据付费的态度正在迅速转变。今年早些时候,包括 Moonshot AI 和 Z.ai 在内的中国顶尖实验室强烈倾向于在内部构建数据工作流,但到了夏天,它们已经开始从美国老牌公司和新兴中国初创公司那里购买前沿数据——用于智能体任务的具有挑战性的 RL 环境。
随着中国的开放权重模型向能力前沿推进,以及近期有关前沿模型在网络安全等领域风险不断增长的记录(例如 OpenAI-HuggingFace 事件),围绕 持续发布如何能够促成更安全的生态系统? 的监管不确定性正在增加。
开放权重模型面临的一个结构性挑战是,几乎没有有效方法能阻止开放软件的片段落入恶意行为者手中。如果试图以放大风险为由限制对中国最强开放权重模型的访问,那么受到拖累的将是美国企业。我们有一个例子——HuggingFace 使用了一个中国开放权重模型来理解这次网络攻击,因为闭源模型不会回应他们的请求。因此,管理开放权重模型的风险 往往归结为生态系统的准备。
开放权重模型正成为 AI 普及的一项关键工具,而要提前应对这些风险以及美国公司依赖中国构建的模型这种失衡关系,最佳路径是继续支持美国对开放模型的投入。拥有开放模型有助于更好地协调和防范那些本质上具有全球性的风险,同时加速 AI 服务在国内经济中的普及。
开放模型的采用现状:学术界、企业和其他国家如何使用开源?
2026 年,开放权重语言模型在普遍关注度和经济可行性方面大幅提升,使得人们得以初步窥见在 Hugging Face 指标之外更直接地比较美国、中国或其他地区模型采用情况的方法。一个例子是 OpenRouter 的使用情况。OpenRouter 是一个流行的 LLM 推理平台,提供单一接口,可在来自美国和中国的开放与闭源模型之间切换。该平台主要以试用各种开放权重模型而闻名。该平台自 2025 年 1 月 1 日起分享了头部模型的使用数据,并显示使用量从 2025 年 9 月某一周开放模型处理的约 1T tokens 增长到如今的每周约 80T tokens。在此期间,中国模型的市场份额从约 70% 增长到使用量的 80% 以上。其他旨在将开放模型商业化的平台也显示出类似数据,例如开源编码智能体 OpenCode,其推理量中中国模型占比约 95% 或更高。
这些开放平台是我们所能得到的、关于开放模型使用情况的最佳近似——很大一部分开放模型的使用发生在不披露各模型细分数据的平台上,例如 Together AI 或 Fireworks AI,以及面向企业应用的私有部署中。
许多知名科技公司和初创公司一直在基于中国的开放权重模型构建其 AI 功能,例如法律智能体Harvey、编程智能体Cursor,以及DoorDash对 Kimi 模型的使用、Airbnb对 Qwen 的使用,或 Perplexity 对 DeepSeek 的使用。这些知名公司只是冰山一角,大量更年轻的硅谷初创公司正在基于中国模型进行构建,以获得低成本、灵活的选择。美国初创公司和企业正呈现出一种日益增长的趋势,即与中国模型实验室签订企业协议,以获得在其产品中使用这些模型的许可——这是我在职业生涯中从未见过的一种新型跨境技术合作。
基于中国模型的创新基础进一步延伸至整个 AI 生态。粗略估计,大多数学术研究都是在阿里巴巴的 Qwen 系列模型上进行的。在我中国之行期间见到了 Qwen 领导团队的多位成员,他们对这类采用投入很深、也很有意为之,而这种局面将很难被美国模型夺回。
为了量化开放模型在学术界的采用情况,我扫描了 arXiv(AI 研究中广受欢迎的预印本平台)中 5 个最热门 ML 分类(cs.AI、cs.CL、cs.CV、cs.LG、stat.ML)的每一篇论文。结果清晰地印证了我对 AI 研究领导地位演变的认知:LLM 正成为 ML 研究的基础层——提及任何开放模型的比例在 2023 年 1 月为 2%,到 2026 年 9 月已达 50%——同时,领导角色在同一时期从美国转向中国。
例如,在 2023 年 4 月至 5 月,也就是 Meta 最初的 Llama(一个反向首字母缩略词,Large Language Model Meta AI,于 2023 年 2 月首次发布)问世几个月后,arXiv 上 12,000 篇新 AI/ML 论文中约有 2,600 篇提及了至少一个知名的开放模型家族。
在所有被扫描的论文中,约 5.5% 提及 Llama,约 1% 提及某个中国模型。2024 年秋季,在 Llama 的巅峰期,约 23% 的论文提及 Llama,约 7.5% 提及 Qwen——最直接的中国竞争者。如今,Llama 已失去在学术界的领先地位,仍有约 21% 的论文提及它,这一持久性相当可观,但 Qwen 的份额已升至 30% 的论文。
总体而言,任何中国开放权重模型被超过 40% 的论文提及,高于美国的 30%,且中国的份额仍在持续增长。
这表明,要在开放权重语言模型时代重新确立美国作为 AI 研究家园的地位,我们显然还有大量工作要做。但也存在希望的迹象。
在我们的研究中,我们发现,与中国同类模型相比,能力与规模比处于相当区间的美国模型,其采用率却高得不成比例。在过去一年里,我们看到 OpenAI 自 ChatGPT 以来首批开放权重模型gpt-oss成为有史以来采用最广泛的开放权重模型之一。此后,Google 的Gemma 4模型成为少数几个采用数据能与 Qwen 最受欢迎的小模型相媲美的模型,而 Nvidia 的Nemotron模型尽管在同一规模点上拥有众多能力更强的模型,采用率却较为有限。
总结
2026 年开放模型的故事,是一个确立经济相关性的故事。这是 AI 生态系统中诸多脉络的交汇,可概括为:
用户可用的开放模型与闭源模型之间的差距一直在缩小,这一趋势已持续 3 年。这一差距因任务而异,但可以估计为 2-5 个月的能力差距。由于整体能力进步如此之快,这使得开放权重 AI 模型在 2026 年解锁了可观的市场,并预示着不久的将来会出现更多拐点。
开放模型的使用正在高价值行业(如软件工程、法律服务、金融服务)中爆发式增长,这表明一个替代最佳闭源模型的生态系统正在兴起。主要提供开放模型推理服务的平台,包括 Together、OpenRouter、Fireworks、Baseten 等,正经历惊人的增长,成为开放模型后训练经济的第一批赢家(其他层面还包括微调 API,如 Thinking Machines 的 Tinker)。与此同时,AI 行业技术人员中流传着大量轶事,称他们使用 GLM-5.3 等开放权重模型作为 Claude 或 GPT 的替代方案,原因是速度、更低的价格、可定制的产品以及隐私保护的组合优势。
中国 AI 公司显然是开放权重模型的领导者。相较于 2025 年 DeepSeek R1 等中国模型以意外之姿震撼 AI 世界的情形,美国 AI 实验室在开放权重模型方面的地位一直在恢复,但尽管美国投入了更多实质性资金,中国实验室仍定期产出明显更强、受到各类用户喜爱的模型。
中国实验室对美国 AI 模型的知识蒸馏并不能完全解释其成功的全貌。知识蒸馏是一种行业标准技术,即利用通常更强的模型的输出来训练另一个 AI 模型。该技术在中国 AI 行业中最为普遍,该行业利用基本漏洞从美国公司未完全加固的产品中提取推理轨迹和额外数据。最佳估计是,知识蒸馏帮助中国公司相对于美国前沿水平将性能差距缩小了 1-2 个月。
中国模型,尤其是阿里巴巴的 Qwen 系列,已成为学术界和本地模型用户研究与开发的基础层。近几个月来,中国开放权重模型在 38% 的 AI 论文中被提及,高于美国的 28%——而且中国的份额增长速度远快于美国。这一点,加上其他政治因素以及美国领先 AI 公司的封闭性质,正在加速美国作为全球顶尖 AI 研究中心的领先地位的衰落。
开放权重模型正进入这样的能力水平:由于大量开放权重模型可供使用,新的风险(如网络安全)可能被触发,这要求在生态系统层面做好准备以应对。这一新的风险时代也带来了一个政治不确定期,监管机构关注最强的 AI 模型,但对于政策将如何在法律上落地存在巨大的不确定性。与此同时,许多研究人员和工程师依赖开放模型,因为其安全防护更为宽松,而 Claude 和 GPT 等封闭模型往往会拒绝关键的网络安全防御工作或生物学研究。
如需更多数据,请查看Interconnects 仪表盘。
结论
2026 年,中国实验室显然在保持其作为开放权重 AI 生态领导者的地位。这一局面出现在开放权重模型已经越过经济可行性拐点之际,也出现在美国实验室作为模型竞争者活动日益增多之时。领先的中国实验室在向全球扩展其企业级和研究领域的采用时,似乎并未受到实质性的挑战。
这一开放模型格局出现在更广泛 AI 生态的关键时刻。我们看到 OpenAI 和 Anthropic 凭借其最新的公开模型迈出了巨大步伐,同时呼吁各方协同审慎地管理 AI 进步的下一阶段。如今在少数 AI 实验室内部发生的事情,尤其是极端的人才与算力密度,预示着不久后将在开放模型生态中出现的局面。
对于少数真正的 AI 前沿实验室之外的世界上的其他所有人来说,开放模型将成为其依托的基础,用以把握软件工程及其他计算实践的加速。对于促成这种对变革性智能的广泛获取的组织而言,这代表着软实力、影响力与潜力的重要来源。
随着这一未来即将到来,我们需要共同对开放模型将走的确切路径保持谦逊。开放模型存在许多未知数——例如,我们并没有很好的数据来了解它们在美国和中国以外的国家是如何被使用的。由于 ML 训练专业知识的分布十分广泛,即有数十个组织和数千名人员距离能力前沿不到一年,开放模型跨越能够催生新工作流的性能阈值只是时间问题,而非是否会发生的问题。集体应采取的做法是,理解如何将这种广泛可获取的开放智能用于善途,同时主动缓解潜在危害。
感谢 Florian Brand 和 Kevin Xu 为这项工作提供的反馈和/或建议。如需了解更多为本文提供依据的研究,请参阅开源 AI 阅读清单.
原文
Original Title
The current balance of power in open models
Source
Nathan Lambert:Interconnects(RSS)
Site
interconnects.ai
Author
Nathan Lambert
Published
2026-09-21 19:56