AI DAILY / 2026-09-22
开源模型的当前力量格局:中美的此消彼长
The current balance of power in open models
全文中文翻译 · AI 生成,仅供学习交流
当前开放模型的力量对比
最近,我受邀向一群国会议员和工作人员汇报从美中竞争视角看到的开放权重模型(open-weight models)现状。我把事先准备的发言整理出来,作为一篇面向更广泛读者的「开放模型国情咨文」。
回顾:开源 vs. 开放权重 vs. 闭源模型
开放语言模型是指权重(weights)可被公开访问或下游使用的 AI 模型。这些模型通常被拿来与所谓的「闭源(closed)」AI 模型对比。闭源模型只能通过应用程序编程接口(Application Programming Interfaces, API)访问,开发者可以用这些 API 直接查询模型,比如 GPT-4 或 Claude Opus 4.5,也可以通过产品访问,比如 ChatGPT 和 Claude Code。
开放语言模型主要分两类,开放权重模型和开源模型。开放权重模型是最常见的形式,Meta 的 Llama、阿里巴巴的 Qwen、谷歌的 Gemma、DeepSeek 的模型都属于这一类。这些模型受许可证(licenses)约束,许可证是规定下游使用允许范围的治理文件,通常还附带 Transformers、VLLM、SGLANG 等库里的推理代码。从 2025 年 4 月前后开始,中国 AI 公司一直是开放权重模型无可争议的领跑者。
真正的「开源」模型在权重、许可证、推理代码之外,还要加上复现模型所需的全部信息,也就是训练代码和训练数据。最出色的开源模型出自美国,最近由艾伦人工智能研究所(Allen Institute for AI)的 Olmo 系列领衔,我在那里最近两年半的时间里也参与过构建。其他知名的开源模型也由美国的非营利组织打造,包括 OpenAthena 的 Marin 系列和 EleutherAI 的 Pythia 系列。
开放权重、开源,以及任何其他标签下的模型,包括主要通过 API 提供的闭源模型,都处在一个连续光谱之上。比如英伟达的 Nemotron 模型比大多数开放权重模型开放得多,在宽松许可证下放出了大量训练数据,但因未公开全部数据,还不能算完全开源。闭源模型之间也有差异,差异来自 API 暴露哪些信息和使用条款的不同。
美中开放权重模型的竞争现状(单位经济、技术能力等)
我们正身处这样一个世界。GLM-5.2 和 Kimi K3 这批最新、最前沿的中国模型,把开放模型的商业可行性往前推了一大步。它们在智能体能力上跨过了 Anthropic 的 Claude Code 在 2025 年 12 月跨过的那种门槛。
美国曾是开放语言模型的早期领跑者,主要靠 Meta 的 Llama 系列撑场面,这些模型在研究和商业任务中被广泛使用。中国的开放权重模型大约在 18 个月前在这两个关键领域超越了美国的开放权重模型。能说明这一点的一个简单指标是 Hugging Face 下载量,中国在 2025 年 7 月取得领先,主要靠阿里巴巴 Qwen 模型的成功。我个人维护着追踪这些数据的工具,自 2025 年 8 月我首次发布「美国真正开放模型」(American Truly Open Models, ATOM)项目以来,中国的累计下载量已达 32 亿次,是美国的两倍。

在主流的能力基准测试上,比如 Artificial Analysis Intelligence Index(AAII),中国开放权重模型对美国同行有明显的领先优势。截至撰写本文的 2026 年 9 月 14 日,排名前三的中国模型分别是 Z.ai 的 GLM-5.3、GLM-5.3-Flash,以及 Moonshot AI 的 Kimi K3,得分依次为 45、42、44。相比之下,美国这边领跑的是 Thinking Machines 的 Inkling 和 Inkling Small,得分都是 26,还有英伟达的 Nemotron 3 Ultra,得分 23。美国顶级模型发布于 2026 年 6 月和 7 月,更新频率比中国同行低。比如中国实验室发布超过这些美国模型得分的版本,要比美国公司早 2 到 6 个月(例如 GLM-5 或 DeepSeek V4 Pro)。越来越多的美国公司正加入发布模型的行列,包括 Arcee AI、Poolside、IBM 等,但它们并没有快速缩小这一性能差距。其他基准测试也呈现出类似的格局。

在 Artificial Analysis Index 上,排名最高的美国开放模型落后于其他 15 个中国制造的模型。
总的来看,中国的开放权重模型大约落后于美国闭源前沿 2 到 5 个月,而美国的开放权重模型大约落后于 OpenAI 和 Anthropic 等公司 6 到 9 个月。中国实验室在用户需求明确的任务上(比如智能体编程)最接近,在更开放式的科学任务(比如物理或生物)上落后更多。
中国实验室尽管资源少于美国同行,却仍能产出这些强模型的原因还在争论中,受工作文化差异影响很大,但也受几个关键技术因素影响。中国实验室发布模型更快,聚焦的任务分布也略窄,这让它们在公共基准上的成绩稍微好看一点。发布得更快有助于拿更高分,因为所有实验室都在持续进步,所以你一旦「完成」一个模型并发布,它就是那个时间点的性能快照。发布时间越晚的实验室,得分往往越高。不过中国实验室做出来的模型确实强,对美国产业构成真正的竞争。这种竞争不会因为闭源实验室修补其 API 产品中可被用于蒸馏(distillation)的漏洞而显著减弱。
蒸馏在全新领域里影响最大,并不会让造一个全面强大的最终模型变得轻而易举。我估计,如果蒸馏被完全阻断,比如在 Anthropic 和 OpenAI 那边部署了解你的客户(know-your-customer, KYC)工具,最强美国模型和中国开放权重模型之间的差距只会再拉大 1 到 2 个月。
比如,中国实验室在 2026 年正快速改变对训练数据付费的态度。今年早些时候,包括 Moonshot AI 和 Z.ai 在内的顶级中国实验室强烈倾向于自建数据流水线;到夏天时,它们已开始向成熟的美国公司和中国新兴初创公司购买前沿数据,也就是智能体任务所需的、具有挑战性的强化学习(RL)环境。
中国开放权重模型正逼近能力前沿,而前沿模型在网络安全等领域(比如 OpenAI-HuggingFace 事件)带来的风险也越来越多地被记录下来,关于持续发布如何能促成更安全的生态系统,监管层面的不确定性正在加大。
开放权重模型的一个结构性难题在于,几乎没有有效办法阻止开源软件的各个部分落到不良行为者手里。如果因为这些模型放大了风险,就去限制获取来自中国的最强开放权重模型,那被拖慢的会是美国企业。我们有先例可循。HuggingFace 曾用一个中国开放权重模型来分析那次网络攻击,因为闭源模型拒绝了他们的请求。所以,管理开放权重模型的风险往往归结到生态系统的准备上。
开放权重模型正成为 AI 扩散的重要工具。在这些风险面前,以及在美国公司依赖中国构建的模型这种不平衡关系面前,抢占先机的最佳路径是继续支持美国对开放模型的投资。掌握开放模型的所有权,能更好地协调和应对那些全球性的风险,同时加速 AI 服务在整个国内经济中的扩散。
开放模型的采用现状:开源模型如何被学术界、企业和其他国家使用?
开放权重语言模型在 2026 年获得了大幅增长的关注度和经济可行性,这让我们得以更直接地比较美国、中国以及其他地区在 Hugging Face 指标之外的模型采用情况。OpenRouter 的使用情况就是一个例子。OpenRouter 是一个流行的 LLM 推理平台,提供一个统一接口来切换来自美国和中国的模型,无论开放还是闭源。这个平台主要以让人试用不同的开放权重模型而闻名。OpenRouter 自 2025 年 1 月 1 日起分享顶级模型的使用数据,增长轨迹清晰可见,从 2025 年 9 月一周内处理约 1 万亿(1T)开放模型 token,增长到如今每周约 80 万亿 token。这段时间里,中国模型的市场份额从约 70% 增长到超过 80%。其他把开放模型商业化的平台也呈现类似数据,比如开源编程智能体 OpenCode,其推理量里中国模型占比约 95% 或更高。

这些开放平台是我们能拿到的开放模型使用情况的最佳近似。很大一部分开放模型的使用发生在不披露单模型细分数据的平台上,比如 Together AI、Fireworks AI,以及企业应用的私有部署中。
许多知名科技公司和初创公司一直在基于中国开放权重模型构建 AI 功能,比如法律智能体 Harvey、编程智能体 Cursor,还有 DoorDash 使用 Kimi 模型、Airbnb 使用 Qwen、Perplexity 使用 DeepSeek。这些知名公司只是冰山一角。大量较年轻的硅谷初创公司正基于中国模型构建,目的是拿到低成本、灵活的选择。越来越多的美国初创公司和企业正与中国模型实验室签订企业协议,获得在自家产品中使用这些模型的许可。这是我职业生涯中没见过的一种新型跨境技术合作。
基于中国模型的创新根基延伸得更深,触及整个 AI 生态系统。粗略估算,绝大多数学术研究都跑在阿里巴巴的 Qwen 模型系列上。我在访华期间见过 Qwen 领导团队的多位成员,他们对这种采用非常投入且刻意为之,要把这种局面扳回到美国模型上并不容易。
为了量化开放模型在学术界的采用情况,我扫描了 arXiv(AI 研究中流行的预印本平台)上 5 个最热门机器学习类别的每一篇论文,分别是 cs.AI、cs.CL、cs.CV、cs.LG、stat.ML。结果清楚地印证了我对 AI 研究领导地位演变的理解。LLM 正在成为机器学习研究的基础层。任何开放模型的提及率从 2023 年 1 月的 2% 上升到 2026 年 9 月的 50%,同一时期内研究领导地位也从美国移到了中国。
比如,2023 年 4 月到 5 月,也就是 Meta 最初的 Llama 发布(译注:Llama 是 Large Language Model Meta AI 的首字母缩写,属于 backronym,即先有「Llama」这个词,再反推出与之对应的释义)几个月后(Llama 首次发布于 2023 年 2 月),arXiv 上 12,000 篇新 AI/ML 论文中约有 2,600 篇提及至少一个知名开放模型家族。在所有扫描的论文里,约 5.5% 提到了 Llama,约 1% 提到了中国模型。2024 年秋天,Llama 处于巅峰期,约 23% 的论文提及 Llama,约 7.5% 提及 Qwen,也就是最直接的中国竞争者。如今 Llama 在学术界已经失去领先地位,但仍被约 21% 的论文提及,持久力惊人;Qwen 的份额则上升到 30%。总体而言,任何中国开放权重模型在超过 40% 的论文中被提及,超过美国模型的 30%,且中国份额仍在持续增长。

这说明,要把美国重新确立为开放权重语言模型时代的 AI 研究中心,我们显然还有大量工作要做。也有希望的迹象。
在我们的研究中我们发现,能力-尺寸档位与中国同行相当的美国模型,被采用的比例会明显更高。过去一年里,我们见证了 OpenAI 自 ChatGPT 之后的首批开放权重模型 gpt-oss 成为有史以来被采用最多的开放权重模型之一。此后,谷歌的 Gemma 4 是少数几个采用量能比肩 Qwen 最热门小型模型的系列之一;英伟达的 Nemotron 系列尽管在同尺寸上有不少更强的模型,采用率仍属温和。
总结
2026 年开放模型的故事,是确立经济相关性的故事。整个 AI 生态系统里多条线索汇聚于此,可以概括为下面几条。
用户能拿到的开放模型与闭源模型之间的差距,过去 3 年一直在缩小。差距因任务而异,但能力上大致可以估算为 2 到 5 个月。整体能力进步如此之快,让开放权重 AI 模型在 2026 年解锁了大量市场,也预示着不久的将来还会有更多拐点。
开放模型的使用正在高价值产业中爆发式增长(比如软件工程、法律服务、金融服务),表明一个与最强闭源模型并行的替代生态正在出现。Together、OpenRouter、Fireworks、Baseten 等主要提供开放模型推理服务的平台,正经历惊人的增长,成为开放模型后训练经济的首批赢家(其他层面还包括 Thinking Machines 的 Tinker 这类微调 API)。与此相伴的是 AI 行业中众多技术人员的反馈,他们使用 GLM-5.3 等开放权重模型作为 Claude 或 GPT 的替代方案,看中的是速度更快、价格更低、可定制,以及隐私性。
中国 AI 公司是开放权重模型毫无争议的领跑者。2025 年,DeepSeek R1 等中国模型曾震动整个 AI 世界。相较之下,美国 AI 实验室正凭借开放权重模型收复失地,但即便美国投入更多资金,中国实验室仍在持续产出明显更强、受到各类用户喜爱的模型。
中国实验室对美国 AI 模型的蒸馏并不能完全解释它们的成功。蒸馏是一种行业标准技术,即基于通常更强的模型的输出来训练另一个 AI 模型。这项技术在中国 AI 行业最为普遍,他们利用基本漏洞从美国公司的产品中提取推理过程和额外数据,而这些产品的安全性并没有做到位。最佳估计是,蒸馏帮助中国公司相对美国前沿把性能差距缩小了 1 到 2 个月。
中国模型,特别是阿里巴巴的 Qwen 系列,已成为学术界和本地模型用户的研究与开发基础。 最近几个月,中国开放权重模型在 38% 的 AI 论文中被提及,高于美国的 28%。中国份额的增长速度远快于美国同行。这一点,连同其他政治因素,以及领先美国 AI 公司的封闭性质,正在加速侵蚀美国作为世界顶级 AI 研究中心的领先地位。
开放权重模型正进入这样的能力水平,新的风险(比如网络安全)可被众多开放权重模型的可获得性所激活,这需要生态系统层面的应对准备。 新的风险时代也带来了一段政策不确定期。监管层面对最强 AI 模型有所关注,但政策将如何在法律上落地仍存在巨大不确定性。与此同时,许多研究人员和工程师依赖开放模型,因为其安全限制更宽松,而 Claude、GPT 这类闭源模型常常拒绝关键的网络安全防御工作或生物学研究。
更多数据,请查看 Interconnects Dashboard。
结论
2026 年,中国实验室显然维持着作为开放权重 AI 生态系统领导者的地位。这发生在开放权重模型已在经济可行性上度过拐点的时刻,也面对着来自美国实验室更激烈的竞争。领先的中国实验室似乎并未受到有意义的挑战,它们正在全球范围内拓展企业和研究采用。
开放模型的这一格局出现在更广泛 AI 生态系统的关键时点。OpenAI 和 Anthropic 在最新公开模型上取得了巨大进展,同时呼吁以协调的审慎来管理 AI 发展的下一阶段。今天在少数 AI 实验室围墙之内发生的事情,尤其是极致的人才与算力密度,将成为开放模型生态系统中即将浮现局面的预演。开放模型会成为世界上除少数真正前沿 AI 实验室之外所有人的底座,让它们抓住软件工程和其他计算实践加速带来的红利。对于促成这种变革性智能广泛获取的组织而言,这是一股可观的软实力、影响力与潜力。
这一未来正在到来,我们需要共同对开放模型将要走出的具体路径保持谦逊。开放模型领域存在大量未知。比如,我们没有它们在美国和中国以外国家使用情况的好数据。机器学习训练专长的分布很广,数十个组织和数千人距前沿能力不到一年。开放模型跨过能开启新工作流的性能门槛只是时间问题,不是会不会的问题。集体的方法应该是,理解如何把这种广泛可及的开放智能用于善,同时主动缓解潜在的危害。