Mozilla于9月15日发布的《State of Open Source AI》报告指出,机构应在大多数工作中默认使用开放模型。Moonshot AI的开放权重Kimi K3模型在Artificial Analysis Intelligence Index上的得分仅落后Anthropic的闭源Fable 5模型3分,而运行成本仅为后者的30%。Mozilla CTO Raffi Krikorian表示,闭源模型在需要专业知识的工作、密集信息检索和长上下文方面具有优势。此外,由于闭源模型开箱即用,并提供合规套件、支持和问责保障,因此更受青睐。开放权重模型虽然可以下载,但其训练数据、数据管线和训练代码通常并不公开。
DoorDash在常规工作中使用Kimi,在难度更高的任务中则使用Fable。METR以人类专家完成任务所需的时间为基准衡量的“时间跨度”数据显示,最佳闭源模型能够完成的任务时长,是最佳开放模型可可靠完成任务时长的1.7倍。Krikorian表示,当开放模型能够完成耗时7小时的工作时,闭源模型可以完成耗时12小时的工作;4个月后,开放模型可完成的任务时长达到12小时,而闭源模型则达到约20小时。时长不足8小时的任务可以交给这两类模型,而目前的差距主要出现在耗时8至12小时的工作中。总体而言,没有任何模型能够可靠完成时长超过12小时的任务。
让模型访问工具和内存的专用软件层可能会影响比较结果。在使用Vals AI中立软件进行的Terminal-Bench 2.1评测中,Z.ai的GLM 5.2模型与Anthropic的Claude Opus 4.7和4.8模型相差不到1分;每完成一项任务的成本约低5倍。据此,付费使用闭源模型,只能在耗时8至12小时的任务中以约5倍成本换取4个月的领先优势。
截至2026年8月,OpenRouter上按token量计算的前10个模型中,有8个是开放权重模型。相比之下,Linux Foundation的研究显示,根据2025年5月至9月的数据,开放模型获得了4%的收入,闭源模型则获得了96%。Krikorian指出,最好的开放模型集中在中国,而闭源模型集中在美国,这会带来风险。他建议通过公共算力计划、中立基金会、企业和慈善组织的支持,在美国和欧洲建立替代性生态系统;并强调,很难信任训练和评估流程不明的模型。
为何重要
该图表显示,对于组织而言,与其依赖单一模型类型,不如根据任务时长、成本、支持和合规要求进行选择,这样更为合理。开放权重模型在常规和短期任务中可减轻成本压力,而闭源模型的优势在耗时更长且需要专业知识的任务中更加明显;但没有任何选项能够可靠完成超过12小时的任务,这仍限制了自动化的能力。结果可能因专用软件层而异,这表明比较时不应只关注原始性能分数。使用量集中于开放模型,而收入集中于闭源模型,凸显了采用程度与商业价值之间的区别,以及支持服务的作用。与此同时,来源中Anthropic模型命名的不一致,意味着有必要核实这些比较。
术语:开放权重
开放权重是指人工智能模型经过训练的参数可供下载;由于其训练数据和代码未必开放,因此并不等同于开源。