今年8月初,曾以"ox-alpha"为名走红的模型被证实是GLM-5.3-Flash,其背后的中国AI实验室Z.ai随即发布了旗舰模型GLM-5.3。本周五,Z.ai在Hugging Face上公开了该模型的权重文件。目前,多家第三方推理服务已对其提供托管,并通过OpenRouter等平台向外提供访问。
The New Stack记者Amanda Caswell在该模型发布时曾报道,Z.ai在训练GLM-5.3时将重点放在后训练阶段。这使得新模型的价值不仅体现在跑分上的大幅提升,更体现在综合能力上——它在多个维度领先其他中国开源模型,足以与美国头部前沿实验室的现役模型相抗衡。
一项超大规模云厂商不会喜欢的新授权条款
Z.ai此次最重要的变化之一是模型的授权方式。GLM-5.2采用宽松的MIT许可证发布,而新模型则采用公司自定义的"GLM-5.3许可证",其中附加了一条重要限制:凡希望托管该模型(而非仅作路由或将其嵌入产品)的企业,若在任意连续12个月内合计营收超过100亿美元,"须在将该软件或其衍生作品用于任何商业目的之前,通过Z.AI的安全审查。"
对个人用户而言,实际变化不大——新许可证在条款上更加细化,明确授予运行、部署和微调等权利。但对于超大规模云厂商(以及一旦达到该营收门槛的新兴云服务商),则需要经历一套额外的审批流程。
Z.ai表示,此次将GLM-5.3的开放权重推迟了两周发布,用于安全评估和加固。根据Z.ai自行披露的数据,GLM-5.3在漏洞发现基准测试CyberGym上取得了84.5%的成绩,是目前已公开的最佳结果,但尚未有外部机构对这一数字进行复现验证。
Z.ai还声称利用该模型在269个开源项目(包括Linux内核)中发现了2,436个漏洞,但目前可供公开查阅的结果仅有数十项。
值得注意的是,尽管Z.ai以安全为由进行说明,但GLM-5.3许可证本身既未设置可接受使用条款,也未对网络安全或攻击性安全应用作出任何规范。
Z.ai修改授权条款究竟出于安全考量,还是意在更好地将自有模型商业化,是一个值得探究的问题。从GLM-5.3-Flash发布时Z.ai强调推理服务运行于国产芯片之上来看,该公司显然有意掌控这些模型的推理层。随着开放权重模型的性能日益接近美国前沿实验室的水平,这一层面的商业价值也愈发不可忽视。
事实上,Z.ai在2023至2024年间也曾为ChatGLM3-6B等模型使用自定义授权条款,要求商业使用须进行注册。此后,公司推出的所有新模型均改用MIT许可证。
相比之下,Z.ai的授权条款比其他中国实验室更为严格。以Moonshot为例,其规定:若某模型即服务提供商基于Kimi K3提供访问,且拥有超过1亿月活用户或月收入超过2000万美元,则须在产品或服务的用户界面上"显著展示'Kimi K3'"字样。DeepSeek至今仍对其旗舰模型沿用基本的MIT许可证。
运行GLM-5.3
在技术架构上,GLM-5.3与GLM-5.2相同,均采用7530亿参数的混合专家架构,支持100万Token的上下文窗口,最大输出为128,000个Token。
权重文件以BF16和FP8格式发布,兼容vLLM、SGLang、KTransformers以及Hugging Face的Transformers库。
与GLM-5.2在发布当天即提供权重不同,此次从API上线到开放权重之间相隔两周,是Z.ai的全新做法。
尽管模型已开放权重,但在本地运行并不现实——除非你拥有配置极高的设备。即便是Unsloth表示仍能保持约86%top-1准确率的2位量化版本,也需要245GB内存,仅勾能在搭载256GB统一内存的Mac上运行;8位量化版本则需要810GB内存。
在定价方面,GLM-5.3的每百万输入/输出Token费用为1.40/4.40美元,在同类竞品中极具竞争力;而GLM-5.3-Flash以每百万Token 0.15/0.47美元的价格,目前几乎无可匹敌的性价比更是吸引眼球。
未来展望
从表面看,授权条款的变化幅度有限,但这一变化恰好发生在同一周内——Nvidia据报以129亿美元收购Hugging Face,Stripe宣布收购OpenRouter。若两笔交易均顺利完成,开发者用于下载开放权重模型的仓库和租用模型的交易平台将归美国公司所有,而模型本身却越来越多地来自中国实验室。
Z.ai在Flash版本上保留了MIT许可证,因此并未完全放弃宽松授权路线,但已不再将其应用于旗舰模型。若GLM-5.4延续相同策略,那么Z.ai的MIT时代将被视为用户获取阶段,而开放权重也将从对生态的馈赠,逐渐演变为附带条款的分发渠道。
Q&A
Q1:GLM-5.3的新授权条款对哪些企业有影响?
A:GLM-5.3的新授权条款主要针对大型托管服务商。具体而言,若一家企业希望托管该模型(而非仅作路由或将其嵌入产品),且在任意连续12个月内合计营收超过100亿美元,则须在商业使用前通过Z.AI的安全审查。对个人用户和中小企业来说,实际影响不大,仍可自由运行、部署和微调模型。
Q2:在本地运行GLM-5.3需要什么硬件配置?
A:GLM-5.3对硬件要求极高,普通设备无法胜任。即便是精度压缩最多的2位量化版本,也需要至少245GB内存,恰好能在搭载256GB统一内存的Mac上运行;而8位量化版本则需要高达810GB的内存。如果希望使用该模型,通过API调用是更实际的方案,每百万输入/输出Token费用为1.40/4.40美元。
Q3:GLM-5.3和GLM-5.3-Flash有什么区别?
A:GLM-5.3是Z.ai的旗舰模型,采用7530亿参数的混合专家架构,性能强劲,定价为每百万Token 1.40/4.40美元,使用GLM-5.3专属授权条款。GLM-5.3-Flash则是轻量版,定价仅为0.15/0.47美元,性价比极高,同时保留了宽松的MIT许可证,是当前市场上极具竞争力的高性价比选择。