跳到主内容

智谱认领匿名模型「牛来」:GLM-5.3-Flash 开源,320B 参数激活 18B,GLM-5 系列首个原生多模态

2026-08-26 · 智谱 AI / 36氪 / 腾讯云开发者社区

要点

  • 智谱 2026-08-26 晚宣布上线并开源 GLM-5.3-Flash(320B-A18B)
  • 官方确认:它就是过去一周在海外开发者社区刷屏的匿名模型 Ox-Alpha,中文社区称「牛来」。
  • GLM-5 系列首个原生多模态模型,训练语料为 30T token 多模态数据。
  • 架构专为极低成本设计:总参数 320B、激活约 18B、45 层(上代 92 层,近乎腰斩);总参数量与 GLM-4.5 相当,激活参数 32B → 18B。
  • 据 Tencent Cloud 开发者社区报道,Cline 用户可继续免费用该模型。

背景与分析

「牛来」的走红路径本身就是一个教科书式的发布策略:智谱先把模型以匿名身份 Ox-Alpha 投放到社区盲测,开发者凭手感打分、社区吵翻热度,再由官方认领。名字甚至被社区提前猜中——相当于把「盲测」玩成了一次大型公开验证,发布即自带口碑背书。

技术上看,GLM-5.3-Flash 与同日开源的 Qwen3.8-Flash 走的是同一条路线:稀疏 MoE + 极低激活比例 + 层数腰斩。GLM-5.3-Flash 保留 320B 的知识容量,但每次推理只动用约 18B 参数和 45 层,推理成本大幅低于同容量的稠密模型。

对开发者的影响

  • GLM 系列终于「有眼睛」:原生多模态意味着图文混合输入(截图理解、UI 还原、文档问答)不再依赖外挂视觉模型。
  • 开源可白嫖:权重开源后,ClineAider 等 BYOK 工具可零成本接入,是「国内可直连 + 不花钱」组合的最优解之一。
  • 私有化部署门槛下降:18B 激活量的推理需求,配合量化版本,单卡服务器即可承载。

AI 之家 观点

8 月 26 日这一晚值得记住:阿里与智谱同日开源两款「低激活、低成本」旗舰级模型,标志着国产开源竞争正式从「参数军备」切换到「效率军备」。对普通开发者,最实际的收益是——牛来 这类模型的 API 定价和开源权重,让 BYOK 类编程工具的月成本进入个位数人民币时代。建议关注两点后续:一是 GLM-5.3-Flash 在 SWE-bench 类编程基准上的独立成绩(官方暂未完整披露);二是它与旗舰 GLM-5.3(发布资讯)的 API 价差——若价差够大,日常任务用 Flash、难题切旗舰的两级路由会成为标配。

相关阅读

来源

本资讯由 AI 之家 编辑部根据智谱官方及 36氪、腾讯云开发者社区公开报道整理;基准分数以官方技术报告为准。