🔥 热点解读 · 2026-08-27(8/24 版更新:官宣确认)

「牛来」Ox Alpha 官宣揭晓:智谱 GLM-5.3-Flash 认领,权重 MIT 开源、国产芯片跑通

小八弟 · 更新于 2026-08-27(8/26 智谱 Z.ai 官宣后)| 数据源:GenAI Daily / 彭博 / TechCrunch / OpenRouter 官方 / Z.ai 官方 / AIMLAPI 实测等
320B-A18B
GLM-5.3-Flash 参数
100万
token 上下文窗口
MIT
权重开源协议
20万亿+
6 天 OpenRouter 消耗 tokens

🔔 8/26 重大更新:智谱 Z.ai 正式确认——神秘的 Ox Alpha 正是其 GLM 系列新作 GLM-5.3-Flash(GLM-5 系列首个原生多模态模型),并于当晚公布权重(MIT 开源),代号致敬中国电影《牛来》(Ox Comes)。神秘面纱落下,匿名发布剧本圆满收官。

一、一句话:发生了什么

8/20,OpenRouter 悄悄上架一个匿名模型 stealth/ox-alpha:无公司名、无参数、完全免费,社区称它「牛来」。上线即屠榜,48 小时内 DeepSWE 编码小样本 80% 引爆讨论,社区 24 小时「指纹侦探战」把矛头指向智谱。8/26,智谱 Z.ai 官方认领——它就是 GLM-5.3-Flash,并宣布权重开源。[1] ↗ [2] ↗

二、官方身份与规格:GLM-5.3-Flash

Z.ai(原智谱)确认 Ox Alpha 为 GLM 系列新迭代,定位「专为编程、持续性智能体任务及生产环境负载设计的推理模型」。OpenRouter 官方将其标注为 GLM-5.3-Flash[1] ↗

规格
模型标识GLM-5.3-Flash(此前匿名代号 stealth/ox-alpha)
参数量320B-A18B(320B 总参 / 18B 激活,MoE 架构)
上下文窗口1,048,576 tokens(100 万级)
最大输出131,072 tokens
输入模态文本 / 图像 / 视频(GLM-5 系列首个原生多模态)
能力工具调用、结构化输出、强制推理
开源协议MIT 许可(8/26 当晚公布权重,可本地运行/二次开发)
算力底座完全运行在中国 AI 芯片上

值得注意的是,社区此前对参数规模的估计(744B/40B)与官方公布的 320B-A18B 有出入——匿名阶段的推断终归是推断,官方口径为准。[5] ↗

三、它有多强:从 80% 到 58.4%,从屠榜到回归

Ox Alpha 的编码能力是引爆点,但完整剧情是一波「先惊艳、后回落」的样本教训:

基准Ox Alpha 结果对照说明
DeepSWE 早期自测(10 任务)80%(8/10)Claude Fable 5 65% / GPT-5.6 Sol 52%个人小样本,方差极大
DeepSWE 全量社区跑58.4%(66/113)回落至 GPT-5.6 Sol 中位水平更大任务集后的真实定位
LiveCodeBench release_v628.0%(49/175)官方榜未正式收录

注:早期 80% 来自 Claude Code 框架作者 Ben Davis 的 10 任务自测,他本人也提醒"样本小、方差高";全量复测后回落至 58.4%,处于前沿第一梯队但谈不上"碾压"。DeepSWE 公开榜至今未正式列出该模型。[4] ↗

实际使用数据才是硬通货:OpenRouter 官方披露,Ox Alpha 上线 6 天处理超过 20 万亿 tokens,是 OpenRouter 平台史上单个模型之最;使用量一度超过 DeepSeek 旗舰的 2 倍。[1] ↗

四、谜底揭晓前:五条指纹如何锁定智谱

官方认领之前,社区已用 24 小时「指纹侦探战」锁定了答案。据 Atomstorm.ai 创始人 lizikk_zhu 分析,五条独立证据全部指向智谱:[6] ↗

#证据内容
视频编码器(最强)同一组受控视频,Ox Alpha 与智谱 GLM-5V-Turbo 逐 token 完全一致,帧采样/时长/分辨率三个设计特征独立吻合
文本 tokenizer25 个特殊字符串 token 数与 GLM-5.2/5.3 几乎完全对齐(仅差 75-token 包装层)
报错码 / Java 堆栈错误码 1210/1214 与智谱 Z.ai API 结构完全对应
中文后端图片解析错误直接返回中文提示
审查口径敏感问题给出智谱官方口径

AIMLAPI 独立复测亦确认:Ox Alpha 的 tokenizer 对 8 组测试串计数与 GLM-5.2/GLM-5.3 完全一致,几乎锁定 GLM 家族。[5] ↗

五、一个实际问题:你的数据去哪了?

身份之外,数据留存政策曾自相矛盾:OpenRouter 模型卡写「对话被提供方留存、不用于训练」,而 OpenCode 官方宣称「零数据留存」。两个官方渠道、两种说法——「不用于训练」≠「零留存」。对企业而言,匿名提供方 + 不透明的留存期限,仍是采用前必须确认的合规点。[6] ↗

六、匿名上架:一套有先例的行业剧本

匿名发布已非孤例。据彭博报道,字节、Sea、阿里巴巴等公司今年都曾不公开来源测试新模型。lizikk_zhu 梳理的先例:

代号真实身份
Hunter Alpha小米 MiMo-V2-Pro
Owl Alpha美团 LongCat 2.0
Pony Alpha智谱 GLM-5
Quasar AlphaOpenAI GPT-4.1
Ox Alpha(本轮)智谱 GLM-5.3-Flash(8/26 官宣)

剧本逻辑:匿名规避品牌风险 → 免费换真实生产流量压测 → 压测反馈比内测更有价值 → 认领发布完成变现。Stripe CEO Patrick Collison 亲手测试后评价「非常令人印象深刻」,OpenRouter 称这是平台史上最大的匿名首秀[1] ↗

七、影响:开源模型冲击西方定价体系

① 权重开源 + 极端低价:GLM-5.3-Flash 以 MIT 协议开放权重,全球开发者可本地运行;Z.ai 托管的 GLM API 定价仅 $1.40/百万输入 tokens——结合 OpenRouter 免费窗口的引流,直接冲击 OpenAI、Anthropic 等高价前沿厂商。[1] ↗

② 国产芯片跑通前沿模型:官方确认 GLM-5.3-Flash 完全运行在中国 AI 芯片上,是国产算力栈承载前沿级模型的里程碑信号。

③ 与 Anthropic 正面交锋:本月 Z.ai 还发布了 GLM-5.3,在部分基准上已能与 Anthropic 的 Fable 5 抗衡——中国开源阵营正在从前沿跟随转向正面竞争。[2] ↗

八、我的判断

① 「匿名发布」正在成为国产模型出海的标准化打法:先匿名上线换真实流量与无偏评测,再认领收割品牌与信任——Ox Alpha 用 6 天 20 万亿 tokens 证明这套路有效。对开发者:匿名模型可试用,但生产依赖务必等官方认领与明确 SLA。

② 实力已到,缺的是「信任溢价」:Ox Alpha 从 80% 回落到 58.4% 的过程,恰恰说明匿名模型初期的跑分需要冷静看待;但 tokenizer 指纹 + 全量数据 + 国产芯片,足以证明中国开源模型已摸到闭源前沿门槛。中国模型缺的不是技术,而是全球开发者社区的认知与信任——匿名发布正是「用实力攒认知」的一步。

③ 对我们的启示:模型选择进入「按任务分级调度」时代——贵的给难的、便宜的打底。GLM-5.3-Flash 以 $1.40 低价 + 100 万上下文 + 编码/Agent 强项,是「长程软件工程 / 复杂智能体」场景的高性价比选项;结合 DeepSeek、Qwen 等,国产低价模型池正在形成多路由的底座。跟踪这类「匿名发布→官宣认领」事件,比追单家旗舰更能看到行业拐点。