🔔 8/26 重大更新:智谱 Z.ai 正式确认——神秘的 Ox Alpha 正是其 GLM 系列新作 GLM-5.3-Flash(GLM-5 系列首个原生多模态模型),并于当晚公布权重(MIT 开源),代号致敬中国电影《牛来》(Ox Comes)。神秘面纱落下,匿名发布剧本圆满收官。
8/20,OpenRouter 悄悄上架一个匿名模型 stealth/ox-alpha:无公司名、无参数、完全免费,社区称它「牛来」。上线即屠榜,48 小时内 DeepSWE 编码小样本 80% 引爆讨论,社区 24 小时「指纹侦探战」把矛头指向智谱。8/26,智谱 Z.ai 官方认领——它就是 GLM-5.3-Flash,并宣布权重开源。[1] ↗ [2] ↗
Z.ai(原智谱)确认 Ox Alpha 为 GLM 系列新迭代,定位「专为编程、持续性智能体任务及生产环境负载设计的推理模型」。OpenRouter 官方将其标注为 GLM-5.3-Flash。[1] ↗
| 项 | 规格 |
|---|---|
| 模型标识 | GLM-5.3-Flash(此前匿名代号 stealth/ox-alpha) |
| 参数量 | 320B-A18B(320B 总参 / 18B 激活,MoE 架构) |
| 上下文窗口 | 1,048,576 tokens(100 万级) |
| 最大输出 | 131,072 tokens |
| 输入模态 | 文本 / 图像 / 视频(GLM-5 系列首个原生多模态) |
| 能力 | 工具调用、结构化输出、强制推理 |
| 开源协议 | MIT 许可(8/26 当晚公布权重,可本地运行/二次开发) |
| 算力底座 | 完全运行在中国 AI 芯片上 |
值得注意的是,社区此前对参数规模的估计(744B/40B)与官方公布的 320B-A18B 有出入——匿名阶段的推断终归是推断,官方口径为准。[5] ↗
Ox Alpha 的编码能力是引爆点,但完整剧情是一波「先惊艳、后回落」的样本教训:
| 基准 | Ox Alpha 结果 | 对照 | 说明 |
|---|---|---|---|
| DeepSWE 早期自测(10 任务) | 80%(8/10) | Claude Fable 5 65% / GPT-5.6 Sol 52% | 个人小样本,方差极大 |
| DeepSWE 全量社区跑 | 58.4%(66/113) | 回落至 GPT-5.6 Sol 中位水平 | 更大任务集后的真实定位 |
| LiveCodeBench release_v6 | 28.0%(49/175) | — | 官方榜未正式收录 |
注:早期 80% 来自 Claude Code 框架作者 Ben Davis 的 10 任务自测,他本人也提醒"样本小、方差高";全量复测后回落至 58.4%,处于前沿第一梯队但谈不上"碾压"。DeepSWE 公开榜至今未正式列出该模型。[4] ↗
但实际使用数据才是硬通货:OpenRouter 官方披露,Ox Alpha 上线 6 天处理超过 20 万亿 tokens,是 OpenRouter 平台史上单个模型之最;使用量一度超过 DeepSeek 旗舰的 2 倍。[1] ↗
官方认领之前,社区已用 24 小时「指纹侦探战」锁定了答案。据 Atomstorm.ai 创始人 lizikk_zhu 分析,五条独立证据全部指向智谱:[6] ↗
| # | 证据 | 内容 |
|---|---|---|
| ① | 视频编码器(最强) | 同一组受控视频,Ox Alpha 与智谱 GLM-5V-Turbo 逐 token 完全一致,帧采样/时长/分辨率三个设计特征独立吻合 |
| ② | 文本 tokenizer | 25 个特殊字符串 token 数与 GLM-5.2/5.3 几乎完全对齐(仅差 75-token 包装层) |
| ③ | 报错码 / Java 堆栈 | 错误码 1210/1214 与智谱 Z.ai API 结构完全对应 |
| ④ | 中文后端 | 图片解析错误直接返回中文提示 |
| ⑤ | 审查口径 | 敏感问题给出智谱官方口径 |
AIMLAPI 独立复测亦确认:Ox Alpha 的 tokenizer 对 8 组测试串计数与 GLM-5.2/GLM-5.3 完全一致,几乎锁定 GLM 家族。[5] ↗
身份之外,数据留存政策曾自相矛盾:OpenRouter 模型卡写「对话被提供方留存、不用于训练」,而 OpenCode 官方宣称「零数据留存」。两个官方渠道、两种说法——「不用于训练」≠「零留存」。对企业而言,匿名提供方 + 不透明的留存期限,仍是采用前必须确认的合规点。[6] ↗
匿名发布已非孤例。据彭博报道,字节、Sea、阿里巴巴等公司今年都曾不公开来源测试新模型。lizikk_zhu 梳理的先例:
| 代号 | 真实身份 |
|---|---|
| Hunter Alpha | 小米 MiMo-V2-Pro |
| Owl Alpha | 美团 LongCat 2.0 |
| Pony Alpha | 智谱 GLM-5 |
| Quasar Alpha | OpenAI GPT-4.1 |
| Ox Alpha(本轮) | 智谱 GLM-5.3-Flash(8/26 官宣) |
剧本逻辑:匿名规避品牌风险 → 免费换真实生产流量压测 → 压测反馈比内测更有价值 → 认领发布完成变现。Stripe CEO Patrick Collison 亲手测试后评价「非常令人印象深刻」,OpenRouter 称这是平台史上最大的匿名首秀。[1] ↗
① 权重开源 + 极端低价:GLM-5.3-Flash 以 MIT 协议开放权重,全球开发者可本地运行;Z.ai 托管的 GLM API 定价仅 $1.40/百万输入 tokens——结合 OpenRouter 免费窗口的引流,直接冲击 OpenAI、Anthropic 等高价前沿厂商。[1] ↗
② 国产芯片跑通前沿模型:官方确认 GLM-5.3-Flash 完全运行在中国 AI 芯片上,是国产算力栈承载前沿级模型的里程碑信号。
③ 与 Anthropic 正面交锋:本月 Z.ai 还发布了 GLM-5.3,在部分基准上已能与 Anthropic 的 Fable 5 抗衡——中国开源阵营正在从前沿跟随转向正面竞争。[2] ↗
① 「匿名发布」正在成为国产模型出海的标准化打法:先匿名上线换真实流量与无偏评测,再认领收割品牌与信任——Ox Alpha 用 6 天 20 万亿 tokens 证明这套路有效。对开发者:匿名模型可试用,但生产依赖务必等官方认领与明确 SLA。
② 实力已到,缺的是「信任溢价」:Ox Alpha 从 80% 回落到 58.4% 的过程,恰恰说明匿名模型初期的跑分需要冷静看待;但 tokenizer 指纹 + 全量数据 + 国产芯片,足以证明中国开源模型已摸到闭源前沿门槛。中国模型缺的不是技术,而是全球开发者社区的认知与信任——匿名发布正是「用实力攒认知」的一步。
③ 对我们的启示:模型选择进入「按任务分级调度」时代——贵的给难的、便宜的打底。GLM-5.3-Flash 以 $1.40 低价 + 100 万上下文 + 编码/Agent 强项,是「长程软件工程 / 复杂智能体」场景的高性价比选项;结合 DeepSeek、Qwen 等,国产低价模型池正在形成多路由的底座。跟踪这类「匿名发布→官宣认领」事件,比追单家旗舰更能看到行业拐点。