OpenRouter 上的 Ox Alpha 是什么?确认是智谱 GLM-5.3 Flash
先说结论:Ox Alpha 是智谱(Z.ai)即将正式发布的 GLM-5.3 Flash。
这不是猜的。我有准确信源确认了这个身份。下面会把社区独立做出的技术指纹分析也一并展开——它们从完全不同的路径得出了相同的结论,构成了一条相当完整的证据链。
它是怎么出现的
8 月 20 日晚上,OpenRouter 放出了一个新的 stealth 模型:代号 Ox Alpha,匿名提供商,免费试用一周。规格相当炸裂——1M 上下文窗口、支持文本 / 图片 / 视频输入、面向编码和长程 Agent 任务。
OpenCode 同步宣布免费接入,声称日产能 100T tokens(对,一百万亿)。9400 多个赞,368 万浏览。
OpenCode 创始人 dax 的态度很典型——「i know what ox alpha is nah nah poo poo」。知道是谁,故意不说,坐看社区猜。
然后社区就开始了一场大型开盒行动。
社区怎么查出来的
在我的信源之外,社区通过至少四条独立的技术路径指向了 GLM 家族。这些分析彼此独立,方法各不相同,但结论高度一致。
Tokenizer 指纹:11/11 完美匹配
这是最硬的一条证据。
@sushsrinivasan 用 11 组 tokenizer 探针测了 10 个模型。结果:Ox Alpha 对 GLM 11/11 全中。其他实验室最高只匹配了 4 项。
@unclecode 用 9 种基础设施探针(tokenizer、错误码、隐藏模板)测了 12-14 个嫌疑人。只有 GLM 家族 4/4 全中。 他后来专门补测了小米 MiMo——MiMo v2.5 只中 2/4,v2.5-pro 0/4。基本排除小米。
@MaxForAI 用 25 组完全不同的 prompt 做对比:Ox Alpha 的原始 token 数和 GLM-5.3 几乎一模一样,每次固定多 75 个 token——这是一个隐藏的 system wrapper 的长度。
@RodrigOrnellas 做了最大规模的对比:60 项指标,GLM-5.2 60/60,Kimi 8/60,混元 3/60,Qwen 2/60,DeepSeek 1/60,MiMo 2.5 是 0/60。
@0xdoug 的评价很直接:每个 prompt 的 token count 都精确匹配 GLM 5.3,「almost 100% proof」。
视频编码器:逐 token 相同
@RichardAGetz 用 4 段对照视频测试了视频编码器的 token 消耗模式。Ox Alpha 和 GLM-5V-Turbo 逐 token 完全相同——帧率无关的帧采样、约 147 tokens/秒的时长缩放、逐帧分辨率缩放。MiMo v2.5、Qwen 3.8 Max、GLM-4.6V 的指纹都不一样。
2 秒测试视频,Ox Alpha 花了正好 296 个 token。GLM-5V-Turbo 在同一视频上也是 296。4 段视频全部吻合。
音频行为和 API 配置
Ox Alpha 拒绝音频输入,和 GLM-5V 的路由行为一致。而 MiMo v2.5 支持音频——如果 Ox Alpha 是 MiMo,它就得主动砍掉自己的招牌功能,这说不通。
@brianchau57 发现 OpenRouter 上 Ox Alpha 的隐藏配置与 GLM-5.3 完全相同。@Norwakar 发现错误字符串和 chat.z.ai 的 spec 逐字一致,reasoning contract 只存在于 GLM-5.3。
Emoji 和文体
这条听起来最不靠谱,但统计上有意义。Ox Alpha 平均每千字符用 1.3 个 emoji,和 GLM/Qwen 系列的特征吻合。Claude、GPT-5.6、Grok 的 emoji 使用率接近 0。
那些反对声音
不是所有人都同意。值得认真看的反对意见有几种:
「tokenizer 相同不等于就是同一个模型」。 Nous 的 Teknium 提出了一个合理的可能性:完全可以是别家拿 GLM 的开源权重做了 post-training 之后自己 serve。配置相同只能说明基础设施来源,不能确认是智谱自己在运营。
这个论点技术上成立,但结合 OpenRouter 此前 stealth 模型的历史——Pony Alpha 是智谱 GLM-5、Hunter/Healer Alpha 是小米 MiMo——每次都是模型厂商自己匿名投放,从没出现过”第三方微调后伪装”的情况。而且 dax 说的是”ox alpha team”在修问题,暗示他直接和模型方沟通。
「政治问答不像中国模型」。 有人测试了敏感话题:问台湾问题,DeepSeek/Qwen 直接说是中国的,GLM 中途切断,Kimi 报错——但 Ox Alpha 回答”政治地位有争议,取决于视角”。这不是典型的中国模型行为。
但也有人发现它问习近平和维尼时硬拒,hidden reasoning 跟着习近平思想走。审查行为是矛盾的——可能是因为 Flash 版本的安全对齐策略和正式版不同,匿名期间调松了部分限制。
@MiaAI_lab 的神秘否认。 这条推最有戏剧性——1666 赞、21 万浏览,声称已确认身份,然后说”NOT what you think”、“You are ALL wrong”。但她没有给出任何证据。在技术指纹如此一致的情况下,一句”你们全错了”不能推翻任何东西。
为什么是 GLM-5.3 Flash 而不是 GLM-5.3
这个区分很重要。GLM-5.3 在 8 月 14 日已经正式发布了——文本模型,没有视觉能力。Ox Alpha 支持图片和视频输入,这不是 GLM-5.3 本身。
GLM-5.3 Flash 是智谱即将发布的变体。Z.ai 官方群的管理员已经透露 GLM-5.3-Flash 即将上线。X 上的 leo @synthwavedd 也直接说了 Ox Alpha = GLM 5.3 Flash,733 个赞。
时间线也对得上。智谱此前的一位员工说过,GLM-5.3 之后的下一个大版本会加入多模态能力。8 月 14 日发布文本版 GLM-5.3,6 天后在 OpenRouter 匿名投放带视觉能力的 Flash 变体——节奏完全合理。
从架构角度看,@kimmonismus 的分析认为 Ox Alpha 和 GLM-5.3 共享同一个基座,Flash 版本是在此之上做了额外的 RL 训练。解码速度和 GLM-5V-Turbo(744B 总参数 / 40B 激活)只差约 6%,参数规模应该在同一量级。
性能到底怎么样
别被”DeepSWE 80%“带跑了。
@davis7(Ben Davis)最早放出的数据——3010 赞、60 万浏览——是在 10 道题的子集上跑的。Ox Alpha 80%,Fable 5 只有 65%,GPT-5.6 Sol 52%。这个数据看起来很炸裂。
但随后 @MaxForAI 补充了更大样本的 DeepSWE 结果:Ox Alpha 约 63%。对比 Fable 5 Medium 65%、Sol xhigh 71%、Opus 5 High 73%、Opus 5 Max 74%。10 题子集上的 80% 被大样本打回了原形。
实际表现的画面更复杂:
亮点:
- @mehulmpt 3 小时烧掉 30 亿 token 跑内部 eval,评价”好模型、速度尚可、真无限”
- @MaxForAI 的”秦始皇骑北极熊”SVG 测试评价”目前见过最好的”
- @matt_kaschel 在真实 Agent 工具任务上称”completely humbled DeepSeek V4 Pro”
- 吞吐约 30-50 tok/s,均值 ~40,对于这个参数量来说不错
泼冷水:
- 大样本编码基准约 63%,没有碾压第一梯队
- Bach Benchmark 惨败,乐谱全错
- 有人觉得不如 DeepSeek V4 Flash
- TNG 发现比 GLM-5.3 多了一层 alignment tax,EQ Bench ELO 更低
- SVG 绘图有”过度思考”倾向——花十几倍时间换来的主要是装饰细节
一句话概括:编码能力摸到第一梯队的门槛,多模态是加分项,但没有碾压级优势。 作为免费模型很香,正式定价后就要看和 GLM-5.3 本体的价差了。
Stealth 发布这套玩法
这已经不是 OpenRouter 第一次了。
| 代号 | 真身 |
|---|---|
| Pony Alpha | 智谱 GLM-5 |
| Hunter Alpha / Healer Alpha | 小米 MiMo-V2-Pro / MiMo-V2-Omni |
| Elephant Alpha | 蚂蚁 Ling-2.6-flash |
| Ox Alpha | 智谱 GLM-5.3 Flash |
全是中国实验室。模式也一样:匿名上线 → 免费试用一周 → 社区猜身份(免费传播) → 官宣揭晓。
这套玩法的精髓在于它把”模型发布”变成了一个社交事件。如果智谱直接发一条”我们发布了 GLM-5.3 Flash”,能拿到多少讨论量?现在这种方式,OpenRouter 官方帖 92 万浏览,OpenCode 官方帖 368 万浏览,Ben Davis 的评测帖 60 万浏览,社区自发产出了几十条分析帖——全部免费。
而且不只是传播。100T tokens/天的免费额度意味着这实际上是一次大规模压力测试——用真实开发者的真实任务来检验模型,比内部 eval 有价值得多。模型方拿到了真实的使用数据和反馈,社区拿到了免费的强模型,OpenRouter 拿到了流量和话题。三方共赢。
顺带一提,这次的命名也成了梗。之前有 Pony Alpha(小马),现在有 Ox Alpha(牛),Ox + Pony = 牛马。中文圈直接管它叫「牛来大模型」。
还有什么值得关注
GLM-5.3 的开源权重 8 月 28 日左右上 Hugging Face。 智谱说这是他们做过最严格的安全审查。如果 Ox Alpha 确实是 Flash 变体,正式发布应该也在这个时间窗口附近。
数据保留的矛盾。 OpenCode 说 Zero Data Retention,但 OpenRouter 页面写的是匿名提供商会保留 prompts 和 completions——只是不用于训练。如果你在乎数据隐私,注意这个差异。
审查行为可能会变。 匿名期间的审查策略不一定代表正式版的表现。智谱可能在 stealth 阶段故意放松了部分限制来收集更广泛的使用数据,正式发布后可能收紧。
参考:OpenRouter Ox Alpha 页面 · Ben Davis 的 DeepSWE 评测 · Ben Davis 的身份分析 · unclecode 的指纹工具 · 证据汇总页 · InfoQ 中文报道