从训练 FLOP 反推模型参数量
前阵子流传一份微软的幻灯片,上面标着 Claude Mythos 的训练总算力:6.1×10²⁷ FLOP,95% 置信区间 5.3×10²⁷ 到 7.1×10²⁷(假设 1 像素的测量误差)。
看到这个数字,第一反应都一样:那它到底多大?多少 B 参数?
能算。但没那么简单。
C ≈ 6ND
训练算力和模型规模之间有个被反复用的粗略关系:
C ≈ 6ND
C 是训练总 FLOP,N 是参数量,D 是训练 token 数。来自「前向 + 反向每 token 大约 6N 次浮点运算」的近似,Chinchilla 那篇 scaling 论文的分析基础。
一个方程,两个未知数(N 和 D)。光知道 C,解不出 N。
必须先猜 token 数
要拿到一个 N,得补一个对 D 的假设。最常用的是 Chinchilla 的 compute-optimal 口径:数据量大约是参数量的 20 倍,D ≈ 20N。代回去:
N ≈ √(C/120)
6.1×10²⁷ FLOP → √(6.1e27/120) ≈ 7.1T 参数,对应约 143T token。
但这个「7.1T」的意思是:「如果这个模型按 Chinchilla 意义上算力最优的方式、且是 dense 架构训练,它该有多大」。真实模型如果是 MoE、或者训练 token 远多于 20 倍参数,这个数就跟现实差一截。
往历史模型上套,偏差立刻出来
同一套 √(C/120) 往几个公开模型上套一试试:
| 图中模型 | 图上训练 FLOP 粗读 | 折算参数量 (B) | 备注 |
|---|---|---|---|
| AlexNet | ~4.5×10¹⁷ | ~0.06B | 公开论文实际约 60M 参数,基本对上。(NeurIPS 会议录) |
| AlphaGo Master | ~3×10²⁰ | ~1.6B | RL/搜索系统,不太适合直接和 LLM 的 “B 参数” 类比。 |
| AlphaGo Zero | ~7×10²⁰ | ~2.4B | 同上,更多是”按 FLOP 硬折算”的量级。 |
| GPT-3 | ~3.2×10²³ | ~52B | 公开实际是 175B,因为 GPT-3 不是 Chinchilla-optimal 口径训练。(arXiv) |
| PaLM | ~3.8×10²⁴ | ~180B | 公开实际是 540B,同样比 compute-optimal 折算值大。(Google Research) |
| GPT-4 | ~2.8×10²⁵ | ~480B | 官方没公开模型大小/训练 compute 等细节。(OpenAI) |
| Gemini Ultra | ~8×10²⁵ | ~810B | 参数量未公开。(crfm.stanford.edu) |
| Claude Opus 4.6 | ~2.0×10²⁷ | ~4,100B,即 ~4.1T | Anthropic 未公开模型大小/架构细节。(crfm.stanford.edu) |
| Gemini 3.1 Pro | ~6×10²⁷ | ~7,100B,即 ~7.1T | 顶部点很挤,像素读数误差会比较大。 |
| Claude Mythos | 6.1×10²⁷ | ~7,130B,即 ~7.1T | 按 95% CI:约 6.6T–7.7T。 |
老一点的、没按 compute-optimal 训练的模型,折算值会系统性偏小。GPT-3 真实 175B,折算只有 52B;PaLM 真实 540B,折算 180B。反过来想,如果 Mythos / Gemini 3.1 Pro 也是过训练(训练 token 远超 compute-optimal 的建议),那 7.1T 同样是高估——真实激活参数可能更小。
换个 token 假设,答案直接砍半
固定 C、只改 D,N 的变化幅度比你想象的大。以 Mythos 的 6.1×10²⁷ 为例,N = C/(6D):
| 训练 token 假设 | 折算参数量 |
|---|---|
| 100T | 10.2T |
| 143T(Chinchilla) | 7.1T |
| 150T | 6.8T |
| 200T | 5.1T |
训练 token 从 100T 涨到 200T,参数量估计直接减半。前沿实验室现在普遍倾向「小底座喂超多数据」——过训练:宁可一次性多花训练算力,换更低的推理成本。所以真实 N 很可能在偏小那一头。
IKP:换套校准方式,中心值从 9.7T 掉到 1.5T
上面是从 FLOP 这头反推。还有另一类黑箱估计根本不用 FLOP——最近有个 IKP(Incompressible Knowledge Probes)方法,用一批事实性问题校准开源模型,再用「事实容量」反推闭源模型的参数。原始结果把 GPT-5.5 放到了 [3.2T, 28.7T],网传中心约 9.7T。
很快有人复核,发现结论对方法细节极度敏感——换一套校准方式,GPT-5.5 掉到 1458B,90% 置信区间 [256B, 8311B],GPT-5.5 Pro 是 1471B。中心值从 9.7T 缩到 1.5T,差了一个量级。作者自己也强调单点不该当成交实参数量。
黑箱估计的「点估计」几乎不可信。可信的是量级和区间。
我的判断
GPT-5.5 这类没人公开的模型,我会这么报:中心估计 ~1.5T,现实区间 1T–4T。9.7T 是激进上沿,不是中心值。这个区间仍然很大,但比一个精确到个位数的假数字诚实。
6.1×10²⁷ FLOP 不唯一对应任何参数量。在 Chinchilla 口径下约等于 7.1T,但只要训练 token 数换个假设,答案就在 5T–10T 之间漂。下次看到「某模型算力泄露,算出 XX 万亿参数」,只需要知道一件事:这个 XX 后面藏着三个没写出来的假设——token 假设是什么、dense 还是 MoE、compute-optimal 还是过训练——三个假设每个都有可能让这个 XX 差一两倍。
参考资料:Chinchilla / Compute-Optimal(Princeton COS 597G 课件) · IKP 原论文 · IKP 复核(LessWrong) · CRFM 模型透明度报告