BTC $79,252.39 +1.55%
ETH $2,507.32 +1.83%
BNB $746.11 -0.14%
XRP $1.43 +1.87%
SOL $103.79 +1.09%
TRX $0.3384 -0.07%
DOGE $0.0902 +1.27%
ADA $0.2183 -0.09%
BCH $258.02 +1.68%
LINK $12.15 -2.41%
HYPE $86.53 +4.68%
AAVE $129.36 +1.23%
SUI $0.8119 +0.99%
XLM $0.1879 -0.13%
ZEC $1,272.92 +10.23%
BTC $79,252.39 +1.55%
ETH $2,507.32 +1.83%
BNB $746.11 -0.14%
XRP $1.43 +1.87%
SOL $103.79 +1.09%
TRX $0.3384 -0.07%
DOGE $0.0902 +1.27%
ADA $0.2183 -0.09%
BCH $258.02 +1.68%
LINK $12.15 -2.41%
HYPE $86.53 +4.68%
AAVE $129.36 +1.23%
SUI $0.8119 +0.99%
XLM $0.1879 -0.13%
ZEC $1,272.92 +10.23%
first_img

研究:2019 至 2025 年预训练效率提升主要来自数据

2026-09-09 17:12:10

ChainCatcher 消息,Dwarkesh Patel 与 Jerry Han 于 2026 年 9 月 8 日发布研究,拆解 2019 至 2025 年预训练进展中数据与模型改进的贡献。研究在较小规模、针对预训练进行,每年对应当年公开的模型配方与公开数据语料,并在最高 1e19 FLOPs 的训练计算规模上组合训练。

结果显示,在 1e19 FLOPs 计算预算下,数据改进带来的计算效率增益为 12.0 倍,模型改进为 3.7 倍,数据侧增益约为模型侧的 3.24 倍。数据与模型改进的增益大体独立、几乎不交互,线性模型下二者加性效应可解释 OLMES 分数 88% 的方差。

模型侧从 GPT-2 演进至 OLMo-2,涵盖优化器、位置编码、归一化、激活函数与初始化等。数据侧从 2019 年约 90 亿 token 的 OpenWebText,演进至 2025 年规模更大、过滤更精细的 UltraFineWeb 等语料。

app_icon
ChainCatcher 与创新者共建Web3世界