
作者:老余捞鱼原创不易,转载请标明出处及原作者。文中示例仅用于技术讨论,不构成任何操作建议。量化策略开发应以学习和技术交流为目的。本号不荐股、不卖课、不承诺收益。市场有风险,请合法合规投资。本文约 5200 字 | 预计阅读 10-15 分钟· · ·做量化的人都知道一个尴尬的事实:LLM从几亿参数缩放到几千亿参数,性能蹭蹭涨,但时间序列预测模型呢?放大反而可能变差。Datadog的团队刚发布的Toto-2.0,终于把这事儿给解决了。5个模型规模,从400万到25亿参数,同一套训练配方,每一个更大的模型都比更小的模型预测得更准。听起来理所当然,但在时序预测领域,这是头一回。一、Toto-2.0是什么?Toto-2.0是Datadog开发的decoder-only(仅解码器)时间序列基础模型,专门做多变量零样本预测。说直白点:给它一段历史数据,不用微调,直接预测未来。先说几个关键标签:Decoder-only架构:基于Patched Transformer,交替使用时间轴注意力和变量轴注意力,支持变长上下文,能接受未来已知的协变量。u-µP缩放:超参数在1000万参数的小模型上调一次,直接迁移到25亿参数的大模型,不用每个规模重新调。CPM单次推理:连续补丁掩码(Contiguous Patch Masking)让模型一次前向传播就生成长 horizon 预测,不用像以前那样一步步自回归解码。概率预测:分位数头(quantile head)+ pinball loss,输出9个分位数,既有预测值也有不确定性估计。开源:Apache 2.0协议,权重开放,GitHub仓库可直接用。在GIFT-Eval、BOOM、TIME三个公开基准测试上,Toto-2.0全部拿下第一名。图1:Toto-2架构——Patched Transformer,交替时间轴/变量轴注意力二、四个核心设计选择Toto-2.0能实现干净缩放,靠的是四个互相配合的设计决策。咱们一个个看。1. Arcsinh归一化:小波动和极端尖峰都照顾到这个设计借自Chronos模型。传统对数归一化有个毛病:接近零的时候行为不线性,会把小幅波动吃掉。对于稀疏和间歇性时间序列(比如某些交易频率低的品种),这种信息丢失很要命。Arcsinh归一化不一样:接近零时表现为线性,保留小幅波动的细节;大值时表现为对数,压缩极端尖峰。两者兼顾,恰好是基础模型预训练需要的,因为训练数据横跨多个数量级。图2:Arcsinh归一化 vs 对数归一化,接近零时Arcsinh保持线性2. 分位数输出头:替换掉不稳定的SMMToto-1.0用的是Student-T混合模型(SMM)做概率预测,在小规模时还行,但模型变大后SMM数值不稳定,预测值接近零时会发散。Toto-2.0换成简单的分位数头:每个未来时间步预测9个分位数水平{0.1, 0.2, ..., 0.9},用pinball loss训练。这种方式现在已经是主流,Chronos-2、Moirai-2、TimesFM 2.5都用这套。为防止分位数交叉(quantile crossing),推理时对预测结果排序。点预测不再单独生成,直