还在用 Excel 拍脑袋做预测?谷歌刚开源的 TimesFM-3,把数据扔进去就能用
- 2026-09-23 03:00:13
零样本、多变量、三大基准第一——预测这件事正在变成水电煤。
明天的奶茶该备多少料?
问十个店长,九个说这是玄学。备多了,晚上倒掉心疼;备少了,客人排队跑单更心疼。电商备货、电网调度、客服排班,说白了全在赌。
上周 Google Research 发了个新模型,专门治这个"赌"。叫 TimesFM-3。一句话讲:把历史数据扔进去,不用训练、不用调参,直接给你预测结果——顺手还把三个主流预测基准的第一名全拿了。
以前的模型,只会看一条线
TimesFM 不是新面孔。2024 年第一版就火过一轮:2 亿参数,拿 1000 亿个真实世界的时间点做预训练,主打"零样本预测"——不用针对你的数据重新训练,直接推理就能出结果。
不过它一直有个硬伤:到去年 9 月的 TimesFM-2.5 为止,只能做单变量预测。翻译一下,就是只会盯着一条线看。预测冰淇淋销量,它只看销量本身的历史。
可真实世界哪是一条线?脆筒卖得好不好、糖浆是不是同款、上个月客流涨没涨、下周有没有高温预警、哪天做大促——这些全搅在一起,共同决定明天的数字。
你看,每条线,其实是一张网里的一根。以前的模型,看不见那张网。

冰淇淋实验:预测自己"长"出了促销的凸起
谷歌在发布博客里举了个例子,我个人觉得特别直观。
假设你是连锁品牌的运营,下个月的促销排期已经定了,现在要预测销量。
传统单变量模型怎么做?盯着历史销量,把每周的规律往后推。促销?它不知道。图上的红线就是它——一条平滑的曲线,波澜不惊。
TimesFM-3 的玩法不一样。你把促销日程表当作一种输入喂给它(术语叫"过去-未来协变量",也就是未来已经确定知道的信息),它去历史数据里自己琢磨:以前搞促销的日子,销量大概涨多少?然后把这个规律套到未来的促销日上。
结果就是图上的蓝线:每个促销日,预测自动抬升约 20%。你没告诉它"促销会涨 20%",这是它自己从历史里学出来的。
它一次能吃三类东西:一是多个目标一起预测,几个品牌的冰淇淋联动着看;二是过去协变量,比如历史客流;三是刚才说的促销、节假日、天气预报这类未来已知信息。每条预测还带 9 档分位数,从 P10 到 P90——不光告诉你"大概多少",还告诉你"最好和最坏差多远"。

一次跑完,不一步步猜
再说个工程上的亮点。
以前的 TimesFM 生成预测像写文章,一段一段往外蹦:先猜下一段,再拿猜出来的当依据,接着猜下一段。延迟高,误差还会滚雪球。
TimesFM-3 改成了"填空题":把未来要预测的位置先打上占位符,跟历史数据一起送进模型,一次前向传播,全部填完。没有循环,没有迭代。
架构上它还是熟悉的 decoder-only Transformer,把每 32 个时间步打包成一个 token。真正有意思的是"交替注意力":横向看,token 只能看自己这条线的过去,严格因果,防止数据穿越;纵向看,同一时刻可以看所有序列,把"这款促销带动那款销量"这种跨序列关系学进去。横一层,纵一层,交替往上叠。
规模呢?3.3 亿参数,预训练数据超过 1 万亿个时间点(真实加合成)。什么概念?GPT-3 是 1750 亿参数。这是个"小"模型,单张卡就能跑。

成绩单:三个基准,双料第一
评测在 Gift-Eval、FEV-Bench、Time 三个公共基准上做。在所有预训练基础模型里,TimesFM-3 的点预测和概率预测都是综合排名第一。对手包括 Amazon 的 Chronos-2、Toto 2.0 全家,还有自家上一代 TimesFM-2.5。
更狠的一个细节:就算把它切成单变量模式——不给任何协变量、不给跨序列信息,当成传统单变量模型用——它也已经追平或超过所有对手。切回完整的多变量模式,再跳一档。
模型已经开源,GitHub 和 Hugging Face 都能下载。BigQuery 的集成几周内上线,到时候一条 AI.FORECAST 命令就能调用,官方原话是"不需要任何机器学习经验"。

说到底,预测正在变成水电煤
这些年大模型把写代码、画图、写文案的成本打到地板价。预测呢?零售、金融、制造、医疗全离不开,却一直是专业团队的手艺——搭数据、调模型、跑实验,一个项目几个月起步。
TimesFM-3 这类模型出来后,"先跑个靠谱基线"这件事的成本,趋近于零。
说实话,我不觉得它能把精细化的专用模型全替掉。深耕某一件事的模型,天花板还是更高。但以后任何业务,接上数据就有个不错的起点——这件事的意义,比一个排行榜第一大多了。
你身边一定有人,还在 Excel 里拉趋势线预测下个季度。
把这篇转给 TA。