几年前,加州理工学院(Caltech)的 Anima Anandkumar 教授着手开发首个基于人工智能(AI)的开源天气模型。在与该领域的专家交流时,她遭遇了质疑。天气是混沌的,物理模拟非常困难,且已经发展了数十年,需要超级计算机,而且根本没有足够的数据。尽管存在疑虑,Anima 依然坚持推进并开始构建。在一年之内,她的团队就开发出了 FourCastNet,这是一种预测模型,其性能可与目前最优秀的基于物理的模拟相媲美。得益于 Anima 及其后续工作,现在任何人都可以使用消费级 GPU 在短时间尺度内准确预测天气。1
在我们在 Latent.Space 上发布的约 15 期科学节目中,我们涵盖了原子、分子、材料、生物学和数学。Anima 是研究连续物理系统的先驱。天气、核聚变以及流体或热流是极难建模的宏大科学领域:它们规模庞大、充满混沌,且从根本上具有多尺度特征。这是一个在某种程度上被 AI 社区所忽视的领域,但我们预计它将快速增长。我们计划在未来的节目中更多地探讨大型物理系统。
从 Anima 的工作中可以了解到的一点是,该 AI 领域抵制了充斥在其他领域的“规模化”(scaling)思想。数据并不存在:在许多此类领域中,开源数据集仅限于几万或几十万个样本,远达不到极度渴求 Token 的 Transformer 所需的量级。更糟糕的是,物理学所要求的解析度将上下文长度推高到了数千亿,因此你无法简单地通过堆砌更多 Token 来解决问题。不过,这并不是天花板,只是一条更慢的道路:这里的进步源于构建结构和归纳偏置(inductive biases)。对那些笃信“惨痛教训”(Bitter Lesson)的语言模型开发者们说声抱歉了。
“如果每个维度甚至只有几百个网格点(这是工业规模的起点)……我们所说的就是数千亿甚至一万亿的上下文长度。因此,别指望能有适用于这种规模的 Transformer,全世界的算力加起来都不够。”
底层数学原理
为了应对这些系统,Anima 开创了一种被称为神经算子(Neural Operators)的技术,这是过去十年中 AI 领域最美丽的理论进展之一。[2](#footnote-