跳转到内容
主站 新闻 控制台

[AINews] 效果差

· Latent Space
播客深度访谈

以 AI 的标准来看,今天是一个相当平静的周五,所以是时候退一步,反思一下究竟在发生什么了。如果你读过我们的 2025 年阅读清单,关注过我们对 Z.ai GLM 的报道,理解了 Poolside 的转型,一直在追踪我们的 AI 科学应用(AI for Science)主题,并收听了今天的 Simile 播客,你不仅是 Latent Space 最忠实的读者之一,可能还会得出这样一个心智模型:

自 2022 年以来,每年都有一个生产机器智能的流水线环节从“人造”转变为“模型制造”。这一转变既非渐进,也非均衡——每一次转变都有一个“零号病人”(即某篇论文或某个产品,合成版本在其中首次在顶尖实验室承担起核心支撑作用),自此以后,未来便已然到来,只是尚未投入生产。

如果你仔细观察,我们过去所说的“合成数据”(synthetic data)、“合成评估标准”(synthetic rubrics)、“AI 研究员”(AI researcher)和“端到端强化学习环境”(end to end RL environments),其实只是野心越来越大的“人类模拟”——虽然效果差了 10%,但成本便宜了 100 倍,速度快了 10,000 倍。

阶段 1:奖励信号(2022年)

出乎意料的是,最先被合成化的是“裁判”。InstructGPT 确立了