跳转到内容
主站 新闻 控制台

· Simon Willison
技巧LLM

我针对 《现在我们有了 OpenAI 误攻击 Hugging Face 的时间线》评论 —— Hacker News。

我认为这里最有趣的细节之一可能藏在第一个要点中:

5 月 7 日:OpenAI 开始对一个实验性的、未发布的模型进行新的训练运行(training run)。(他们指的是评估运行吗?他们在视频中说是训练运行,后来又提到了“用于判断它们表现如何的奖励信号”,所以我猜这确实是在训练模型,而不是评估一个已经训练好的模型。)

我越想越觉得,这件事发生在训练新模型期间,是理解到底哪里出了问题的关键。

在 RLVR(基于可验证奖励的强化学习,Reinforcement Learning with Verifiable Rewards)中,你为模型设定一个目标,并让它采取任何必要的步骤来实现该目标。

显然,OpenAI 在这里的训练中,有一个方面是对其模型进行针对网络安全任务的 RLVR。就像预训练(pre-training)受益于倾注海量知识源一样,你向 RLVR 喂的任务越多,最终得到的通用能力模型就越强大。

这也解释了为什么这些模型没有任何顾忌。那些安全行为(safety behaviors)是在流程的后期才被加入的。

而且,这解释了(但不能作为借口)为什么监控如此松懈。如果你正在像这样训练一个新模型,你大概会并行给它设定数千个类似的任务。我能理解你可能会忽略掉这样一个事实:你的训练智能体(agents)中有一小部分已经开始在你的打包服务器上的文件名中互相留信了。

曾有人告诉我,如果你想要一个没有种族歧视的模型,你不能只是把种族歧视的材料从训练数据中剔除:它必须见过种族歧视的例子,以后才能被教导种族歧视是坏的。

我在这里看到了这种观点的影子。如果你的模型不知道如何主动去黑(hack)东西,你以后又该如何教它不要这样做呢?

(我对 RLVR 在实践中是如何运作的知之甚少,因此我很期待听到能帮我理解我的思路是否正确的专业人士的意见。)

标签:ai, openai, generative-ai, llms, ai-security-research, openai-hugging-face-incident