跳转到内容
主站 新闻 控制台

智能体测试基准/智能体

· Latent Space
播客深度访谈

2025年圣诞节前后,AI 工程师们注意到智能体(agents)发生了一些变化。它们开始真正起作用了!很难确切说清这是为什么。也许是因为我们终于有了假期的闲暇时间,去尝试用最新的模型搭配最新的智能体。也许是模型跨越了某种能力阈值(capability threshold)。也许是模型外围的**封装(wrappers)**已经成熟。

我在这篇文章中想表达的观点是,这是后两者的结合。模型与外壳(harness)共同提升,然后它们的发展曲线在恰当的时刻交汇。这种动态变化有助于解释接下来的发展趋势:模型不断将外壳的功能吸收到其权重中,工程师不断删除已被吸收的部分,而最终留下的,将是一个服务于人类注意力而非模型的“外壳”。

Transformer 的发明者之一 Lukasz Kaiser 在 6 月的“Unsupervised Learning”节目中说道:

“去年冬天、去年圣诞节期间的变化——有点难说清楚。我的意思是,外壳(harness)改变了,后训练(post-training)也有一点变化,然后新的预训练模型也出来了……但感觉就像是一个巨大的飞跃,很难说清到底是什么促成了它。”

**“发生了什么?”**的答案并不仅仅在于模型权重。而在于围绕这些权重建立起来的系统。

答案就在于智能体外壳(agent harness)。

回想一下 2022 年 11 月,当时 ChatGPT 还是最先进的 AI 工具。它所拥有的唯一能力就是下一个 Token 预测(next-token prediction)以及一些使其表现得像个得力助手的基于人类反馈的强化学习(RLHF)。没有工具,没有搜索,也没有推理。

最初的 ChatGPT 局限于它的训练数据和你发送给它的提示词(prompt)。不多也不少。它就像是一个缸中之脑。

智能体外壳(agent harness)是让大语言模型(LLM)摆脱这种局限并与真实的数字信息空间进行交互的一种方式。

什么是外壳(Harness)

智能体外壳(agent harness)是指除模型权重之外,所有让智能体正常工作的一切。 围绕模型的环境、工具、上下文和护栏(guardrails)。没有这个外壳,模型就是一个缸中之脑。它可以做出认知行动(epistemic action),但需要外壳在真实的数字空间中执行该决策。

外壳就像是给模型的思想赋予了一个身体。 有了外壳,模型就可以进行感知(上下文)、