推理软件栈的微小差异,就能改变输出 Token
梦晨 发自 凹非寺
糟糕!辛辛苦苦在本地部署的大模型,为什么用起来总感觉比官方版本更笨?
即使使用同一张显卡、完全相同的权重,推理软件栈的微小差异也会导致模型在关键位置输出完全不同的 Token,甚至导致工具调用彻底失败。
这种陷阱极易触发却极难排查,甚至会让人产生“被智子封锁了”的错觉。
糟糕!辛辛苦苦在本地部署的大模型,为什么用起来总感觉比官方版本更笨?
即使使用同一张显卡、完全相同的权重,推理软件栈的微小差异也会导致模型在关键位置输出完全不同的 Token,甚至导致工具调用彻底失败。
这种陷阱极易触发却极难排查,甚至会让人产生“被智子封锁了”的错觉。