LLM 函数调用的不确定性量化
Uncertainty Quantification for LLM Function-Calling
摘要
大型语言模型(LLM)在自主解决现实任务中广泛采用函数调用(Function-Calling)范式以赋予工具使用能力,但错误调用可能引发不可逆后果(如转账或删除数据)。为此,研究者引入不确定性量化(UQ)方法,在函数执行前评估LLM对调用正确性的置信度,以降低风险。
大型语言模型(LLM)正越来越多地被部署用于自主解决现实世界任务。其中的一个关键要素是 LLM 函数调用(Function-Calling)范式,这是一种广泛用于赋予 LLM 工具使用能力的方法。然而,LLM 错误地调用函数可能会产生严重后果,尤其是在其效果不可逆的情况下,例如转账或删除数据。因此,在执行函数调用之前,考虑 LLM 对该调用能正确解决问题的置信度至关重要。不确定性量化(UQ)方法可用于量化……
译自 Apple · ML Research · 录于 二〇二六年七月十六日