ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Simple Yet Effective: An Information-Theoretic Approach to Multi-LLM Uncertainty Quantification

Simple Yet Effective: An Information-Theoretic Approach to Multi-LLM Uncertainty Quantification 文章主要内容总结本文聚焦于大型语言模型(LLMs)在高风险场景(如医疗)中的不确定性量化问题,提出了一种基于信息论的多LLM不确定性估计方法MUSE(Multi-LLM Uncertainty via Subset Ensembles)。研究背景:现有LLM不确定性估计方法多针对单个模型,忽略了不同模型因训练数据、架构差异带来的互补性;而LLM输出的不一致性(如相同输入在不同解码设置下的差异)在高风险领域可能导致决策风险,因此需可靠的不确定性量化方法。核心假设:不同LLM因训练语料、目标和架构的差异,在输入空间的不同区域表现更优,且语言的齐夫定律(Zipfian nature)使得模型预测具有互补性,聚合这些输出可降低不确定性、提升鲁棒性。方法设计:通过詹森-香农散度(Jensen-Shannon Divergence, JSD)量化模型间的分歧(认知不确定性,epistemic uncertainty),结合单个模型预测的熵(偶然不确定性,aleatoric uncertainty),提出MUSE算法。该算法通过贪心或保守策略选择校准良好的LLM子集,平衡多样性与可靠性,最终聚合子集输出得到预测结果。实验验证:在三个二分类数据集(通用领域的TruthfulQA、临床领域的EHRShot和MIMIC-Extract)上验证,结果显示MUSE在AUROC(准确性)、ECE(校准误差)和Brier分数(预测误差)上均优于单模型和简单集成方法,尤其在临床等高风险场景中表现稳定。/
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进