DeepAmbigQA:用于评估LLM答案完整性的模糊多跳问题基准
DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness
摘要
DEEPAMBIGQAGEN是一个自动数据生成流水线,用于构建开放域问答(QA)基准,专门针对共享标题的多部电影及演员推理等复杂问题。该流水线生成的问题要求区分同名实体并整合跨大量候选的证据,现有基准未同时覆盖这两项挑战。通过该工具生成的问答数据集,旨在评估大型语言模型(LLM)集成搜索工具在复杂开放域QA中的完整答案集生成能力。
大型语言模型(LLM)集成搜索工具在开放域问答(QA)中展现出巨大潜力,但面对诸如“电影《盗火线》中哪位演员至少获得过一次奥斯卡奖?”这类复杂问题时,它们往往难以生成完整的答案集。这类问题要求(1)区分共享同一标题的多部电影,以及(2)在大量演员中进行推理,以收集并整合证据。现有的问答基准很少同时评估这两个挑战。为解决这一问题,我们引入了DEEPAMBIGQAGEN,一个自动数据生成流水线,用于构建问答……
译自 Apple · ML Research · 录于 二〇二六年八月七日