基于标签分布学习的度量相关标注饱和
Metric-Dependent Annotation Saturation for Learning from Label Distributions
摘要
在NLI(自然语言推理)任务中,标注者分歧本身携带信号,所需标注者数量取决于评估指标。基于ChaosNLI数据集(每项含100份独立判断)二次采样标签分布微调模型后,发现熵相关性(识别分歧项目)需约N≈20–50名标注者收敛,而分布匹配度(KL散度)在N≈10时饱和,在五个模型上实现87–95%改进。
当标注者对标签存在分歧时,分歧本身即携带信号——而捕捉该信号所需的标注者数量取决于评估指标。我们基于从 ChaosNLI(一个为每个项目提供 100 份独立标注者判断的数据集)中二次采样的标签分布对 NLI 模型进行微调,并识别出指标相关的饱和点。在我们的三分类 NLI 设定中,熵相关性(即模型能否识别哪些项目会引发分歧)需要约 N ≈ 20–50 名标注者才能收敛,而分布匹配度(KL 散度)则在 N ≈ 10 时即达到饱和(在五个模型上实现了 87–95% 的改进)。
译自 Apple · ML Research · 录于 二〇二六年六月二十四日