用可解释性理解标注员安全政策
Understanding Annotator Safety Policy with Interpretability
摘要
该研究探讨了AI安全策略中标注分歧的成因与区分方法。标注分歧源于操作失误、策略模糊或价值多元性,三者需分别通过质量控制、策略澄清和审慎讨论加以应对。研究未提供具体数据或模型名称,但强调了区分这些原因对安全策略开发的重要性。
安全策略定义了何为安全与不安全的AI输出,指导数据标注和模型开发。然而,标注分歧普遍存在,可能源于多种原因,例如操作失误(标注者误解或错误执行任务)、策略模糊(策略措辞留有解释空间)或价值多元性(不同标注者对安全持有不同观点)。区分这些原因至关重要。例如,操作失误需要质量控制,模糊性需要策略澄清,而多元性则需要审慎讨论……
译自 Apple · ML Research · 录于 二〇二六年七月七日