混合文本与ID嵌入的个性化增量视频搜索
Personalizing Incremental Video Search with Hybrid Text and ID Embeddings
摘要
针对Apple TV增量式视频搜索中短前缀(1-3字符)意图不明确的问题,提出一种个性化排序系统。该系统在排序阶段融合两种互补信号:基于文本的多语言编码器(TextEmb)通过对比学习在共同参与三元组上微调,以及基于ID的协同嵌入模型(IdEmb)在交互衍生的正样本上训练。服务阶段从用户行为构建表征,实现每次按键后的高质量排序。
增量式视频搜索要求在每次按键后提供高质量排序,而此时的意图往往不够明确(例如1-3个字符的前缀)。我们提出了一种适用于Apple TV搜索的个性化系统,该系统在排序阶段融合了互补的语义信号与协同信号。我们的方法学习两个物品嵌入空间:(i) 基于文本的多语言编码器(TextEmb),通过对比学习在共同参与三元组上微调;(ii) 基于ID的协同嵌入模型(IdEmb),在交互衍生的正样本上训练。在服务阶段,我们从……构建用户表征。
译自 Apple · ML Research · 录于 二〇二六年七月十七日