别分类。去幻觉!
Don't classify. Hallucinate!
摘要
作者博客有1,856个标签,因数量过多无法一次性交由LLM匹配。Doug Turnbull提出方案:让模型不参考现有词汇表直接输出标签,再通过向量嵌入(vector embeddings)对照现有语料库,找出与模型猜测最接近的具体标签。其示例提示包含标签形状示例(如“家具/客厅家具/咖啡桌与边桌/咖啡桌”),以引导模型生成更实用的分类。
不要分类。去幻觉!我的博客上还有不少旧内容,一直没来得及打标签。我的博客有1,856个标签——可能太多了,无法一次性喂给LLM并说“这些标签中哪些匹配以下内容”。Doug Turnbull有一个简洁的解决方案。让模型输出标签,而不提供现有词汇表的任何细节,然后使用向量嵌入(vector embeddings)对照现有语料库,找到与模型想象中可能合适的标签最接近的具体标签!他的示例提示建议包含一个标签形状的示例,以帮助模型做出更有用的猜测:
你的任务是创建新颖的、前所未见的家具、家居用品或硬件分类,以最好地匹配搜索查询。产品分类可能看起来像: 家具 / 客厅家具 / 咖啡桌与边桌 / 咖啡桌 装饰与抱枕 / 装饰抱枕与毯子 / 抱枕 家具 / 卧室家具 / 梳妆台与衣柜 厨房与桌面 / 厨房收纳 / 食品储存与罐子 学校家具与用品 / 学校家具 / 学校椅与座椅 / 可叠放椅 婴儿与儿童 / 幼儿与儿童卧室家具 / 儿童床 以下是为其生成分类的查询:棕色咖啡桌
标签:搜索、人工智能、生成式AI、LLM、嵌入、Doug Turnbull
译自 Simon Willison · 博客 · 录于 二〇二六年八月十五日