Simon Willison · 博客

“他们坑了我们”:性格冲突导致Anthropic模型下线

"They screwed us": Personality clashes sent Anthropic's models offline

二〇二六年六月十五日 · 英文原文

Axios报道称,性格冲突导致Anthropic模型下线。报道援引多位消息人士,详述美国政府出口管制相关幕后细节。Anthropic前沿红队负责人Logan Graham、安全负责人Dave Orr及Nicholas Carlini今日将与美国商务部会面。报道指出,方案之一是确保Anthropic模型无法被越狱,但完美防护可能无法实现。Anthropic声称尚未发现针对Claude Mythos的“通用越狱”,并将触发政府回应的越狱归类为“潜在的非通用窄域越狱”。

"他们坑了我们":性格冲突导致Anthropic模型下线。Axios这篇报道中充斥着大量"熟悉政府思路的消息人士"和"接近Anthropic的消息人士",这是我目前看到关于美国政府出口管制神话/寓言故事最详尽的幕后八卦合集。据报道,Logan Graham(我领导Anthropic前沿红队)、Dave Orr(安全负责人,前Google DeepMind工程总监)以及博客常客Nicholas Carlini今天将在华盛顿与商务部会面。祝他们好运!(我刚注意到Logan在鲍里斯·约翰逊时期曾任"首相特别顾问",负责AI、科学与技术政策——政治经验相当丰富。)这篇结尾注释让我对短期内重获寓言模型不抱太大希望:底线:一种方案是确保Anthropic的模型无法被越狱——尽管完美的越狱防护可能无法实现。若做不到这一点,一位熟悉政府思路的消息人士表示,可能最终归结为态度调整:不是感到被轻视,而是"每个人都感到安全、有保障且愉快"。这让我怀疑Anthropic是否成功解决了2023年《针对对齐语言模型的通用与可迁移对抗攻击》论文中描述的那类攻击。看起来他们的宪法分类器工作(今年1月的博文)与此相关。他们继续声称尚未发现针对Claude Mythos的"通用越狱",并将触发美国政府回应的越狱归类为"潜在的非通用窄域越狱"。

标签:越狱、人工智能、生成式AI、大语言模型、Anthropic、Claude、Nicholas Carlini、AI伦理、Claude Mythos

译自 Simon Willison · 博客 · 录于 二〇二六年六月十五日