AI实验室在玩鹈鹕最大化吗?
Are AI labs pelicanmaxxing?
Dylan Castillo 使用 8 种动物 × 6 种交通工具共 48 个 prompt,在 GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2 和 DeepSeek V4 Pro 七个模型上各运行三次,并借助 GPT-5.6 Luna 与 Gemini 3.1 Flash-Lite 评估结果。测试未发现“鹈鹕最大化”证据:骑自行车的鹈鹕画质不优于其他组合,实验室在鹈鹕或自行车单项上无显著优势,且组合效果未超出各自表现预期。GLM-5.2 在该组合上提升最大,但效果微小且不显著。
AI实验室是否在“鹈鹕最大化”(pelicanmaxxing)?Dylan Castillo 完成了一项出色的工作,他深入探讨了一个经常被思考的问题:AI实验室是否一直在故意训练模型,以回应我那个极不科学的基准测试,画出骑自行车的鹈鹕。过去我曾随机抽查过这一点,方法是测试模型绘制其他动物骑其他类型交通工具的效果,但从未像 Dylan 的方法论这样严谨。Dylan 采用了 8 种动物 × 6 种交通工具 = 48 个 prompt,每个 prompt 在 7 个不同模型(GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2 和 DeepSeek V4 Pro)上各运行三次。然后他使用 GPT-5.6 Luna 和 Gemini 3.1 Flash-Lite 来帮助评估结果。这里有一个简洁的筛选视图用于探索结果:对于他测试的模型,没有发现鹈鹕最大化的证据:骑自行车的鹈鹕看起来并不更好;实验室并不更擅长画鹈鹕;实验室并不更擅长画自行车;即使调整了难度,实验室也不更擅长画骑自行车的鹈鹕;鹈鹕-自行车场景看起来并非记忆化的结果……鹈鹕画得并不比其他动物好。自行车画得并不比其他交通工具好。而且,没有任何实验室画出的组合效果优于其鹈鹕和自行车各自表现所预示的水平。GLM-5.2 最接近:它在鹈鹕-自行车这个具体组合上提升最大,而且它第一个鹈鹕骑自行车的样本引起了我的注意。但效果很小且不显著,所以我不认为这值得过分关注。来源:Hacker News 标签:ai , generative-ai , llms , evals , pelican-riding-a-bicycle