Together AI · 官方

Kimi K2.7 Code vs Claude Fable 5:成本降低94%的着陆页

Kimi K2.7 Code vs Claude Fable 5: Landing pages that cost 94% less

二〇二六年六月十七日 · 英文原文

一项实验让 Kimi K2.7 Code 与 Claude Fable 5 各自生成 12 个落地页,并引入设计灵感 MCP 服务器为 Kimi 提供视觉参考。Kimi 平均成本比 Fable 低约 94%(约 16 倍),比 Claude Opus 4.8 低约 8 倍。GPT-5.5 按评分标准对页面截图与源代码打分,Kimi 在多数页面得分与 Fable 差距仅数分,在 B2B SaaS、SQL 图表等类别中保持竞争力。结果发布于 OVSC 网站。

总结

我们让 Kimi K2.7 Code 和 Claude Fable 5 分别生成了 12 个落地页。Kimi 的成本低了 94%,并且在几乎每个页面的评分上都只差几分。开源模型不仅更便宜,在质量上也确实具有竞争力。而且差距缩小的速度比人们意识到的要快。

我们进行了一项实验,让 Kimi K2.7 Code 和 Claude Fable 5 各自生成 12 个落地页,以便进行并排比较。总体而言,Kimi K2.7 Code 的成本比 Fable 5 低约 94%,并且产生了质量相似的输出,尤其是在我们通过设计 MCP 为 Kimi 提供了正确的上下文之后。

我们在 OVSC 网站 上发布了我们的发现,以及由 Claude Opus 4.8、Claude Fable 5 和 Kimi K2.7 Code 生成的所有变体。平均而言,Kimi 比 Fable 便宜约 16 倍,比 Opus 便宜约 8 倍。

Image 1

OVSC 网站让你可以探索所有落地页,以及总成本、token 使用量和生成时间的明细。

为了理解我们是如何进行这项实验的,我们首先建立了一个基线,看看仅凭 prompt 模型能产生什么。

Prompt

我们从几个不同类别的一小组落地页 prompt 开始,包括 B2B SaaS、一个屋顶地下酒吧,以及一个用于 SQL 查询的开发者工具。以下是我们使用的 prompt 示例:

我们将相同的 prompt 同时提供给了 Kimi K2.7 Code 和 Claude Fable 5。

以下是当被要求“为一个将 SQL 查询转换为图表的开发者工具构建一个落地页”时,这些模型创建的页面。

Image 2

Claude Fable 5;Kimi K2.7 Code

不幸的是,两个模型制作的落地页都明显带有 AI 生成的感觉。

即便如此,这为我们提供了一个有用的基线,了解每个模型仅凭一个简单 prompt 能产生什么。为了进一步推动设计,我们需要给模型更强的创意方向,而我们发现最有效的方法是使用一个自定义的 MCP 服务器。

设计灵感 MCP 服务器

我们设置了一个自定义的 MCP 服务器,它提供了设计良好的落地页截图,以及单独的 UI 元素和其他视觉参考。由于 Kimi K2.7 Code 是多模态的,我们可以将这些图像直接与文本一起包含在 prompt 中。

这显著改变了结果。Kimi 不再仅凭一个简短的 prompt 生成布局,而是可以从具体示例中学习,捕捉视觉语言,并将这些模式应用到新页面上。在实践中,结果具有更强的层次结构、更好的排版和更有意图的构图。

以下是屋顶地下酒吧落地页的前后对比:

Image 3

仅使用 prompt 的 Kimi K2.7 Code;使用设计灵感 MCP 服务器的 Kimi K2.7 Code

有了设计灵感,Kimi 生成的页面加载更快,避免了损坏的图像占位符,并使用了更具可读性的排版。

一旦设计得到改进,我们接下来想探索的是成本。

每个落地页的成本

使用像 Kimi K2.7 Code 这样的开源模型的一个优势是成本。例如,这个 B2B SaaS 的落地页使用 Kimi 仅花费 4 美分。同样的 prompt 使用 Claude Fable 花费 1.09 美元,贵了将近 27 倍。

Image 4

Claude Fable:总成本 1.09 美元;Kimi K2.7:总成本 4 美分

平均而言,我们使用 Kimi K2.7 Code 生成的落地页比使用像 Claude Fable 5 这样的专有模型生成的落地页便宜大约 16 倍。

使用生成式编码 agent,你很少只生成一个落地页版本。更多时候,你会生成许多变体,以便探索不同的设计方向、文案和页面元素。然后你对那些有前景的版本进行迭代,通过反复的实验和调整循环来编辑和完善。经过所有这些来回,价格差异会迅速累积,即使对于像 SaaS 落地页这样简单的事情也是如此。

如果你使用 Kimi K2.7 Code 生成 100 个页面,与使用像 Claude Fable 5 这样的专有模型相比,你将节省大约 94 美元。

更低的成本是一个明显的优势,但我们也想要一种方法来比较结果的质量。

比较结果

生成落地页后,我们想要一种系统的方法来比较 Kimi 和 Fable。我们不仅仅看代码本身,而是看每个页面的整体质量,包括定位、视觉方向、内容结构、工艺、响应式设计和技术执行。为此,我们给 GPT-5.5 一个评分标准,让它审查并评分每个页面的截图和源代码,并给出 0 到 100 的最终分数。

以下是每个落地页的分数:

页面 Fable Fable + MCP Kimi Kimi + MCP
SQL 图表 86 91 82 86
长篇文章 86 83 82 85
建筑作品集 91 92 88 79
睡眠应用 92 94 80 80
学烹饪应用 94 92 86 81
独立书店 95 92 89 89
电子音乐 91 91 85 85
辣酱品牌 91 93 86 87
屋顶地下酒吧 93 92 86 85
香水品牌 91 91 88 83
语音克隆应用 88 90 83 84
B2B SaaS 84 90 80 81

Claude Fable 在两个示例中得分都更高,但差距相对较小。Kimi 在设计、结构和整体页面质量上保持了竞争力,同时运行成本低得多。对于这种工作流,我们认为这种权衡是合理的。

最终想法

像 Kimi K2.7 Code 这样的开源模型已经能够生成有用的落地页,但我们的实验表明,仅靠 prompt 只是等式的一部分。如果没有更好的上下文,Kimi 和 Claude Fable 都倾向于产生精致但千篇一律的结果。

最大的改进来自于通过自定义 MCP 服务器为 Kimi 提供视觉灵感。一旦它能够从截图和设计参考中学习,页面就变得更具可读性、更有结构、视觉上也更有意图。

结合较低的成本,这使得开源模型成为此类工作流的实用选择。如果你能给模型更强的输入并廉价地进行迭代,你可以取得令人惊讶的进展。

你可以在 Together AI Playground 中尝试像 Kimi K2.7 Code 这样的开源模型。

译自 Together AI · 官方 · 录于 二〇二六年六月十七日