Simon Willison · 博客

Ornith-1.0:面向智能体编程的自脚手架大语言模型

Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding

二〇二六年六月二十九日 · 英文原文

DeepReinforce 发布首个开放权重模型 Ornith-1.0(MIT 许可),提供 9B Dense、31B Dense、35B MoE 和 397B MoE 四种变体。该模型基于预训练的 Gemma 4(Apache 2.0)和 Qwen 3.5(Apache 2.0)构建,在编程 benchmark 上达到同等规模开源模型中的 SOTA 性能。用户通过 LM Studio 运行 ornith-1.0-35b-Q4_K_M.gguf(20GB)GGUF 文件,在 agent harness 中实现多次工具调用,生成速度达 103 tokens/秒。DeepReinforce 最早可查论文为 2025 年 6 月的《CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning》。

Ornith-1.0:用于智能体编程的自脚手架大语言模型

这是一个有趣的新开放权重(MIT 许可)模型,是 DeepReinforce 发布的首个模型。[...] 包含 9B Dense、31B Dense、35B MoE 和 397B MoE 等变体。基于预训练的 Gemma 4 和 Qwen 3.5 构建,它在编程 benchmark 上达到了同等规模开源模型中的 SOTA 性能。据我所知,这些基础模型的许可与这种使用方式兼容——Gemma 4 采用 Apache 2.0 许可(不受之前 Gemma 模型所受的繁琐附加 Gemma 使用条款约束),Qwen 3.5 同样采用 Apache 2.0 许可。

我一直在使用 LM Studio 运行该模型,具体是 ornith-1.0-35b-Q4_K_M.gguf(20GB)GGUF 文件,并连接到 Pi。初步印象非常好——它似乎能够以熟练的方式在多次工具调用中运行 agent harness。以下是一个终端会话示例:我要求它"找到解码 actor cookie 的代码",然后"找到点击按钮时打开插入对话框的代码",针对一个 Datasette checkout 仓库,它轻松完成了任务。

我还让它画了这只鹈鹕,生成速度为 103 tokens/秒:

虽然有点变形,但鹈鹕明显是鹈鹕。

我找不到太多关于 DeepReinforce 本身的信息。我能找到他们最早的一篇论文是 2025 年 6 月的《CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning》。

标签:ai、generative-ai、local-llms、llms、qwen、pelican-riding-a-bicycle、gemma、llm-release、lm-studio

译自 Simon Willison · 博客 · 录于 二〇二六年六月二十九日