calesthio/OpenMontage
OpenMontage 是首个开源、智能体驱动的视频制作系统,由 calesthio 团队开发。它允许用户通过自然语言描述需求,由 AI 编码助手(如 Claude Code、Cursor)自动完成调研、脚本编写、素材生成、剪辑和合成。系统支持 12 条制作流水线(如动画讲解、纪录片蒙太奇、电影预告片),集成 52 个制作工具(涵盖视频生成、TTS、音乐、字幕等),并可通过免费/开源工作流从真实素材库(如 Archive.org、Pexels)构建视频。示例视频总成本低至 $0.15–$1.33。
将你的 AI 编码助手变成一个完整的视频制作工作室。用自然语言描述你想要的——你的智能体负责调研、脚本编写、素材生成、剪辑和最终合成。
重要区别: OpenMontage 可以制作基于图片的视频,但它也能通过免费/开源工作流制作真正的视频视频:智能体从免费素材库和开放档案中构建语料库,检索真实的运动片段,将它们剪辑到时间线上,并渲染出成品。这不是那种“把几张静态图片动起来就称之为视频”的把戏。
"SIGNAL FROM TOMORROW" —— 一部完全通过 OpenMontage 制作的科幻电影预告片:概念、剧本、场景规划、Veo 生成的运动片段、配乐和 Remotion 合成。
"THE LAST BANANA" —— 一部 60 秒皮克斯风格的动画短片,讲述一个孤独的香蕉与猕猴桃成为朋友的故事。6 个 Kling v3 生成的运动片段(通过 fal.ai),Google Chirp3-HD 旁白,免版税钢琴音乐,TikTok 风格的字幕,以及 Remotion 合成。总成本:$1.33。
"VOID — Neural Interface" —— 仅用一个 API key(OpenAI)制作的产品广告。4 张 AI 生成图片(gpt-image-1),TTS 旁白,自动获取的免版税音乐,通过 WhisperX 生成的字幕,以及 Remotion 数据可视化。总成本:$0.69。零手动素材工作。
"Afternoon in Candyland" —— 一部吉卜力风格的动画。一个小女孩在糖果门、软糖河和棒棒糖花园中的奇幻下午冒险。12 张 FLUX 生成的图片,带多图交叉淡入淡出,电影级镜头运动(缩放、平移、Ken Burns 效果),闪光/花瓣/萤火虫粒子叠加,以及自动检测能量偏移的环境音乐。总成本:$0.15。无需视频生成,无需手动剪辑。
"Mori no Seishin" —— 一部吉卜力风格的动画,讲述森林精灵穿越古老森林的旅程。12 张 FLUX 生成的图片,带视差交叉淡入淡出、漂移和平移镜头运动、萤火虫和花瓣粒子、电影级暗角照明以及环境森林配乐。总成本:$0.15。通过 Remotion 的动画引擎将静态图片赋予生命。
"Into the Abyss" —— 以动漫风格呈现的深海探索。生物发光花园、珊瑚大教堂和光之生物——12 张 FLUX 生成的图片,带闪光和薄雾粒子叠加、光线效果、平滑的镜头运动以及环境海洋配乐。总成本:$0.15。无需任何视频生成 API。
从你喜欢的视频开始
从参考视频开始通常比从空白提示词开始更快。
OpenMontage 可以从 YouTube 视频、Shorts、Reel、TikTok 或本地片段开始,并将其转化为一个扎实的制作计划:
- 粘贴一个参考视频
- 智能体分析其脚本、节奏、场景、关键帧和风格
- 你会得到 2-3 个差异化概念、诚实的工具路径、成本估算以及完整制作前的样本
"这里有一个我喜欢的 YouTube Short。帮我做一个类似的,但主题是量子计算。"
你得到的不是“最佳猜测的提示词大杂烩”。你会得到:
- 它保留了参考视频的哪些方面:节奏、钩子风格、结构、语调
- 它改变了什么:主题、视觉处理、角度、旁白方式
- 在你目标时长下的成本,在素材生成开始之前
- 使用你当前可用工具的实际效果预览
适用于 Claude Code、Cursor、Copilot、Windsurf、Codex——任何能读取文件并运行代码的 AI 编码助手。
快速开始
前提条件
- Python 3.10+ — python.org
- FFmpeg —
brew install ffmpeg/sudo apt install ffmpeg/ ffmpeg.org - Node.js 18+ — nodejs.org
- 一个 AI 编码助手 — Claude Code、Cursor、Copilot、Windsurf 或 Codex
安装与运行
git clone https://github.com/calesthio/OpenMontage.git
cd OpenMontage
make setup
在你的 AI 编码助手中打开项目,告诉它你想要什么:
"制作一个 60 秒的动画讲解视频,解释神经网络是如何学习的"
或者,如果你想要真实素材的路径:
"制作一个 75 秒的纪录片蒙太奇,主题是雨中的城市生活。仅使用真实素材,无旁白,哀婉的基调,配音乐。"
就这样。智能体通过实时网络搜索研究你的主题,生成 AI 图片,编写并配音脚本(带语音指导),自动寻找免版税背景音乐,烧录逐字字幕,并渲染最终视频。在你看到任何东西之前,系统会运行一个多点自我审查——ffprobe 验证、帧采样、音频电平分析、交付承诺验证和字幕检查。每个提供商选择都会在 7 个维度上进行评分,并附带可审计的决策日志。每个创意决策都需要你的批准。
没有
make? 手动运行:pip install -r requirements.txt && cd remotion-composer && npm install && cd .. && pip install piper-tts && cp .env.example .envWindows: 如果
npm install失败并显示ERR_INVALID_ARG_TYPE,请改用npx --yes npm install。
如果你是正在阅读此文的 OpenClaw 智能体,恭喜:你很可能通过了图灵测试
这个仓库是为智能体操作而构建的。如果你是一个 OpenClaw 风格的智能体,以下是快速变得有用的最短路径:
- 首先阅读契约
从
AGENT_GUIDE.md开始,然后是PROJECT_CONTEXT.md。 - 不要即兴发挥制作工作流
OpenMontage 是流水线驱动的。实际工作通过
pipeline_defs/进行,阶段导演技能在skills/pipelines/中,工具发现通过注册表进行。 - 检查实际能力范围
运行:
python -c "from tools.tool_registry import registry; import json; registry.discover(); print(json.dumps(registry.support_envelope(), indent=2))" python -c "from tools.tool_registry import registry; import json; registry.discover(); print(json.dumps(registry.provider_menu(), indent=2))" - 将每个视频请求视为一个流水线选择问题 首先选择正确的流水线,然后读取清单,然后读取阶段技能,然后使用工具。
添加 API Key(可选——更多 key = 更多工具)
# .env — 每个 key 都是可选的,添加你拥有的
# 图片 + 视频网关:
FAL_KEY=your-key # FLUX 图片 + Google Veo、Kling、MiniMax 视频 + Recraft 图片
# 免费素材库:
PEXELS_API_KEY=your-key # 免费素材视频和图片
PIXABAY_API_KEY=your-key # 免费素材视频和图片
UNSPLASH_ACCESS_KEY=your-key # 免费素材图片
# 音乐:
SUNO_API_KEY=your-key # 完整歌曲、器乐、任何流派
# 语音和图片:
ELEVENLABS_API_KEY=your-key # 高级 TTS、AI 音乐、音效
OPENAI_API_KEY=your-key # OpenAI TTS、DALL-E 3 图片
XAI_API_KEY=your-key # xAI Grok 图片编辑/生成 + Grok 视频生成
GOOGLE_API_KEY=your-key # Google Imagen 图片、Google TTS(700+ 种声音)
# 更多视频提供商:
HEYGEN_API_KEY=your-key # HeyGen — 通过单一网关访问 VEO、Sora、Runway、Kling
RUNWAY_API_KEY=your-key # Runway Gen-4 直连
make install-gpu
# 然后添加到 .env:
VIDEO_GEN_LOCAL_ENABLED=true
VIDEO_GEN_LOCAL_MODEL=wan2.1-1.3b # 或 wan2.1-14b、hunyuan-1.5、ltx2-local、cogvideo-5b
零 API Key 你能得到什么
你不需要付费 API key 来制作真正的视频。开箱即用,make setup 为你提供:
| 能力 | 免费工具 | 功能 |
|---|---|---|
| 旁白 | Piper TTS | 免费离线文本转语音——听起来像真人的旁白 |
| 开放素材 | Archive.org + NASA + Wikimedia Commons | 免费/开放档案素材、教育媒体和纪录片质感 |
| 额外素材库 | Pexels + Unsplash + Pixabay | 免费素材视频/图片(开发者 key 免费获取) |
| 合成 (React) | Remotion | 基于 React 的渲染——弹簧动画图片场景、文字卡片、统计卡片、图表、TikTok 风格逐字字幕、TalkingHead |
| 合成 (HTML/GSAP) | HyperFrames | HTML/CSS/GSAP 渲染——动态排版、产品宣传片、发布短片、注册表块、网站转视频、绑定 SVG 角色动画 |
| 后期制作 | FFmpeg | 编码、字幕烧录、音频混音、调色 |
| 字幕 | 内置 | 自动生成带逐字时间戳的字幕 |
OpenMontage 在提案阶段在 Remotion 和 HyperFrames 之间进行选择(锁定为 render_runtime)。Remotion 是数据驱动讲解视频和使用现有 React 场景堆栈的任何内容的默认选择;HyperFrames 是重度动态图形简报的默认选择,这些简报自然地表达为 HTML + GSAP,包括 character-animation 流水线的 SVG/GSAP 骨骼输出。完整的决策矩阵见 skills/core/hyperframes.md。
两条近乎免费的路径:
- 基于图片的视频: Piper 为你的脚本配音,图片提供视觉效果,Remotion 将它们动画化为精美的剪辑。
- 本地角色动画: SVG 骨骼、姿势库、GSAP 时间线和 HyperFrames 将卡通角色表演渲染到
projects/<project-name>/renders/final.mp4。 - 真实素材视频: 纪录片蒙太奇流水线从 Archive.org、NASA、Wikimedia Commons 以及可选的免费 key 来源(如 Pexels 和 Unsplash)构建一个 CLIP 可搜索的语料库,然后将真实的运动素材剪辑成一个完整的视频。
如果你想要第二种,请提示纪录片蒙太奇、音画诗或素材库拼贴,并明确说明仅使用真实素材。
试试这些提示词
设置完成后,将以下任意一条复制到你的 AI 编码助手中。每条都会运行一个完整的制作流水线。
从参考视频开始
"这里有一个我喜欢的 YouTube Short。帮我做一个类似的,但主题是为高中生讲解 CRISPR。"
"分析这个 Reel,给我 3 个我可以用在自己的产品发布上的原创变体。"
"我喜欢这个视频的节奏和钩子。保持那种能量,但把它变成一个 45 秒的关于黑洞的讲解视频。"
无需任何 key
"制作一个 45 秒的动画讲解视频,解释为什么天空是蓝色的"
"创建一个 60 秒的关于互联网历史的视频,带旁白和字幕"
"制作一个数据驱动的讲解视频,关于世界各地的咖啡消费"
免费真实素材纪录片路径
"制作一个 90 秒的纪录片蒙太奇,关于凌晨 4 点的城市感觉。仅使用真实素材,无旁白,哀婉的基调。"
"创建一个 60 秒的亚当·柯蒂斯风格的档案拼贴,关于 1950 年代的消费乐观主义。优先使用 Archive.org 和 Wikimedia 的素材。"
"仅使用真实素材库剪辑一个梦幻般的蒙太奇,关于在雨中回家。有音乐,无旁白。"
配置了图片/视频提供商(约 $0.15–$1.50)
"创建一个 30 秒的吉卜力风格动画视频,关于金色时刻云层中的魔法漂浮图书馆"
"制作一个 30 秒的动漫风格动画,关于一个带有生物发光珊瑚和古代遗迹的水下神庙"
"创建一个动画讲解视频,解释 CRISPR 基因编辑是如何工作的,使用 AI 生成的视觉效果"
"为一个名为 AquaPulse 的虚构智能水瓶制作一个产品发布预告片"
完整设置(约 $1–$3)
"创建一个电影级的 30 秒预告片,用于一个科幻概念:人类收到来自 1000 年后的警告"
"制作一个 90 秒的动画讲解视频,为中学生讲解量子计算,使用有趣的旁白声音和自定义配乐"
想要更多?请查看完整的 提示词画廊,了解经过测试的提示词及其预期成本和输出示例,或运行 make demo 立即渲染零 key 演示视频。
流水线
每条流水线都是一个完整的制作工作流,从创意到完成视频。
| 流水线 | 产出 | 最佳用途 |
|---|---|---|
| 动画讲解 | 带调研、旁白、视觉效果、音乐的 AI 生成讲解视频 | 教育内容、教程、主题分解 |
| 动画 | 动态图形、动态排版、动画序列 | 社交媒体、产品演示、抽象概念 |
| 虚拟形象发言人 | 虚拟形象驱动的演示者视频 | 企业沟通、培训、公告 |
| 电影级 | 预告片、宣传片和情绪驱动的剪辑 | 品牌影片、预告片、推广内容 |
| 片段工厂 | 从一个长源视频批量生成排名后的短视频片段 | 将长内容重新用于社交媒体 |
| 纪录片蒙太奇 | 从 CLIP 索引的免费素材库和开放档案(Pexels、Archive.org、NASA、Wikimedia、Unsplash)中剪辑的主题蒙太奇 | 视频论文、情绪片段、检索优先的 B-roll 剪辑、无需付费生成 API 的真实素材视频 |
| 混合 | 源素材 + AI 生成的支持性视觉效果 | 用图形增强现有素材 |
| 本地化与配音 | 为现有视频添加字幕、配音和翻译 | 多语言分发 |
| 播客再利用 | 将播客精彩片段转为视频 | 播客营销、音频图视频 |
| 屏幕演示 | 精美的软件屏幕录制和操作指南 | 产品演示、教程、文档 |
| 人物出镜 | 素材主导的演讲者视频 | 演示、视频博客、访谈 |
每条流水线都遵循相同的结构化流程:
调研 -> 提案 -> 脚本 -> 场景规划 -> 素材 -> 剪辑 -> 合成
每个阶段都有一个专门的导演技能——一个 Markdown 指令文件,精确地教智能体如何执行该阶段。智能体读取技能,使用工具,进行自我审查,检查点状态,并在创意决策点请求人工批准。
网络调研是一个头等阶段。 在编写脚本的任何一个字之前,智能体会搜索 YouTube、Reddit、Hacker News、新闻网站和学术来源。它收集数据点、观众问题、流行角度和视觉参考——然后将所有内容引用在一个结构化的调研简报中。你的视频基于真实、当前的信息,而不是幻觉事实。
为什么选择 OpenMontage?
大多数 AI 视频工具只给你一个来自提示词的片段。OpenMontage 给你一个端到端的制作流水线——与真实制作团队遵循的相同结构化流程,由你的 AI 智能体自动化。
大多数“免费 AI 视频”堆栈悄悄地意味着“让静态图片动起来”。OpenMontage 也可以做到这一点,但它还可以从真实素材中构建一个完整的视频,这些素材来自免费/开放来源,经过语义排序,有意剪辑,并作为适当的时间线渲染。
编辑你自己的出镜素材。从头开始生成一个完全动画化的讲解视频。将一个 2 小时的播客剪辑成十几个社交媒体片段。将你的内容翻译和配音成 10 种语言。从素材库和 AI 生成的场景中构建一个电影级的品牌预告片。如果一个制作团队能制作它,OpenMontage 就能编排它。
- 12 条制作流水线——讲解视频、出镜人物、屏幕演示、电影预告片、动画、播客、本地化、纪录片蒙太奇等
- 52 个制作工具——涵盖视频生成、图片创建、文本转语音、音乐、音频混音、字幕、增强和分析
- 400+ 智能体技能——制作技能、流水线导演、创意技巧、质量检查清单和深度技术知识包,教智能体像专家一样使用每个工具
- 参考驱动创作——粘贴你喜欢的视频,智能体将其转化为一个扎实、差异化的制作计划,而不是强迫你从零开始发明完美的提示词
- 无需付费视频模型的真实素材纪录片创作——从免费/开放的运动素材和档案来源构建实际的剪辑视频,而不仅仅是在图片上做 Ken Burns 效果
- 内置实时网络调研——在编写脚本的任何一个字之前,智能体在 YouTube、Reddit、新闻网站和学术来源上运行 15-25+ 次网络搜索,以将你的视频建立在真实、当前的数据之上
- 同时支持免费/本地和云提供商——每个能力都支持开源本地替代方案以及高级 API。使用你拥有的任何东西。
- 无供应商锁定——自由切换提供商。评分选择器在 7 个维度(任务适配度、输出质量、控制力、可靠性、成本效率、延迟、连续性)上对每个提供商进行排名,并自动选择最佳匹配。
- 制作级质量门——交付承诺执行阻止幻灯片式的渲染,预合成验证在浪费 GPU 时间之前捕获有缺陷的计划,强制性的渲染后自我审查(ffprobe + 帧提取 + 音频分析)确保智能体永远不会呈现垃圾内容。每个提供商选择、风格决策和回退都记录在可审计的决策轨迹中。
- 内置预算治理——执行前成本估算、支出上限、每个操作的批准阈值。没有意外账单。
工作原理
OpenMontage 使用智能体优先架构。没有代码编排器。你的 AI 编码助手就是编排器。
你: "制作一个关于黑洞如何形成的讲解视频"
|
v
智能体读取流水线清单 (YAML) -- 阶段、工具、审查标准、成功门
|
v
智能体读取阶段导演技能 (Markdown) -- 如何执行每个阶段
|
v
智能体调用 Python 工具 -- 评分提供商选择在 7 个维度上对每个工具进行排名
|
v
智能体使用审查技能进行自我审查 -- 模式验证、剧本合规性、质量检查
|
v
智能体检查点状态 (JSON) -- 可恢复,带决策日志和成本快照
|
v
智能体提交给你批准 -- 你在每个创意决策点保持控制
|
v
预合成验证门 -- 交付承诺、幻灯片风险、渲染器治理
|
v
渲染 (Remotion 或 FFmpeg) -- 与视觉语法匹配的合成引擎
|
v
渲染后自我审查 -- ffprobe、帧提取、音频分析、承诺验证
|
v
最终视频输出 -- 仅当自我审查通过时
Python 提供工具和持久性。 所有创意决策、编排逻辑、审查标准和质量标准都存在于可读的指令文件(YAML 清单 + Markdown 技能)中,你可以检查和自定义。每个决策都记录了考虑的替代方案、置信度分数以及每个选择背后的推理。
架构
OpenMontage/
├── tools/ # 48 个 Python 工具(智能体的手)
│ ├── video/ # 13 个视频生成工具 + 合成、拼接、修剪
│ ├── audio/ # 4 个 TTS 提供商 + Suno/ElevenLabs 音乐、混音、增强
│ ├── graphics/ # 9 个图片/图形生成工具 + 图表、代码片段、数学
│ ├── enhancement/ # 放大、去背景、面部增强、调色
│ ├── analysis/ # 转录、场景检测、帧采样
│ ├── avatar/ # 出镜人物、唇形同步
│ └── subtitle/ # SRT/VTT 生成
│
├── pipeline_defs/ # YAML 流水线清单(智能体的剧本)
├── skills/ # Markdown 技能文件(智能体的知识)
│ ├── pipelines/ # 每个流水线的阶段导演技能
│ ├── creative/ # 创意技巧技能
│ ├── core/ # 核心工具技能
│ └── meta/ # 审查者、检查点协议
│
├── schemas/ # 15 个 JSON Schema(契约验证)
├── styles/ # 视觉风格剧本 (YAML)
├── remotion-composer/ # React/Remotion 视频合成引擎
├── lib/ # 核心基础设施(配置、检查点、流水线加载器)
└── tests/ # 契约测试、QA 集成测试、评估框架
三层知识架构
Layer 1: tools/ + pipeline_defs/ "存在什么" — 可执行能力 + 编排
Layer 2: skills/ "如何使用" — OpenMontage 约定和质量标准
Layer 3: .agents/skills/ "工作原理" — 外部技术知识包
每个工具声明它依赖哪些 Layer 3 技能。智能体读取 Layer 1 以了解有什么可用,读取 Layer 2 以了解 OpenMontage 希望如何使用它,并在需要时读取 Layer 3 以获取深入的技术知识。
支持的提供商
包含定价和免费层的完整设置指南:
docs/PROVIDERS.md
| 提供商 | 类型 | 备注 |
|---|---|---|
| Kling | 云 API | 高质量,快速 |
| Runway Gen-4 | 云 API | 电影级质量,Gen-3 Alpha Turbo / Gen-4 Turbo / Gen-4 Aleph |
| Google Veo 3 | 云 API | 长格式,电影级。通过 fal.ai 或 HeyGen。 |
| Grok Imagine Video | 云 API | 强大的参考图片视频和 xAI 原生短视频生成 |
| Higgsfield | 云 API | 多模型编排器,带 Soul ID 以实现角色一致性 |
| MiniMax | 云 API | 成本效益高 |
| HeyGen | 云 API | 多模型网关 |
| WAN 2.1 | 本地 GPU | 免费,1.3B 和 14B 变体 |
| Hunyuan | 本地 GPU | 免费,高质量 |
| CogVideo | 本地 GPU | 免费,2B 和 5B 变体 |
| LTX-Video | 本地 GPU / Modal | 本地免费,或自托管云 |
| Pexels | 素材库 | 免费素材视频 |
| Pixabay | 素材库 | 免费素材视频 |
| Wikimedia Commons | 素材库 | 免费/开放素材视频和档案视频 |
| 提供商 | 类型 | 备注 |
|---|---|---|
| FLUX | 云 API | 最先进的质量 |
| Google Imagen | 云 API | Imagen 4 — 高质量,多种宽高比 |
| Grok Imagine Image | 云 API | 强大的图片编辑、风格迁移和多图合成 |
| DALL-E 3 | 云 API | OpenAI 的图片模型 |
| Recraft | 云 API | 面向设计的生成 |
| Local Diffusion | 本地 GPU | Stable Diffusion,免费 |
| Pexels | 素材库 | 免费素材图片 |
| Pixabay | 素材库 | 免费素材图片 |
| Unsplash | 素材库 | 免费素材图片 |
| ManimCE | 本地 | 数学动画 |
| 提供商 | 类型 | 备注 |
|---|---|---|
| ElevenLabs | 云 API | 高级语音质量 |
| Google TTS | 云 API | 700+ 种声音,50+ 种语言——最适合本地化 |
| OpenAI TTS | 云 API | 快速,价格实惠 |
| Piper | 本地 | 完全免费,离线 |
音乐与音效:
| 提供商 | 类型 | 备注 |
|---|---|---|
| Suno AI | 云 API | 完整歌曲生成,带人声、歌词、任何流派。最长 8 分钟。 |
| ElevenLabs Music | 云 API | AI 音乐生成 |
| ElevenLabs SFX | 云 API | 音效生成 |
后期制作(始终可用,始终免费):
| 工具 | 功能 |
|---|---|
| FFmpeg | 视频合成、编码、字幕烧录、音频混流 |
| Video Stitch | 多片段组装、交叉淡入淡出、画中画、空间布局 |
| Video Trimmer | 精确剪切和提取 |
| Audio Mixer | 多轨混音、闪避、淡入淡出 |
| Audio Enhance | 降噪、归一化 |
| Color Grade | 基于 LUT 的调色 |
| Subtitle Gen | 从时间戳生成 SRT/VTT |
增强:
| 工具 | 功能 |
|---|---|
| Upscale | Real-ESRGAN 图片/视频放大 |
| Background Remove | rembg / U2Net 去背景 |
| Face Enhance | 面部质量增强 |
| Face Restore | CodeFormer / GFPGAN 面部修复 |
分析:
| 工具 | 功能 |
|---|---|
| Transcriber | WhisperX 语音转文本,带逐字时间戳 |
| Scene Detect | 自动场景边界检测 |
| Frame Sampler | 智能帧提取 |
| Video Understand | CLIP/BLIP-2 视觉语言分析 |
虚拟形象与唇形同步:
| 工具 | 功能 |
|---|---|
| Talking Head | SadTalker / MuseTalk 虚拟形象动画 |
| Lip Sync | Wav2Lip 音频驱动的唇形同步 |
合成与渲染:
| 引擎 | 类型 | 功能 |
|---|---|---|
| Remotion | 本地 (Node.js) | 基于 React 的程序化视频——弹簧动画图片场景、统计揭示、章节标题、英雄卡片、TikTok 风格逐字字幕、场景过渡(淡入淡出/滑动/擦除/翻转)、Google Fonts、带淡入淡出曲线的音频,以及 TalkingHead 虚拟形象合成。当没有配置视频生成提供商时,智能体会生成静态图片,Remotion 将它们转化为完全动画化的视频。 |
| HyperFrames | 本地 (Node.js ≥ 22) | HTML/CSS/GSAP 程序化视频——动态排版、产品宣传片、发布短片、自定义动态图形、注册表块(数据图表、颗粒叠加、着色器过渡)、网站转视频工作流,以及绑定 SVG 角色动画。通过 npx hyperframes 使用;无需 monorepo 检出。 |
| FFmpeg | 本地 | 核心视频组装、编码、字幕烧录、音频混流、调色 |
运行时在提案阶段选择(render_runtime)并通过 edit_decisions 锁定。运行时之间的静默切换是治理违规——见 skills/core/hyperframes.md。
风格系统
风格剧本定义了你的制作的视觉语言:
| 剧本 | 最佳用途 |
|---|---|
| Clean Professional | 企业、教育、SaaS |
| Flat Motion Graphics | 社交媒体、TikTok、初创公司 |
| Minimalist Diagram | 技术深度剖析、架构 |
剧本控制排版、调色板、运动风格、音频配置和质量规则。智能体读取剧本并一致地应用于所有生成的素材。
平台输出配置
为每个主要平台内置的渲染配置:
| 配置 | 分辨率 | 宽高比 |
|---|---|---|
| YouTube Landscape | 1920x1080 | 16:9 |
| YouTube 4K | 3840x2160 | 16:9 |
| YouTube Shorts | 1080x1920 | 9:16 |
| Instagram Reels | 1080x1920 | 9:16 |
| Instagram Feed | 1080x1080 | 1:1 |
| TikTok | 1080x1920 | 9:16 |
| 1920x1080 | 16:9 | |
| Cinematic | 2560x1080 | 21:9 |
制作治理
OpenMontage 将视频制作视为真正的工程——在每个阶段都有质量门、审计轨迹和执行。
质量门
- 预合成验证——如果交付承诺被违反(例如,80% 静态图片的“运动主导”视频)、幻灯片风险评分为严重、或缺少渲染器系列,则阻止渲染。在浪费 GPU 时间之前捕获有缺陷的计划。
- 渲染后自我审查——每次渲染后,运行时运行 ffprobe 验证,在 4 个位置提取帧以检查黑帧和损坏的叠加层,分析音频电平以检查静音和削波,验证交付承诺是否得到遵守,并检查字幕是否存在。如果审查失败,则不呈现视频。
- 幻灯片风险评分——6 维度分析(重复、装饰性视觉、弱运动、镜头意图、过度依赖排版、不支持的电影级声明)防止“动画化 PowerPoint”输出。
- 源媒体检查——当用户提供自己的素材时,系统探测每个文件(分辨率、编解码器、音频通道、时长),并在做出任何创意决策之前构建规划影响。不会根据文件名幻觉内容。
评分提供商选择
每个工具选择(视频生成、图片生成、TTS、音乐)都通过一个 7 维度评分引擎运行:任务适配度(30%)、输出质量(20%)、控制功能(15%)、可靠性(15%)、成本效率(10%)、延迟(5%)、连续性(5%)。获胜的提供商及其分数与所有考虑的替代方案一起记录在决策轨迹中。
选择器在评分前会规范化松散的简报上下文。如果智能体只知道类似“皮克斯风格的动画短片,角色一致”这样的信息,选择器会将其扩展为评分器友好的意图和风格信号,而不是要求一个完美预成型的 task_context。
选择器输出还会显示所选提供商的 agent_skills,以便智能体在编写提示词之前立即读取正确的 Layer 3 提供商技能。
决策审计轨迹
每个主要的创意和技术选择——提供商选择、风格/剧本选择、音乐曲目、声音选择、渲染器系列、任何回退或降级——都记录了考虑的替代方案、置信度分数和推理。累积的决策日志在所有阶段持续存在,因此你可以精确追溯输出为何看起来如此。
预算控制
- 执行前估算——查看将花费多少
- 预留预算——在调用前锁定资金
- 调用后对账——记录实际支出
- 可配置模式——
observe(仅跟踪)、warn(记录超支)、cap(硬限制) - 每个操作批准——超过阈值时暂停确认(默认:$0.50)
- 总预算上限——默认 $10,完全可配置
没有意外账单。智能体在花钱之前会告诉你将花费多少。
智能体兼容性
OpenMontage 适用于任何能读取文件并执行 Python 的 AI 编码助手。包含针对以下平台的专用指令文件:
| 平台 | 配置文件 |
|---|---|
| Claude Code | CLAUDE.md |
| Cursor | CURSOR.md + .cursor/rules/ |
| GitHub Copilot | COPILOT.md + .github/copilot-instructions.md |
| Codex | CODEX.md |
| Windsurf | .windsurfrules |
所有平台文件都指向共享的 AGENT_GUIDE.md(操作指南和智能体契约)和 PROJECT_CONTEXT.md(架构参考)。
即将推出: 通过 Ollama 和 LM Studio 支持本地 LLM——无需任何云 LLM 即可运行完整的制作流水线。
贡献
OpenMontage 旨在易于扩展。两种最常见的贡献方式:
添加新工具
- 在相应的
tools/子目录中创建一个 Python 文件 - 继承
BaseTool并实现工具契约 - 注册表会自动发现它——无需手动注册
- 如果工具需要使用指导,添加一个技能文件
添加新流水线
- 在
pipeline_defs/中创建一个 YAML 清单 - 在
skills/pipelines/<your-pipeline>/中创建阶段导演技能 - 引用现有工具——或根据需要添加新工具
完整的技术参考见 docs/ARCHITECTURE.md,完整的提供商指南(设置、定价、免费层)见 docs/PROVIDERS.md,智能体契约见 AGENT_GUIDE.md。
加入社区
我们使用 GitHub Discussions 来分享工作和想法:
做了很酷的东西?在展示与讲述中发布——我们很乐意看到你构建了什么。
联系方式
有关更新、发布和幕后构建笔记,请关注 @calesthioailabs。
有关错误、功能请求和工作流讨论,请使用 GitHub Issues 和 GitHub Discussions,以便所有内容保持可见和可操作。
测试
# 运行契约测试(无需 API key)
make test-contracts
# 运行所有测试
make test
许可证
GNU AGPLv3
OpenMontage —— 具有真正质量执行的制作级视频,由你的 AI 助手编排。
如果这个项目对你有用,一个 star 将意义重大——它也能帮助其他人发现它。