PipeNetwork/minimax-h3-mlx
PipeNetwork/minimax-h3-mlx
MiniMax 发布 MiniMax-H3,一个接受文本、图像、音频和视频输入并生成最长 15 秒含音频视频片段的通用全模态生成系统。PipeNetwork 将其移植为 Python 包 minimax-h3-mlx,支持 Apple Silicon。作者在 M5 Max MacBook Pro 上运行,下载约 115 GB 模型文件,视频生成耗时不到 45 分钟。生成的视频效果良好,但音频为类似语音的噪音,因未提供音频 prompt 指导。
PipeNetwork/minimax-h3-mlx MiniMax 两天前发布了 MiniMax-H3——他们将其描述为“一个通用、全模态生成系统”,实际上这意味着它能接受文本、图像、音频和视频输入,并利用这些内容生成最长 15 秒、包含音频的视频片段。这个 Python 包将其移植到 MLX,以便在 Apple Silicon 上运行。我在我的 M5 Max MacBook Pro 上成功运行了它。我克隆了仓库,并按如下方式运行模型:
首先下载模型
uvx --from huggingface_hub hf download MiniMaxAI/MiniMax-H3
--include 'FL2VA/' --exclude 'FL2VA/transformer/'
uvx --from huggingface_hub hf download pipenetwork/MiniMax-H3-MLX-8bit
然后运行 prompt
uv run --with mlx-vlm
--with-requirements requirements.txt python scripts/generate.py
"a rainbow colored skunk leaps over a mossy log in a supermarket"
-o skunk.mp4
-c ~/.cache/huggingface/hub/models--MiniMaxAI--MiniMax-H3/snapshots/fa9c8ab1eaa21c8ae25e7e40b83b2e6002f340af/FL2VA
-t ~/.cache/huggingface/hub/models--pipenetwork--MiniMax-H3-MLX-8bit/snapshots/3ac52081470b0488921c3ec3ba84a39097bf2361
以下是我针对该 prompt 生成的视频:a rainbow colored skunk leaps over a mossy log in a supermarket
您的浏览器不支持 HTML5 视频。
它下载了约 115 GB 的模型文件,视频生成耗时不到 45 分钟。视频效果令人印象深刻,但音频是奇怪的类似语音的噪音,因为我没有提供任何关于音频应如何的 prompt 指导。提示指南(我在这次实验前没有阅读)包含了大量关于如何使其正常工作的信息。
标签:ai、generative-ai、mlx、text-to-video、minimax