DiffusionGemma
DiffusionGemma
摘要
谷歌发布开放权重(Apache 2许可)DiffusionGemma模型(google/diffusiongemma-26B-A4B-it),NVIDIA通过NIM云API免费托管。该模型生成2,409个token耗时4.4秒,速度至少每秒500个token。此前谷歌曾短暂发布实验性Gemini Diffusion模型,运行速度为每秒857个token。
DiffusionGemma 去年五月,谷歌短暂发布了一款实验性的 Gemini Diffusion 模型。我当时试用了预览版,记录到它以每秒 857 个 token 的速度运行。这是一个令人兴奋的模型,但谷歌此后未再发布任何相关公告。如今,这项研究以最佳方式回归:作为一款新的开放权重(Apache 2 许可)Gemma 模型——google/diffusiongemma-26B-A4B-it。NVIDIA 目前正通过其 NIM 云 API 免费托管该模型。我使用该 API 生成了这只鹈鹕,根据 time uv run generate.py 的记录,返回 2,409 个 token 耗时 4.4 秒——因此速度至少为每秒 500 个 token。
来源:Hacker News
标签:google, ai, generative-ai, llms, nvidia, pelican-riding-a-bicycle, gemma, llm-release, llm-performance
译自 Simon Willison · 博客 · 录于 二〇二六年八月二十六日