Zetta ζ:面向自进化物理智能的高效闭环具身框架
Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
摘要
具身智能体(embodied agents)越来越多地被用于弥合端到端策略模型留下的差距。然而,智能体路径尚未在物理执行中实现闭环学习:现有框架大多仍处于开环状态,在 rollout 期间遵循固定技能,并仅在回合结束后进行反思。这种事后反思无法在执行过程中指导行为,因为物理交互要求决策以超出当前大型智能体模型能力的频率跟踪快速变化的机器人-环境状态。我们提出 Zetta,一种闭环具身框架,它在保持基础策略冻结的同时,在线演化基于代码的运行时批评者(runtime critics)和恢复技能。通过三个时间尺度分离的循环,Zetta 提供动作频率治理、rollout 级批评者-恢复提议,以及验证门控的技能更新。结合 Z-Infra(一种将智能体逻辑与异构执行资源解耦的 rollout 基础设施),Zetta 在当前 rollout 预算下在 LIBERO-Pro 和 RoboCasa 上达到最先进水平,分别取得 90.8% 和 93.6% 的成功率,并实现 11.1 倍推理加速;成功率随自我探索经验持续提升;所学技能可零样本迁移,并出现清晰的机器人“顿悟时刻”(Aha Moments)。这些结果表明,闭环框架的自我演化为可靠物理智能开辟了一条扩展路径。
译自 Hugging Face · Daily Papers · arXiv:2608.16590 · 录于 二〇二六年八月二十日