Macaron-V1:迈向具备自我改进与LoRA混合的开放持续学习
Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
来自 Mind Lab
摘要
Macaron-V1是一个面向体验智能的开放智能体模型家族,其核心在于从真实环境中学习经验,并在部署后持续学习。该系统围绕两个系统目标进行组织。适应性通过版本化模型-测试平台对的递归改进来实现,其中来自某一配置的经验在外部契约下进行评估,并用于构建其后续版本。协作则通过Mixture-of-LoRA(MoL)架构实现,该架构冻结基础模型,组合专家LoRA适配器,并在每个用户轮次中选择一个LoRA。旗舰模型Macaron-V1-Venti结合了744B GLM-5.2基础模型与四个用于聊天、智能体、编码和GenUI的LoRA;基于Qwen3.6的Macaron-V1-Tall(50B)采用相同设计用于本地部署。
本报告将Macaron-V1呈现为一个涵盖架构、算法和基础设施的协同设计系统。MoL架构通过可扩展的LoRA专家支持持续学习。算法结合了模型-测试平台协同设计与递归自我改进循环,包括UI4A组件原生GenUI测试平台、有状态动作基底、版本化HCP契约,以及智能体强化学习框架MindForge。支撑基础设施包括后训练平台MinT、长上下文强化学习方法LongStraw,以及针对稀疏MoE和DSA基础模型的稳定性技术。
我们在个人智能、GenUI和通用能力基准上,将Macaron-V1与前沿基线进行了评估。结果验证了当前系统的有效性,而持续学习和集体智能带来的复合增益仍是待解问题。
译自 Hugging Face · Daily Papers · arXiv:2608.09819 · 录于 二〇二六年八月十一日