Frontis-MA1:训练AI4AI模型以实现机器学习工程中的递归自我改进
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
递归自我改进(RSI)要求AI系统能够改进构建AI的过程(即AI4AI);机器学习工程(MLE)为研究这一能力提供了一个具体且可执行的测试平台。我们推出OpenMLE,一个用于MLE中RSI研究的开源全栈系统,涵盖带执行反馈的可验证任务环境(OpenMLE-Gym)、算子学习(OpenMLE-RL)以及长时程搜索(OpenMLE-Evo)。在此栈上,我们对Frontis-MA1(35B)进行后训练,使其成为MLE的元进化智能体,将后训练和推理围绕四个原子程序进化算子(Draft、Improve、Debug、Crossover)对齐:这些算子通过基于执行结果的SFT和RL训练,数据已针对所有评估基准去重,随后组合成长时程搜索,在单一循环中耦合学习与进化。在MLE-Bench Lite上,以单块RTX 4090(显存上限12 GB)每任务12小时预算,Frontis-MA1(35B)通过OpenMLE-Evo将奖牌平均值从39.39%提升至60.61%,并通过OpenMLE-Evo-Max(与基准无关的经验先验和异步搜索)达到71.21%,超过GPT-5.5 + Codex,接近GPT-5.6 Sol和2.8T的Kimi K3。在保留的NatureBench Lite上,两个组件均表现出迁移性:固定框架时,替换为训练后的模型将Match-SOTA从50%提升至70%;固定模型时,替换为OpenMLE-Evo将其从20%提升至50%。我们发布模型权重和完整OpenMLE栈,以支持面向RSI的可执行AI4AI的可复现研究。代码:https://github.com/FrontisAI/OpenRSI