Macaron-V1: 不断学习自我改进和Lora的混合适应器

2026年8月24日3 次浏览来源:Dev.to阅读原文

这是一篇名为"Macaron-V1:用自我改进和混合-Lora适应器持续学习"的研究论文的平版英文论文摘要.

如果你喜欢这些分析,你可以找到更多关于AIModels.fyi的研究,或者在Twitter上跟踪我们.

冻结型号的问题 今天大多数AI系统遵循一种熟悉的模式:火车,评估,部署,然后停止.

该型号此时被锁定,作为成品而非活系统处理.

但现实世界立即开始偏离培训数据。

用户以培训过程从未预见的方式与系统互动。

出现新域.

首选项移.

试验日看来很聪明的模型随着时间推移逐渐变得不切实际.

这种冷冻在地的方法不是偶然的.

它反映了机器学习几十年来的实践.

复训以贵.

部署新版本带有风险。

持续改进生产系统的基础设施几乎不存在。

于是,各小组运送一个模型,继续前进,接受它会缓慢而不可避免地地衰变.

Macaron-V1提出了另一个问题:如果AI系统能够通过现实世界的经验不断改善自身,从部署后发生的数十亿次互动中学习,怎么办?

不是理论上,而是实际上,在生产中,与用户.

答案不是魔术。

它需要两个建筑转变。

首先,将部署视为学习过程的起步,而不是一个过程的结束.

将版本化,评价合同,反馈回路直接建入系统.

第二,停止假设 你需要重新训练你的整个模型。

取而代之的是,将一个稳定的基座冻结并组成周围的轻量级专家适配器,使系统能够在不失去基础的情况下增强能力.

重新思考部署作为一种持续学习的机会 这里的洞察力是建筑学.

马卡龙-V1没有将所部署的模型视为最终形式,而是将其作为无限链中的第一个环节.

每个版本都从现实世界的反馈中学习,根据外部质量合同进行评价,或者被提升或者被抛弃.

下一个版本纳入了经验教训。

然后循环相续.

这需要倒置团队通常如何思考生产.

生产不是停止学习的地方,而是拥有最有价值的学习信号的地方。

你的用户正在运行你能够设计的最大,最现实的实验.

每次互动都揭示出一些实际可行的东西。

挑战在于将这种混乱的信号转化为系统的改进。

这个机器是Model-Harness联合设计。

这里的"痛苦"不仅仅是推论代码 它是围绕模型的完整环境:用户如何与它互动,它可以叫什么工具,产出如何评价,反馈来自何处,成功是什么样子.

传统上,队伍把模型当作整个故事,把绳子当作管道.

Macaron-V1倒置这个.

模型和牵引装置被一起版本,一起测试,一起部署.

它们作为一个单元进化,因为它们是共同的依赖.

这有什么关系?

因为很多真实的智能都生活在被子,而不仅仅是模型的重量.

一个检索错误的上下文,格式输出差,或者不小心收集反馈的系统,不管基本模型有多聪明,都将是无用的.

Macaron-V1通过共同设计模型和取用,确保改进传播到所有用户的造型行为.

循环改进周期 实际力学是欺骗性的简单.

每个周期都遵循相同的模式:从生产中收集数据,根据合同进行评估,选择最佳的新配置,部署.

复说.

合同是关键机制。

它是一个版本,外部的规格,"更好"的意思.

并非领导牌得分或质量概念模糊,而是正式定义:用户应该能够用系统完成X,具有Y级的可靠性, in

分享