探索崩溃: 代理机制收敛到固定策略,失去了新行为的发现

作者: Finanzgoblin创建于 2026年2月13日更新于 2026年8月25日
标签enhancementv0.x

问题

Agent Lightning 的训练循环 (RL、SFT、提示优化) 朝着奖励信号优化。这对于具有稳定奖励地形的任务来说效果很好,但引入了结构性风险:训练的代理丧失了发现不在奖励信号中表示的新行为的能力。

内容来源: microsoft/agent-lightning