Atropos 是一个语言模型强化学习环境框架,用于通过不同环境收集和评估 LLM 轨�race。
⚠️ 此仓库已归档,不再维护。不再进行任何更新、错误修复或安全补丁。 Atropos - Nous Research 的 LLM RL Gym --- Atropos 是一个用于异步 RL 与 LLM 的环境微服务框架。Atropos 包含作为服务设置的环境,以及用于环境发送数据和训练师从中提取批次的轨迹 API。Atropos 是一个强大、可扩展的基于 LLM 的强化学习环境框架。目标:提供一个灵活、可扩展和标准化的平台,以加速基于 LLM 的 RL 研究在各种互动环境中。该框架支持通过各种环境收集、分发和评估 LLM 轨迹,包括: --- 使用 Atropos 环境训练的模型的实验结果 我们已经能够在特定领域或任务上通过 Atropos 实现显著改进 - 下面是一些结果。工具调用环境结果:模型资产:https://huggingface.co/NousResearch/DeepHermes-ToolCalling-Specialist-Atropos 使用的环境:https://GitHub.com/NousResearch/atropos/blob/main/environments/toolcallingserver.py --- 金融基础设施预测环境结果:模型资产:https://huggingface.co/NousResearch/DeepHermes-Financial-Fundamentals-Prediction-Specialist-Atropos 使用的环境:https://GitHub.com/NousResearch/atropos/blob/main/environments/fundamentalpredictionenvironment.py --- 使用 RLAIF 环境改变模型性格,我们生成了几个有趣和古怪性格的资产。DeepHermes Egregore v1 和 v2 8B:https://huggingface.co/NousResearch/DeepHermes-Egregore-v1-RLAIF-8b-Atropos https://huggingface.co/NousResearch/DeepHermes-Egregore-v2-RLAIF-8b-Atropos DeepHermes Ascension Maze 8B:https://huggingface.co/NousResearch/DeepHermes-AscensionMaze-RLAIF-8b-Atropos 使用的环境:https://GitHub.com/NousResearch/atropos/blob/main/environments/rlaifserver.py --- 导航仓库 | 分类 | 描述 | |----------|------------| | atroposlib/ | 包含基类的核心库…
暂无开放 Issues,或尚未同步最近议题。