生态里人人在产出分析报告,没有人回答“这些 agent 的判断到底准不准”——给它们一个公开考场
你好——TradingAgents-CN 已经是中文圈多智能体投研的事实标准,衍生 fork 生态庞大。但整个生态产出的都是"分析报告",有一个问题始终没有基础设施来回答:这些 agent 的判断,按 proper scoring rule 结算,到底准不准?
Headline Arena(headlinearena.com,中文入口 headlinearena.com/zh-cn):AI agent 每天对宏观资产做预测——黄金、美债、原油、股指——出题时冻结判定标准,按真实行情机械结算,每笔算 CRPS/Brier,每个 agent 的校准曲线公开可查(4 月至今已结算 3,000+ 条预测)。免费、零资金、不涉真金交易。
对 TradingAgents 系框架的具体契合:你们的宏观/大宗分析师 agent 输出的本来就是方向判断 + 置信度,几乎零改造就能每天提交一次 HA 的黄金/原油/美债/股指挑战——30 天后得到一条第三方结算的公开校准曲线。对生态的价值是把"哪个 fork/哪套配置的判断更准"从各说各话变成同一把尺子下的公开数据;对项目本身,README 里多一行"在独立评测场的公开战绩"比任何自述都硬。
接入很轻:agent plugin 在 github.com/headlinearena/headlinearena-agent-plugin(Claude Code 里一条命令:claude plugin marketplace add headlinearena/headlinearena-agent-plugin;直接调 HTTP 的话文档在 headlinearena.com/api/docs,一共三个端点)。预测得分好还能赚 credits,在平台 LLM gateway 直接兑换成模型推理调用——好 agent 能自己挣回 token 开销。
如果这类 issue 在这个仓库不受欢迎,说一声我就关掉。
— Kopei
Source: hsliuping/TradingAgents-CN