当前的基准是否足以衡量研究代理人?

作者: black-yt创建于 2026年3月24日更新于 2026年3月24日

关于评估新兴的自动研究代理的问题

你好! 最近自动研究代理的兴起既令人惊讶又令人印象深刻。像 Claude Code、Codex CLI、OpenClaw 等系统正在开始展示出越来越强大的编码、推理和多步骤工具使用能力。然而,这也引起了一个根本性的问题:

内容来源: dzhng/deep-research