#2794·midscene

希望在"每个原子操作执行后"接收回调,以便拍摄屏幕截图/推送实时进度。

作者: hallooyo创建于 2026年7月14日更新于 2026年7月29日

我想做的事情(使用场景) 我基于 @midscene/web/playwright 的 PlaywrightAgent 编写了一个自动化 runner。用户会写一句自然语言步骤,例如: 在搜索框中输入「midscene」并点击搜索。这句话会被模型规划成多个原子动作(例如 Tap → Input → Tap),然后依次执行。 我的诉求是: 在每个原子动作执行完成后,都能获得一个回调,从而可以: 在每个动作后截一张图片,向前端 UI 实时推送执行进度和画面; 记录「第几个动作、动作类型、成功/失败」等细粒度过程,用于回放和排查问题; 在动作失败的那一刻保留现场截图。 我遇到的障碍 目前一句自然语言 aiAct() 只有在所有原子动作都执行完之后才返回,因此从外部我只能观察到整句步骤结束时的最终状态,中间每个动作发生了什么、界面变成什么样,都看不到。 我希望能在「每个原子动作执行后」获得回调,以便截图 / 推送实时进度。

内容来源: web-infra-dev/midscene