我想做的事情(使用场景)
我基于 @midscene/web/playwright 的 PlaywrightAgent 做了一个自动化 runner。用户会写一句自然语言步骤,比如:
在搜索框输入「midscene」并点击搜索
这句话会被模型规划成多个原子动作(例如 Tap → Input → Tap)后依次执行。
我的诉求是:在每一个原子动作执行完成后,都能拿到一个回调,从而可以:
在每个动作后截一张图,向前端 UI 实时推送执行进度和画面;
记录「第几个动作、动作类型、成功/失败」这样的细粒度过程,用于回放和排查问题;
在动作失败的那一刻保留现场截图。
我遇到的障碍
目前一句自然语言 aiAct() 只有在所有原子动作都执行完之后才返回,所以从外部我只能观察到整句步骤结束时的最终状态,中间每个动作发生了什么、界面变成什么样,都看不到。
希望能在「每个原子动作执行后」拿到回调,以便截图 / 推送实时进度
我想做的事情(使用场景)
我基于 @midscene/web/playwright 的 PlaywrightAgent 做了一个自动化 runner。用户会写一句自然语言步骤,比如:
在搜索框输入「midscene」并点击搜索
这句话会被模型规划成多个原子动作(例如 Tap → Input → Tap)后依次执行。
我的诉求是:在每一个原子动作执行完成后,都能拿到一个回调,从而可以:
在每个动作后截一张图,向前端 UI 实时推送执行进度和画面;
记录「第几个动作、动作类型、成功/失败」这样的细粒度过程,用于回放和排查问题;
在动作失败的那一刻保留现场截图。
我遇到的障碍
目前一句自然语言 aiAct() 只有在所有原子动作都执行完之后才返回,所以从外部我只能观察到整句步骤结束时的最终状态,中间每个动作发生了什么、界面变成什么样,都看不到。
希望能在「每个原子动作执行后」拿到回调,以便截图 / 推送实时进度