最近在试一种 Agent 工作方式:少一点 LLM 来回,多一点单回合批量命令。
测试任务是一份 15 页的东亚鱿鱼料理演示,需要同时找菜谱、图片和烹饪视频,还要确认链接、资源和多屏布局都能用。
四次运行里,直接执行组平均 10 个回合、82 次工具调用; CLI 风格组平均 13.5 个回合、10.5 次调用。某个回合一次并行做了约 20 次菜谱/视频搜索,最后核对了 10 个来源、10 个不重复视频、15 个资源和 1440 / 768 / 390 三种屏幕宽度,还修掉了一个坏地址。
只有四次运行,所以这不是“任何时候都更快”的结论;耗时有快有慢,token 的统计来源也不同。真正有用的点是:让 LLM 回合做判断,让命令做可搜索、可测试、可复查的工作。
交互任务: https://turaai.net/benchmark-task?task=east-asian-squid-recipes-slides
说明:我维护 Tura 和这套 benchmark 。你们的工作流里,有哪一步适合“模型判断一次,然后批量跑可验证命令”?