爱意满满的作品展示区。
yohjisakamoto

少一点 LLM 来回,多一点单回合命令: Agent 做调研时更靠谱的一种思路

  •  
  •   yohjisakamoto · 7h 34m ago · 585 views

    真实 15 页任务产出

    最近在试一种 Agent 工作方式:少一点 LLM 来回,多一点单回合批量命令。

    测试任务是一份 15 页的东亚鱿鱼料理演示,需要同时找菜谱、图片和烹饪视频,还要确认链接、资源和多屏布局都能用。

    四次运行里,直接执行组平均 10 个回合、82 次工具调用; CLI 风格组平均 13.5 个回合、10.5 次调用。某个回合一次并行做了约 20 次菜谱/视频搜索,最后核对了 10 个来源、10 个不重复视频、15 个资源和 1440 / 768 / 390 三种屏幕宽度,还修掉了一个坏地址。

    只有四次运行,所以这不是“任何时候都更快”的结论;耗时有快有慢,token 的统计来源也不同。真正有用的点是:让 LLM 回合做判断,让命令做可搜索、可测试、可复查的工作。

    交互任务: https://turaai.net/benchmark-task?task=east-asian-squid-recipes-slides

    原始结果: https://github.com/Tura-AI/benchmark/tree/main/results/design/east-asian-squid-recipes-slides/report-20260711-design-matrix

    说明:我维护 Tura 和这套 benchmark 。你们的工作流里,有哪一步适合“模型判断一次,然后批量跑可验证命令”?

    2 replies    2026-08-05 08:05:42 +08:00
    iintothewind
        1
    iintothewind  
       6h 5m ago
    标题和正文对不上。

    少调用和并行是两条不同的优化思路:一个靠减少交互次数,一个靠单回合批量塞活。前者省往返,后者省的是串行等待、代价是单回合决策变重。你标题要前者,正文吹后者,俩叠一块,既不省决策也不省理解——到底想优化哪头?

    感觉逻你的引流简述的逻辑有点混乱,就不想点开看了.
    yohjisakamoto
        2
    yohjisakamoto  
    OP
       4h 44m ago
    @iintothewind 一个 llm provider 交互有 5 个命令, 另外一个 5 个 llm proider 交互 每次一个命令共计也是 5 个命令。 少往返有问题吗? 另外说的根本不是并行 哥们。 这不是个优化。 如果你愿意了解可以花时间简单看一下理解下。我不觉得这说的不清楚。 前者的 CV cache 消耗了 5 次, 后者只消耗一次哥们。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3559 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 30ms · UTC 04:49 · PVG 12:49 · LAX 21:49 · JFK 00:49
    ♥ Do have faith in what you're doing.