AutumnVerse
V2EX  ›  问与答

大哥们,多模态大模型,能给个对比吗?

  •  
  •   AutumnVerse · 17h 24m ago · 1141 views
    让 ai 监控画面,然后自动执行处理,7*24 运行,哪家比较合适?另外不能太慢,那 chatgpt5.6 sol 跑了一天,效果挺不错的,但是太慢了,一次请求要 10s 左右,延长太高经常出问题。

    以前在 v 站看到一个模型对比表格,列出了各个模型的参数量、价格、跑分,但是现在搜不出来了,哪个大哥能再给一个吗
    25 replies    2026-09-08 00:57:04 +08:00
    clemente
        1
    clemente  
       15h 9m ago
    哥们 NASA 都不敢这么用
    AutumnVerse
        2
    AutumnVerse  
    OP
       13h 19m ago via iPhone
    @clemente ?有啥问题吗?成本太高?

    sol 跑了一天,几千块钱成本而已,也可能是 sol 太慢了,10 秒左右才返回一次。
    ruanimal
        3
    ruanimal  
       12h 49m ago
    一天几千块而已。。
    clemente
        4
    clemente  
       12h 49m ago
    @AutumnVerse 首先多模态的模型不是干监控的。99%的多模态就是 画面描述器的胶水模型 和 LLM 投影沾到一起的

    我不知道你实际的工作需求,如果能走 cli 还是尽可能走 cli 或者 headless
    wizChen
        5
    wizChen  
       11h 39m ago
    这种本地部署比较好吧
    Nasdaq
        6
    Nasdaq  
       11h 37m ago
    这,OP 拿一张监控画面跑一下看看成本,要是 24 小时非常夸张的。。。
    AutumnVerse
        7
    AutumnVerse  
    OP
       11h 29m ago via iPhone
    就是拿来跑监控的,把图片压缩到 480p ,token 消耗还行,唯一问题是 sol 太慢了,处理一帧要 10s ,取下一帧的时候已经过了 10 多秒了,这期间如果出现异常又消失了,ai 就监控不到了。

    成本那是老板考虑的,我知道 yolo ,也知道传统的 opencv 里面的算法,但是你用那些算法做出来,老板怎么给投资人吹牛逼,你连大模型都没用上,谁给你投资。
    @Nasdaq
    @ruanimal
    AutumnVerse
        8
    AutumnVerse  
    OP
       11h 24m ago
    @clemente 现在是写了一个程序,把相关画面抽帧给 ai ,让 ai 发现某些事件,调用对应的 function 处理。

    主要问题是 sol 太慢了,导致抽帧非常少,两帧中间的内容就丢掉了。尝试了 gemini flash 3.8 ,看统计也要 4s 左右一次,也没快多少。
    Nasdaq
        9
    Nasdaq  
       11h 22m ago
    @AutumnVerse #7 这是我一个类似项目用 gemini-3.7-flash 做图片理解(仅供参考),图片分辨率大概 1080p 左右

    Routing 197ms
    Google 2.6s
    Generation 8.5s
    Total 11.3s

    Cost $0.00632
    Throughput 179.0tok/s
    xujinkai
        10
    xujinkai  
       11h 18m ago via Android
    并发呗,真有钱🤣
    AutumnVerse
        11
    AutumnVerse  
    OP
       11h 16m ago via iPhone
    @Nasdaq 那跟我测试差不多,我用的 480p 会快一点。但是总耗时也要 4s 左右。
    tim9527
        12
    tim9527  
       11h 15m ago
    想想就好贵,家底富裕啊
    clemente
        13
    clemente  
       11h 15m ago
    @AutumnVerse 我 6 年前做过类似的,我做的是检测+跟踪。我的方法是帧不变走缓存,帧变了走识别那一套逻辑,但是有一点因为设备计算能力达不到实时,所以我加了异步队列和跳帧方法,这样能保证所有事件捕捉+某个场景能同步到实时
    cvooc
        14
    cvooc  
       11h 14m ago
    误闯天家系列, 没这么用过...
    wysnxzm
        15
    wysnxzm  
       11h 11m ago
    做异步,延迟 10s 而已不会漏数据
    winterx
        16
    winterx  
       11h 7m ago
    你需要的是视频算法而不是 AI ,当然 AI 也能干这事就是太烧钱了
    如果成本受限可以考虑海康、商汤或者旷视
    AutumnVerse
        17
    AutumnVerse  
    OP
       11h 2m ago via iPhone
    @cvooc
    @tim9527 做 cv 算法的工程师,一个月也得三四万,这一套下来,两三个人也得十来万了,这钱拿来买 token ,我觉得是帮公司省钱了。而且招人也要时间,开发也要时间,改 bug 也要时间。

    几天时间能跑通业务,完成商业验证,简直赚麻了。
    la9998372
        18
    la9998372  
       10h 56m ago
    你是啥场景啊?非要用大模型来做?
    现在的 qwen3.8flash 和 glm5.3flash 都支持多模态了,应该性价比和性能都挺不错吧
    cvooc
        19
    cvooc  
       10h 56m ago
    @AutumnVerse #17 哪怕让 ai 写算法呢...花点钱...上肥波,上 astra... 也比直接让 ai 识别强啊...
    gpt5
        20
    gpt5  
       10h 51m ago
    我知道几家公司的主营业务就是这个。
    上百个监控全接进来,实时 ai 分析。
    AutumnVerse
        21
    AutumnVerse  
    OP
       10h 49m ago via iPhone
    @gpt5 直接上大模型还是传统的 yolo 类的小模型?
    gpt5
        22
    gpt5  
       9h 53m ago
    @AutumnVerse 本地大模型+精巧的系统设计+极限优化
    Sezxy
        23
    Sezxy  
       8h 3m ago
    本地部署 Qwen3.8-27B 是不是好点
    cyningxu
        24
    cyningxu  
       7h 57m ago via Android
    看楼主的描述是不考虑成本的,那直接异步,每秒固定往里丢个图,只是 10 秒后出判定结果而已,但这样做就不会丢数据
    fuyang3213
        25
    fuyang3213  
       3h 4m ago
    你要快,肯定是 gemini 的 flash 了,贼快。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   958 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 49ms · UTC 20:01 · PVG 04:01 · LAX 13:01 · JFK 16:01
    ♥ Do have faith in what you're doing.