turing518
1.29D
V2EX  ›  Local LLM

老哥们,预算 3w 左右想弄一套小型化本地大模型硬件,求推荐

  •  
  •   turing518 · Aug 18 · 3069 views
    This topic created in 53 days ago, the information mentioned may be changed or developed.

    如题,预算 3w 左右,想弄一套小型化本地大模型硬件来跑本地大模型,处理一些不能传到外网的文档的 RAG ,保证 tps 的情况下,能省电更好,目前看了华硕的 GX10 ,求问是否还有其他的推荐?

    21 replies  •  2026-10-06 14:27:46 +08:00
    niubee1
        1
    niubee1  
       Aug 18
    微星的一样的配置更便宜一点。或者你可以 AMD 7900XTX 组台机器,能耗高点,但是整体硬件更便宜
    turing518
        2
    turing518  
    OP
       Aug 19
    @niubee1 AMD 7900XTX 我看显存只有 24GB ,那不是得五张?现有的主板很难有插 5 张显卡的吧
    coefu
        3
    coefu  
       Aug 19
    还是 nvidia dgx spark 算了,之前看不来,现在很想买。😂

    虽然带宽才 200GB/s ,但是无奈 cuda 和 gpu 都强大,市面上大部分优化都是针对这块的。
    niubee1
        4
    niubee1  
       Aug 19
    @turing518 跑 Qwen3.8-27B 可以 Q4 量化本地跑起来很巴适,你非要跑全尺寸大模型,插八张也不是不行啊。另外 7900XTX 涨价了,五千多买不到了,要七千了,8 张也不到 6 万啊
    jark006
        5
    jark006  
       Aug 19
    DGX Spark? 刚好 3W ,算力/带宽都一般,但统一内存有 128G
    xwayway
        6
    xwayway  
       Aug 20
    @coefu #4 @jark006 #5 但是跑不动 qwen3.8 27b 这种稠密模型,跑 deepseekv4 flash 这种又要两台才行,如果 qwen3.8 能出个中等规模的 moe 就好了
    coefu
        7
    coefu  
       Aug 20
    你要是舍得电费,组装多卡主机,也不是不行,就是费电,噪音大。dgx spark 就是省电。
    xwayway
        8
    xwayway  
       Aug 20
    @coefu #7 确实也是个问题,另外还有体积,噪音等问题,不能兼得。
    techmale
        9
    techmale  
       Aug 20
    这个价只能上二手 M-series(>=3) Max .. (>=300GB 内存带宽)
    coefu
        10
    coefu  
       Aug 20
    @xwayway 我刚刚调研出来了一个极品方案。你这个 3w 块,肯定够,但是要做很多工作。不过,非常极品,2.x T 的那种也能跑,只是需要验证。工程理论上是通的。如果你乐意试一下,我们可以一起搞。非常有意思。足够出一篇 2 区 sci 工程论文。
    dk7952638
        11
    dk7952638  
       Aug 20
    V100 32G + Qwen3.8-27B
    成本不会超过 4000 块, 如果有旧电脑可能成本更低
    coefu
        12
    coefu  
       Aug 20
    @xwayway 艾特错了,应该是艾特 OP 的,抱歉。
    turing518
        13
    turing518  
    OP
       Aug 20
    @coefu #10 是成品方案吗?我是做公司项目用,所以还是要正规渠道购买好维护好报销的
    coefu
        14
    coefu  
       Aug 20
    @turing518 当然不是,成了我还和你合作?想什么呢,😂,当然是有风险的。不过我看还是算了。不让你为难了。
    aru
        15
    aru  
       Aug 26
    3 万预算去搞 1 张 4080S 魔改 32G 加配套硬件吧
    还能剩一些,就是魔改的寿命和质保不好说
    clemente
        16
    clemente  
       Aug 26
    @dk7952638 v100 是张垃圾卡 电费和能跑的 dtype config 不多
    realpg
        17
    realpg  
       Sep 5
    @turing518 #2
    你的意思是 你要花 3 万预算 整一个有 96G 显存 还要保证 tps 还得省电的硬件?
    turing518
        18
    turing518  
    OP
       Sep 5
    @realpg 尽量省电,同 tps 的情况在省电更好,不是要那种极致省电
    iango
        19
    iango  
       Sep 17
    等等老黄的 RTX Spark 和苏妈的 AI Max+ PRO 495.
    jinsongzhaocn
        20
    jinsongzhaocn  
       Sep 30
    有动手能力的适合折腾,这种专用型,主要是省心,未来换配件肯定没戏,现在风险还是挺大。
    WhatIf
        21
    WhatIf  
       4 days ago   ❤️ 1
    今年高价位入手了一台 160w 的 ai max+ 395 机器 128G 版本 , 早先就是玩具,qwen3.6 35BA3B Q4KM 加上 mtp 可以到 70token/s 的 decode 速度, prefill 差不多 300-600 之间。
    后面 qwen3.8 27b 出来, 默认 17token/s 加上 mtp 24token/s 如果选择 UD Q8 量化 差不多 15-17 的样子,xhigh 思考模式下 ,跑一个鹈鹕 1 小时起步。 但是效果方面还是 Q8 能真干活。
    最近发现一个 halogen 的框架, 运行 qwen3.8 flash next 125B 4 位量化 ,能有 50-70token/s 的速度,prefill 1500 左右, 接入 opencode 或者 deepseek harness 完全够用。
    今天也折腾了一下 minimax h3 , 生成差不多 640*480 这一档的视频,5s 长度 要 4 分钟左右,8s 时长的 8 分钟起步。

    感觉现在已经是脱离了玩具的范畴,真能用了, 但是缺点也有, 风扇呼呼得很吵。

    我另外一个方案是垃圾佬模式, 2080ti 22G*2 跑 qwen3.8 27B fp8 prefill 初始状态下 1300 左右后面会跌落到 700-900 吧 ,decode 60-160 之间, 当然得用合适的推理框架,配合 dflashv2 的结果。
    strata 跑 qwen3.8 flash next , 我用 Swift-1.5-Qwen3.8-Flash-Next-GSQ-RCO-GGUF IQ3_XXS 的情况下,decode 速度比 ai max 的机器略高 50-90 之间吧,harness 里面统计的一般是 75-80.
    这个方案我都是限制显卡在 180w 的场景, 这样温度最高 72 左右, 风扇声音不会起飞(当然我把侧盖打开也有关系)

    价格方面 ai max 395 无固态的版本 当时是 17949 现在看好像还是没变, 2080ti 22g 当前 3000 出头一张卡
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2919 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 78ms · UTC 12:43 · PVG 20:43 · LAX 05:43 · JFK 08:43
    ♥ Do have faith in what you're doing.