如题,预算 3w 左右,想弄一套小型化本地大模型硬件来跑本地大模型,处理一些不能传到外网的文档的 RAG ,保证 tps 的情况下,能省电更好,目前看了华硕的 GX10 ,求问是否还有其他的推荐?
如题,预算 3w 左右,想弄一套小型化本地大模型硬件来跑本地大模型,处理一些不能传到外网的文档的 RAG ,保证 tps 的情况下,能省电更好,目前看了华硕的 GX10 ,求问是否还有其他的推荐?
1
niubee1 Aug 18
微星的一样的配置更便宜一点。或者你可以 AMD 7900XTX 组台机器,能耗高点,但是整体硬件更便宜
|
3
coefu Aug 19
还是 nvidia dgx spark 算了,之前看不来,现在很想买。😂
虽然带宽才 200GB/s ,但是无奈 cuda 和 gpu 都强大,市面上大部分优化都是针对这块的。 |
4
niubee1 Aug 19
@turing518 跑 Qwen3.8-27B 可以 Q4 量化本地跑起来很巴适,你非要跑全尺寸大模型,插八张也不是不行啊。另外 7900XTX 涨价了,五千多买不到了,要七千了,8 张也不到 6 万啊
|
5
jark006 Aug 19
DGX Spark? 刚好 3W ,算力/带宽都一般,但统一内存有 128G
|
6
xwayway Aug 20
|
7
coefu Aug 20
你要是舍得电费,组装多卡主机,也不是不行,就是费电,噪音大。dgx spark 就是省电。
|
9
techmale Aug 20
这个价只能上二手 M-series(>=3) Max .. (>=300GB 内存带宽)
|
10
coefu Aug 20
@xwayway 我刚刚调研出来了一个极品方案。你这个 3w 块,肯定够,但是要做很多工作。不过,非常极品,2.x T 的那种也能跑,只是需要验证。工程理论上是通的。如果你乐意试一下,我们可以一起搞。非常有意思。足够出一篇 2 区 sci 工程论文。
|
11
dk7952638 Aug 20
V100 32G + Qwen3.8-27B
成本不会超过 4000 块, 如果有旧电脑可能成本更低 |
15
aru Aug 26
3 万预算去搞 1 张 4080S 魔改 32G 加配套硬件吧
还能剩一些,就是魔改的寿命和质保不好说 |
19
iango Sep 17
等等老黄的 RTX Spark 和苏妈的 AI Max+ PRO 495.
|
20
jinsongzhaocn Sep 30
有动手能力的适合折腾,这种专用型,主要是省心,未来换配件肯定没戏,现在风险还是挺大。
|
21
WhatIf 4 days ago 今年高价位入手了一台 160w 的 ai max+ 395 机器 128G 版本 , 早先就是玩具,qwen3.6 35BA3B Q4KM 加上 mtp 可以到 70token/s 的 decode 速度, prefill 差不多 300-600 之间。
后面 qwen3.8 27b 出来, 默认 17token/s 加上 mtp 24token/s 如果选择 UD Q8 量化 差不多 15-17 的样子,xhigh 思考模式下 ,跑一个鹈鹕 1 小时起步。 但是效果方面还是 Q8 能真干活。 最近发现一个 halogen 的框架, 运行 qwen3.8 flash next 125B 4 位量化 ,能有 50-70token/s 的速度,prefill 1500 左右, 接入 opencode 或者 deepseek harness 完全够用。 今天也折腾了一下 minimax h3 , 生成差不多 640*480 这一档的视频,5s 长度 要 4 分钟左右,8s 时长的 8 分钟起步。 感觉现在已经是脱离了玩具的范畴,真能用了, 但是缺点也有, 风扇呼呼得很吵。 我另外一个方案是垃圾佬模式, 2080ti 22G*2 跑 qwen3.8 27B fp8 prefill 初始状态下 1300 左右后面会跌落到 700-900 吧 ,decode 60-160 之间, 当然得用合适的推理框架,配合 dflashv2 的结果。 strata 跑 qwen3.8 flash next , 我用 Swift-1.5-Qwen3.8-Flash-Next-GSQ-RCO-GGUF IQ3_XXS 的情况下,decode 速度比 ai max 的机器略高 50-90 之间吧,harness 里面统计的一般是 75-80. 这个方案我都是限制显卡在 180w 的场景, 这样温度最高 72 左右, 风扇声音不会起飞(当然我把侧盖打开也有关系) 价格方面 ai max 395 无固态的版本 当时是 17949 现在看好像还是没变, 2080ti 22g 当前 3000 出头一张卡 |