3090 24GB 的显卡 64GB DDR5 内存
目前调研能部署的有 Qwen3-Coder-30B-A3B ( Q4_K_M / AWQ )、DeepSeek-R1-Distill-Qwen-32B ( AWQ / INT4 )、DeepSeek-Coder-V2-Lite ( Q4_K_M / Q5_K_M )、DeepSeek-Coder-33B ( Q4_K_M )
有同志真自己部署了吗,哪一个的效果相对好一点呢?
3090 24GB 的显卡 64GB DDR5 内存
目前调研能部署的有 Qwen3-Coder-30B-A3B ( Q4_K_M / AWQ )、DeepSeek-R1-Distill-Qwen-32B ( AWQ / INT4 )、DeepSeek-Coder-V2-Lite ( Q4_K_M / Q5_K_M )、DeepSeek-Coder-33B ( Q4_K_M )
有同志真自己部署了吗,哪一个的效果相对好一点呢?
1
misdake 6h 51m ago
没那么关注,不过前些天我装了个 Strata ( https://github.com/Niko1221/Strata ),也许可以试试。
|
2
misdake 6h 50m ago
24GB 显存可以搞高精度一点的模型还有长上下文了。
|
3
codehz 3h 35m ago via Android
这种去年的模型有啥好折腾的,工具调用根本不稳定,不如用🤗上的新模型量化版
|
4
kennylam777 3h 20m ago
舊模型不值得折騰+1
DS R1 Distill 還是 Qwen2.5, 而 Qwen3 也不算太好, 這些東西 Tool use 正確輸出 xml 也極不穩定而且無法自行修正, 到了 Qwen 3.5 就好很多 有 64GB RAM 直接上 Strata 試試吧, Qwen 3.8 Flash Next 125B A10B 的 Tool uses 很穩, 3090 應該在 Prefill 及 generation 的速度也十分好用 |
5
xixi1412 2h 13m ago
年度最佳本地小模型:
低内存:qwen3.8 27B. 高内存:qwen3.8 flash next ( Strata ). 27b 在执行层面上,只要把任务和验收标准写好,质量不比 gpt6 sol 差。找个大一点的付费模型当领导,27b 当力工。 |
6
wwhc 1h 49m ago
建议 llama.cpp 上 Qwen3.8 27B Q4 。建议暂时不要尝试 Strata ,这个东西似乎买了推广,作为一个开源推理系统,推广力度如此之大,原因不明,等情况明朗后再尝试,上 Qwen3.8 flash next 用 llama.cpp 也没有问题
|