52txr
V2EX  ›  Local LLM

有什么本地部署好使的写代码小模型吗? 24GB 显存玩玩那种

  •  
  •   52txr · 7h 39m ago · 668 views

    3090 24GB 的显卡 64GB DDR5 内存

    目前调研能部署的有 Qwen3-Coder-30B-A3B ( Q4_K_M / AWQ )、DeepSeek-R1-Distill-Qwen-32B ( AWQ / INT4 )、DeepSeek-Coder-V2-Lite ( Q4_K_M / Q5_K_M )、DeepSeek-Coder-33B ( Q4_K_M )

    有同志真自己部署了吗,哪一个的效果相对好一点呢?

    6 replies  •  2026-10-07 00:45:29 +08:00
    misdake
        1
    misdake  
       6h 51m ago
    没那么关注,不过前些天我装了个 Strata ( https://github.com/Niko1221/Strata ),也许可以试试。
    misdake
        2
    misdake  
       6h 50m ago
    24GB 显存可以搞高精度一点的模型还有长上下文了。
    codehz
        3
    codehz  
       3h 35m ago via Android
    这种去年的模型有啥好折腾的,工具调用根本不稳定,不如用🤗上的新模型量化版
    kennylam777
        4
    kennylam777  
       3h 20m ago
    舊模型不值得折騰+1

    DS R1 Distill 還是 Qwen2.5, 而 Qwen3 也不算太好, 這些東西 Tool use 正確輸出 xml 也極不穩定而且無法自行修正, 到了 Qwen 3.5 就好很多

    有 64GB RAM 直接上 Strata 試試吧, Qwen 3.8 Flash Next 125B A10B 的 Tool uses 很穩, 3090 應該在 Prefill 及 generation 的速度也十分好用
    xixi1412
        5
    xixi1412  
       2h 13m ago
    年度最佳本地小模型:
    低内存:qwen3.8 27B.
    高内存:qwen3.8 flash next ( Strata ).
    27b 在执行层面上,只要把任务和验收标准写好,质量不比 gpt6 sol 差。找个大一点的付费模型当领导,27b 当力工。
    wwhc
        6
    wwhc  
       1h 49m ago
    建议 llama.cpp 上 Qwen3.8 27B Q4 。建议暂时不要尝试 Strata ,这个东西似乎买了推广,作为一个开源推理系统,推广力度如此之大,原因不明,等情况明朗后再尝试,上 Qwen3.8 flash next 用 llama.cpp 也没有问题
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   898 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 29ms · UTC 18:35 · PVG 02:35 · LAX 11:35 · JFK 14:35
    ♥ Do have faith in what you're doing.