$V2EX
Solana
Give SOL to Copy Address
使用 SOL 向 slowgen 打赏,数额会 100% 进入 slowgen 的钱包。
 slowgen's recent timeline updates
slowgen

slowgen

V2EX member #83209, joined on 2014-11-23 14:34:54 +08:00
Today's activity rank 7797
PRO
PRO member
Per slowgen's settings, the topics list is only visible after you sign in
Deals info, including closed deals, is not hidden
slowgen's recent replies
3 days ago
Replied to a topic by Need4more Local LLM mac 本地部署 llm 不是最佳选择
你假设的数据让你得到了错误的结论,因为你假设的 token 处理量太低了,当然如果你每天就用那么多,那确实回本周期慢。

我用 4 卡 RTX Pro 6000 跑 Qwen3.8 Flash Next NVFP4 ,现在一天最多是跑 54 亿 token(有峰谷,不均匀),还是因为 SM120 在新模型 Day 0 支持不给力,降级到了 marlin 的 backend 数据,要是用新内核估计处理能力还能提升 20%。

结合 Deepseek Harness 一个/goal 开放式任务可以跑 20 小时以上,最近我做了 xterm.js 移植到 dart 和 CSharp 的测试,然后用 Flutter 和 Avalonia 复刻 tabby ,并且自我迭代优化,几乎是每小时跑 1 亿 token 输入,25 到 30 万的 token 输出,缓存命中率一般在 98%~99%。按照 Qwen 官方定价每小时大概消耗 12~13 元。

现在我的 M2 Ultra 跑 Qwen3.8 Flash Next 的 4bit 量化,短的上下文时,prefill: 538.1 token/s, decode: 55.2 token/s ,长任务会衰减,假设这个数据在 M5 Ultra 上不衰减(因为增强了 AI 部分计算性能),根据 M5 Ultra 对比 M2 Ultra 的带宽差异计算,decode 的 token/s 大概在 80 ~ 100 ,prefill 速度估计可以 x10 ,这个意义在与有 KV Cache 的部分不用重复 prefill ,跑 Agent 新追加的上下文一般是并发读文件,追加的文件到上下文里几乎秒处理完,保守点的估计每小时 3000 万到 5000 万的 token 应该有,对比官方定价每小时消耗 6 元,一个月是 4320 元,M5 Ultra 256G 的 24 期免息分期费用每个月是 3615 元。
今晚 Qwen3.8-Flash-Next 发布,和 Ling-3.0-Flash 差不多大小,125B A6B ,如果性能追上 DeepSeek v4 Flash 0731 的话,其实 256GB 就够。

人的欲望总是随着新模型的发布不断上涨,买 512GB 赌的是未来这个容量可以跑下更大更 SOTA 的开源模型,赌 Fable 5 级别的模型很快就可以跑在个人设备上。
unsloth 的 NVFP4 没什么问题,反而是 SGLang 用 RadixArk 的那个 NVFP4 + DSpark 有大问题,给了 85G 显存还会 OOM 。
LMCache 记得用,冷对话的 KV Cache 可以转移到内存,避免时间太久对话被丢掉需要重建 KV Cache ,从而又走一遍 prefill 阶段。

同时今天出 Dflash 2 ,加速效果比 DSpark 还猛,可以继续测了。

我这几天用 DeepSeek Harness 跑 DeepSeek-V4-Flash-0731 和 Qwen3.8 27B ,都是 NVFP4 ,跑了几亿 token 做测试,结果在做 GUI 方面 Qwen3.8 很亮眼,在移植 tabby 项目到 tauri2 + rust 的测试中,有以下难点:
1.我在虚拟机里跑的 Linux Mint ,GPU 是虚拟的,可能用不到加速,运行过程中可能黑屏白屏、帧数低等问题;
2.rust 编程能力的问题
3.e2e 测试的问题,自动化界面点击测试

Qwen3.8 27B 全面领先,毕竟有视觉能力,一路高歌猛进,/goal 设定目标就可以了,虚拟机丢旁边看着它一直推进,SFTP 面板都在做 GUI 的冒烟测试。构建完成后空载内存只有 39MB ,看到原子弹爆炸了。
就是中间有一个 bug ,反馈给它后,它自己用了插桩、探针、前端 SPY 、hook 多种手段来调试,花了 5100w 的 token ,修了一行代码,再次看到原子弹爆炸,xhigh 真就是用电力换能力了。
Aug 15
Replied to a topic by majuzhang Local LLM 公司本地部署开源模型
如果 MiniMax M2.7 级别的模型能满足你,那么今天 Qwen3.8-27B 的能力就超越了 M2.7 ,还是多模态,你只需要 5090 就可以了,使用 SGLang 的方案在单个 5090 上,结合 NVFP4 和 DSpark ,解码速度达 206.1 tok/s https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-27B ,随着人数的增加来加卡就行。

如果你想要更好的模型能力,那么用 DeepSeek V4 Flash 0731 的 NVFP4 量化也行,RTX Pro 6000 现在涨价厉害可以退一步买 RTX Pro 6000D 这个被砍一刀的卡,2 张有点吃紧但是能跑,4 张就最好,我这里 4 张卡一天跑 20 亿 token 没问题,最大的问题就是这个成本对比买 API 哪一个划算,哪一个符合你们要求。

用多台 DGX-Spark 串联跑,也 ok ,https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark

最好使用 LMCache 来把 KV Cache 转移到内存,这样显存放模型,内存放 KV Cache ,速度也不会慢多少,显存容量的要求也降低,可以让更多的大上下文进来,工程上都是这么玩的。
结合好的 Agent 比如最近的 DeepSeek Harness ,缓存利用率大部分都是 95%~99%,对 prefill 速度友好。
@davinci21s 迁移动作才占你视频的百分之多少?不都是先做分镜图然后图生视频吗?你可以租个 5090 到 RTX Pro 6000 这个级别的显卡,配合 NVFP4 跑,刷新一下认知。反正我们做 5s 的 720p 视频一个就几十秒
谁告诉你本地模型几秒钟的视频要半小时?你的数据来源都是错的
鸡腿肉丁一样低脂又便宜,口感比鸡胸肉好多了。
光是油这一样就占了很多因素了,饭店的油有点水平都自己调配过,加了增香的料进去炸过
198 一个号,这个价格比很多网游账号的价值都高啊
本地跑大模型还得是 Blackwell 架构的 RTX Pro 6000 ,直接上 NVFP4 量化,真的就一代架构一代神
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   1259 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 12ms · UTC 23:40 · PVG 07:40 · LAX 16:40 · JFK 19:40
♥ Do have faith in what you're doing.