Web  1 sites indexed in VXNA
14 articles feed address
 ahdw's recent timeline updates
ahdw

ahdw

V2EX member #328218, joined on 2018-07-10 16:05:54 +08:00
Today's activity rank 11772
Per ahdw's settings, the topics list is hidden
Deals info, including closed deals, is not hidden
ahdw's recent replies
5 days ago
Replied to a topic by Need4more Local LLM mac 本地部署 llm 不是最佳选择
@fe619742721

我觉得就当前 2026 年 9 月来看,「绝大部分人」确实如你所说,在只关注本地部署带来的隐私性这一方面来看,这个类比不恰当。

---

但我有新的论据。

90 年代的私家车,相比打车,更方便、更灵活的优势依然存在,但是当年的本土汽车市场可没有现在这么发达。这说明对「绝大多数人」而言,还有其他因素在。

就汽车而言,这个因素是汽车单价相对于收入的比例。现在这个比例远不如 90 年代时那么悬殊了,因此「绝大多数人」开始正视这个需求,并迎来了私家车市场的空前繁荣。汽车技术进步也对降低这个比例有很大贡献。

---

说回本地模型。隐私不是唯一的考量。
除了本帖中讨论的众多因素之外,我还想补充以下几点:

首先,随着模型技术的发展(既包括开源模型的能力提升、也包含小尺寸模型的相对智能越来越强、还包含推理引擎的迭代优化),在消费级硬件上可以部署能力足够强的模型了。这个趋势不会变。也就是说,本地部署模型不一定需要购买昂贵的新硬件。

然后,模型的能力是主观的。
第一个角度是,人类作为模型的使用者,是有自己的偏好的。当年 ChatGPT 下线 GPT-4 系列,全面用 GPT-5 来面向终端用户的时候,可是引起了巨大反感。
第二个角度是,对模型能力的评估,就没有普适的客观标准。
在有确定性的领域,比如编程,有很多 benchmark ,但是在实际使用当中,大家并没有一边倒地认为 benchmark 得分高的模型用起来就一定比得分低的模型强(可感知的强)。当然可以说这是所谓的 benchmaaxed 的结果,但这不影响结论:评价标准本身有问题。
而被视为衡量各大模型真实使用体验的最直观标准之一,也就是 LMArena ,它采用的是盲测的形式(双盲对比):用户在平台上输入任意提示词( Prompt )后,系统会调用两个匿名的 AI 模型给出回答(例如 Model A 和 Model B )。用户在不知道模型身份的情况下,根据哪个回答更好进行投票,投完票后系统才会揭晓两个模型的真实名字。最后的排行也是动态的。平台通过收集数千万次真实用户的盲测投票,利用类似国际象棋的 Elo 评分系统( Bradley-Terry 模型)计算出各个模型的实时胜率和排名。
这个标准本身反应的,恰恰是这种模型能力的「主观性」。比如从这个 LMArena 上能看人们相比于很多私有部署的大模型,反而更偏爱小尺寸的开源模型。

最后,建立在前两条的基础上,可以得出结论,当你的需求,可以被某个本地中小尺寸模型满足时,而技术允许你把它部署在你已经拥有的设备上,或者你花少量金钱升级后的硬件设备上时,你一定会被吸引的。
就像你上班不需要开法拉利一样,对「绝大多数人」来说,他们也不需要 GPT-5.6-sol-max 或者 Kimi K3.

如果当年的 GPT-4 就能满足你的需求,那么我敢说,当你能在自己的硬件上拥有这个程度的智能时,你一定不会想要租赁。

---

Callback 汽车的类比。在汽车领域,那个隐藏因素是「汽车单价相对于收入的比例」,在本地部署模型的领域,这个因素是「硬件购置与算力门槛相对于模型真实可用性的比例」,而这个「真实可用性」,是主观的。

比如我就在 5 年前的硬件( M1 Max )上部署了若干中小尺寸的模型。它们满足了我很大一部分需求。2023 年、2024 年、2025 年我都曾经花过 20 美元订阅 GPT-Plus (那个时候 Codex ,或者说 Agentic Coding 还不是个流行概念),现在这部分需求我完全不用花钱了。

我现在依然会为 Agentic Coding 花钱,这方面我愿意承担成本的硬件上可以部署的本地中小尺寸模型的「真实可用性」还没有越过那个临界点。

---

一个证据:就聊天而言,无论是 Gemini ,还是 ChatGPT ,免费额度几乎都用不完了。当然,现今最先进的免费模型的体验(比如说 GPT-5.4 mini 之类)是否在主观上真的比当年的 GPT-4o 强,大家自己心里都有数。

模型厂这方面的慷慨,恰恰说明了,这个领域的本地模型的「真实可用性」已经足够高了。

---

最后,我再强调一下,就当前 2026 年 9 月来看,「绝大部分人」确实如你所说,在只关注本地部署带来的隐私性这一方面来看,这个汽车类比不恰当。
但是,当「绝大多数人」可以承担得起的硬件上,能够部署的本地模型,相对于他们的需求的「真实可用性」超过临界值时,考虑本地部署就会变成理所当然的事情。

有兴趣可以看看我写的这两篇知乎专栏文章:
https://zhuanlan.zhihu.com/p/2063768272701592014
https://zhuanlan.zhihu.com/p/2063060063984654083
Aug 31
Replied to a topic by Need4more Local LLM mac 本地部署 llm 不是最佳选择
这么算账的话,你买车的养车用车的钱,够你打车打一辈子。
那为什么会有私家车市场?而且还不断普及、下沉?

显然你少算了。
Aug 13
Replied to a topic by Livid Local LLM local.ai
vibe 一个啊,贴合你自己的真实场景
Jun 25
Replied to a topic by xgq89757 Apple macbook m3 pro 和 m1 max 如何选择
跑 LLM 吗?跑的话 M1 Max ,因为 64GB 统一内存是真爽,而且 Max 芯片的带宽比 Pro 芯片的带宽大多了。
M1 Max 是 400GB/s ,M3 Pro 只有 150GB/s 。

做视频剪辑吗? M1 Max 有两个多媒体引擎,M3 Pro 只有一个。

除了 CPU 性能有提升,GPU 硬件支持了 bf16 格式以外,我看不出选 M3 Pro 的任何理由。
Jun 13
Replied to a topic by mikifuns Oracle Oracle Always Free Resources 政策调整
吓得我赶紧去把 ARM VM reshape 成了 2 核 12G
Jun 1
Replied to a topic by SteveRogers Local LLM 本地大模型最佳 Mac 配置选择
@SteveRogers 太贵了太贵了,我 7000 块钱搞了个 16 寸无头骑士 64GB 的 M1 Max ,够我玩一阵子了

再往上升级目前看就 M5 Max 性能提升明显,但是对比 7K 的价格,太不划算了……
May 31
Replied to a topic by SteveRogers Local LLM 本地大模型最佳 Mac 配置选择
@zhongzh 我试了一圈下来,Qwen3.6-35b-a3b-oQ8 不开思考模式是最稳的,我 hot cache 设置成 2GB ,memory guard 设置成 aggressive ,用 Pi Coding Agent ,在一个 session 里面反复探索、深入,体验和用 DSv4 Flash 这样的模型很接近了。当然,智力是明显差一些的。但是真的已经是能用的程度了。

27B 和 31B 两个,在我的 M1 Max 上最大的问题是 PP 太慢。这两个 Dense Model 对量化的容忍程度比 MoE 高,为了速度,我选了 4bit 量化,但是还是慢。差不多 10 tokens/s 的生成速度我能忍,但是真实场景里面到了中途以后,动辄 10 分钟起步的 PP 令我难以忍受。
M1 Max 也是 2 小核,我的实际感受并不是 2 个小核会导致突然卡一下,而是相对比较费电。M4 (不带后缀)的 6 小核 4 大核设计才更适合日常使用。
May 30
Replied to a topic by SteveRogers Local LLM 本地大模型最佳 Mac 配置选择
@zhongzh 你跑多大的 context ?

oMLX - LLM inference, optimized for your Mac
https://github.com/jundot/omlx
Benchmark Model: Qwen3.6-27B-MLX-VL-oQ8-fp16 (DFlash)
================================================================================

Single Request Results
--------------------------------------------------------------------------------
Test TTFT(ms) TPOT(ms) pp TPS tg TPS E2E(s) Throughput Peak Mem
pp1024/tg128 9841.9 24.30 104.0 tok/s 41.5 tok/s 12.927 89.1 tok/s 31.94 GB
pp4096/tg128 38659.6 23.87 106.0 tok/s 42.2 tok/s 41.691 101.3 tok/s 34.03 GB
pp8192/tg128 77367.7 24.89 105.9 tok/s 40.5 tok/s 80.529 103.3 tok/s 35.27 GB
pp16384/tg128 160222.9 25.85 102.3 tok/s 39.0 tok/s 163.506 101.0 tok/s 37.61 GB
pp32768/tg128 349855.4 49.53 93.7 tok/s 20.3 tok/s 356.146 92.4 tok/s 42.01 GB
pp65536/tg128 801931.3 51.50 81.7 tok/s 19.6 tok/s 808.472 81.2 tok/s 47.38 GB
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   3036 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 11ms · UTC 14:34 · PVG 22:34 · LAX 07:34 · JFK 10:34
♥ Do have faith in what you're doing.