V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  sentinelK  ›  全部回复第 7 页 / 共 85 页
回复总数  1683
1 ... 3  4  5  6  7  8  9  10  11  12 ... 85  
其实把自己“搬砖姿势优雅”当成是搬砖工的能力这事儿,本来就很奇葩。
我认为目前对于 AI Coding 的工作流,还是没法做到定量分析。

1 、各家都有各家的嫡系应用。到底比嫡系还是比公用。
2 、在主要还是调用 API 的环境下,模型质量很难保证。(各种降智,撕毁价格方案)

在以上无法控制的前提下,很难自证工作流的先进性,更别提费效比。

在 claude code“被”开源之前的几天,v 站冒出来好几个 Agent 仙人帖。自称自己设计的 Agent 工作流和 Claude Code 等方案相比是“大学教授和小学生的差距”,“效率提升 1300%”

然后 claude code“被开源”之后,这种帖就再也没有了。
5 月 13 日
回复了 Suger828 创建的主题 Android Android 开发如何 vibe coding
要抛弃过去那种“开发 XX 一定要在 XX 里”的一站式 IDE 的思路。

实在想一站式解决,android studio 一样有终端选项卡,一样可以跑 claude code/opencode 等等。
代码结构、AI 上下文可见性、程序架构,这三者是风马牛不相及。

并不会互相影响。
@zsj1029 我在某硬件平台,租了个 5090 平台测试,Q4_K_M 版本,使用 llama.cpp 运行 262114 上下文,显存占用 26GB ,prefill 大概 3000t/s,decode 稳定在 70t/s

感觉是不是楼主的 A100 参数还有优化的空间。体感上 5090 跑 qwen3.6-27B,输出不比官网 v4-flash 慢
@zsj1029 借楼,A100 运行 qwen3.6-27B ,是全量版本、上下文开满吗? prefill 和 decode 分别性能是多少?
统计学模型最容易发挥优势的地方就在于“统计”。

也就是“规则复杂维度多,基础数据庞大检索困难,难以通过人力归纳总结收敛最优解,甚至需要制定一些反效率的框架与流程来束缚一线从业者能力上限,从而提高生产成功率”的领域。

比如编程就是上述描述的典型场景。

对应的,医疗、法律建议,科学研究,合同分析,新闻解析等,也都如此。目前 AI 沁润比较深的也都是以上行业。
你通过什么手段进行的结果审核?如果没有 result review ,会大幅度的消耗你的精力。

你是否通过提示词指导了 AI 如何生成素材?游戏里的视觉效果,五成靠骗,四成凑合,一成靠画。如果你是业余的前提下,主观客观上指导了 AI 如何实现视觉效果,其实绝大多数情况都是误导。
花了一点时间,几乎是穷举,吧八格的必胜法走出来了……

1 、开局走马。
2 、通过移动车,逼对方马前跳
3 、让对方的王吃掉自己的马,否则会逼和。
4 、车吃掉对方前跳的马。
@SteveRogers 要等 M5 Max 版本的 studio 出来才行。M4 MAX 的性能比这代低很多,另外,mac 的统一内存是够放满血版本(非量化)的 qwen3.6 27B 的,但是因为内存带宽,所以性能很差。
@hello365 目前的话,qwen3.6-27B 4bit 量化的 mlx 版本模型,M5 MAX 128GB 的 macbookpro ,decode 输出可以跑到 30t/s ,prefill 输入可以跑到 700t/s

如果是 moe 模型,比如 qwen3.6-35B-A3B ,能到 100t/s 的输出。
5 月 8 日
回复了 skuuhui 创建的主题 程序员 在 AI coding 上的困境,想做个调研
@skuuhui 这个直觉没错的,但是对应的账应该反过来算。
1 、你降低了你自己的心智负担,你就更有时间、精力来给模型兜底。
2 、目前主流的 Agent 思路是 loop + 审核抽卡,所以误差的积累很大程度上可以靠增多多抽卡次数来抹平。也就是靠烧更多的 token 来换你更少的干预。
3 、目前模型的能力更强了,最优解的统计学优势更明显,即便上下文有一系列错误,也会无视或者自行纠错。
5 月 8 日
回复了 skuuhui 创建的主题 程序员 在 AI coding 上的困境,想做个调研
btw:使用大模型,核心矛盾点,就是你需要投入多少精力来进行控制。这和企业管理的底层逻辑相通。

你给员工更大的自由,他就更能发挥上限,代价就是捅娄子的能力也更强。
你越依赖微操,你的员工的能力就越难以发挥,也就越难以突出你的人力优势。这里要 @蒋委员长
5 月 8 日
回复了 skuuhui 创建的主题 程序员 在 AI coding 上的困境,想做个调研
1 、我会干预其架构设计。不是别的,是因为我要为我的 Agent 兜底,他的技术选型我看不懂我就兜不了……
2 、看心情,所以我目前在尝试可能的情况下,让 hermes 接管我的代码仓库和文档,让他帮我去调用 claudeCode/openCode 。我只提需求和把控设计。
3 、同理,hermes 可以大幅度降低人工提供上下文的心智负担。
5 月 7 日
回复了 AIgogo 创建的主题 随想 AI 大模型的能力边界越发清晰
@ZX16815 但现实就是,因为 LLM 的不透明性,导致普遍的头部供应商都“无良”。

一个商业逻辑不成立的领域,讨论其理想情况如何如何,在我看来是没有实际意义的。
5 月 7 日
回复了 AIgogo 创建的主题 随想 AI 大模型的能力边界越发清晰
“知道了工具怎么用,然后探索把工具用起来和用好。 那么人类本能对未知的神秘感和焦虑感也就自然消除”

不会的。
因为目前 LLM 的模式对于消费者而言是全黑盒模式。消费者唯一只知道,调用了某个公司的一个 API 服务。

数据输入输出是否被污染?不知道。
数据究竟被什么模型加工?不知道。
究竟收费多少钱?不知道。
我的数据会被如何对待?不知道。
未来 LLM 公司是否会因为利益、政策等原因断供、修改条款?不知道。
模型的输出能力是否稳定?不知道。

在以上都完全未知的前提之下,谈“工具属性越来越清晰”,是纯扯淡。

你家的锤子不会今天你凿完三颗钉子,明天管你要 100 美元的。
也不会今天你凿完三颗钉子,明天告诉你你凿的钉子太多,锤子受不了,要么折价退款,要么每天只能凿一颗。
更不会今天凿完钉子,明天变成塑料玩具。
mlx 的 qwen3.6-35B-A3B 试试看
btw:

如果只是想了解 Agent 的理念,我觉得这个视频的信息量已经够了: https://www.bilibili.com/video/BV1dpQTB3EXg?spm_id_from=333.788.videopod.sections&vd_source=0ef6494d0ac82c1df8c1a6cc5e8ef08c
@newtype0092 是的,毕竟 LLM 的本质就是统计学概率续写。各种工程化只是在利用目前 LLM 模型算法的甜点,争取能够提升最终答案落在全局最佳的比例。

而且 Agent 底层理念就在于,我承担返工的风险,烧更多的 token ,但是要一次性(或者说非人工干预下)成功。

高效利用 token 的理念则恰恰相反。
1 ... 3  4  5  6  7  8  9  10  11  12 ... 85  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   958 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 33ms · UTC 22:15 · PVG 06:15 · LAX 15:15 · JFK 18:15
♥ Do have faith in what you're doing.