V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  sentinelK  ›  全部回复第 3 页 / 共 85 页
回复总数  1683
1  2  3  4  5  6  7  8  9  10 ... 85  
7 月 6 日
回复了 wcwcxiaobin 创建的主题 OpenAI 感觉 AI 推理目前瓶颈还是比较明显
LLM 的表现有很大程度上不光是模型本身,还有运行环境,kv cache 优化等很多层级的问题。
随便折腾一次自部署就能了解个大概了。
7 月 6 日
回复了 shendaowu 创建的主题 程序员 哪些因素会导致人低估大语言模型?
@zhongzhaoguo 这本来就是个伪命题。目前 Agent 的“能力”根本就不能定量分析。而且 Agent 能做的其实就是“上下文加工”,不太能理解"局限在 LLM"的本质逻辑是什么。
7 月 6 日
回复了 shendaowu 创建的主题 程序员 哪些因素会导致人低估大语言模型?
@cde979 你这个例子就很典型的指出了 LLM 的问题。
1 、他把“不到中位数”,等价于“无知”。
2 、他主观臆断一个人的动机,“是一种典型的“我懂你们都不懂”的认知优越感”。

充分说明,在上下文不充沛(你最起码得用 Agent 让 GPT 爬一下我所有发言),语义理解不清晰(明显他的上下文没有楼主的内容)的前提下,会做出非常离谱的错误判断。
7 月 5 日
回复了 shendaowu 创建的主题 程序员 哪些因素会导致人低估大语言模型?
@Rorysky 目前的 Coding Agent ,本质上就是针对你的提示词,加上你已有的既定程序,进行信息检索+加工。最终进行代码输出。

如果一下子就能写的非常漂亮,只能说明:
1 、这个需求或者说逻辑链条非常常见。
2 、最佳实践的统计学优势很强(有通识的最佳范式)

所以如果开发者认为这样的结果很“惊艳”,就只能说明显你不懂当前需求的最佳范式或者说共识,不了解共识,说一句认知不到中位数,也不过分吧。
7 月 5 日
回复了 shendaowu 创建的主题 程序员 哪些因素会导致人低估大语言模型?
简单粗暴的讲,如果 LLM 能给你“惊艳”的感觉,说明你对于对应领域的认知不到“中位数”。
反之亦然。
7 月 2 日
回复了 shuck 创建的主题 OpenAI 大家的 opencode go 的 deepseekd 的 flash 还能用吗?
GLM5.2 的 decode 速度也明显变慢,视觉预估也就 30t/s
7 月 2 日
回复了 shuck 创建的主题 OpenAI 大家的 opencode go 的 deepseekd 的 flash 还能用吗?
现在已经连锁反应了,大量的请求转移到其他 go 订阅的模型上,mimo v2.5 也已经崩了。
换句话说,这和 vibe Coding 有什么关系?
你自己发明了一个药,也不做调研也不做实验,一下子直接把病患吃死了,然后你说这个药的生产设备有问题?
首先,本来 Agent 这个形态就不是一个 100%确定结果的产品,这个你们没有预期吗?
其次,引入 Agent 应该循序渐进,而不是硬切换。比如最起码要和既定的客服流程并行处理一段时间,采纳率高于某个阈值再上。

然后就是所谓的性能瓶颈,这说明你们对于产品本身的定义和选型都没做到和场景适配,在这种情况下跟代码就没什么关系了。
@sdjl “提需求的话这活谁都能干。”你确定吗?
@suikatw 所以你的公司在 AI 时代之前有行这个颗粒度的 Code Review 机制吗?如果没有的话,你的公司时如何对程序的质量和运维能力打包票的?
@saySilence 这个思路就很奇怪,自动化测试、集成测试、产品测试这套流程推最起码 20 年了。啥时候产业要验收代码了。换句话说,代码质量本身就从来没成为过软件工程的衡量标准。

唯一验收代码的就是 code review ,而在 AI Coding 的大环境下,Code review 也没意义了。

而且有什么证据支持人对于代码的验收能力能超过机器和 AI 呢?
换句话说,“看代码”是一种基于你认知习惯和效率的生产方式,不是写程序的必要条件。

就跟你用什么键盘一样。
“不看代码的程序员会被淘汰吗?”
不会的,因为本质上,软件工程只看软件,不看代码。
之前所有对于代码质量、结构、逻辑的纠结,都只局限在“人”这个上下文极短、遵从性极差的生物上限下的产物。

如果不是语料不够丰富,LLM 早就去直接写机器码了。
说少了,最起码 95%
宣发走顺了,你的游戏即便有缺陷也是设计。
6 月 30 日
回复了 xxxman 创建的主题 程序员 這一年來跟著 AI 發展的心得
我个人判断,AI 的 toB 落地比之前 SaaS 要难得多。

1 、和 SaaS 完全不同,企业 AI 化的本质就是企业数据的再加工分析。相当于他是对既有数据的挖掘和诊断。一个公司,既有数据里边不光包含业务的演进,必然还包含一些非股东的私人利益以及一些人为的反效率结构。这就导致估计除了 AI 改造领头人(你的内线)以外,剩下的人全部都反对,最起码也是被动不合作状态。

2 、SaaS 还可以理解为是自上而下的“定向医美”,是有人对流程负责的。AI 化是彻头彻尾的数据统计诊断。整个改造有可能是完全失去控制的,这个责任谁来负。这就导致,AI 改造要么割到大动脉企业直接原地爆炸,要么不疼不痒。乙方里外不是人。

3 、企业肯定不会让数据上云,所以 AI 化绝大多数情况都是本地的,这样下来对于乙方来讲,风险就非常大了。你如何证明你的硬件方案和甲方的 AI 需求是契合的? prefill 和 decode 性能多少叫够用?并发多少人算可用?采纳度多少算有效?这些全都是主观答案,没有任何客观标准。更别提模型体量对于硬件需求的巨大差异性。
1 、2 楼是我,从现在的视角看,我说的貌似依然还有效,很庆幸 XD
6 月 24 日
回复了 echoVic 创建的主题 程序员 押注 DeepSeek,再次出发做 Agent
一直没想明白,Agent 工具目前到底如何区分他们的特点和能力?有没有一个相对量化的指标?

如果没有的话,那这些 feature 的意义到底在哪里……反复迭代 Agent 工具的最终目的又是什么……
其实这个问题是非常主观的。

学霸 A 刷遍了全世界所有的题,发现考试的时候撞题成功,考了满分。
学霸 B 智商超群,考试的时候利用其他题干互相印证推导,做题成功,考了满分。

他们都是满分,只是不稳定因素不同。

学霸 A 对于历史信息有过拟合。所以做题很难做满分。
学霸 B 推导的过程中会有误差累积,一旦某一个步骤出错,就全盘皆输,要么满分,要么 0 分。

其实这也就引申到了 GPT 时刻,讨论的非常火的问题,既所谓智能(智商、能力),到底是不是既有信息的统计学重复。
降智这种主观的都先不谈。

各家 plan 的“代币”有能说明白的吗?
现在 LLM 厂商给我的感觉,就是我进饭馆,我能吃什么,吃多少,花多少钱,都不是我能决定的。
1  2  3  4  5  6  7  8  9  10 ... 85  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1079 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 24ms · UTC 18:19 · PVG 02:19 · LAX 11:19 · JFK 14:19
♥ Do have faith in what you're doing.