 |
|
bwnjnOEI
V2EX member #545030, joined on 2021-05-11 13:45:47 +08:00Today's activity rank 11411
|
 |
Per bwnjnOEI's settings, the topics list is hidden |
Deals info, including closed deals, is not hidden
bwnjnOEI's recent replies
狭隘和猥琐地看,reward model 都是和 researcher 价值观对齐的,未来可能真就要么是 researcher 要么成为他们的性服务人员。
可以试试小众但轻量却不失优雅的 hcom 它是基于 hook 实现的
我觉得上面的角度都是应用层和软件工程的角度 换个角度可以了解下自我迭代 元代理 哥德尔机等概念。如果对 kv cache token 经济学有深入就更好了
现在都训练自己的路由器难的 fable/mythos 简单的自己部署的或廉价的模型,积累了足够多和高质量的业务数据再微调自己的模型,所谓的国内蒸馏美国模型也都大同小异,本质上是解决冷启动问题。但目前国内模型在不同纬度数据质量参差不齐所以比如 glm5.2 在个别几类问题上表现还有待提高,话说最近配合 zcode 用着还不错至少有那味了。
2 4 claude 和 GPT 也一样你可以用类似 code memory mcp 这种东西建立 ast 树并增量更新,其余的问题由于国内后训练和那两家还是有差距从强化学习环境到后训练方法都有差距 合成数据实际质量一般 像 3 这种 reward heck 程度还是高。
没试试 sglang 吗?话说你要想部署生产级响应的需要把所有参数都要搞明白,玩弄多卡高并发的 vllm/sglang 难度不亚于 k8s