1
happy99 16h 51m ago
噱头比较多一点吧! 暂时观望
|
2
andrew2558 16h 18m ago
google 吹牛是第一
|
3
maolon 15h 53m ago
那 muse spark 1.3 还 75 分 deepswe 脚踢 3.8 flash 呢,
deepswe 现在不推出新版本测试就是下一个 livebench 了,很快就无人在意,已经被这些新模型玩坏了 |
4
Tumblr 15h 47m ago
Gemini 这玩意儿差点把我心态搞崩!
我问它我的法师在游戏里的木桩输出是什么水平,它告诉我单目标 116k 是 very low ,5 目标 350k 是 quite low ,给出的平均数据是单目标 320-350k ,5 目标是 950-1100k~ PS 魔兽世界里的日怒奥法师 |
5
evilHa 15h 24m ago
gemini 算了,事实错误太多了,用 google.com 直接问能更准点,搜索的资料多,能弥补事实错误。
|
6
bush911 15h 19m ago
不懂这些评测
|
7
miniliuke 15h 13m ago AI 跑分已经被玩坏了,含金量堪比安兔兔
|
8
f10w 15h 12m ago
早上起来打开 agy ,看到 Gemini 3.8 flash 了
|
10
zsxzy 15h 9m ago
用来做 Android app 开发挺好用的, 知识是最新的
|
11
keenkiller 14h 46m ago
刷分刷的
|
12
docx 14h 41m ago via iPhone
过不了一周又要拉了
|
13
ryougifujino 14h 30m ago
DeepSWE 越来越像个笑话了,从 Opus5 全方面碾压 Fable5 就能看出来
|
14
Felldeadbird 14h 27m ago
诚然 gemini 很强,但是 3.5 后 额度消耗那么快,同比其他家,你再强额度太快也遭不住啊。
|
15
dingwen07 14h 22m ago
@zsxzy Android App 开发,只要装了 Android CLI 的 Skill ,AI 就能够直接自主查询 Android Developer 文档
|
16
gpt5 14h 20m ago
手机有跑分模式,模型也有跑分模式。
算力给够了都贼拉猛。 |
17
zuosiruan 14h 4m ago
@Felldeadbird 啊?你是真心觉得很强的吗?
|
18
kindjeff 13h 51m ago
|
19
Felldeadbird 12h 54m ago
@zuosiruan 要看哪方面啊。UI 设计我觉得 gemini 是这么多家最好看的。出图一致性比 openai 好。 其他方面就见仁见智。但是额度消耗太高了,没几个羊毛号用不起。
|
20
wowo243 12h 52m ago
为什么知乎上都是说刷分的
|
21
mogutouer 12h 49m ago
这个榜单 fable 比 opus 分数还低,是怎么回事,这个成绩还可用吗,实际体感上 fable 比 opus 出品好多了
|
22
we1w3i 12h 28m ago
就算他模型很强,实际使用算力也不会给那么足给你
|
23
Maboroshii 12h 22m ago
这个榜单应该是写代码的榜吧
|