爱意满满的作品展示区。
fzuccq

个人业余项目,做了一个可以物理操作 iPhone 的 agent,不知道有商业前景吗?

  •  
  •   fzuccq · Jul 27 · 10862 views
    This topic created in 45 days ago, the information mentioned may be changed or developed.

    淘宝美团常用的 app ,都没有 API ,agent 没法直接调用。走 ADB 容易被风控,豆包手机那条路似乎也很坎坷不好走。

    我想,如果能用硬件直接托管 iPhone ,用摄像头观察屏幕,用机械臂点击,或许能绕过大部分风控检测。搞了几个月,agent 跑通了,使用起来还可以。

    目前,最大的问题不是可行性的问题,是 token 太贵,点击一次 token 花费 0.2 元。

    大家觉得这种 agent 有商业前景吗?

    项目地址: https://github.com/physiclaw/PhysiClaw

    硬件组装手册和代码都开源,硬件 DIY 成本 1000 元左右。

    165 replies    2026-07-29 16:00:55 +08:00
    1  2  
    sillydaddy
        1
    sillydaddy  
       Jul 27
    有没有钱景不知道,不过我一直在找呢: /t/1004095
    另外问下,耗费贵是因为图片太耗 token 吗?
    network127001
        2
    network127001  
       Jul 27
    你这种大规模应用后不就是主板机,恶意刷单
    bwnjnOEI
        3
    bwnjnOEI  
       Jul 27   ❤️ 1
    我刚在 x 上刷到这个东西叫 lumi 吧
    flyqie
        4
    flyqie  
       Jul 27 via Android
    这种感觉得考虑法律风险。
    fzuccq
        5
    fzuccq  
    OP
       Jul 27
    @sillydaddy 每一次点击动作,agent 都需要观察屏幕才能决策,prompt 需要把图片放到 context 里面,当然 context 做了很多优化,但 token 还是很贵。
    fzuccq
        6
    fzuccq  
    OP
       Jul 27
    @flyqie 法律风险肯定要考虑,不过这是开源软件,我只做 harness ,不运营。
    fzuccq
        8
    fzuccq  
    OP
       Jul 27
    @network127001 只是觉得日常点外卖、买火车票、挂号,这些事,应该 AI 来做,人们只需要交代一声就行了。
    sillydaddy
        9
    sillydaddy  
       Jul 27
    我记得看到过 Google 有 Gemini Live API ,也就是流式处理图片和声音,延迟很低。价格不知道怎么样。
    timethinker
        10
    timethinker  
       Jul 27
    黑灰产自动化可能会有用,可以将一些常规且重复的操作流程,利用 AI 烘培为基于 OCR 的程序化操作,类似于生成一次性的中间脚本,这样就不用经过 AI ,也不用消耗 Token ,只在某些意外情况无法解决的时候,再由 AI 介入进行修复,然后更新 Case 。
    jayeli
        11
    jayeli  
       Jul 27
    本地部署的大模型可以跑吗?
    fzuccq
        12
    fzuccq  
    OP
       Jul 27
    @bwnjnOEI 不知道他这多少钱一套?
    fzuccq
        13
    fzuccq  
    OP
       Jul 27
    @jayeli 本地模型,一是太慢,二是能力不行,容易在陌生界面卡住。
    fzuccq
        14
    fzuccq  
    OP
       Jul 27
    @timethinker 你这烘培称 OCR 的程序化操作思路非常不错,我看看能不能加进来,减少 token 消耗,速度还快。
    DeadLion
        15
    DeadLion  
       Jul 27
    感觉没有前景,中间产物。
    未来“豆包手机”这种更可能是主流。
    或者再进一步没有 app 了,都是 xx-cli ,自己部署一个 xxclaw 就能用了。
    fzuccq
        16
    fzuccq  
    OP
       Jul 27
    @DeadLion 豆包也是命途多舛,agent 是大厂必争之地,能让豆包这没有硬件基础的公司垄断吗?
    network127001
        17
    network127001  
       Jul 27
    系统自带的 ai agent 才是趋势,有厂家兜底,这玩意最大的问题就是安全隐私了吧,豆包手机不就被下架了。万一模型投毒 给你钱包刷爆就完了 :(
    @fzuccq
    fzuccq
        18
    fzuccq  
    OP
       Jul 27
    @network127001 安全性是很大的问题,给 agent 权限越大,越方便,出了问题越严重,咱们的许多身家可都在手机上呢。
    nilaoda
        19
    nilaoda  
       Jul 27
    极客湾测续航似乎也是这种
    kulove
        20
    kulove  
       Jul 27 via Android
    没有前景 自己做也做不到完美 而且手机厂商会自己做的
    fzuccq
        21
    fzuccq  
    OP
       Jul 27   ❤️ 1
    @kulove 确实,我也不知道,咱们搞技术的人,喜欢拿着锤子找钉子。
    Nasdaq
        22
    Nasdaq  
       Jul 27
    请教 OP,能过滑块吗?
    fzuccq
        23
    fzuccq  
    OP
       Jul 27
    @Nasdaq 没遇到滑块验证。iPhone 环境信任度高,操作微信、淘宝没有任何异常需要验证。能不能过,我没试过。
    Nasdaq
        24
    Nasdaq  
       Jul 27
    @fzuccq #23 TB 查看卖家店铺营业执照试一下。
    fzuccq
        25
    fzuccq  
    OP
       Jul 27   ❤️ 1
    @Nasdaq 我刚才手工试验了一下,agent 通不过验证。agent 无法边滑动边观察屏幕,agent 做一个动作,移开触控笔,不遮挡摄像头,才能观察屏幕。
    Nasdaq
        26
    Nasdaq  
       Jul 27   ❤️ 1
    @fzuccq #25 感谢,已 Star 支持。
    airqj
        27
    airqj  
       Jul 27
    很多人做这个了
    靠在社交软件里钓男人挣钱
    qaq13037
        28
    qaq13037  
       Jul 27   ❤️ 2
    看了 B 站视频评论区和当前评论区,为什么非得要求拟人化呢,好像不拟人这个项目就要被处死一样,就比如 op 说的几个场景,买票之类的,根本没有被检测的可能。有些人啊,屁股就是歪的,拿来就想去做灰产。这个项目我觉得挺有意思的,可能很多人都想过这个思路,但是 op 做出来了,也有继续进化的可能,很佩服,已 star
    fzuccq
        29
    fzuccq  
    OP
       Jul 27
    @qaq13037 感谢认可,当前一是硬件 1000 元确实不小门槛,二是 token 贵,也只有黑灰产才会感兴趣。我自己用它在京东七鲜买菜,也挺心疼的。买次生鲜 token 花费 6-7 元。
    iixy
        30
    iixy  
       Jul 27
    @timethinker 啊?怎么现在又是蒸馏又是烘焙的,下一步是不是该红烧 ai 了。
    lumia1020
        31
    lumia1020  
       Jul 27
    貌似极客湾做手机续航测试就是这么干的,和楼主想法差不多,只是听说是本地模型来做的。
    fzuccq
        32
    fzuccq  
    OP
       Jul 27   ❤️ 2
    @iixy 烘培的意思是,把 agent 操作 app 的经常性动作,固定下来,下次 agent 要执行某个操作时,直接触发一连贯动作,就像打游戏出个连招,不用每一步都经过大模型。
    fzuccq
        33
    fzuccq  
    OP
       Jul 27
    @lumia1020 我看过极客湾测试视频,导航相对比较单一,本地模型应该可以跑得动。
    NeverMore11
        34
    NeverMore11  
       Jul 27
    对于 Android 来说,adb + uiautomator 方案没有问题,成本还低,基本上视图树、坐标点完成主流程,截图做关键步骤确认。我天天用这个自动化发小红书,没遇到检测。
    Sunyin
        35
    Sunyin  
       Jul 27
    [极客湾手机续航大横评:电池锁容?电量缩水?谁在浑水摸鱼?] https://www.bilibili.com/video/BV1LR336sEFX

    确实,今天刚刷到
    HeyWeGo
        36
    HeyWeGo  
       Jul 27
    那些上来就说啥完美不完美的听上去就是正确的废话
    fzuccq
        37
    fzuccq  
    OP
       Jul 27
    @NeverMore11 不同技术方案适合不同场景,到没有说哪种最优。但如果你想让 agent 能帮你购物、挂号、缴费、打卡,可能需要更 robust 的技术栈。
    xue777hua
        38
    xue777hua  
       Jul 27 via iPhone
    简单的不需要这个 难得你也过不去(刷脸)
    fzuccq
        39
    fzuccq  
    OP
       Jul 27
    @xue777hua 个人使用的话,拿起手机刷完脸放回去,让 agent 继续做,问题倒也不大。
    grzhan
        40
    grzhan  
       Jul 27
    有,国内灰产需求很大。尤其是抖音和微信。
    fzuccq
        41
    fzuccq  
    OP
       Jul 27
    @grzhan 我还是希望自己项目能用在正当合法的地方的~
    ota
        42
    ota  
       Jul 27
    软件不行,硬件来凑,手段暴力,但思路的确可以。
    后面优化硬件,小型化,包装成产品,用途太多了,小型外科机器人?哈哈。
    专门一台手机交给硬件,随便点,自己的主力机负责远控,哇靠。以后国产软件都能不装了。
    从 camera - ocr - text - 终端,直接可以分离。

    https://imgur.com/a/d9zEruN
    xue777hua
        43
    xue777hua  
       Jul 27 via iPhone
    @fzuccq 既然让你刷脸 那就是标记你了 多刷几次 就封号了。

    总的来说 成本还是搞 似乎没啥场景是 必须要在手机完成的(感觉只有灰产需要?或 灰产类似?
    fzuccq
        44
    fzuccq  
    OP
       Jul 27
    @ota 目前设计架构确实是这样的,主力手机通过微信远程遥控,发指令任务,专门一个手机交给 agent ,查看微信,用硬件操作 iPhone app ,然后回复。
    grzhan
        45
    grzhan  
       Jul 27
    @fzuccq 如果平台愿意开放的话它就会直接开放 API 来拥抱 AI Native ,也就不需要这个东西。一些 App 他们风控这么变态就是不希望你自动化。所以这也是这块变成灰产的原因。

    现在一些咸鱼卖滑轨机械臂+摄像头的也会带上 SDK 和自动化脚本软件,应该是有一定产业的。
    skyemin
        46
    skyemin  
       Jul 27
    所以我的手机得一直放在那吗
    fzuccq
        47
    fzuccq  
    OP
       Jul 27
    @xue777hua 价格高就是原罪。
    fzuccq
        48
    fzuccq  
    OP
       Jul 27
    @skyemin 你需要两台手机,一台主力机你用,一台手机 agent 用来物理操作。
    fzuccq
        49
    fzuccq  
    OP
       Jul 27
    @grzhan 希望远离黑灰产,我做这个,初衷是希望 agent 能成为人们的生活助手,减少日常繁琐事务带来的心智负担。
    grzhan
        50
    grzhan  
       Jul 27
    @fzuccq 只能说真正在商业上有需求的,也就是商业上能带来利润的主要还是灰产。
    grzhan
        51
    grzhan  
       Jul 27
    剩下就是作为极客玩具的市场了,但这块由于其实门槛没那么高,不好说哇。先考虑在开源占个生态位?
    ZhaokunZhang
        52
    ZhaokunZhang  
       Jul 27
    我前同事也做了一个,AI 自动化测试,路子跟你差不多,https://github.com/dongxinsuperman/ai-phone 已经有公司开始用了,
    ota
        53
    ota  
       Jul 27
    @fzuccq 截图 + OCR + LLM 推理,但这样的问题是延迟+token 。
    问题的核心是“持续视觉理解”,我想到了 yolo 这个,让本地 gpu 跑。
    第二个是,这些 app 虽然不开放 api ,但页面加载的监控是否能做呢?比如加载完成了,就立刻让 agent 去截图。我看你的视频貌似卡了一下,是不是在等页面平稳?
    软+硬?
    纯过程探讨,不涉及可行性和逻辑性,抱歉。
    ZhaokunZhang
        54
    ZhaokunZhang  
       Jul 27
    @ZhaokunZhang #52 等等,但好像又不太一样,但是确实用视觉识别+ LLM 推理了。
    fzuccq
        55
    fzuccq  
    OP
       Jul 27
    @grzhan 可能 token 成本降下来,才能进入个人消费者市场吧。
    dreamdragon
        56
    dreamdragon  
       Jul 27
    不限制在手机上,直接炒菜
    fzuccq
        57
    fzuccq  
    OP
       Jul 27
    @ota 有个摄像头在手机正上方,视频中没录进去。agent 通过摄像头观察屏幕,不是通过截屏。在执行完一个动作后,把机械臂移开,摄像头拍照,在本地进行 OCR 和图标识别,把识别结果、bbox 列表和原图一起发给大模型,决策下一个动作。
    spike0100
        58
    spike0100  
       Jul 27
    我看成本更低的方式是用 mac 的 iphone 镜像+本地多模态模型,在镜像模拟点击。就是忘了项目名称叫什么了
    fzuccq
        59
    fzuccq  
    OP
       Jul 27
    @spike0100 这个 mac iphone 镜像就是可扩展性太差,生态锁死在 Apple 上了。
    ybz
        60
    ybz  
    PRO
       Jul 27
    有 API 可以持续录制手机屏幕的啊,就是直播软件用的那个,不需要专门整个摄像头来看着。而且你都这样做了,整越狱 iPhone 啊,越狱后都不用物理操作了,直接软件操作。
    we1w3i
        61
    we1w3i  
       Jul 27
    如果是按你的愿景,那 iOS27 很可能可以实现
    fzuccq
        62
    fzuccq  
    OP
       Jul 27
    @ybz 我初衷是想做个人助理 agent ,总不能指望用户把自己 iPhone 越狱才能用 agent 吧?需要考虑用户易用性,尽量减少配置和设置。
    fzuccq
        63
    fzuccq  
    OP
       Jul 27
    @we1w3i 苹果是有强大号召力的,就看各大厂愿不愿配合了。
    yuruizhe
        64
    yuruizhe  
       Jul 27
    让大模型直接操作实体手机,如果指令混入了恢复出厂设置步骤,那岂不是很危险。。。
    fzuccq
        65
    fzuccq  
    OP
       Jul 27
    @yuruizhe 这个 guardrail 需要用户自己来控制,比如,不要把自己的主力机给 agent 操作,账户余额少充点,退出 apple id ,只装必要的 app 。
    evilHa
        66
    evilHa  
       Jul 27
    你得把一些场景包装好,收费降下来了,比如什么样的动作,调用大模型的次数减少,费用降低,然后包装起来,这样商业化就成功多了。

    一旦某个场景这样跑通,你就可以定制另外一些动作,而且像有些信息采集的,就超级简单了,只需要往下拉,收集信息,不需要 AI 操作。提取信息直接用 OCR 技术就行了,也能省掉 token 钱。

    综合来看,适合做,但是要往深了做,使用成本先降下来。

    当作业余做个小东西吧,先把想挣钱的事情,做好了,自然商业化场景就来了。就跟那个 rapiddns 一样,每年一大笔支出好多年,然后开始卖数据了,也挣了一笔钱。
    fzuccq
        68
    fzuccq  
    OP
       Jul 27
    @evilHa 硬件 DIY 1000 元虽然贵了些,但毕竟是一次性支出。token 要持续花费的。大模型调用确实需要大力优化的方向,一个是一次调用触发连续动作,中间就不需要调用大模型了,第二个是,优先用便宜的模型,卡住了再切换能力更强的大模型。 这些工程难度不小,增加许多项目复杂度。
    printdarling
        69
    printdarling  
       Jul 27
    @fzuccq 智谱之前不是开源了一个 AutoGLM-Phone-9B 的模型嘛?感觉可以瞅瞅
    zhangshaohan
        70
    zhangshaohan  
       Jul 27
    我前些日子正在寻找这种,目的是给我京东的订单评价赚京豆,几十个订单自己评价又太麻烦了,还需要传图片
    fzuccq
        71
    fzuccq  
    OP
       Jul 27
    @MasterCai 自动化测试用的最多是本地化视觉模型,对于简单的导航够用。对于能零 skill 配置就导航各种常用 app ,还需要调用最先进的大语言视觉模型。
    evilHa
        72
    evilHa  
       Jul 27
    @fzuccq #68
    越复杂的项目,越有护城河。

    而且你真的商业化了,就可以自己部署模型了,边界成本低。
    loveumozart
        73
    loveumozart  
       Jul 27
    你的视频演示用的是什么模型啊?
    我自己之前用 qwen3.7 这个多模态来做过 windows 上面的模拟 computer use ,让它下国际象棋,识别然后输出点击操作、拖动棋的操作挺快的,有两个很大的问题:
    1. 靠 llm 多模态识别出来的 x,y 不精准,很多次无法正确拖动棋子。
    2. 靠 llm 本身的聪明程度,后面复杂了会乱下棋,实际上并不懂国际象棋规则,为了让上下文利用起来,最好的方式是每次都新开上下文下棋。
    fzuccq
        74
    fzuccq  
    OP
       Jul 27
    @printdarling 我最近也在寻找能本地部署的开源模型,感谢分享,我回去测试一下 AutoGLM 性能,看能不能集成到本地。如果本地开源模型能驱动 agent ,那 token 成本一下子就可以忽略了。
    DiamondYuan
        75
    DiamondYuan  
       Jul 27
    我感兴趣。 有成品卖吗?

    我的想法是接入 https://midscenejs.com/ , 做自动化测试
    Vipcw95
        76
    Vipcw95  
       Jul 27
    这个感觉和 agent 关系不大啊,识图的方案不需要 agent 吧
    silencil
        77
    silencil  
       Jul 27
    之前已经找到一个 也接入了我的 harness 工具,在我的本地安装一个 runner app ,通过拿节点树和截图辅助一起定位操作我的本机 ipone ,实现帮我使用购物 app 来获取 BOM 信息(做些小玩具的时候),不过体感是太慢了也不稳定,也还没优化,晚点再看看你这个
    fzuccq
        78
    fzuccq  
    OP
       Jul 27
    @loveumozart 我演示视频用的是 sonnet-5 ,但 kimi-k2.6, k3 性能也都不错。不能让多模态模型直接看图像输出 x,y bbox ,那样会漂移。我的做法是,在本地先对图片进行 OCR 和 ICON 检测,获取都 bbox 列表,和原图一起,发给大模型。让大模型从 bbox 列表选择,这样输出坐标就很稳定了。
    xiaomushen
        79
    xiaomushen  
       Jul 27
    太慢,token 太贵

    建议重点优化高价值场景:崩老头

    我说真的
    fzuccq
        80
    fzuccq  
    OP
       Jul 27
    @DiamondYuan 需要购买零件,DIY ,文档里有组装手册。
    yohjisakamoto
        81
    yohjisakamoto  
       Jul 27
    默认坐标放在右下角是不是好一点,大部分交互设计都是放在屏幕下侧的。另外不是很懂机器人,但是感觉 xy 的复位不需要每次操作都复位一次吧,计算新 x 和 y 就当前点击位置的偏差,然后每 5 次复位一下会有影响吗。感觉可以快很多。另外我觉得你图片压缩上有很大搞头,只要能压缩到不丢失交互信息,费用能减少很多。
    xiaomushen
        82
    xiaomushen  
       Jul 27
    @timethinker 可以用来抓淘宝京东,APP 端价格数据。这种方式,不违法
    fzuccq
        83
    fzuccq  
    OP
       Jul 27
    @xiaomushen 只针对特定场景,有固定操作流程,确实能做到低成本和快速响应。我想做的是,无需配置能操作大部分常用 app ,能应付各种 app 导航,这个场景要求确实 token 很贵。
    DiamondYuan
        84
    DiamondYuan  
       Jul 27
    @fzuccq

    midscenejs 是基于纯视觉做自动化测试的,和你的场景几乎一样。

    你可以参考他的模型选择

    https://midscenejs.com/zh/model-strategy.html


    千问和豆包的视觉模型应该不错。 然后成本应该是不高的。
    jjtang11
        85
    jjtang11  
       Jul 27
    我之前刷过不知道是不是你的,同一台机子操作十几台手机,如果不是的话说明市场早有跟成熟的方案了,你这个一机一控效率太低了
    zhangli2946
        86
    zhangli2946  
       Jul 27
    通过物理手段构造的以信息终端为目标的输入, 本质上都是吃政策红利和做政策对抗。
    信息终端必须由人类进行物理操作这一限定而产生。
    限定被打破便是对这个行当颠覆性的外部条件变化。
    fzuccq
        87
    fzuccq  
    OP
       Jul 27
    @yohjisakamoto 手机正上方比较高的地方有摄像头,拍摄手机屏幕。把机械臂停靠在左上角,是为了不挡住摄像头观察操作结果。context 图片压缩,我已经做了极致优化,只保留最新的图片,历史图片都被 OCR 文本取代了。其实速度瓶颈不是机械运动,而是大模型 api 延迟太高,需要至少 20s 才能返回结果。
    fzuccq
        88
    fzuccq  
    OP
       Jul 27
    @jjtang11 这个 agent 的定位是个人助理,帮你操作需要在手机上做的事情,并不是要做手机自动化农场。
    fzuccq
        89
    fzuccq  
    OP
       Jul 27
    @zhangli2946 你这个论断太宏大了,我只不过想让 agent 能帮我做些琐事,好让我不必每天都操心这些必要而又无足轻重的事情。
    Clannad0708
        90
    Clannad0708  
       Jul 27
    目前来看这个需求是真实的,未来我觉得一定是豆包手机那种形式,从底层具备了 agent 操作能力。

    现在最大的主力是这些 agent 想要真正完成落地需要依赖很多其他 sass 系统比如淘宝,高德。但是这些操作能力,数据内容又是他们大公司的核心价值。不可能免费或者很轻易的给你(在他们找到自己生态位之前)

    我觉得未来所有的 sass 都会 cli 化比如飞书 lark 那种。
    cezhang
        91
    cezhang  
       Jul 27
    我之前也有这个这个想法 我是用途是拿来打卡 狗头
    fzuccq
        92
    fzuccq  
    OP
       Jul 27
    @Clannad0708 技术路线和商业利益冲突的时候,历史不会自动选择最优的技术路线,或者最优路线需要很多年,走过很多弯路才会实现。
    zhangli2946
        93
    zhangli2946  
       Jul 27
    当然可以,头伸出去探索一下,除了崩老头及同模式的变现方式,还有没有其他的变现方式。
    另外探索新技术来在成本端做优化。
    chouyee
        94
    chouyee  
       Jul 27
    如果只是模拟点击,完全不用大模型介入,可以换成安卓,用无障碍模式,可以实现大部分点击功能,而且更精确
    zhangli2946
        95
    zhangli2946  
       Jul 27   ❤️ 1
    @fzuccq 个人发展要和时代浪潮结合,才有的潮头永立 XP
    fzuccq
        96
    fzuccq  
    OP
       Jul 27
    @chouyee 让 agent 能稳定可靠运行,还是要减少对手机系统的侵入,这样风控触发会少很多。
    xiaomushen
        97
    xiaomushen  
       Jul 27
    @fzuccq 合法合规前提虾,大企业对于终端渠道价格的监控,是强烈需求。人工方案不算,目前只有灰产才能做到,而你这个方案,完全合法合规,所有有商业价值
    fzuccq
        98
    fzuccq  
    OP
       Jul 27
    @xiaomushen 也只有大企业才能付得起 token 费用,目前能稳定驱动 agent 的模型,单次点击操作成本 0.2 元,确实有很多优化空间。
    loveumozart
        99
    loveumozart  
       Jul 27
    @fzuccq #78 很棒啊,确实应该多识别一些精准元数据出来!不过好像下国际象棋的场景很特殊,棋子都太像了,没法像你这样做得很泛化,支持楼主
    loveumozart
        100
    loveumozart  
       Jul 27   ❤️ 1
    @chouyee 大模型是提供泛化能力的,具体用什么点,这个不是大模型的工作
    1  2  
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   1028 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 124ms · UTC 22:31 · PVG 06:31 · LAX 15:31 · JFK 18:31
    ♥ Do have faith in what you're doing.