爱意满满的作品展示区。
MaskerPRC

做了个小工具:丢个 HuggingFace 链接进去,自动打出免装环境的本地模型懒人包

  •  
  •   MaskerPRC · 8h 18m ago · 275 views

    起因是我自己被配环境搞烦了。想跑个 whisper ,CUDA 版本对不上,cudnn 缺文件,折腾一晚上没跑起来。后来发现网上其实不缺懒人包,缺的是能随时出新包的办法——别人分享的包永远是固定那几个模型,你想跑个新的,还是得自己从头配环境。

    所以我把方向反过来:不做固定的包,做一条打包流水线。丢一个 HuggingFace 链接进去,自动产出整合包。谁想跑新模型新框架,把链接发我就行,很快打包上架。

    包里不放 Python ,只有编译好的 C++ 内核( llama.cpp 、whisper.cpp 这类)加权重,运行时由客户端提供。所以体积小很多:最小的 whisper 包 59MB ,qwen3-0.6b 的包 602MB 。对比那些内嵌 Python 的整合包,光解释器就 4 个多 G 。

    每台机器情况不一样,同一个模型我出了 CPU 版和显卡加速版分开上架,客户端按本机硬件默认选,没独显的话跑不动的包直接不展示。

    上架前每个包都会真跑一遍:起服务、发真实请求、断言输出、再关停,用的就是客户端跑模型的同一套代码。免得有人下载下来发现根本起不来。

    实测数据,i9-14900KF / 16G 内存 / 纯 CPU: whisper-base-q5_1 ,59.2MB ,启动 0.6s ,首次推理 0.9s qwen3-0.6b-gguf ,602MB ,启动 1.6s ,38 tok/s

    目前只出了 Windows x64 的包。下载走网盘,包不大,千兆带宽下载也就几秒的事。

    想跑什么新模型,直接把链接丢给我,我打包好上架。也欢迎拍砖,尤其觉得这个思路有坑的,说说坑在哪。

    No Comments Yet
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   886 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 20ms · UTC 19:50 · PVG 03:50 · LAX 12:50 · JFK 15:50
    ♥ Do have faith in what you're doing.