尧图精选

GenieX实战指南:三步在骁龙设备上本地部署LLM与VLM

🕒 发布时间:2026/9/20 17:30:13 📁 来源:尧图网络
GenieX实战指南三步在骁龙设备上本地部署LLM与VLM【免费下载链接】GenieXRun frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code项目地址: https://gitcode.com/GitHub_Trending/ne/GenieXGenieX 是高通为骁龙设备打造的端侧生成式 AI 推理运行时一套底层 C SDK向上暴露 CLI、Python、Kotlin/Java、Docker 与 OpenAI 兼容本地服务器五种入口让 Hugging Face 上的 GGUF 模型或高通 AI Hub 的预编译模型包都能以几行代码在 Hexagon NPU、Adreno GPU 或 CPU 上本地运行。一套 SDK五种入口不管你是想在终端里聊两句还是把模型嵌进 Android 应用走的是同一条技术链路CLI—— 终端直接推理附带模型拉取与服务能力Python—— 接口风格对齐transformersfrom_pretrained()→generate()Android SDKKotlin/Java—— 面向骁龙手机与平板的端侧应用Docker—— 容器内就是完整 CLI行为与本机一致兼容 OpenAI 协议的服务器—— 现有 OpenAI 客户端换个 base_url 就能接上。双运行时按模型来源选性能档GenieX 同时内置两个推理运行时这是它模型覆盖广和性能到顶能兼得的原因llama_cppqairtAI Engine Direct模型来源Hugging Face 任意 GGUF高通 AI Hub 预编译模型包计算单元NPU · GPU · CPU 任选仅 NPU适合场景自带模型、灵活试跑追求端侧峰值性能一个实用经验走 llama_cpp 时把精度选Q4_0它才能落到 Hexagon NPU 上其他量化档位一般回退到 GPU/CPU。VLM 也完整支持VLM 支持图像输入音频输入目前仅 llama_cpp 后端可用。三步上手从安装到跑通第 1 步装 CLI。Windows ARM64 从 release 页下载安装包即可Linux ARM64 一行搞定# Linux ARM64 一键安装无需 sudo curl -fsSL https://qaihub-public-assets.s3.us-west-2.amazonaws.com/qai-hub-geniex/install.sh | sh # 在终端直接与模型开聊自动下载并缓存 geniex infer google/gemma-4-E4B-it-qat-q4_0-gguf第 2 步用 Python 集成。装完pip install geniex后写法几乎照抄 transformers把本地模型、AI Hub 模型或ai-hub-models/*路径传进from_pretrained即可流式生成。第 3 步按需切换硬件。geniex infer model --compute npu|gpu|cpu指定算力骁龙多 DSP 设备上还可以用--compute HTP0,HTP1,...把负载摊到多个 NPU 核心上。把本地模型变成 OpenAI 兼容服务想让 LangChain 之类的框架直接接上本地模型不需要改一行代码# 先把模型拉到本地缓存 geniex pull ai-hub-models/Qwen3-4B-Instruct-2507 # 启动 OpenAI 兼容服务器默认监听 127.0.0.1:18181 geniex serve服务默认跑在http://127.0.0.1:18181/v1支持chat/completions、completions、models端点流式、工具调用、思考内容分离reasoning_content都有浏览器打开根地址还能直接进内置 Swagger UI 试请求。VLM 模型也走同一条路径图片支持本地路径、HTTP URL 和 base64 三种写法。常用命令与参数速查命令 / 参数作用geniex pull model下载并缓存模型--local-path可导入本地文件或 zipgeniex infer model交互式本地对话VLM 可直接拖入图片/音频--compute npu\|gpu\|cpu选择计算单元默认npu--think / --thinkfalse开关推理模型的思考模式--sliding-window仅 qairt上下文超长时丢弃最旧 token 继续聊--power-mode burst调节 HTP 功耗/时钟档位geniex serve启动 OpenAI 兼容本地服务器geniex list / remove / clean查看、删除、清空已缓存模型geniex model list --all列出当前芯片可用的 NPU 预编译模型GENIEX_LOGdebug环境量控制日志级别--log等效文档与进阶路线全量中文开发者文档docs/README.mdCLI 速查在 cli/README_zh.mdC/C SDK 接口sdk/README.md头文件 sdk/include/geniex.hPython 绑定源码bindings/python/Android SDKbindings/android/示例 Notebookexamples/python/windows.ipynb设备端测试脚本tests/qdc/想参与共建先读 CONTRIBUTING.md然后可以# 克隆源码从 notes/build.md 开始了解构建流程 git clone https://gitcode.com/GitHub_Trending/ne/GenieX目前 GenieX 处于开发者预览阶段覆盖 Windows ARM64、Android、Linux ARM64 三类骁龙平台遇到 bug 或想提需求直接提 issue 即可。✅【免费下载链接】GenieXRun frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code项目地址: https://gitcode.com/GitHub_Trending/ne/GenieX创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →