尧图精选

不联网也能在手机上跑大模型?聊聊这个 NPU 优先的开源 AI 运行时

🕒 发布时间:2026/9/26 16:22:20 📁 来源:尧图网络
先说个场景你想在手机上做个本地助手结果要么得把数据传到云端、要么模型根本跑不动。我最近翻到一个叫NexaSDK的项目GitHub它想解决的正是这个——让前沿的大模型直接住在设备里手机、PC、IoT 都能跑还尽量用上厂商自家的 NPU[注]。[注]NPU神经网络处理单元一种专门给 AI 推理加速的芯片特点是又快又省电相当于给设备装了台AI 专用发动机。下面用普通使用者的视角梳理一遍不替项目方喊口号能落地的说落地有坑的也提一嘴。它到底想解决什么设备端 AI 这个坑踩过的人都知道有多碎。NexaSDK 想填的几个洞平台太碎以前 PC 用一套、Android 一套、iOS 又一套重复造轮子。NPU 没人管手机里明明有 NPU但大多数框架只认 GPU、CPUNPU 常年闲置。新模型等不起模型刚发布端侧往往要等社区移植慢半拍。多模态难集成图文、语音这些能力自己拼起来很麻烦。跨端成本高每换一个平台就得重写一遍。说白了它想做一套 SDK哪儿都能跑的设备端 AI 运行时。我比较看重的几个能力1. NPU 优先而不是能跑就行这是它和 Ollama、llama.cpp 这类工具最大的区别。NexaSDK 是少见的 NPU-first[NPU 优先默认优先调用 NPU没有再退到 GPU最后才是 CPU]设计。打个比方三个计算后端就像三种工人CPU是啥都会一点的万能工但干重活慢GPU是能并行扛重活的壮劳力NPU是只干 AI 这一件事、却又快又省电的专项工。NexaSDK 的优先级是NPU GPU CPU能上 NPU 就上 NPU。它目前支持高通 Hexagon NPU骁龙系列苹果 Neural Engine[Neural Engine苹果自家的 AI 加速芯片简称 ANE]Intel / AMD 的 NPUWindows 端2. 全平台一套代码多端跑覆盖得挺全平台提供什么备注PCPython / C SDKWin / macOS / LinuxAndroidKotlin SDK支持 NPU/GPU/CPU最低 SDK 27iOSSwift SDK走 ANE需 iOS 17Linux / IoTDocker 镜像支持 Arm64 和 x86适合边缘设备3. 新模型当天就能用官方叫 Day-0 支持[Day-0模型刚发布、权重一出就能在端侧跑不用等移植]。它支持三种模型格式GGUF[GGUF把大模型量化压缩后的通用权重格式llama.cpp 生态也在用]MLX[MLX苹果推出的机器学习框架专为 Apple 芯片优化]NEXA它自己的原生格式针对 NPU 做了优化支持到的模型包括 Qwen3-VL、IBM Granite-4、Gemma-3n、GPT-OSS 这些较新的型号。4. 多模态一条龙不止聊天它能跑LLM[LLM大语言模型就是常见的文本对话模型]VLM[VLM视觉语言模型能同时看图和理解文字]ASR[ASR自动语音识别语音转文字]OCR[OCR光学字符识别从图片提取文字]Rerank[Rerank重排序检索时把最相关结果往前排]目标检测、图像生成、向量嵌入[Embedding把文字变成一串数字方便比相似度]5. 接口统一还兼容 OpenAI一套 API 打天下并且兼容 OpenAI 接口意味着你已有的 OpenAI 风格代码改动不大就能接上。支持流式输出和 Function Calling[Function Calling让模型能调用你提供的函数/工具]。能用在哪从社区反馈和文档来看几个比较实在的落点手机本地助手离线也能对话、翻译断网不怕。IoT / 边缘计算智能音箱、摄像头、温控器在本地做识别数据不出门。桌面应用集成本地文档处理、代码辅助隐私友好。企业内网对数据敏感、不允许上云的场景本地推理更稳。实际怎么用光说没用把命令摆出来。命令行最省事# Linux ARM64 一键装 CLIcurl-Lhttps://github.com/NexaAI/nexa-sdk/releases/latest/download/nexa-cli_linux_arm64.sh|bash# 跑第一个模型nexa infer ggml-org/Qwen3-1.7B-GGUF# 多模态直接把图片拖进 CLInexa infer NexaAI/Qwen3-VL-4B-Instruct-GGUF# 走 NPUWindows arm64 骁龙 X Elitenexa infer NexaAI/OmniNeural-4BPythonfromnexaaiimportLLM,GenerationConfig,ModelConfig,LlmChatMessage llmLLM.from_(modelNexaAI/Qwen3-0.6B-GGUF,configModelConfig())conversation[LlmChatMessage(roleuser,contentHello, tell me a joke)]promptllm.apply_chat_template(conversation)fortokeninllm.generate_stream(prompt,GenerationConfig(max_tokens100)):print(token,end,flushTrue)AndroidKotlindependencies{implementation(ai.nexa:core:0.0.19)}NexaSdk.getInstance().init(this)VlmWrapper.builder().vlmCreateInput(VlmCreateInput(model_nameomni-neural,model_path/data/data/your.app/files/models/OmniNeural-4B/files-1-1.nexa,plugin_idnpu,configModelConfig())).build().onSuccess{vlm-vlm.generateStreamFlow(Hello!,GenerationConfig()).collect{print(it)}}iOSSwiftimportNexaSdkletasrtryAsr(plugin:.ane)tryawaitasr.load(from:modelURL)letresulttryawaitasr.transcribe(options:.init(audioPath:audio.wav))print(result.asrResult.transcript)Linux / IoTDockerdockerpull nexa4ai/nexasdk:latestexportNEXA_TOKENyour_token_heredockerrun--rm-it--privileged\-eNEXA_TOKEN\nexa4ai/nexasdk:latest infer NexaAI/Granite-4.0-h-350M-NPU架构长啥样我翻了下它的设计是典型的分层结构应用层 → SDK 层 → 运行时层 → 计算后端。运行时层把算在哪和怎么算抽象出来底层再挂 NPU / GPU / CPU 三个插件CPU 当保底。应用层 CLI / Python / Android / iOS │ SDK 层 统一 API · 模型加载管理 · 配置 │ 运行时层 计算后端抽象 · 格式解析 · 推理引擎 │ ┌──┴───┐ NPU GPU 插件 插件 │ CPU 插件兜底和别的框架比差在哪我把常见的几个拉出来对比满分五星纯个人从文档和功能层面看的对比项NexaSDKOllamallama.cppLM StudioNPU 支持★★★★★✕✕✕移动端 SDK★★★★★△△✕Linux Docker★★★★★★★★★★★★★★★✕新模型当天用★★★★★✕ 滞后△✕ 滞后多模态★★★★★△△△跨平台★★★★★△△△一行命令跑★★★★★★★★★★△ 需配置★★★★★OpenAI 兼容★★★★★★★★★★★★★★★★★★★★一句话如果你只是想在电脑上玩玩模型Ollama 更轻但如果你要上手机、上 NPU、上 IoTNexaSDK 的覆盖明显更全。它适合谁不适合谁适合想做手机本地 AI 应用的开发者离线、隐私友好想用 NPU 加速省电的移动开发在 IoT / 边缘设备上跑模型的同学想做设备端多模态图文、语音的人先想清楚再上NPU 部分需要许可证CPU/GPU 组件是 Apache-2.0 免费NPU 不是商用前看清授权。NPU 只认特定芯片高通骁龙、苹果 ANE、Intel/AMD NPU老设备吃不到。Android 最低 SDK 27、iOS 要 17老系统跑不了。我还没在真机上深度压测性能和功耗请以你自己的设备为准。名词小抄NPU专门加速 AI 的芯片又快又省电量化降低模型数值精度体积变小、速度变快GGUF / MLX / NEXA三种模型权重格式端侧常用VLM / ASR / OCR / Rerank / Embedding多模态能力的几种类型看图、听声、读字、排序、向量化Day-0模型发布当天就能在端侧跑怎么开始GitHubhttps://github.com/NexaAI/nexa-sdk官网文档https://docs.nexa.ai版本v0.2.71CPU/GPU 组件用 Apache-2.0如果你也在折腾设备端 AI或者已经在真机上跑过 NexaSDK欢迎在评论区聊聊真实体验——尤其是 NPU 那块的功耗和速度我挺想看实测数据。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →