Xinference 使用教程:本地部署大模型,一条命令拉起你的多模型服务
Xinference 使用教程本地部署大模型一条命令拉起你的多模型服务【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inferenceXinference 是一个开源的大模型推理服务框架model serving 框架它把「安装、启动、调用」大模型这套繁琐流程收敛成一个统一入口。你只需pip install后启动一条命令就能在本地同时管理大语言模型、文本嵌入模型embedding、重排模型等多种模型并且对外提供 OpenAI 兼容的 RESTful API即接口格式与 OpenAI 官方 API 一致现有代码改个base_url就能接上。为什么需要它想象这样一个场景你想在笔记本上跑一个开源大模型做个人助理结果一头扎进了依赖地狱——某个推理引擎和 PyTorch 版本冲突量化参数不知道怎么配装完发现还得自己写 HTTP 服务才能给其他程序调用。折腾一天模型还没跑起来。Xinference 的价值在于把这套流程标准化了。框架内置了常见的开源模型如 Qwen 系列、GLM 系列等你不需要手动下权重、配环境首次启动时它会自动从 HuggingFace 下载并本地缓存。更实际的一点是「多模型统一管理」。很多 RAG检索增强生成即先用嵌入模型把文档转成向量做检索、再交给大模型生成答案或知识库项目同时需要 LLM embedding rerank 三类模型。用别的方案你得给每类模型各起一个服务而用 Xinference 它们在同一个端口下统一管理客户端通过同一个地址调用切换和扩缩容都方便。快速上手下面三步从零到能对话。安装与启动步骤pip install xinference[all] xinference-local --host 0.0.0.0 --port 9997[all]会装齐各类推理后端的依赖如果你只需要部分能力也可以按 安装文档 单独安装。启动后浏览器访问http://127.0.0.1:9997就能看到 Web 管理界面。第一个模型怎么跑在 Web 界面里点选模型即可启动或者用 Python 客户端一行拉起。以 Qwen 系列为例from xinference.client import RESTfulClient client RESTfulClient(http://127.0.0.1:9997) model_uid client.launch_model( model_enginevllm, model_nameqwen2.5-instruct, model_formatpytorch, size_in_billions7 ) print(model_uid)注意model_engine参数自 v0.11.0 起启动 LLM 需要指定推理引擎可选 vllm、sglang、llama.cpp、transformers、MLX 等。不确定某个模型支持哪种引擎和量化组合时用xinference engine命令查询即可。启动完成后model_uid默认就是模型名如qwen2.5-instruct后续调用直接用它标识模型。完整场景演示本地个人知识库问答目标把你的笔记、文档扔进去做一个只跑在本机、不联网传数据的问答助手。步骤一启动一个文本嵌入模型用于把文档切片转成向量client.launch_model( model_namebge-base-en-v1.5, model_typeembedding )步骤二用 OpenAI 兼容接口调用无需引入专用 SDK。因为 Xinference 实现了与 OpenAI 一致的 Chat Completions 和 Embeddings 接口你可以直接用openai官方客户端只把地址指向本地from openai import OpenAI client OpenAI(base_urlhttp://127.0.0.1:9997/v1, api_key本地无需密钥) resp client.chat.completions.create( modelqwen2.5-instruct, messages[{role: user, content: 用一句话解释什么是 RAG}] ) print(resp.choices[0].message.content)效果所有推理都在本机完成文档内容不出你的机器同时 Web 界面和 API 两条路都能用写脚本、调界面都顺手。模型源码与内置模型列表可参考 xinference/model/ 目录。部署与进阶三种规模各给一句话方式适用场景关键命令本地单机个人、笔记本/工作站xinference-localDocker 容器GPU 服务器环境隔离docker run --gpus all xprobe/xinference分布式集群大模型多机分摊xinference-supervisorxinference-worker本地前面已演示模型缓存默认放在~/.xinference可用环境变量XINFERENCE_HOME改路径。DockerNVIDIA GPU 机器用官方镜像即可CPU-only 机器有专门的-cpu版本详见 Docker 指南。分布式一台机器跑 supervisor 做调度其余机器跑 worker 接活超大模型可跨节点分摊参考 分布式推理文档。写在最后Xinference 把「跑一个能用的本地大模型」这件事的门槛压得很低装包、起服务、调接口三步搞定且天然支持多模型与分布式扩展 。延伸阅读官方使用指南 doc/source/getting_started/using_xinference.rst、安装说明 doc/source/getting_started/installation.rst、客户端 API doc/source/user_guide/client_api.rst、推理后端选择 doc/source/user_guide/backends.rst。【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →