Kimi K2 本地部署实操指南:16 张卡一条命令跑起万亿参数智能体模型
Kimi K2 本地部署实操指南16 张卡一条命令跑起万亿参数智能体模型【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2把 Kimi K2 智能体模型部署到本地最先卡住你的往往不是模型本身而是显存总参数 1 万亿FP8 权重大约 1TB官方给出的最小部署单元是 16 卡集群。后文按官方文档路线走先核对硬件再起 vLLM 服务最后把工具调用接上。能力速览Kimi K2 到底能干什么Kimi K2 是 Moonshot AI 团队出品的开源智能体大模型MoE 架构总参数 1 万亿每个 token 只激活 320 亿从 384 个专家里选 8 个。上下文 128K权重为 FP8block-fp8。两个变体Base 是基座模型适合微调Instruct 是后训练版直接用于对话和智能体任务。它的主场是三件事长上下文理解、工具调用、智能体代码修复。项目数值架构MoE384 个专家每 token 选 8 个总参数 / 激活参数1T / 32B上下文长度128K权重格式FP8block-fp8推荐推理引擎vLLM、SGLang、KTransformers、TensorRT-LLM适合的场景不适合的场景长代码库、长文档的 128K 上下文分析单卡或小集群家用环境官方最小单元为 16 卡工具调用、多步骤自动化任务拿 Base 直接当聊天助手应用 Instruct智能体代码修复、自动改 bug 提补丁磁盘只剩 1TB 可用权重本身已约 1TB开工前先核对这张硬件表 显存要求最直接的依据是部署文档FP8 权重跑满 128K 上下文在 H200/H20 平台的最小单元是 16 卡集群张量并行或数据并行专家并行。一句话Kimi K2 的显存要求没有单卡就行这条路。采购前对一下这张表项目要求GPU16 张 H2096GB或 H200141GB官方最小单元Python3.8 以上具体以推理引擎官方说明为准CUDA11.7 以上具体以推理引擎官方说明为准磁盘权重约 1TB建议预留 2TB 以上可用空间卡数凑不够 16 张就别硬上 vLLM转去看部署文档里 KTransformersGGUF那一节它面向 CPU 加 GPU 混合的环境。一条命令路线跑通服务先把项目拉下来git clone https://gitcode.com/GitHub_Trending/ki/Kimi-K2 cd Kimi-K2再用 vLLM 起服务官方要求版本不低于 v0.10.0rc1$MODEL_PATH 换成权重路径vllm serve $MODEL_PATH --port 8000 \ --served-model-name kimi-k2 --trust-remote-code \ --tensor-parallel-size 16 \ --enable-auto-tool-choice --tool-call-parser kimi_k2最后两个参数是开启工具调用的必选项。多节点示例和完整参数说明都在部署指南 docs/deploy_guidance.md 里。想追更高吞吐的看同文件的 SGLang 一节KTransformers 和 TensorRT-LLM 路线也在同一份文档里这里不展开。跑通后最值得调的三个点温度。官方 README 给 Kimi-K2-Instruct 的推荐值是 0.6。它比推理引擎默认的 1.0 低换一些随机性工具调用和代码输出更稳定。请求里直接带上这个值不用反复试。工具调用。服务启动时带上--enable-auto-tool-choice --tool-call-parser kimi_k2请求里把工具列表传进去并设tool_choiceauto模型自己决定何时调用completion client.chat.completions.create( modelkimi-k2, messagesmessages, temperature0.6, toolstools, tool_choiceauto, ) # finish_reasontool_calls 时执行函数把结果以 roletool 写回 messages再调一次完整循环、流式输出、框架没有解析器时的手动解析都写在 docs/tool_call_guidance.md。代码生成。SWE-bench Verified 智能体代码修复单项Kimi K2 Instruct 单次尝试通过率 65.8%多语言任务 47.3%。想搭开 issue → 自动修 bug → 提补丁这类流程可以从它切入。新手最容易踩的三个坑 ⚠️显存爆了。权重默认就是 FP8再往下是量化路线更先做的是砍你实际用到的上下文长度。官方 16 卡最小单元是按 128K 满长度算的用不满就从这里省。端口冲突。改--port之前先看旧进程是不是还占着端口。等旧服务退出再换端口重试别以为换号就能绕过去。工具调用回来一堆乱码。多半是启动 vLLM 时漏了--enable-auto-tool-choice和--tool-call-parser kimi_k2。模型输出的是原始工具调用片段客户端解析不了。你的推理框架没有原生解析器的话翻工具调用说明的手动解析一节。服务起好后打开 docs/deploy_guidance.md 的 vLLM 一节把参数和你实际的卡数对上。再跑通 README 里 Tool Calling 那章的 get_weather 示例控制台打出 tool_result这条路线就算真正通了。【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →