尧图精选

Lucebox专攻DeepSeek V4:DSpark草稿模型、MoE专家并行与ROCmFPX量化达成42 tok/s

🕒 发布时间:2026/10/1 8:32:52 📁 来源:尧图网络
Lucebox专攻DeepSeek V4DSpark草稿模型、MoE专家并行与ROCmFPX量化达成42 tok/s【免费下载链接】luceboxLLM speculative inference server for heterogeneous hardware consumer GPUs项目地址: https://gitcode.com/gh_mirrors/lu/luceboxLucebox 是一个面向消费级硬件的 LLM 推测推理服务器speculative inference server专为异构显卡与消费级 GPU 设计。它对 DeepSeek V4 Flash 做了深度定制用DSpark 草稿模型加速解码、用MoE 专家并行把模型拆到两块 AMD GPU 上、再用ROCmFPX 混合量化把模型塞进 128 GB 统一内存——在 Strix Halo 平台上单请求解码实测42 tok/s8K 上下文预填充高达320 tok/s。实测成绩一览DeepSeek V4 在消费级 AMD 平台上Lucebox 的 DeepSeek V4 优化不是实验室数字而是在真实消费硬件上反复资格验证qualification后的结果硬件组合配置实测吞吐Strix HaloRyzen AI MAX 395128 GB 统一内存ROCmFPX MIX 量化 DSpark 草稿 全部 6 个路由专家--profile ds4-strix42 tok/s解码8K 上下文320 tok/s预填充123K 上下文仍有36 tok/s代码/数学题39 tok/s长文25 tok/sR9700 Strix Halo 双卡MoE 专家并行--profile ds4-r9700-strix86 tok/s解码2K 上下文预填充788 tok/sRX 7900 XT Strix Halo双 ROCm 128K 方案真 top-k-645.0 ~ 47.7 tok/s解码132,981 token 预填充111.2 tok/sStrix Halo 单机多客户端分页注意力并发--max-concurrency 44 客户端输出窗口48.4 tok/s注不同跑分对应不同提示词混合与推理策略官方明确说这些数字展示的是配置可行而非跨硬件排名。DSpark 草稿模型推测解码如何做到 42 tok/s推测解码的思路是让一个很小的草稿模型先快速猜一串 token再由大模型一次性批量验证猜对了就整段接受。DeepSeek V4 在 Lucebox 里配套的草稿器叫DSpark它有三个巧妙之处只有 3 层。DSpark 从目标模型第 40~42 层提取特征用一个约 3 层的小 DeepSeek V4 块堆栈生成草稿块默认 block size 为 5 个 token。它的 token 嵌入和输出投影lm_head与目标模型共享权重草稿文件本身不携带词表权重内存开销极小。实现见 deepseek4_dspark.h。Markov 头 置信度头。草稿末端有两个小头Markov 头做逐位置的修正置信度头给每个候选打分。Lucebox 用置信度头在线校准每一步动态选择验证宽度 q2~q5——草稿可信就一次验证 5 个 token不可信就只验证 2 个把算力花在刀刃上。融合五路验证器q5 fused verifier。gfx1151RDNA3.5上启用 DSpark 后自动安装五路融合验证 GPU 图一次校验 5 个草稿 token跨压缩边界的拒绝只回滚并重放已接受前缀避免浪费。一个容易被忽略的坑DSpark 验证器只支持贪心解码。如果请求temperature 0服务器会静默回退到纯自回归解码。官方模型卡默认temperature: 1.0见 deepseek-v4-flash-0731-rocmfpx.json所以测速时请显式传temperature: 0.0否则测到的只是 AR 速度。MoE 专家并行256 个专家拆给两块 GPU 跑DeepSeek V4 Flash 是 43 层 MoE 模型每层有256 个路由专家top-6 1 个共享专家显存压力巨大。Lucebox 的方案是路由级专家并行route-level expert parallelism而不是按层切分离散 GPU如 R9700 或 7900 XT持有稠密层、精选的热专家、KV 缓存和 DSpark 草稿器Strix Halo 持有其余冷专家每个 MoE 层两边各自算完专家结果后在进程内合并——这是单次前向内的并行不需要第二个服务进程。专家放哪台卡由路由统计决定先用代表性请求采集一次路由分布 CSV再用LUCE_DS4_HOTNESS_CSV指导放置把最热且性价比最高的专家放在带宽更好的卡上。关键放置逻辑在 moe_hybrid_placement.h完整机制与验证数据见 DS4.md 的 In-process heterogeneous expert parallel 一节。对只有 RX 7900 XT20 GB Strix Halo 的用户仓库内置了可直接运行的双卡启动脚本 serve_ds4_dual_rocm_128k.sh默认 128K 上下文、真 top-k-6环境变量可覆盖所有设备与预算设置。ROCmFPX 量化混合比特让模型装进 128 GBStrix Halo 的统一内存是 128 GB但要装下全部 256×43 个专家的原始精度并不轻松。Lucebox 使用ROCmFPX MIX 自适应量化产物DeepSeek-V4-Flash-0731-ROCMFPX-MIX-STRIX.gguf不同专家按路由热度采用不同固定码本宽度ROCmFP2 / FP3 / FP4 混合热专家保留更高精度冷专家压得更狠对应内核MMQ/MMVQ在gfx1151和 RDNA4 上专门调优gfx1151设备档案在启动时自动装好全部内核与策略默认值用户无需调任何环境变量注意自适应码本产物qtype-105/106不要降低--ds4-expert-top-k——官方实测 top-4 会把逐字复制保真度从 95% 打到 60%而 uniform 产物则无影响。快速上手三步启动 DeepSeek V4 服务第一步准备模型文件下载目标模型ROCmFPX MIX Strix与 DSpark 草稿Q4RMFP4-denseF16放到models/与models/draft/目录。第二步用官方 profile 启动Strix Halo 单机方案只需一行 profile所有内核默认值自动生效./server/build-hip/luce_server /path/to/DeepSeek-V4-Flash-0731-ROCMFPX-MIX-STRIX.gguf \ --draft /path/to/DeepSeek-V4-Flash-0731-DSpark-draft-Q4RMFP4-denseF16.gguf \ --target-device auto \ --profile ds4-strixds4-strixprofile 展开为--max-ctx 131072 --chunk 8192 --ds4-fused-decode --ds4-fused-verify-f16-kv --ds4-expert-top-k 6 --ds4-prefill sparse。命令行上任何 flag 都会覆盖 profile 默认值。第三步调用 OpenAI 兼容 APIcurl -s http://127.0.0.1:8000/v1/chat/completions \ -H Content-Type: application/json \ -d {messages:[{role:user,content:Write a Python LRU cache.}], max_tokens:256,temperature:0}不想手动构建预构建的 Docker 镜像同时覆盖 NVIDIA:cuda12与 AMD:rocm挂载模型目录后直接--profile ds4-strix即可新手常见疑问FAQQ42 tok/s 是哪种负载是混合评测平均。代码/数学类提示词接受率高约 39 tok/s开放长文接受率低约 25 tok/s。评估推测解码速度时请对照它测得的接受率而不是直接对比标题数字。Q多客户端并发怎么办分页注意力并发服务--paged-attention --max-concurrency 4~6走自回归解码并拒绝--draft与 DSpark 投机路径不叠加Strix Halo 单机 6 通道、R9700Strix 异构配置经资格验证支持 1~4 并发。详见 DS4.md。Q测出来只有 3~5 tok/s是坏了先检查请求是否显式传了temperature: 0.0见上文静默 AR 回退再检查机器是否空闲——Strix Halo 解码受统一内存带宽限制宿主上跑个无关编译就能把 18.2 tok/s 打到 3.8 tok/s。延伸阅读推荐机型矩阵与启动参数RECOMMENDED_SETUPS.mdDeepSeek V4 完整指南执行模式、环境变量、验证器DS4.mdq5 AMD 资格验证脚本与重叠分析qualify_ds4_q5_amd.sh、analyze_rocprof_overlap.py服务器参数与环境变量总览server/README.md、server/docs/ENVIRONMENT.md【免费下载链接】luceboxLLM speculative inference server for heterogeneous hardware consumer GPUs项目地址: https://gitcode.com/gh_mirrors/lu/lucebox创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →