尧图精选

Spark-X2.5-4B基准测试深度解读:AIME 90.7、SWE-Bench Pro 44.4,真实数据看它如何越级同规模开源模型

🕒 发布时间:2026/9/20 11:52:36 📁 来源:尧图网络
Spark-X2.5-4B基准测试深度解读AIME 90.7、SWE-Bench Pro 44.4真实数据看它如何越级同规模开源模型【免费下载链接】Spark-X2.5-4BSpark-X2.5-4B 旨在让强大的 AI 更实用、更高效、更易获得。在广泛日常任务中表现强劲涵盖对话、写作、翻译、推理、编码、工具调用以及智能体工作流并在同等规模的开源模型中取得领先成绩。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合并支持 200 多种语言。项目地址: https://ai.gitcode.com/SparkLLM/Spark-X2.5-4BSpark-X2.5-4B 是一款面向端侧与轻量部署的 4B 级开源大语言模型主打对话、写作、翻译、推理、编码、工具调用与智能体工作流并原生支持最高 1M tokens 上下文窗口和 200 多种语言。本文基于官方基准测试真实数据逐项解读它的 AIME 90.7、SWE-Bench Pro 44.4 等成绩看看这个小钢炮究竟如何越级挑战同规模乃至更大参数的开源模型。一、先认识 Spark-X2.5-4B4B 参数背后的三大设计在拆分数之前先用 3 个关键点理解它的定位效率优先的混合注意力架构36 层中每 4 层包含 1 层全注意力 3 层滑动窗口注意力窗口 512 tokens大幅降低长上下文计算开销这是它能扛住 1M 上下文的底气。层类型排布可以直接在 config.json 中看到原生 1M 上下文max_position_embeddings设为 1,048,576见 config.json无需外挂长文本技巧大规模强化学习后训练预训练语料约 20 万亿 tokens再通过 SFT 多领域强化学习 MOPD 蒸馏整合在华为昇腾集群上完成重点强化推理、编码与指令跟随。 仓库中模型权重以 5 个分片存放model-00001-of-00005.safetensors至model-00005-of-00005.safetensors分片映射关系见 model.safetensors.index.json。二、数学推理基准测试AIME 90.7 有多强数学竞赛题是检验模型硬推理能力的试金石。官方数据思考模式推荐采样参数 temperature1.0、top_p0.95与 generation_config.json 一致如下数学基准Spark-X2.5-4BQwen3.5-9BQwen3.5-4BGemma4-12BAIME 202690.788.283.082.1HMMT Feb 202681.270.869.765.6IMO-AnswerBench74.269.868.557.2Gaokao 2026满分150133.4135.5130.3130.6三个值得注意的信号AIME 90.7不仅领先同规模的 Qwen3.5-4B 近 8 分甚至超过 9B、12B 级的对手是典型越级表现HMMT 81.2对 Qwen3.5-9B 领先 10 分以上差距拉开越明显说明优势并非单题运气高考 133.4与 9B 级模型基本打平中文数学场景不掉队。 通俗理解让一个 4B 模型做 AIME 达到 90.7 分相当于小学生解出了研究生水平的竞赛题——这靠的是强化学习对推理链的系统性训练而非单纯堆参数。三、代码与智能体基准测试SWE-Bench Pro 44.4 的含金量代码修复与智能体Agent能力是当前小模型竞争最激烈的赛道这也是 Spark-X2.5-4B 的主场基准Spark-X2.5-4BQwen3.5-9BQwen3.5-4BGemma4-12BSWE-Bench Pro44.433.829.421.9SWE-Bench Multilingual53.343.327.732.5τ³-bench30.49.36.713.3MCP-Atlas54.647.440.830.5BrowseComp40.98.314.310.0BFCL-V465.166.150.337.4关键解读SWE-Bench Pro 44.4真实 GitHub Issue 修复任务上领先 9B 模型约 11 分是 Gemma4-12B 的 2 倍——对本地修 Bug 助手类应用是质变级提升τ³-bench 30.4 vs 9.3在复杂多轮工具调用场景领先近 3 倍多智能体/工具调用是其明显强项BrowseComp 40.9 vs 8.3信息检索类任务差距接近 5 倍适合做联网问答与资料整理场景。⚖️ 客观说SWE-Bench Verified41.6与 SciCode34.7上它落后于 Qwen3.5-9B 和 Gemma4-12B说明越级主要体现在 Pro 版与多语言等更难、更贴近真实工程的场景中。四、通用能力与指令跟随93.0 的 IFEval 意味着什么日常使用体验更多取决于通用能力这一组数据体现的是听话程度和知识储备基准Spark-X2.5-4BQwen3.5-9BQwen3.5-4BGemma4-12BIFEval93.091.589.894.8IFBench75.064.559.273.5GPQA研究生级问答67.477.267.272.8AA-LCR逻辑推理56.363.057.055.3HLE专家级知识12.314.38.613.1IFEval 93.0仅次于 12B 级 Gemma4意味着按要求格式输出、限制字数、用指定语言回答这类约束它基本都能稳定执行——这是智能体和 RAG 应用最看重的能力GPQA 67.4与 9B 模型相当科学专业知识上没有因参数小而明显缩水。五、为什么 4B 能越级混合注意力架构一句话讲清Spark-X2.5-4B 用 36 层 Transformer 实现了1 全注意力 3 滑动窗口的循环排布配置见 config.json滑动窗口层只看最近 512 个 tokens计算量极小、KV Cache 占用低负责处理局部细节全注意力层每 4 层出现一次负责跨全文档的信息打通保住 1M 长上下文能力模型实现细节可查看 modeling_spark.py对话行为模板见 chat_template.jinja默认开启思考模式。效果就是长上下文场景下推理速度更快、显存占用更低官方称其在多硬件平台的 TTFT/TOPT 指标优于同级模型。对新手来说这意味着用消费级显卡甚至 NPU 也能跑百万级上下文的实用服务。六、新手快速上手三种最省事的体验方式Spark-X2.5-4B 采用 Apache 2.0 协议见 LICENSE可商用。官方支持 vLLM、SGLang、llama.cpp、MLX 等推理框架完整部署命令参考 README.md。新手推荐由易到难Ollama最简单安装 Ollama v0.34.1 及以上版本后执行ollama run SparkLLM/Spark-X2.5-4B即可本地对话LM Studio图形界面2.34.0 及以上运行时原生支持spark2_5架构拖入模型即可使用SGLang / vLLM生产部署一条 docker 命令即可拉起 OpenAI 兼容 API 服务详细参数见 README.md 的 Quickstart 章节。⚙️ 采样建议按官方推荐 temperature1.0、top_p0.95、top_k-1思考模式默认开启若需关闭思考在请求中设置chat_template_kwargs: {enable_thinking: false}即可。七、总结谁最适合用 Spark-X2.5-4B✅适合你如果想在单卡/端侧设备跑数学推理 代码修复 工具调用三合一的轻量模型需要 1M 长上下文但预算有限文档问答、长报告分析做多语言场景覆盖 200 语言SWE-Bench Multilingual 53.3 领先同级。⚠️需要权衡纯知识型深度问答GPQA、HLE上仍不如 9B~12B 模型若追求 SWE-Bench Verified 标准题型的极致分数Qwen3.5-9B 仍是更稳的选择。 一句话总结AIME 90.7 SWE-Bench Pro 44.4Spark-X2.5-4B 证明了 4B 参数也能在竞赛数学与真实工程任务上越级是目前端侧开源模型中智能体能力的第一梯队选手。注对比数据中 * 号项来自公开模型卡/论文– 表示暂无分数完整基准表格见 README.md 的 Benchmarks 章节。【免费下载链接】Spark-X2.5-4BSpark-X2.5-4B 旨在让强大的 AI 更实用、更高效、更易获得。在广泛日常任务中表现强劲涵盖对话、写作、翻译、推理、编码、工具调用以及智能体工作流并在同等规模的开源模型中取得领先成绩。Spark-X2.5 将面向效率的架构与最高 1M tokens 的原生上下文窗口相结合并支持 200 多种语言。项目地址: https://ai.gitcode.com/SparkLLM/Spark-X2.5-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →