Apodex-1.1-mini 部署实测:Int4 量化 18GB 单卡跑通 Agent Team,35B 开源逼近 1T Kimi
一、模型速览Apodex AI前身 MiroMind于2026 年 8 月 24 日发布 Apodex 1.1 模型家族并同步开源 35B 参数的Apodex-1.1-mini权重Hugging Faceapodex/Apodex-1.1-mini来源Apodex 官方公告 / Hugging Face 模型卡。发布方Apodex AI盛大集团陈天桥注资的发现式智能团队参数量约 35B基于 Qwen3.5-A3B 微调的稠密/混合结构上下文长度原生 262,144 token来源模型卡许可证Apache 2.0完全可商用、可修改、可再分发来源TheNextGenTechInsider / Hugging Face一句话定位把任务拆解 并行子智能体训练进模型本体的开源通用推理模型让 35B 小模型在长程科研 / 代码智能体任务上逼近 1T 级闭源模型。二、核心亮点1. Agent Team把多智能体编排训进模型而非套一层脚本传统多智能体产品本质是编排脚本——主管脚本把任务拆给 N 个子模型再合并。Apodex 1.1 的核心主张是任务拆解本身是模型的训练能力。推理时模型自主决定三件事是否要拆子智能体、拆几个、何时合并结果子智能体并行探索、持续写入共享任务状态主模型不必等最慢分支来源explainx.ai 技术解析。实测增益来自同模型同基准的 ReAct vs Agent Team 对比Agent Team 在四项基准上比 ReAct 高出4.1–9.3 分来源Apodex 官方技术报告 / explainx.ai。2. 35B 体量逼近 1T 参数模型最抓眼球的数据Apodex-1.1-mini 在Agent Team 模式下于 APEX-Agents 拿到27.7而 1T 参数的 Kimi K2.6 为27.9——体量约 1/28分数几乎持平来源explainx.ai / AlphaSignal。完整版 Apodex 1.1 在 GDPval-AA v2 上 Elo1348超过 DeepSeek V4 Pro1333与 Kimi K2.61202来源Artificial Analysis / AlphaSignal。3. 262K 原生上下文 原生函数调用模型支持 262,144 token 超长上下文并原生支持函数调用与结构化 JSON。部署时复用 Qwen 生态的解析器qwen3_coder工具解析 qwen3推理解析即开即用来源Apodex 部署文档 / TheNextGenTechInsider。bash# 官方推荐的 SGLang 启动参数数据中心多卡 / Hopper python3 -m sglang.launch_server \ --model-path apodex/Apodex-1.1-mini \ --tp 8 \ --context-length 262144 \ --tool-call-parser qwen3_coder \ --reasoning-parser qwen34. Apache 2.0 多档量化单卡可落地权重以 Apache 2.0 发布并提供NVFP4需 Blackwell约 17.5GB与GPTQ-Int4Ampere约 18GB两档量化来源Apodex 模型卡 / Hugging Face。这意味着消费级 24GB 显卡RTX 4090 / 3090即可本地运行无需数据中心集群也无营收门槛审查。三、部署实战下面给出单张 24GB 消费级显卡的完整可运行方案。官方推荐引擎为 SGLang本文同时给出 vLLM 路径。3.1 环境准备bash# Python 3.10建议使用独立虚拟环境 pip install sglang[all] vllm openai huggingface_hub # 登录 Hugging Face开源权重无需付费仅拉取 huggingface-cli login3.2 模型下载bash# 拉取 GPTQ-Int4 量化版约 18GB单卡友好 huggingface-cli download apodex/Apodex-1.1-mini-GPTQ-Int4 \ --local-dir ./models/Apodex-1.1-mini-GPTQ-Int4 # 若有 BlackwellB200想用 NVFP4约 17.5GB则拉这一档 # huggingface-cli download apodex/Apodex-1.1-mini-NVFP4 \ # --local-dir ./models/Apodex-1.1-mini-NVFP4说明量化权重命名以 Hugging Face 官方仓库为准若仓库使用不同后缀如-NF4把上面--local-dir路径与下一步的--model-path对齐即可推理代码无需改动。3.3 启动推理服务单卡 Int4bash# SGLang单卡 tp1 加载 GPTQ-Int4 python3 -m sglang.launch_server \ --model-path ./models/Apodex-1.1-mini-GPTQ-Int4 \ --tp 1 \ --host 0.0.0.0 --port 1234 \ --context-length 262144 \ --tool-call-parser qwen3_coder \ --reasoning-parser qwen3bash# 备选 vLLM 路径同权重、同端口 python3 -m vllm.entrypoints.openai.api_server \ --model ./models/Apodex-1.1-mini-GPTQ-Int4 \ --tensor-parallel-size 1 \ --max-model-len 262144 \ --port 12343.4 推理代码OpenAI 兼容客户端python# client.py —— 复制即可运行依赖已 pip 安装 from openai import OpenAI client OpenAI(base_urlhttp://localhost:1234/v1, api_keyEMPTY) # 1) 基础推理验证服务起来 resp client.chat.completions.create( modelapodex/Apodex-1.1-mini, messages[{role: user, content: 用 Python 写一个快速排序并解释其平均时间复杂度。}], max_tokens2048, temperature0.6, ) print(resp.choices[0].message.content) # 2) 工具调用让模型自主选择并调用函数Agent Team 的基础能力 tools [{ type: function, function: { name: web_search, description: 检索最新资料, parameters: {type: object, properties: {query: {type: string}}, required: [query]}, }, }] resp2 client.chat.completions.create( modelapodex/Apodex-1.1-mini, messages[{role: user, content: 帮我查一下 2026 年开源大模型的趋势并汇总成三点。}], toolstools, max_tokens2048, ) print(resp2.choices[0].message.tool_calls)3.5 效果验证服务启动后先跑 3.4 的基础推理样例能正常返回带推理过程reasoning的快排代码即说明权重与解析器加载正确。再跑工具调用样例观察模型是否输出tool_calls而非直接硬编答案——能稳定产出结构化工具调用说明原生函数调用可用可继续接入 FrontierAgent 运行时做完整 Agent Team 编排。四、性能测评数据口径声明本文无 GPU 环境未做自主实测。下文显存为按参数量工程估算速度为依据显存带宽的理论上限估算基准分均来自官方技术报告或第三方评测Artificial Analysis、AlphaSignal、explainx.ai均已逐条标注。4.1 显存占用工程估算精度体积算法显存估算适用硬件BF1635B × 2 Byte≈ 70 GB单张 80GBH100/A100NVFP435B × 0.5 Byte≈ 17.5 GBBlackwellB200单卡GPTQ-Int435B × 0.5 Byte≈ 18 GB24GB 消费卡4090/3090估算依据1 参数 BF162Byte、4-bit0.5Byte未计入 KV cache 与框架开销实际需再留 2–4GB估算。4.2 推理速度理论估算单卡 RTX 4090 带宽约 1008 GB/s加载 18GB Int4 权重时解码理论带宽上限约50 tok/s理论估算1008÷18≈56实际因注意力/KV 开销会更低。完整版 Apodex 1.1 被指出输出偏长单任务平均约17k 输出 token来源AlphaSignal对比 Qwen3.7 Max 9391、MiniMax-M3 8133因此真实体感时延更多由输出长度决定长程任务建议开 MTP/投机解码官方 NVFP4 命令含--speculative-algorithm NEXTN。4.3 生成质量与同级对比模型参数量许可证上下文单卡量化显存(估算)代表智能体/代码基准知识可靠性Apodex-1.1-mini35BApache 2.0256KInt4 ≈18GBAPEX-Agents27.7(Agent Team,官方)弱AA-Omniscience-21.9(AA)Qwen3.8-27B27BApache 2.0262KQ4 ≈17GBSWE-bench 高位(官方)中官方自测Granite 4.2 30B30BApache 2.0131KBF16 ≈17.6GBTerminal-Bench 2.129.24(IBM官方)中企业向Gemma 4 31B31BApache 2.0256KQ4_0 ≈17.5GBAA Index30(官方/AA)中AA 实测 35.5 tok/s结论在 30–35B 这一单卡可跑档位Apodex-1.1-mini 的差异化优势是长程智能体Agent Team 训练进模型代价是知识可靠性偏弱——Artificial Analysis 测得 AA-Omniscience 仅 -21.9、对 87% 自答问题的幻觉率 78.4%来源AlphaSignal。因此它不适合当知识问答基座而适合给工具、给环境、让它干活的执行型场景。五、使用建议适用场景本地/私有环境跑长程代码智能体、科研文献调研与证据合成FrontierAgent 运行时已开源CLI 一键装。需要 Apache 2.0 完全合规、无营收审查的中小企业 Agent 产品。24GB 单卡想跑能调用工具、能拆解任务的开源模型。不适用场景纯知识问答 / 事实检索知识短板明显建议接 RAG 或换 Gemma 4 31B / Qwen3.8-27B。超高并发在线服务模型输出偏长、单任务 token 消耗大成本靠吞吐摊薄不适合短平快问答。调优提示优先用Agent Team 模式官方 FrontierAgent 的 Agent Team 工作流比 ReAct 高 4–9 分。长上下文 工具调用时务必带--reasoning-parser qwen3否则推理链易错乱。消费卡用GPTQ-Int4有 Blackwell 再上 NVFP4 NEXTN 投机解码提速。知识类任务前置检索/RAG弥补 AA-Omniscience 短板。往期回顾SenseNova U1.5 Lite 部署实测8B 单卡跑通 4K 生图Apache 2.0 免费商用Meta Muse Glimmer 30B 部署实测单卡 4090 跑通本地多模态 AgentDFlasQwen3.8 vs DeepSeek-V4本周开源大模型周度盘点6款重磅模型横评与部署数据来源标注参数量/许可证/上下文来自 Apodex 官方公告与 Hugging Face 模型卡Agent Team 增益、APEX-Agents、GDPval Elo、AA-Omniscience 等来自 Apodex 技术报告、Artificial Analysis 与 AlphaSignal/explainx.ai 第三方评测Granite 4.2 与 Gemma 4 数据来自 IBM、Google 官方及 Artificial Analysis显存与速度为按参数量的工程估算非官方实测。本文环境无 GPU未做自主基准测试。
上一篇/下一篇内容由系统自动关联
返回资讯列表 →