12 × H20
两组资源 · 同型号模型
算力配置 / 模型部署
从两套 Qwen 同模型部署,调整为 DeepSeek 与 Qwen 双模型分工。
两组资源 · 同型号模型
两组资源 · 双模型协同
H20 96GB → H200 141GB,显存向主力推理任务集中。
H20 96GB → Pro 5000 48GB,同时改为部署 Qwen3.8-27B。
12 张 GPU 总数不变,总显存净增 168GB,资源向主力组集中。
按已确认的 H20 单卡 96GB、Pro 5000 单卡 48GB,以及 H200 官方单卡 141GB 计算。物理显存合计不等于单卡容量或统一显存池;可用显存还需扣除模型、KV 缓存和运行时开销。
01 / 费用对比
输入实际差额,自动计算总费用及增幅。
已知实际费用增加“4,000 多元”。默认 4,000 元仅用于测算,最终金额以正式报价为准。计费周期及含税范围尚未明确。
02 / 模型能力
评分核对日期:2026年9月4日。旧方案的“Qwen3.5-122B”按官方 Qwen3.5-122B-A10B 引用;若实际部署为其他微调或量化版本,应重新核对。以下为发布方官方报告值,均非本项目实测。
MoE 架构,支持文本、图片和视频输入;原生上下文 262,144 tokens,可扩展至 1,010,000。既有通用问答、推理和多模态能力,作为本次替换的业务基线。
官方模型卡 ↗该正式版本重点增强 Agent 能力,并附带 DSpark 推测解码模块;支持 low / high / max 推理强度。官方本版评测集中于文本与代码 Agent;本方案的图片和视频任务交由 Qwen。
官方模型卡 ↗支持图片、视频理解,思考模式可开关并调节深度;原生上下文 262,144 tokens,可扩展至 1,000,000。建议承担文档、视觉与通用任务,也可参与代码和 Agent 工作。
官方模型卡 ↗六个模型放在同一张表中,集中查看代码、Agent、推理与文档能力。D表示DeepSeek官方报告,Q表示Qwen官方报告;分数按原表保留,越高越好。
左右滑动,查看全部六个模型 →
| 评测与中文说明 | DeepSeek-V4-Flash-0731 | Qwen3.8-27B | GLM-5.2(国内) | Qwen3.7-Plus(国内同系列) | Opus-4.8(海外) | Opus4.6 Max(海外) |
|---|---|---|---|---|---|---|
| 终端任务执行Terminal Bench 2.1D/Q · 框架不同 | 82.7 | 73.0 | 81.0 | 64.0 | 85.0 | 78.2 |
| 自然语言驱动的仓库开发NL2RepoD | 54.2 | — | 48.9 | — | 69.7 | — |
| 软件工程智能体DeepSWED | 54.4 | — | 46.2 | — | 58.0 | — |
| 复杂工具使用Toolathlon-VerifiedD | 70.3 | — | 59.9 | — | 76.2 | — |
| 高难度智能体任务Agents’ Last ExamD | 25.2 | — | 23.8 | — | 25.7 | — |
| 真实软件工程任务SWE-bench ProQ | — | 61.7 | — | 57.6 | — | 53.4 |
| 代码解题LiveCodeBench v6Q | — | 90.3 | — | 89.6 | — | 88.8 |
| 高难度科学推理GPQA DiamondQ | — | 89.2 | — | 90.3 | — | 91.3 |
| 桌面操作智能体OSWorld-VerifiedQ | — | 84.3 | — | 73.3 | — | 72.7 |
| 文档理解OmniDocBench 1.5Q | — | 91.1 | — | 91.4 | — | 86.6 |
“—”表示此处未列同口径数值,不表示零分、不支持,也不表示该模型没有相关评测。D与Q是两份发布方报告,不是统一环境的第三方重测;Terminal Bench 2.1使用的框架不同,不能仅按分差推断模型提升。SWE-bench Pro中Opus4.6 Max取官方报告值,其余参照由Qwen使用Claude Code及修正任务集评测。Opus-4.8与Opus4.6 Max是不同版本,分别保留;Qwen3.7-Plus是国内同系列参照。
相对定位:在所选D报告项目中,DeepSeek 0731高于GLM-5.2、低于Opus-4.8,适合作为复杂代码与工具任务的主力候选;在所选Q报告项目中,Qwen3.8的代码解题、SWE-bench Pro和桌面Agent分数高于Opus4.6 Max,但终端任务与科学推理低于它,文档理解高于Opus而略低于Qwen3.7-Plus。结论仅覆盖所列项目,不构成综合排名或本项目实测承诺。
原方案与两个新模型,放在同一张表里看。
左右滑动,查看三个模型 →
| 对照维度 | Qwen3.5-122B-A10B 原方案 | DeepSeek-V4-Flash-0731 新主力 | Qwen3.8-27B 新通用 |
|---|---|---|---|
| 本方案角色(建议) | 现有两组通用服务,作为替换基线 | 8卡H200承接复杂文本、代码与多步骤Agent | 4卡Pro 5000承接通用、文档、图片和视频任务 |
| 代码与Agent | 具备代码、工具调用能力 | 0731版重点强化Agent,支持三级推理强度 | 支持代码和长流程Agent,同时保留视觉能力 |
| 图片与视频 | 官方支持原生多模态输入 | 不支持原生图片/视频输入;视觉任务交由Qwen | 官方支持图片和视频理解 |
| 怎么判断替换效果 | 保留同批业务题的基线结果 | 重点验收多步骤任务完成率、工具调用与复杂问题质量 | 重点验收日常问答、文档视觉效果及实际并发 |
输入输出 · 长文本能力 · 视觉与Agent评分
左右滑动,查看三个模型及比较口径 →
| 能力 / 评测 | Qwen3.5 122B-A10B | DeepSeek-V4 Flash-0731 | Qwen3.8 27B | 比较口径 |
|---|---|---|---|---|
| 文本输入 | 支持 | 支持 | 支持 | 三者均可接收文本。 |
| 图片输入 / 视觉理解 | 支持 | 不支持(原生) | 支持 | 以当前开源权重和官方配置为准,不含外接视觉模型。 |
| 视频输入 / 理解 | 支持 | 不支持(原生) | 支持 | Qwen通过视觉帧理解视频,不等于原生识别音轨。 |
| 音频 / 语音输入 | 不支持(原生) | 不支持(原生) | 不支持(原生) | 可外接语音识别服务转成文本,但不是这三个模型的原生模态。 |
| 输出模态 | 文本 | 文本 | 文本 | 回答、代码、结构化文本及工具调用内容属于文本输出。 |
| 图片 / 视频 / 语音生成 | 不支持(原生) | 不支持(原生) | 不支持(原生) | 调用外部生成工具不计为模型本身的输出模态。 |
| 架构 | MoE · 122B总参数 / 10B激活 | MoE + DSpark推测解码 | Dense · 27B | 激活参数、总权重和硬件速度不能直接等同。 |
| 默认配置上下文 | 262,144 tokens(原生) | 1,048,576 tokens(配置上限) | 262,144 tokens(原生) | DeepSeek配置已含YaRN缩放;上下文是输入、历史及生成内容共享的总窗口。 |
| 官方扩展上下文 | 最高1,010,000 tokens | 无单列更高扩展上限 | 最高1,000,000 tokens | Qwen需按官方方案调整长度/缩放配置;上限不等于当前服务器已支持的并发长度。 |
| 思考模式 | 默认思考,可关闭 | low / high / max推理强度 | 默认思考,可关闭并调节深度 | 思考内容消耗生成预算;不同模式分数和延迟可能不同。 |
| 开源许可证 | Apache-2.0 | MIT | Apache-2.0 | 以对应仓库许可证及实际使用方式为准。 |
| 文档理解 · OmniDocBench 1.5 | 89.8 | 不支持(原生视觉) | 91.1 | 文档理解;Qwen为各自官方报告分数,未统一环境重跑。 |
| 真实场景视觉问答 · RealWorldQA | 85.1 | 不支持(原生视觉) | 85.9 | 真实场景视觉问答;分数越高越好。 |
| 无字幕视频理解 · VideoMME | 83.9 | 不支持(原生视频) | 本版官方卡未列 | Qwen3.8支持视频;当前所引官方卡没有该项分数,不能写成不支持。 |
| 终端任务执行Terminal Bench | 49.4 · v2 | 82.7 · v2.1 | 73.0 · v2.1 | DeepSeek 与新 Qwen 同为2.1,但使用 DeepSeek Harness / Terminus;旧 Qwen为v2。 |
| 仓库级开发 | 本版官方卡未列 | 54.2 · NL2Repo | 42.3 · NL2Repo-Bench | 报告名称及框架不同;新 Qwen使用Claude Code并限制特定仓库获取命令,未统一重跑。 |
| 软件工程智能体DeepSWE | 本版官方卡未列 | 54.4 · DeepSWE | 42.2 · DeepSWE 1.1 | 数据集版本标注不同,不作为同版本排名。 |
| 复杂工具使用Toolathlon-Verified | 本版官方卡未列 | 70.3 | 本版官方卡未列 | 仅DeepSeek本版卡有该项数据,不能视为另两模型得分为0。 |
| 代码解题 · LiveCodeBench v6 | 78.9 | 本版官方卡未列 | 90.3 | 衡量代码解题能力;同名项目来自各自官方报告,不等于真实项目交付成功率。 |
| 软件工程 · SWE-bench | 72.0 · Verified | 本版官方卡未列 | 61.7 · Pro | Verified与Pro为不同评测,不可按分数高低排序;新Qwen的Pro使用Claude Code及修正后的任务集。 |
| 函数调用 · BFCL-V4 | 72.2 | 本版官方卡未列 | 本版官方卡未列 | 衡量函数/工具调用能力;缺少同项分数不表示模型不支持工具调用。 |
| 交互式工具任务 · TAU2-Bench | 79.5 | 本版官方卡未列 | 本版官方卡未列 | 衡量交互式工具任务;旧Qwen的航空领域评测采用官方卡说明的修正。 |
| 桌面操作智能体 · OSWorld-Verified | 本版官方卡未列 | 本版官方卡未列 | 84.3 | Qwen3.8官方多模态Agent分数;能力依赖桌面操作框架,不是仅部署权重就自动具备的应用。 |
| 浏览器操作智能体 · WebArena-Verified | 本版官方卡未列 | 本版官方卡未列 | 64.8 | Qwen3.8使用官方grader与OSWorld scaffold;不等同于所有网站的自动化成功率。 |
表内为各模型官方报告的并列对照,分数越高越好;“本版官方卡未列”仅表示当前所引模型卡未提供该项数据。评测框架、数据集版本及任务约束存在差异,不计算跨模型差值、提升百分比或综合排名。DeepSeek公开代码Agent项采用DeepSeek Harness minimal、max推理强度、temperature=1.0、top_p=0.95;新Qwen的DeepSWE 1.1采用Claude Code、256K上下文及相同temperature/top_p。
直接对照结论:在各自官方报告中,DeepSeek 0731 的 Terminal Bench 2.1 数值为82.7,新 Qwen 为73.0;这为优先验证 DeepSeek 的终端 Agent 能力提供参考,但框架不同,不能当作纯模型提升。Qwen 的原生视觉能力更适合本方案的图片和视频输入。旧 Qwen 到 DeepSeek 的统一条件提升幅度,目前缺少同环境实测证据。
旧 Qwen 官方数据 ↗DeepSeek 官方数据 ↗新 Qwen 官方数据 ↗
模态口径:以上“不支持”限定于本次列出的开源模型原生能力;依据官方模型卡、输入输出示例及配置结构判断。外接OCR、语音识别、视觉模型或生成工具可扩展应用功能,不改变模型的原生模态。上下文单位为tokens,不是汉字数;图片/视频的视觉tokens、历史消息与思考/回答会共同占用窗口。当前12卡方案的实际最大长度与并发仍需部署验证。
同名评测对照 · 分数越高越好 · 差值按原表分数计算
左右滑动表格,查看两代模型分数 →
| 评测 / 能力 | Qwen3.5 122B-A10B | Qwen3.8 27B | 报告分数差 |
|---|---|---|---|
| 科学推理GPQA Diamond | 86.6 | 89.2 | +2.6 |
| 代码解题LiveCodeBench v6 | 78.9 | 90.3 | +11.4 |
| 指令遵循IFBench | 76.1 | 79.5 | +3.4 |
| 文档理解OmniDocBench 1.5 | 89.8 | 91.1 | +1.3 |
| 真实场景视觉问答RealWorldQA | 85.1 | 85.9 | +0.8 |
同名评测便于参考,但两代模型来自各自发布时的报告,未完成同环境重跑。差值为报告分数差,不是业务准确率或速度提升;不同指标不加总。DeepSeek 0731 当前官方模型卡未列出这五项分数,因此不以旧版或预览版数据补齐。
从官方评测到本方案的任务选择
Terminal Bench、仓库开发和Toolathlon等官方结果,为优先验证终端、代码与多步骤工具任务提供依据。建议在8卡H200主力服务上重点验收任务完成率、工具调用正确性和失败恢复。
除通用问答和视觉理解,还可参与代码、浏览器及桌面Agent任务。LiveCodeBench、SWE-bench Pro、OSWorld和WebArena分别反映代码解题、软件工程、桌面及网页操作能力;不应仅定位成简单任务模型。
旧122B已具备代码和Agent能力,SWE-bench Verified、BFCL-V4与TAU2-Bench提供官方参考。替换应比较真实任务完成质量、稳定性、耗时与资源成本,不能把新方案描述为从无到有。
以上定位是基于官方资料的选型建议,不是本项目实测结论。算法题、软件工程、函数调用和长流程Agent衡量不同能力;框架、工具权限、重试预算与上下文管理也会影响结果。建议用同一批业务任务、相同工具和可比预算进行部署验收。
方案解读:27B 不应仅因参数更少而被视为能力降级;这里列出的同名官方分数支持优先验证它在通用、代码和文档任务上的替换效果,但不代表全面胜出。旧 Qwen 本身已支持多模态;本次变化是模型升级与资源分工。DeepSeek 侧重点是复杂 Agent,Qwen 侧重点是通用与视觉,分工仍需用真实业务验证。
部署解读:122B MoE 的 10B 激活参数不等于只需存储 10B 权重,27B 稠密模型也不能仅凭参数更少就推导更快。按同精度的权重存储粗估,122B→27B 可下降约77.9%,并不等于整机显存需求同比下降。官方上下文上限不是本次硬件的已验收能力;量化、KV缓存、并行策略及服务框架均会影响可用长度、速度和并发。
03 / 任务分工
集中承接复杂分析和多步骤任务,为业务推理配置独立资源。
承接通用与视觉任务,也可按需求承担代码、浏览器和桌面 Agent 工作。
按任务类型选择模型通用任务进入 Qwen 服务,复杂任务进入 DeepSeek 服务;需配置并验证路由与降级策略。
04 / 决策依据
| 比较维度 | 原方案 | 调整方案 |
|---|---|---|
| 资源配置 | 12 张 H20,分为 8 卡与 4 卡两组 | 8 张 H200 配置主力模型,4 张 Pro 5000 配置通用模型 |
| 模型能力组合 | 两组均部署 Qwen3.5-122B | DeepSeek 与 Qwen 按业务分工,效果需同题验证 |
| 模型维护 | 同一模型体系,适配相对统一 | 分别适配提示词、工具调用和输出格式 |
| 故障接管 | 可设计同模型切换,容量受两组配置影响 | 可设计跨模型降级,接管效果与容量并不等同 |
| 性能验收 | 作为现有业务基线 | 对比准确性、响应时间、目标并发和稳定性 |
H20 单卡 96GB、Pro 5000 单卡 48GB 已确认。H200 单卡 141GB,8 卡合计 1,128GB;仍需确认 H200 形态、互联及 Pro 5000 完整产品代际。
明确模型精度、上下文、目标并发,以及计费周期、税费和服务范围。
用同一知识库、同批问题和可比输出长度,对比回答与引用准确性、工具调用、首字响应时间、并发稳定性;单独验证多模态任务。参数量不能直接判断效果。
确认规格与报价,
以业务验收结果决定切换。