算力方案 / 配置对比评估方案 · 2026.09

算力配置 / 模型部署

12 张 GPU,重新分配算力。

从两套 Qwen 同模型部署,调整为 DeepSeek 与 Qwen 双模型分工。

阅读方案原文 ↗
原方案01 / CURRENT

12 × H20

两组资源 · 同型号模型

8 张 H20资源组 A
0102030405060708
部署模型Qwen3.5-122B
单卡 96 GB · 8 卡合计768 GB
4 张 H20资源组 B
01020304
部署模型Qwen3.5-122B
单卡 96 GB · 4 卡合计384 GB
物理显存总量1,152 GB
原方案总费用¥94,024.80
调整方案02 / PROPOSED

8 × H200 + 4 × Pro 5000

两组资源 · 双模型协同

8 张 H200主力推理资源
0102030405060708
部署模型DS-V4-Flash-0731
单卡 141 GB · 8 卡合计1,128 GB
4 张 Pro 5000通用与多模态资源
01020304
部署模型Qwen3.8-27B
单卡 48 GB · 4 卡合计192 GB
物理显存总量1,320 GB
调整后总费用 测算¥98,024.80
GPU 总数保持 12 张
模型组合 1 类 → 2 类
费用增幅 4.25%

显存变化:主力组增加,通用组收缩。

已确认:H20 96GB · Pro 5000 48GB
8 卡主力资源

768 → 1,128 GB

+360 GB · +46.88%

H20 96GB → H200 141GB,显存向主力推理任务集中。

4 卡通用资源

384 → 192 GB

−192 GB · −50.00%

H20 96GB → Pro 5000 48GB,同时改为部署 Qwen3.8-27B。

12 卡显存总量

1,152 → 1,320 GB

+168 GB · +14.58%

12 张 GPU 总数不变,总显存净增 168GB,资源向主力组集中。

按已确认的 H20 单卡 96GB、Pro 5000 单卡 48GB,以及 H200 官方单卡 141GB 计算。物理显存合计不等于单卡容量或统一显存池;可用显存还需扣除模型、KV 缓存和运行时开销。

01 / 费用对比

小幅增投,调整资源结构。

相同计费周期 · 相同服务范围

费用增量测算

人民币
¥

输入实际差额,自动计算总费用及增幅。

调整后费用¥ 98,024.80
增幅+4.25%

费用对比

按当前输入测算
原方案¥ 94,024.80
调整方案¥ 98,024.80
原费用增加费用 ¥ 4,000.00

已知实际费用增加“4,000 多元”。默认 4,000 元仅用于测算,最终金额以正式报价为准。计费周期及含税范围尚未明确。

02 / 模型能力

看模型能力,也看评分口径。

官方报告 · 2026.09.04

评分核对日期:2026年9月4日。旧方案的“Qwen3.5-122B”按官方 Qwen3.5-122B-A10B 引用;若实际部署为其他微调或量化版本,应重新核对。以下为发布方官方报告值,均非本项目实测。

原方案 · 两组均部署

Qwen3.5-122B-A10B

122B 总参数 / 10B 激活

MoE 架构,支持文本、图片和视频输入;原生上下文 262,144 tokens,可扩展至 1,010,000。既有通用问答、推理和多模态能力,作为本次替换的业务基线。

官方模型卡 ↗
调整方案 · 8 × H200

DeepSeek-V4-Flash-0731

Agent 与工具执行

该正式版本重点增强 Agent 能力,并附带 DSpark 推测解码模块;支持 low / high / max 推理强度。官方本版评测集中于文本与代码 Agent;本方案的图片和视频任务交由 Qwen。

官方模型卡 ↗
调整方案 · 4 × Pro 5000

Qwen3.8-27B

27B 稠密模型 / 原生多模态

支持图片、视频理解,思考模式可开关并调节深度;原生上下文 262,144 tokens,可扩展至 1,000,000。建议承担文档、视觉与通用任务,也可参与代码和 Agent 工作。

官方模型卡 ↗

国内外模型能力,一张表看清。

六个模型放在同一张表中,集中查看代码、Agent、推理与文档能力。D表示DeepSeek官方报告,Q表示Qwen官方报告;分数按原表保留,越高越好。

左右滑动,查看全部六个模型 →

评测与中文说明DeepSeek-V4-Flash-0731Qwen3.8-27BGLM-5.2(国内)Qwen3.7-Plus(国内同系列)Opus-4.8(海外)Opus4.6 Max(海外)
终端任务执行Terminal Bench 2.1D/Q · 框架不同82.773.081.064.085.078.2
自然语言驱动的仓库开发NL2RepoD54.248.969.7
软件工程智能体DeepSWED54.446.258.0
复杂工具使用Toolathlon-VerifiedD70.359.976.2
高难度智能体任务Agents’ Last ExamD25.223.825.7
真实软件工程任务SWE-bench ProQ61.757.653.4
代码解题LiveCodeBench v6Q90.389.688.8
高难度科学推理GPQA DiamondQ89.290.391.3
桌面操作智能体OSWorld-VerifiedQ84.373.372.7
文档理解OmniDocBench 1.5Q91.191.486.6

“—”表示此处未列同口径数值,不表示零分、不支持,也不表示该模型没有相关评测。D与Q是两份发布方报告,不是统一环境的第三方重测;Terminal Bench 2.1使用的框架不同,不能仅按分差推断模型提升。SWE-bench Pro中Opus4.6 Max取官方报告值,其余参照由Qwen使用Claude Code及修正任务集评测。Opus-4.8与Opus4.6 Max是不同版本,分别保留;Qwen3.7-Plus是国内同系列参照。

如何理解这张表

相对定位:在所选D报告项目中,DeepSeek 0731高于GLM-5.2、低于Opus-4.8,适合作为复杂代码与工具任务的主力候选;在所选Q报告项目中,Qwen3.8的代码解题、SWE-bench Pro和桌面Agent分数高于Opus4.6 Max,但终端任务与科学推理低于它,文档理解高于Opus而略低于Qwen3.7-Plus。结论仅覆盖所列项目,不构成综合排名或本项目实测承诺。

D · DeepSeek 官方对照表 ↗Q · Qwen 官方对照表 ↗

DeepSeek 与 Qwen,能力如何分工?

原方案与两个新模型,放在同一张表里看。

左右滑动,查看三个模型 →

对照维度Qwen3.5-122B-A10B
原方案
DeepSeek-V4-Flash-0731
新主力
Qwen3.8-27B
新通用
本方案角色(建议)现有两组通用服务,作为替换基线8卡H200承接复杂文本、代码与多步骤Agent4卡Pro 5000承接通用、文档、图片和视频任务
代码与Agent具备代码、工具调用能力0731版重点强化Agent,支持三级推理强度支持代码和长流程Agent,同时保留视觉能力
图片与视频官方支持原生多模态输入不支持原生图片/视频输入;视觉任务交由Qwen官方支持图片和视频理解
怎么判断替换效果保留同批业务题的基线结果重点验收多步骤任务完成率、工具调用与复杂问题质量重点验收日常问答、文档视觉效果及实际并发

旧 Qwen 官方数据 ↗DeepSeek 官方数据 ↗新 Qwen 官方数据 ↗

三模型对照:模态、上下文与官方评分。

输入输出 · 长文本能力 · 视觉与Agent评分

左右滑动,查看三个模型及比较口径 →

能力 / 评测Qwen3.5
122B-A10B
DeepSeek-V4
Flash-0731
Qwen3.8
27B
比较口径
文本输入支持支持支持三者均可接收文本。
图片输入 / 视觉理解支持不支持(原生)支持以当前开源权重和官方配置为准,不含外接视觉模型。
视频输入 / 理解支持不支持(原生)支持Qwen通过视觉帧理解视频,不等于原生识别音轨。
音频 / 语音输入不支持(原生)不支持(原生)不支持(原生)可外接语音识别服务转成文本,但不是这三个模型的原生模态。
输出模态文本文本文本回答、代码、结构化文本及工具调用内容属于文本输出。
图片 / 视频 / 语音生成不支持(原生)不支持(原生)不支持(原生)调用外部生成工具不计为模型本身的输出模态。
架构MoE · 122B总参数 / 10B激活MoE + DSpark推测解码Dense · 27B激活参数、总权重和硬件速度不能直接等同。
默认配置上下文262,144 tokens(原生)1,048,576 tokens(配置上限)262,144 tokens(原生)DeepSeek配置已含YaRN缩放;上下文是输入、历史及生成内容共享的总窗口。
官方扩展上下文最高1,010,000 tokens无单列更高扩展上限最高1,000,000 tokensQwen需按官方方案调整长度/缩放配置;上限不等于当前服务器已支持的并发长度。
思考模式默认思考,可关闭low / high / max推理强度默认思考,可关闭并调节深度思考内容消耗生成预算;不同模式分数和延迟可能不同。
开源许可证Apache-2.0MITApache-2.0以对应仓库许可证及实际使用方式为准。
文档理解 · OmniDocBench 1.589.8不支持(原生视觉)91.1文档理解;Qwen为各自官方报告分数,未统一环境重跑。
真实场景视觉问答 · RealWorldQA85.1不支持(原生视觉)85.9真实场景视觉问答;分数越高越好。
无字幕视频理解 · VideoMME83.9不支持(原生视频)本版官方卡未列Qwen3.8支持视频;当前所引官方卡没有该项分数,不能写成不支持。
终端任务执行Terminal Bench49.4 · v282.7 · v2.173.0 · v2.1DeepSeek 与新 Qwen 同为2.1,但使用 DeepSeek Harness / Terminus;旧 Qwen为v2。
仓库级开发本版官方卡未列54.2 · NL2Repo42.3 · NL2Repo-Bench报告名称及框架不同;新 Qwen使用Claude Code并限制特定仓库获取命令,未统一重跑。
软件工程智能体DeepSWE本版官方卡未列54.4 · DeepSWE42.2 · DeepSWE 1.1数据集版本标注不同,不作为同版本排名。
复杂工具使用Toolathlon-Verified本版官方卡未列70.3本版官方卡未列仅DeepSeek本版卡有该项数据,不能视为另两模型得分为0。
代码解题 · LiveCodeBench v678.9本版官方卡未列90.3衡量代码解题能力;同名项目来自各自官方报告,不等于真实项目交付成功率。
软件工程 · SWE-bench72.0 · Verified本版官方卡未列61.7 · ProVerified与Pro为不同评测,不可按分数高低排序;新Qwen的Pro使用Claude Code及修正后的任务集。
函数调用 · BFCL-V472.2本版官方卡未列本版官方卡未列衡量函数/工具调用能力;缺少同项分数不表示模型不支持工具调用。
交互式工具任务 · TAU2-Bench79.5本版官方卡未列本版官方卡未列衡量交互式工具任务;旧Qwen的航空领域评测采用官方卡说明的修正。
桌面操作智能体 · OSWorld-Verified本版官方卡未列本版官方卡未列84.3Qwen3.8官方多模态Agent分数;能力依赖桌面操作框架,不是仅部署权重就自动具备的应用。
浏览器操作智能体 · WebArena-Verified本版官方卡未列本版官方卡未列64.8Qwen3.8使用官方grader与OSWorld scaffold;不等同于所有网站的自动化成功率。

表内为各模型官方报告的并列对照,分数越高越好;“本版官方卡未列”仅表示当前所引模型卡未提供该项数据。评测框架、数据集版本及任务约束存在差异,不计算跨模型差值、提升百分比或综合排名。DeepSeek公开代码Agent项采用DeepSeek Harness minimal、max推理强度、temperature=1.0、top_p=0.95;新Qwen的DeepSWE 1.1采用Claude Code、256K上下文及相同temperature/top_p。

直接对照结论

直接对照结论:在各自官方报告中,DeepSeek 0731 的 Terminal Bench 2.1 数值为82.7,新 Qwen 为73.0;这为优先验证 DeepSeek 的终端 Agent 能力提供参考,但框架不同,不能当作纯模型提升。Qwen 的原生视觉能力更适合本方案的图片和视频输入。旧 Qwen 到 DeepSeek 的统一条件提升幅度,目前缺少同环境实测证据。

旧 Qwen 官方数据 ↗DeepSeek 官方数据 ↗新 Qwen 官方数据 ↗

模态口径:以上“不支持”限定于本次列出的开源模型原生能力;依据官方模型卡、输入输出示例及配置结构判断。外接OCR、语音识别、视觉模型或生成工具可扩展应用功能,不改变模型的原生模态。上下文单位为tokens,不是汉字数;图片/视频的视觉tokens、历史消息与思考/回答会共同占用窗口。当前12卡方案的实际最大长度与并发仍需部署验证。

Qwen3.5 配置 ↗DeepSeek 配置 ↗Qwen3.8 配置 ↗

Qwen:参数更小,所列官方分数更高。

同名评测对照 · 分数越高越好 · 差值按原表分数计算

左右滑动表格,查看两代模型分数 →

评测 / 能力Qwen3.5
122B-A10B
Qwen3.8
27B
报告分数差
科学推理GPQA Diamond86.689.2+2.6
代码解题LiveCodeBench v678.990.3+11.4
指令遵循IFBench76.179.5+3.4
文档理解OmniDocBench 1.589.891.1+1.3
真实场景视觉问答RealWorldQA85.185.9+0.8

同名评测便于参考,但两代模型来自各自发布时的报告,未完成同环境重跑。差值为报告分数差,不是业务准确率或速度提升;不同指标不加总。DeepSeek 0731 当前官方模型卡未列出这五项分数,因此不以旧版或预览版数据补齐。

Qwen3.5 官方评测 ↗Qwen3.8 官方评测 ↗

代码与 Agent:这些评分意味着什么?

从官方评测到本方案的任务选择

DeepSeek:复杂文本与工具执行

Terminal Bench、仓库开发和Toolathlon等官方结果,为优先验证终端、代码与多步骤工具任务提供依据。建议在8卡H200主力服务上重点验收任务完成率、工具调用正确性和失败恢复。

Qwen3.8:代码与多模态Agent候选

除通用问答和视觉理解,还可参与代码、浏览器及桌面Agent任务。LiveCodeBench、SWE-bench Pro、OSWorld和WebArena分别反映代码解题、软件工程、桌面及网页操作能力;不应仅定位成简单任务模型。

旧Qwen:保留可比较的业务基线

旧122B已具备代码和Agent能力,SWE-bench Verified、BFCL-V4与TAU2-Bench提供官方参考。替换应比较真实任务完成质量、稳定性、耗时与资源成本,不能把新方案描述为从无到有。

以上定位是基于官方资料的选型建议,不是本项目实测结论。算法题、软件工程、函数调用和长流程Agent衡量不同能力;框架、工具权限、重试预算与上下文管理也会影响结果。建议用同一批业务任务、相同工具和可比预算进行部署验收。

DeepSeek 官方评测 ↗Qwen3.8 官方评测 ↗旧 Qwen 官方评测 ↗

对本次替换意味着什么?

方案解读:27B 不应仅因参数更少而被视为能力降级;这里列出的同名官方分数支持优先验证它在通用、代码和文档任务上的替换效果,但不代表全面胜出。旧 Qwen 本身已支持多模态;本次变化是模型升级与资源分工。DeepSeek 侧重点是复杂 Agent,Qwen 侧重点是通用与视觉,分工仍需用真实业务验证。

部署解读:122B MoE 的 10B 激活参数不等于只需存储 10B 权重,27B 稠密模型也不能仅凭参数更少就推导更快。按同精度的权重存储粗估,122B→27B 可下降约77.9%,并不等于整机显存需求同比下降。官方上下文上限不是本次硬件的已验收能力;量化、KV缓存、并行策略及服务框架均会影响可用长度、速度和并发。

03 / 任务分工

让不同任务,使用合适的模型。

建议分工 · 非实测性能承诺
8 × H200主力分析与推理

DeepSeek-V4-Flash-0731

集中承接复杂分析和多步骤任务,为业务推理配置独立资源。

  • 复杂知识问答与多文档综合分析
  • 多步骤推理与工具调用
  • Agent 任务执行
4 × Pro 5000通用与多模态处理

Qwen3.8-27B

承接通用与视觉任务,也可按需求承担代码、浏览器和桌面 Agent 工作。

  • 日常问答、摘要与信息抽取
  • 文本分类与结构化整理
  • 图片与文档视觉理解
  • 代码与多模态 Agent 任务

按任务类型选择模型通用任务进入 Qwen 服务,复杂任务进入 DeepSeek 服务;需配置并验证路由与降级策略。

04 / 决策依据

收益与实施条件,一起看清。

比较维度原方案调整方案
资源配置12 张 H20,分为 8 卡与 4 卡两组8 张 H200 配置主力模型,4 张 Pro 5000 配置通用模型
模型能力组合两组均部署 Qwen3.5-122BDeepSeek 与 Qwen 按业务分工,效果需同题验证
模型维护同一模型体系,适配相对统一分别适配提示词、工具调用和输出格式
故障接管可设计同模型切换,容量受两组配置影响可设计跨模型降级,接管效果与容量并不等同
性能验收作为现有业务基线对比准确性、响应时间、目标并发和稳定性
01

确认完整硬件规格

H20 单卡 96GB、Pro 5000 单卡 48GB 已确认。H200 单卡 141GB,8 卡合计 1,128GB;仍需确认 H200 形态、互联及 Pro 5000 完整产品代际。

02

约定部署与费用口径

明确模型精度、上下文、目标并发,以及计费周期、税费和服务范围。

03

用真实业务进行验收

用同一知识库、同批问题和可比输出长度,对比回答与引用准确性、工具调用、首字响应时间、并发稳定性;单独验证多模态任务。参数量不能直接判断效果。

方案建议

确认规格与报价,
以业务验收结果决定切换。

本次调整的目标是增强主力资源配置、建立双模型分工。实际速度、并发和回答质量以部署实测为准。

资料与依据

配置与费用由需求方提供;官方资料用于能力说明。

阅读方案原文 ↗

右下角提供源文件下载,保留原始 4,000 元测算基线。