# AI 算力配置与模型部署对比方案

版本：2026年9月4日 · 方案评估稿

## 一、方案概述

本次拟在GPU总数保持12张的前提下，将原有两组Qwen3.5-122B部署调整为DeepSeek与Qwen双模型部署。目标是增强主力资源配置，按业务类型分配模型服务。实际速度、并发及回答质量以部署实测为准。

## 二、配置与费用对比

| 对比项 | 原方案 | 调整方案 |
| --- | --- | --- |
| GPU总数 | 12张 | 12张 |
| 第一组硬件 | 8张H20 | 8张H200 |
| 第一组模型 | Qwen3.5-122B | DeepSeek-V4-Flash-0731（DS-V4-Flash-0731） |
| 第二组硬件 | 4张H20 | 4张Pro 5000 |
| 第二组模型 | Qwen3.5-122B | Qwen3.8-27B |
| 模型组合 | 两组同型号模型 | DeepSeek与Qwen双模型 |
| 总费用 | 94,024.80元 | 约98,024.80元，另加超出4,000元的实际差额 |
| 费用变化 | 基线 | 增加4,000多元，约4.3% |

费用暂按人民币、相同计费周期和服务范围比较。计费周期、含税情况及最终差额尚未明确。按增加4,000元测算：94,024.80 + 4,000 = 98,024.80元；增幅为4,000 ÷ 94,024.80 × 100% ≈ 4.25%。以上为测算值，并非最终报价。

网站的费用输入框用于情景测算，本文件保留原始4,000元测算基线，不随页面输入变化。

### 显存容量变化（已确认版本）

配置口径：需求方已确认原H20为单卡96GB，Pro 5000为单卡48GB；H200按官方单卡141GB计算。

| 资源范围 | 原方案 | 调整方案 | 容量变化 |
| --- | --- | --- | --- |
| 第一组：8卡主力资源 | 8 × 96 = 768GB | 8 × 141 = 1,128GB | +360GB（+46.88%） |
| 第二组：4卡通用资源 | 4 × 96 = 384GB | 4 × 48 = 192GB | −192GB（−50.00%） |
| 12卡物理显存总量 | 1,152GB | 1,320GB | +168GB（+14.58%） |

显存重新分配的重点：主力资源组显存增加46.88%；通用资源组显存减少50%，同时由Qwen3.5-122B调整为Qwen3.8-27B。总显存增加，不代表两组容量都增加。

以上均为GPU物理显存的算术合计，不是单卡容量，也不代表两组资源可合并为统一显存池。模型权重、KV缓存、运行时及并行开销会占用显存；可用上下文和并发须在实际部署精度与互联配置下验证。这里统一使用厂商标注的GB单位，不混用GiB。

## 三、模型能力与官方评分

评分核对日期：2026年9月4日。旧方案的“Qwen3.5-122B”按官方 Qwen3.5-122B-A10B 引用；若实际部署为其他微调或量化版本，应重新核对。以下为发布方官方报告值，均非本项目实测。

### 三个模型的能力定位

**Qwen3.5-122B-A10B｜原方案 · 两组均部署**

122B 总参数 / 10B 激活。MoE 架构，支持文本、图片和视频输入；原生上下文 262,144 tokens，可扩展至 1,010,000。既有通用问答、推理和多模态能力，作为本次替换的业务基线。 [官方模型卡](https://huggingface.co/Qwen/Qwen3.5-122B-A10B)

**DeepSeek-V4-Flash-0731｜调整方案 · 8 × H200**

Agent 与工具执行。该正式版本重点增强 Agent 能力，并附带 DSpark 推测解码模块；支持 low / high / max 推理强度。官方本版评测集中于文本与代码 Agent；本方案的图片和视频任务交由 Qwen。 [官方模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)

**Qwen3.8-27B｜调整方案 · 4 × Pro 5000**

27B 稠密模型 / 原生多模态。支持图片、视频理解，思考模式可开关并调节深度；原生上下文 262,144 tokens，可扩展至 1,000,000。建议承担文档、视觉与通用任务，也可参与代码和 Agent 工作。 [官方模型卡](https://huggingface.co/Qwen/Qwen3.8-27B)

### 国内外模型参照：官方如何介绍这两个模型

六个模型放在同一张表中，集中查看代码、Agent、推理与文档能力。D表示DeepSeek官方报告，Q表示Qwen官方报告；分数按原表保留，越高越好。

| 评测与中文说明 | DeepSeek-V4-Flash-0731 | Qwen3.8-27B | GLM-5.2（国内） | Qwen3.7-Plus（国内同系列） | Opus-4.8（海外） | Opus4.6 Max（海外） |
| --- | --- | --- | --- | --- | --- | --- |
| 终端任务执行 · Terminal Bench 2.1（D/Q · 框架不同） | 82.7 | 73.0 | 81.0 | 64.0 | 85.0 | 78.2 |
| 自然语言驱动的仓库开发 · NL2Repo（D） | 54.2 | — | 48.9 | — | 69.7 | — |
| 软件工程智能体 · DeepSWE（D） | 54.4 | — | 46.2 | — | 58.0 | — |
| 复杂工具使用 · Toolathlon-Verified（D） | 70.3 | — | 59.9 | — | 76.2 | — |
| 高难度智能体任务 · Agents’ Last Exam（D） | 25.2 | — | 23.8 | — | 25.7 | — |
| 真实软件工程任务 · SWE-bench Pro（Q） | — | 61.7 | — | 57.6 | — | 53.4 |
| 代码解题 · LiveCodeBench v6（Q） | — | 90.3 | — | 89.6 | — | 88.8 |
| 高难度科学推理 · GPQA Diamond（Q） | — | 89.2 | — | 90.3 | — | 91.3 |
| 桌面操作智能体 · OSWorld-Verified（Q） | — | 84.3 | — | 73.3 | — | 72.7 |
| 文档理解 · OmniDocBench 1.5（Q） | — | 91.1 | — | 91.4 | — | 86.6 |

“—”表示此处未列同口径数值，不表示零分、不支持，也不表示该模型没有相关评测。D与Q是两份发布方报告，不是统一环境的第三方重测；Terminal Bench 2.1使用的框架不同，不能仅按分差推断模型提升。SWE-bench Pro中Opus4.6 Max取官方报告值，其余参照由Qwen使用Claude Code及修正任务集评测。Opus-4.8与Opus4.6 Max是不同版本，分别保留；Qwen3.7-Plus是国内同系列参照。

相对定位：在所选D报告项目中，DeepSeek 0731高于GLM-5.2、低于Opus-4.8，适合作为复杂代码与工具任务的主力候选；在所选Q报告项目中，Qwen3.8的代码解题、SWE-bench Pro和桌面Agent分数高于Opus4.6 Max，但终端任务与科学推理低于它，文档理解高于Opus而略低于Qwen3.7-Plus。结论仅覆盖所列项目，不构成综合排名或本项目实测承诺。

来源：[D · DeepSeek 官方介绍与对照表](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731#introduction) · [Q · Qwen 官方介绍与对照表](https://huggingface.co/Qwen/Qwen3.8-27B#benchmark-results)。核对日期：2026年9月4日。

### DeepSeek 与两代 Qwen 的能力对照

| 对照维度 | Qwen3.5-122B-A10B（原方案） | DeepSeek-V4-Flash-0731（新主力） | Qwen3.8-27B（新通用） |
| --- | --- | --- | --- |
| 本方案角色（建议） | 现有两组通用服务，作为替换基线 | 8卡H200承接复杂文本、代码与多步骤Agent | 4卡Pro 5000承接通用、文档、图片和视频任务 |
| 代码与Agent | 具备代码、工具调用能力 | 0731版重点强化Agent，支持三级推理强度 | 支持代码和长流程Agent，同时保留视觉能力 |
| 图片与视频 | 官方支持原生多模态输入 | 不支持原生图片/视频输入；视觉任务交由Qwen | 官方支持图片和视频理解 |
| 怎么判断替换效果 | 保留同批业务题的基线结果 | 重点验收多步骤任务完成率、工具调用与复杂问题质量 | 重点验收日常问答、文档视觉效果及实际并发 |

[旧 Qwen 官方模型卡](https://huggingface.co/Qwen/Qwen3.5-122B-A10B#benchmark-results) · [DeepSeek 官方模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731#introduction) · [新 Qwen 官方模型卡](https://huggingface.co/Qwen/Qwen3.8-27B#benchmark-results)

### 三模型的模态、上下文与官方评分对照

| 评测 | Qwen3.5-122B-A10B | DeepSeek-V4-Flash-0731 | Qwen3.8-27B | 比较口径 |
| --- | --- | --- | --- | --- |
| 文本输入 | 支持 | 支持 | 支持 | 三者均可接收文本。 |
| 图片输入 / 视觉理解 | 支持 | 不支持（原生） | 支持 | 以当前开源权重和官方配置为准，不含外接视觉模型。 |
| 视频输入 / 理解 | 支持 | 不支持（原生） | 支持 | Qwen通过视觉帧理解视频，不等于原生识别音轨。 |
| 音频 / 语音输入 | 不支持（原生） | 不支持（原生） | 不支持（原生） | 可外接语音识别服务转成文本，但不是这三个模型的原生模态。 |
| 输出模态 | 文本 | 文本 | 文本 | 回答、代码、结构化文本及工具调用内容属于文本输出。 |
| 图片 / 视频 / 语音生成 | 不支持（原生） | 不支持（原生） | 不支持（原生） | 调用外部生成工具不计为模型本身的输出模态。 |
| 架构 | MoE · 122B总参数 / 10B激活 | MoE + DSpark推测解码 | Dense · 27B | 激活参数、总权重和硬件速度不能直接等同。 |
| 默认配置上下文 | 262,144 tokens（原生） | 1,048,576 tokens（配置上限） | 262,144 tokens（原生） | DeepSeek配置已含YaRN缩放；上下文是输入、历史及生成内容共享的总窗口。 |
| 官方扩展上下文 | 最高1,010,000 tokens | 无单列更高扩展上限 | 最高1,000,000 tokens | Qwen需按官方方案调整长度/缩放配置；上限不等于当前服务器已支持的并发长度。 |
| 思考模式 | 默认思考，可关闭 | low / high / max推理强度 | 默认思考，可关闭并调节深度 | 思考内容消耗生成预算；不同模式分数和延迟可能不同。 |
| 开源许可证 | Apache-2.0 | MIT | Apache-2.0 | 以对应仓库许可证及实际使用方式为准。 |
| 文档理解 · OmniDocBench 1.5 | 89.8 | 不支持（原生视觉） | 91.1 | 文档理解；Qwen为各自官方报告分数，未统一环境重跑。 |
| 真实场景视觉问答 · RealWorldQA | 85.1 | 不支持（原生视觉） | 85.9 | 真实场景视觉问答；分数越高越好。 |
| 无字幕视频理解 · VideoMME | 83.9 | 不支持（原生视频） | 本版官方卡未列 | Qwen3.8支持视频；当前所引官方卡没有该项分数，不能写成不支持。 |
| 终端任务执行 · Terminal Bench | 49.4 · v2 | 82.7 · v2.1 | 73.0 · v2.1 | DeepSeek 与新 Qwen 同为2.1，但使用 DeepSeek Harness / Terminus；旧 Qwen为v2。 |
| 仓库级开发 | 本版官方卡未列 | 54.2 · NL2Repo | 42.3 · NL2Repo-Bench | 报告名称及框架不同；新 Qwen使用Claude Code并限制特定仓库获取命令，未统一重跑。 |
| 软件工程智能体 · DeepSWE | 本版官方卡未列 | 54.4 · DeepSWE | 42.2 · DeepSWE 1.1 | 数据集版本标注不同，不作为同版本排名。 |
| 复杂工具使用 · Toolathlon-Verified | 本版官方卡未列 | 70.3 | 本版官方卡未列 | 仅DeepSeek本版卡有该项数据，不能视为另两模型得分为0。 |
| 代码解题 · LiveCodeBench v6 | 78.9 | 本版官方卡未列 | 90.3 | 衡量代码解题能力；同名项目来自各自官方报告，不等于真实项目交付成功率。 |
| 软件工程 · SWE-bench | 72.0 · Verified | 本版官方卡未列 | 61.7 · Pro | Verified与Pro为不同评测，不可按分数高低排序；新Qwen的Pro使用Claude Code及修正后的任务集。 |
| 函数调用 · BFCL-V4 | 72.2 | 本版官方卡未列 | 本版官方卡未列 | 衡量函数/工具调用能力；缺少同项分数不表示模型不支持工具调用。 |
| 交互式工具任务 · TAU2-Bench | 79.5 | 本版官方卡未列 | 本版官方卡未列 | 衡量交互式工具任务；旧Qwen的航空领域评测采用官方卡说明的修正。 |
| 桌面操作智能体 · OSWorld-Verified | 本版官方卡未列 | 本版官方卡未列 | 84.3 | Qwen3.8官方多模态Agent分数；能力依赖桌面操作框架，不是仅部署权重就自动具备的应用。 |
| 浏览器操作智能体 · WebArena-Verified | 本版官方卡未列 | 本版官方卡未列 | 64.8 | Qwen3.8使用官方grader与OSWorld scaffold；不等同于所有网站的自动化成功率。 |

表内为各模型官方报告的并列对照，分数越高越好；“本版官方卡未列”仅表示当前所引模型卡未提供该项数据。评测框架、数据集版本及任务约束存在差异，不计算跨模型差值、提升百分比或综合排名。DeepSeek公开代码Agent项采用DeepSeek Harness minimal、max推理强度、temperature=1.0、top_p=0.95；新Qwen的DeepSWE 1.1采用Claude Code、256K上下文及相同temperature/top_p。

直接对照结论：在各自官方报告中，DeepSeek 0731 的 Terminal Bench 2.1 数值为82.7，新 Qwen 为73.0；这为优先验证 DeepSeek 的终端 Agent 能力提供参考，但框架不同，不能当作纯模型提升。Qwen 的原生视觉能力更适合本方案的图片和视频输入。旧 Qwen 到 DeepSeek 的统一条件提升幅度，目前缺少同环境实测证据。

[旧 Qwen 官方模型卡](https://huggingface.co/Qwen/Qwen3.5-122B-A10B#benchmark-results) · [DeepSeek 官方模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731#introduction) · [新 Qwen 官方模型卡](https://huggingface.co/Qwen/Qwen3.8-27B#benchmark-results)

模态口径：以上“不支持”限定于本次列出的开源模型原生能力；依据官方模型卡、输入输出示例及配置结构判断。外接OCR、语音识别、视觉模型或生成工具可扩展应用功能，不改变模型的原生模态。上下文单位为tokens，不是汉字数；图片/视频的视觉tokens、历史消息与思考/回答会共同占用窗口。当前12卡方案的实际最大长度与并发仍需部署验证。

配置依据：[Qwen3.5 配置](https://huggingface.co/Qwen/Qwen3.5-122B-A10B/raw/main/config.json) · [DeepSeek 0731 配置](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/raw/main/config.json) · [Qwen3.8 配置](https://huggingface.co/Qwen/Qwen3.8-27B/raw/main/config.json)。

### Qwen 两代模型的同名评测

全部按官方原表分数展示，所选项目分数越高越好。

| 评测 | 衡量能力 | Qwen3.5-122B-A10B | Qwen3.8-27B | 报告分数差 |
| --- | --- | --- | --- | --- |
| GPQA Diamond | 科学推理 | 86.6 | 89.2 | +2.6 |
| LiveCodeBench v6 | 代码解题 | 78.9 | 90.3 | +11.4 |
| IFBench | 指令遵循 | 76.1 | 79.5 | +3.4 |
| OmniDocBench 1.5 | 文档理解 | 89.8 | 91.1 | +1.3 |
| RealWorldQA | 真实场景视觉问答 | 85.1 | 85.9 | +0.8 |

同名评测便于参考，但两代模型来自各自发布时的报告，未完成同环境重跑。差值为报告分数差，不是业务准确率或速度提升；不同指标不加总。DeepSeek 0731 当前官方模型卡未列出这五项分数，因此不以旧版或预览版数据补齐。

来源：[Qwen3.5 官方评测](https://huggingface.co/Qwen/Qwen3.5-122B-A10B#benchmark-results)、[Qwen3.8 官方评测](https://huggingface.co/Qwen/Qwen3.8-27B#benchmark-results)。

### 代码与 Agent 能力评价

**DeepSeek：复杂文本与工具执行**

Terminal Bench、仓库开发和Toolathlon等官方结果，为优先验证终端、代码与多步骤工具任务提供依据。建议在8卡H200主力服务上重点验收任务完成率、工具调用正确性和失败恢复。

**Qwen3.8：代码与多模态Agent候选**

除通用问答和视觉理解，还可参与代码、浏览器及桌面Agent任务。LiveCodeBench、SWE-bench Pro、OSWorld和WebArena分别反映代码解题、软件工程、桌面及网页操作能力；不应仅定位成简单任务模型。

**旧Qwen：保留可比较的业务基线**

旧122B已具备代码和Agent能力，SWE-bench Verified、BFCL-V4与TAU2-Bench提供官方参考。替换应比较真实任务完成质量、稳定性、耗时与资源成本，不能把新方案描述为从无到有。

以上定位是基于官方资料的选型建议，不是本项目实测结论。算法题、软件工程、函数调用和长流程Agent衡量不同能力；框架、工具权限、重试预算与上下文管理也会影响结果。建议用同一批业务任务、相同工具和可比预算进行部署验收。

来源：[DeepSeek 官方评测](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731#introduction) · [Qwen3.8 官方评测](https://huggingface.co/Qwen/Qwen3.8-27B#benchmark-results) · [旧Qwen 官方评测](https://huggingface.co/Qwen/Qwen3.5-122B-A10B#benchmark-results)。

### 对本次替换的意义

方案解读：27B 不应仅因参数更少而被视为能力降级；这里列出的同名官方分数支持优先验证它在通用、代码和文档任务上的替换效果，但不代表全面胜出。旧 Qwen 本身已支持多模态；本次变化是模型升级与资源分工。DeepSeek 侧重点是复杂 Agent，Qwen 侧重点是通用与视觉，分工仍需用真实业务验证。

部署解读：122B MoE 的 10B 激活参数不等于只需存储 10B 权重，27B 稠密模型也不能仅凭参数更少就推导更快。按同精度的权重存储粗估，122B→27B 可下降约77.9%，并不等于整机显存需求同比下降。官方上下文上限不是本次硬件的已验收能力；量化、KV缓存、并行策略及服务框架均会影响可用长度、速度和并发。

## 四、建议业务分工

### 8张H200 + DeepSeek-V4-Flash-0731

建议承担复杂知识问答、多文档综合分析、多步骤推理、工具调用和Agent任务，将高规格GPU资源集中配置给主力分析与推理服务。DeepSeek官方资料强调该版本的Agent能力，但这些说明不代表本项目实测性能。

### 4张Pro 5000 + Qwen3.8-27B

建议承担日常问答、文本摘要、信息抽取、分类以及图片与文档视觉理解，也可按业务需求承担代码、浏览器和桌面Agent任务。Qwen3.8-27B官方资料明确支持文本、图片和视频理解。将通用任务配置到独立服务，可减少与复杂任务的直接资源竞争。响应速度和并发能力仍需实测。

### 双模型协同

按任务类型配置模型路由，通用任务进入Qwen服务，复杂任务进入DeepSeek服务。路由、失败重试及降级策略需要在应用层落实并验收。跨模型降级不等于效果与容量完全等同的接管。

## 五、收益与取舍

1. 主力配置：第一组由8张H20调整为8张H200。H200单卡141GB显存、4.8TB/s显存带宽，8卡合计1,128GB物理显存。实际可用于推理的容量受模型权重、并行策略、缓存和互联影响。
2. 模型组合：从两组同型号模型改为不同模型承担不同任务，便于按业务选择。
3. 通用资源：第二组采用较小规模模型，模型权重存储需求下降；不能仅据此判断速度或回答质量。
4. 运维适配：原方案模型一致，适配相对统一；新方案需要分别验证提示词、工具调用、输出格式、监控和路由。
5. 故障接管：原方案同样需要配置切换机制，且两组卡数不同，容量不等同。新方案可设计跨模型降级，但需单独验证可接管任务及容量。
6. 投入价值：增加约4.3%的费用进行硬件与模型组合调整，是否达到预期价值应以核心业务验收结果判断。

## 六、落地条件与验收

### 完整硬件规格

已确认H20为单卡96GB，Pro 5000为单卡48GB。H200单卡141GB；仍需确认H200是SXM还是NVL形态、8卡互联拓扑及服务器配置。Pro 5000的完整产品代际与部署兼容性以供货清单确认，不能仅按显存容量判断部署能力。

### 部署与商务口径

明确模型权重版本、推理精度、上下文长度、目标并发、服务框架、计费周期、含税范围和交付服务内容。模型名称中的参数量不能直接代表业务能力强弱。

### 业务验收

使用同一批业务问题、同一知识库和可比输出长度，对比回答准确性、引用正确性、工具调用成功率、首字响应时间及目标并发下的稳定性。需要多模态任务时，单独验证图片与文档视觉理解流程。达到约定标准后再决定切换。

## 七、方案建议

本次拟将原有12张H20的两组Qwen3.5-122B部署，调整为8张H200部署DeepSeek-V4-Flash-0731，以及4张Pro 5000部署Qwen3.8-27B，GPU总数量保持12张。调整后由DeepSeek承担复杂分析、推理及Agent任务，Qwen承担通用问答、信息处理及多模态任务，形成按业务分工的双模型服务。原方案费用为94,024.80元，调整后增加约4,000多元，增幅约4.3%。建议在确认硬件规格、部署参数及业务验收结果后采用调整方案，最终金额以正式报价为准。

## 八、官方参考资料

- H20 96GB官方规格依据：https://docs.nvidia.com/ai-enterprise/release-6/6.5/appendix/vgpu.html
- H200规格：https://www.nvidia.com/en-us/data-center/h200/
- RTX PRO 5000规格：https://www.nvidia.com/en-us/products/workstations/professional-desktop-gpus/rtx-pro-5000/
- DeepSeek-V4-Flash-0731：https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
- Qwen3.8-27B：https://huggingface.co/Qwen/Qwen3.8-27B
- Qwen3.5-122B-A10B：https://huggingface.co/Qwen/Qwen3.5-122B-A10B

配置与费用依据需求方提供的信息，资料核对日期为2026年9月4日。参考资料不构成本项目性能承诺。
