新闻中心
新闻中心

AI推理服务器怎么选配置(企业采购版)|海卫士专业选型与配置建议

信息来源:海卫士日期:2026-08-11浏览量:94

返回列表

一、为什么推理服务器的选型逻辑不同于训练?

很多企业采购AI服务器时,直接套用训练集群的配置思路,这会导致成本浪费高达40%以上。推理与训练有三大本质区别。

第一,延迟敏感性。训练关注吞吐,推理关注延迟。训练可以跑几天,推理必须在毫秒级返回,这意味着单卡推理能力比集群扩展能力更关键。

第二,批处理特征。推理时Batch Size通常为1~32,远小于训练的数百甚至上千。小Batch下,GPU的计算单元利用率偏低,瓶颈往往在显存带宽和CPU数据传输上。

第三,模型静态化。推理模型通常是训练完成的静态权重,不再频繁更新梯度,这意味着KV Cache成为显存占用的主体,选型时必须精准计算。

采购决策的第一原则:先明确业务场景的SLA——首Token延迟(TTFT)和Token间延迟(TPOT)要求是多少,再倒推硬件配置,而不是先定预算再配机器。


二、GPU选型:推理场景下的“黄金三角”法则

推理场景选GPU,要看三个维度的平衡:显存带宽(决定吞吐上限)、显存容量(决定能跑多大的模型)、单卡推理性价比(决定TCO)。

当前主流推理GPU对比如下(2026年Q3):H200 NVL拥有141GB HBM3e显存和4.8TB/s带宽,INT8推理性能设为基准1.0x,适合大模型(70B~405B)高并发,单卡参考价28~32万元;H100 SXM为80GB HBM3和3.35TB/s,性能0.85x,适合通用推理中大规模部署,价格22~26万元;L40S为48GB GDDR6和864GB/s,性能0.65x,是中小模型(≤34B)的性价比优选,仅需9~12万元;A10G为24GB和600GB/s,性能0.35x,适合轻量推理(≤13B),价格4~6万元;AMD MI300X提供192GB HBM3和5.2TB/s,性能0.95x,但需适配ROCM,价格25~30万元。数据来源为NVIDIA官方SPEC及MLPerf Inference v5.0(2026年6月),价格为国内批量采购参考价。

在具体选型时,首先按模型参数量筛选。如果模型不超过13B(如Llama 3.2 8B、Qwen2.5 14B),单张A10G(24GB)即可承载,Batch Size=16时显存占用约18GB,余量充足。若模型在13B到34B之间(如Mixtral 8x7B、Qwen2.5 32B),单张L40S(48GB)是最优选择,显存恰好够用,性价比最高。对于34B到70B的模型(如Llama 3.1 70B、Qwen2.5 72B),至少需要两张L40S通过NVLink桥接,或者单张H200 NVL——推荐后者以避免跨卡通信损耗。当模型超过70B(如DeepSeek-V3、Llama 4 405B),则必须采用H200 NVL或MI300X的多卡方案,并需考虑Tensor Parallelism跨卡部署。

其次,按并发量估算所需GPU数量。经验公式可简化为:所需卡数 ≈ (峰值QPS × 平均输入Token数 × 平均输出Token数) / (单卡Batch Size × 单卡理论吞吐 × 利用率系数)。实际操作中,如果QPS低于10(内部使用或小规模API),1~2张L40S足够;QPS在10~50之间(中等规模SaaS服务),需要4~8张L40S或2~4张H200 NVL;QPS达到50~200(大规模公有云API),则需8张以上H200 NVL并配置分布式推理框架。需要特别提醒的是,很多采购方案动辄推荐8×H100,但对大部分企业推理场景来说,4×L40S的总体拥有成本仅为1×H200 NVL的50%,而吞吐量可达到后者的70%,这是当前最大的性价比机会点。


三、CPU与内存:被严重低估的推理性能瓶颈

推理服务器的CPU不参与模型计算,但负责数据预处理(Tokenization)、KV Cache的内存管理和网络I/O调度。当GPU算力充足时,CPU可能成为隐藏瓶颈。推荐每张GPU配置至少8个物理CPU核心(16个超线程)。具体而言,1~2张L40S建议选用Intel Xeon 5418Y或AMD EPYC 9254,16~24核,搭配128GB DDR5;2~4张L40S建议Xeon 6438M或EPYC 9354,24~32核,256GB DDR5;4~8张H200则需Xeon 8468或EPYC 9554,32~48核,512GB~1TB DDR5;8张以上H200应选用双路Xeon 8490H或双路EPYC 9754,64核以上,1TB以上DDR5。

内存带宽对推理性能影响显著,尤其在Prompt处理(Prefill)阶段。实测数据显示,DDR5-5600相比DDR4-3200可使Prefill延迟降低约22~28%(MLPerf Inference v5.0公开数据)。因此企业采购应强制要求DDR5,并优先选择12通道内存架构的CPU平台(如Intel Eagle Stream或AMD Genoa),以最大化内存带宽。关键配置细节包括:内存通道必须全部插满——例如8通道CPU必须插8条内存,否则带宽减半;内存容量计算公式为“总内存 ≥ 模型权重加载冗余 × 2 + KV Cache预留”,KV Cache建议按最大并发数×最大输出长度×每Token缓存大小预留,通常每张GPU对应64~128GB系统内存即可。


四、网络:推理集群的“隐形天花板”

推理集群的网络设计常被忽视,但多卡推理(Tensor Parallelism)和分布式部署(Pipeline Parallelism)对网络有刚性要求。单机多卡场景下,推荐同一台服务器内的GPU通过NVLink(≥900GB/s)互联,且每对GPU之间最好有NVLink Bridge硬桥接。同时需确认CPU提供的PCIe通道数是否足够——8张GPU需要至少64条PCIe 5.0通道(每卡×8),若主板只提供×4通道,跨卡通信带宽将下降50%。

多机集群方面,有三种主流方案:RoCE v2(400G)提供400Gbps带宽和约1.5μs延迟,成本中等,是推理集群的首选;InfiniBand NDR同样有400Gbps但延迟更低(0.8μs),成本却是RoCE的约2.5倍,主要用于训练,推理不推荐;标准以太网(100G)带宽低、延迟高(~5μs),不适用于多卡推理。核心结论是:推理场景下RoCE v2加上支持PFC(优先级流控制)的交换机是综合最优解,NVIDIA Spectrum-4或Aruba CX 10000均为已验证方案。不要为了“保险”而购买InfiniBand,推理集群用不上其极低延迟优势,却要多付一倍成本。

对于多节点推理集群(如使用vLLM、TensorRT-LLM),建议将节点间的All-Reduce通信带宽配置为节点内带宽的1/4以上。例如,节点内NVLink为900GB/s,节点间RoCE应不低于200Gbps(25GB/s),否则跨节点推理性能会因通信瓶颈急剧下降。


五、存储:从“能用”到“好用”的关键跃迁

存储配置应实现系统盘与数据盘分离。系统盘推荐2块480GB SSD做RAID 1(镜像),用于操作系统和日志。模型存储盘则推荐PCIe 5.0 NVMe SSD(如三星PM1743、Solidigm P5520),要求顺序读取≥12GB/s,随机读取≥1500K IOPS。

推理场景对存储IOPS要求高的原因在于模型加载和热切换。当需要从存储读取数十GB至上百GB的模型权重时,若IOPS不足,模型冷启动时间将从30秒延长至5分钟以上,模型热更新时服务也会出现超时毛刺。因此采购时建议模型存储盘配置RAID 10(兼顾读写性能和数据安全),至少4块PCIe 5.0 SSD;如条件允许,可配置NVMe over Fabric(NVMe-oF)共享存储,便于多台服务器共用同一模型池,减少重复存储成本。

存储容量可按模板计算:总存储需求 = 模型文件大小 × 模型版本数 × 2(预留滚动更新空间) + 日志存储(建议至少5TB)。举例来说,部署Llama 3.1 70B(约140GB FP16)、Qwen2.5 72B(约145GB)和DeepSeek-V3(约670GB)三个模型,共3个版本,总容量 ≈ (140+145+670)×3×2 + 5000GB ≈ 10.7TB。


六、散热与功耗:容易被忽视的部署约束

不同GPU配置的功耗差异巨大。2张L40S典型满载约600W,推荐1600W 1+1冗余电源,风冷即可;4张L40S约1200W,需2400W电源和4U风冷机箱;4张H200约2800W,需4000W电源并建议液冷或混合散热;8张H200约5600W,必须配备8000W 2+2冗余电源和全液冷方案。机房约束方面,标准42U机柜单柜功耗上限通常为6~10kW,8×H200满载超过5.6kW,加上CPU和网络设备可能超过7kW,必须提前确认机房散热能力和PDU容量,否则服务器上架后频繁降频将导致性能腰斩。

风冷与液冷的选择原则:总功耗低于4kW时风冷足够,推荐2U或4U标准机箱;功耗在4~6kW之间建议混合散热(GPU液冷+CPU风冷),如NVIDIA HGX平台搭配闭式液冷;功耗超过6kW则必须全液冷,推荐直接采购整机柜液冷方案(如Vertiv、nVent等OEM集成)。液冷增加的采购成本约15~25%,但可降低PUE从1.6降至1.2以下,年电费节省显著——以8×H200满负载运行计算,液冷每年可节省电费约4~6万元(按0.8元/度工业电价估算)。