新闻中心
新闻中心

AI推理服务器怎么选配置?

信息来源:海卫士日期:2026-07-20浏览量:62

返回列表

2026年的AI推理市场,已经和两年前完全不同。

就在上周,一位做AI视频审核的客户找到我们,开口就要“8卡H100”,预算500万。细问之下才发现——他的日均请求量只有2万次,视频时长平均15秒。按这个体量,一台单卡L20 + 合理的CPU配置,30万以内就能轻松跑满,延迟还能压到200ms以下。

这个案例不是个例。训练要“胖”,推理要“巧”——两者选型逻辑完全不同

训练追求吞吐量,GPU利用率必须拉满,多卡互联带宽决定效率;推理追求延迟 + 并发,显存容量决定模型能否装下,内存带宽决定Token生成速度,PCIe通道数反而比NVLink更关键。更重要的是,推理服务器的CPU选型、内存容量、甚至网卡速率,都会直接影响首个Token生成时间(TTFT)和每个Token生成时间(TBT)——这两个指标直接决定用户体验和商业转化率。

选错一台推理服务器,轻则性能腰斩,重则项目根本跑不起来。

核心选配逻辑:抛开参数迷雾,先想清楚这4个问题

不要一上来就比H100和B200的算力表。在打开任何供应商报价单之前,先回答以下4个问题:

1. 你的模型有多大?(参数量 + 量化方案)

模型规模典型代表FP16显存占用INT4显存占用
7B~8BLLaMA 3.1、Qwen 2.5~16GB~4GB
13B~14BQwen 14B~28GB~7GB
32B~34BDeepSeek-V3、Qwen 32B~68GB~17GB
70B~72BLLaMA 3 70B、Qwen 72B~144GB~36GB
400B+DeepSeek-R1、Grok>800GB>200GB
计算公式(粗略版) :显存占用 ≈ 参数量 × 每个参数字节数 × 1.2(KV Cache和中间激活开销)FP16:参数×2 bytesINT8:参数×1 byteINT4:参数×0.5 byte

选型铁律: 显存容量是第一硬约束,放不下的模型,算力再高也是废铁。

2. 你的业务场景对延迟有多敏感?

场景类型延迟要求(P99)TTFT要求推荐架构
实时对话助手< 200ms< 100ms单卡/双卡高端GPU + 高主频CPU
代码补全< 500ms< 200ms单卡中高端GPU + 中等配置
文档摘要(离线)< 5s< 1s多卡中端GPU,可接受批处理
RAG检索增强< 1s< 300ms单卡中端GPU + 大内存(存向量库)
批量数据分析> 10s不敏感可上T4/A10,做离线批处理

选型铁律: 实时场景拼的是单卡推理能力和CPU处理速度;离线场景可以拼多卡并行吞吐

3. 你的并发请求量有多大?

  • QPS < 10:单卡消费级(RTX 4090 / 5090)或入门级专业卡(L20)足够
  • QPS 10~100:单卡中高端(L40S / A100 40GB)或双卡
  • QPS 100~500:2~4卡高端(A100 80GB / H100 / H200)
  • QPS > 500:集群方案,需要负载均衡和分布式推理框架

选型铁律: 并发每翻10倍,GPU数量大约需要翻2~4倍(取决于batch size优化)。

4. 你的部署环境是什么?(数据中心 / 企业机房 / 边缘节点)

  • 数据中心:供电、散热、机柜空间充足,可以上高功率GPU(H100 700W、B200 1000W)
  • 企业标准机房:一般单机柜供电≤6~8kW,单节点建议≤双卡H100(2×700W = 1400W + CPU ≈ 2000W)
  • 边缘/办公环境:必须选≤300W的单卡,优先考虑L20(275W)、A10(150W)、RTX 5090(575W已经偏高)

GPU选型:2026年主流AI推理卡横向对比

NVIDIA 产品线

GPU型号显存显存带宽INT8推理算力功耗定位参考单价(2026.07)
H200141GB HBM3e4.8TB/s~2,800 TOPS700W旗舰推理/训练$30,000+
B200192GB HBM3e8.0TB/s~4,500 TOPS1,000W最新旗舰,价格极高$40,000+
H100 (80GB)80GB HBM33.35TB/s~1,800 TOPS700W高端全能$25,000~30,000
L40S48GB GDDR6 ECC864GB/s~733 TOPS300W推理性价比之王$8,000~10,000
L2048GB GDDR6 ECC864GB/s~366 TOPS275W推理主力,能效出色$5,000~7,000
A100 (80GB)80GB HBM2e2.0TB/s~624 TOPS300W上一代全能,仍可一战$12,000~15,000
RTX 509032GB GDDR71.8TB/s~200 TOPS (消费级)575W开发测试/小规模部署$1,999 MSRP(实际溢价)
RTX 409024GB GDDR6X1.0TB/s~130 TOPS450W入门开发首选$1,500~1,800

2026年选型趋势观察

  • H200正在取代H100成为主流推荐:更大的显存(141GB vs 80GB)让H200可以单卡运行70B模型(INT8) ,而H100必须双卡或上量化,性价比差距拉大。
  • B200当前价格过高($40,000+),且功耗达1000W,多数数据中心尚未完成散热改造,建议观望。
  • L40S是目前推理的“甜点卡” :300W功耗、48GB显存、FP8推理性能强劲,单卡可跑70B INT8或34B FP16,性价比明显优于A100。
  • L20是国产合规场景下的最优解:275W功耗,48GB显存,性能约为L40S的60%,价格却低40%,适合企业成本敏感型部署。
  • 国产GPU(华为昇腾910B、寒武纪MLU370)在金融、政务等国产化场景落地加速,但生态兼容性仍需额外适配成本,通用场景暂不推荐。

选型决策矩阵(按模型规模)

模型规模推荐GPU数量理由
7B INT8 / INT4L20 / RTX 40901显存足够,功耗可控
13B FP16 / 34B INT8L40S / A100 40GB148GB显存正好装下
34B FP16L40S / A100 80GB140GB不够,必须80GB
70B INT8L40S(勉强)/ H200 / A100 80GB×21~2L40S 48GB装INT8刚好,但KV Cache紧张;H200单卡最优
70B FP16H200 / A100 80GB×2 / H100×22144GB显存需求,H200单卡放不下FP16
400B MoE(稀疏)H200×2~4 / B200×22~4MoE稀疏性降低显存压力,但依然需多卡
400B+ 稠密H100×8 / B200×88+集群方案,需配备NVLink + InfiniBand


CPU选型:Xeon还是EPYC?推理场景的CPU常被低估

很多团队在选推理服务器时,GPU选得很认真,CPU却随便配一颗“能用就行”——这是被低估的最大性能陷阱

在推理pipeline中,CPU承担三大关键任务,直接影响用户体验:

  1. Prompt预处理(Tokenization + Embedding):计算密集型,影响TTFT(首个Token延迟)
  2. 调度与批处理(Continuous Batching):影响吞吐和延迟稳定性
  3. KV Cache管理(PageAttention等):内存密集型,影响并发上限

2026年CPU选型建议

CPU型号核心数基础频率最大频率内存通道适用场景
Intel Xeon 6548N (Granite Rapids)96核2.0GHz3.8GHz8通道DDR5大并发推理,最强单路性能
Intel Xeon 6538N64核2.1GHz3.9GHz8通道DDR5高性价比推理主力
AMD EPYC 9755 (Turin)128核2.7GHz4.1GHz12通道DDR5极致多核,批处理优势明显
AMD EPYC 955564核3.0GHz4.4GHz12通道DDR5均衡之选,主频优势
Intel Xeon 4510T (Emerald Rapids)24核2.1GHz3.7GHz8通道DDR5边缘/单卡推理

选型建议:

  • 实时对话/代码补全(对TTFT敏感):选高主频CPU(AMD EPYC 9555 单核更强,或 Intel Xeon 6538N 平衡性好)
  • 大批量离线推理(对批处理吞吐敏感):选多核心CPU(AMD EPYC 9755 128核优势明显)
  • 小规模/单卡部署(L20/RTX 4090):Intel Xeon 4510T 或 AMD EPYC 9124 完全够用,不必上旗舰

2026年特别关注: Intel Granite Rapids系列在AMX(高级矩阵扩展)指令集上持续优化,对INT8推理有额外加速效果;AMD Turin系列则在能效比上更优(128核TDP仅360W)。做AI推理,建议至少选择32核以上的CPU,主频不低于2.5GHz

内存、存储与网络:被忽视的“铁三角”

内存(RAM)

  • 最低要求:CPU核心数 × 2GB(例如64核至少128GB)
  • 推荐配置:256GB~512GB DDR5
  • 2026年趋势:大模型推理中KV Cache offload逐渐普及,允许将部分KV Cache放在CPU内存,用DRAM换显存——这对内存带宽提出更高要求。建议优先选择8通道DDR5-5600以上配置。
  • 实际案例:一个部署DeepSeek-R1(INT8量化)的4卡H200节点,内存配置从256GB升级到512GB后,最大并发从64提升到96(提升50%),原因是KV Cache offload让显存压力大幅缓解。

存储(SSD)

  • 系统盘:2 × 480GB SSD(RAID 1),用于操作系统和日志
  • 数据盘:≥2TB NVMe SSD(建议RAID 10),用于存储模型权重文件、数据集
  • 关键提示:大模型权重文件动辄几百GB(DeepSeek-R1 INT8版本约400GB),模型加载速度直接取决于SSD顺序读取速度。推荐使用PCIe 5.0 NVMe SSD(顺序读≥10GB/s),可将模型加载时间从分钟级压缩到秒级。

网络(网卡)

这是推理集群中最容易被低估的组件。

  • 单卡独立部署:万兆网卡(10GbE)即可
  • 2~4卡并行:建议25GbE,若有跨节点通信需求,升级到100GbE
  • 8卡以上集群:强制200Gb/s InfiniBand或RoCE,否则多卡通信会成为瓶颈
  • 2026年新变化:NVIDIA Spectrum-X平台正在推动以太网AI优化,部分场景可替代InfiniBand,成本降低约30%,值得关注