返回列表
2026年的AI推理市场,已经和两年前完全不同。
就在上周,一位做AI视频审核的客户找到我们,开口就要“8卡H100”,预算500万。细问之下才发现——他的日均请求量只有2万次,视频时长平均15秒。按这个体量,一台单卡L20 + 合理的CPU配置,30万以内就能轻松跑满,延迟还能压到200ms以下。
这个案例不是个例。训练要“胖”,推理要“巧”——两者选型逻辑完全不同。
训练追求吞吐量,GPU利用率必须拉满,多卡互联带宽决定效率;推理追求延迟 + 并发,显存容量决定模型能否装下,内存带宽决定Token生成速度,PCIe通道数反而比NVLink更关键。更重要的是,推理服务器的CPU选型、内存容量、甚至网卡速率,都会直接影响首个Token生成时间(TTFT)和每个Token生成时间(TBT)——这两个指标直接决定用户体验和商业转化率。
选错一台推理服务器,轻则性能腰斩,重则项目根本跑不起来。
不要一上来就比H100和B200的算力表。在打开任何供应商报价单之前,先回答以下4个问题:
| 模型规模 | 典型代表 | FP16显存占用 | INT4显存占用 |
|---|---|---|---|
| 7B~8B | LLaMA 3.1、Qwen 2.5 | ~16GB | ~4GB |
| 13B~14B | Qwen 14B | ~28GB | ~7GB |
| 32B~34B | DeepSeek-V3、Qwen 32B | ~68GB | ~17GB |
| 70B~72B | LLaMA 3 70B、Qwen 72B | ~144GB | ~36GB |
| 400B+ | DeepSeek-R1、Grok | >800GB | >200GB |
计算公式(粗略版) :显存占用 ≈ 参数量 × 每个参数字节数 × 1.2(KV Cache和中间激活开销)FP16:参数×2 bytesINT8:参数×1 byteINT4:参数×0.5 byte
选型铁律: 显存容量是第一硬约束,放不下的模型,算力再高也是废铁。
| 场景类型 | 延迟要求(P99) | TTFT要求 | 推荐架构 |
|---|---|---|---|
| 实时对话助手 | < 200ms | < 100ms | 单卡/双卡高端GPU + 高主频CPU |
| 代码补全 | < 500ms | < 200ms | 单卡中高端GPU + 中等配置 |
| 文档摘要(离线) | < 5s | < 1s | 多卡中端GPU,可接受批处理 |
| RAG检索增强 | < 1s | < 300ms | 单卡中端GPU + 大内存(存向量库) |
| 批量数据分析 | > 10s | 不敏感 | 可上T4/A10,做离线批处理 |
选型铁律: 实时场景拼的是单卡推理能力和CPU处理速度;离线场景可以拼多卡并行吞吐。

选型铁律: 并发每翻10倍,GPU数量大约需要翻2~4倍(取决于batch size优化)。

| GPU型号 | 显存 | 显存带宽 | INT8推理算力 | 功耗 | 定位 | 参考单价(2026.07) |
|---|---|---|---|---|---|---|
| H200 | 141GB HBM3e | 4.8TB/s | ~2,800 TOPS | 700W | 旗舰推理/训练 | $30,000+ |
| B200 | 192GB HBM3e | 8.0TB/s | ~4,500 TOPS | 1,000W | 最新旗舰,价格极高 | $40,000+ |
| H100 (80GB) | 80GB HBM3 | 3.35TB/s | ~1,800 TOPS | 700W | 高端全能 | $25,000~30,000 |
| L40S | 48GB GDDR6 ECC | 864GB/s | ~733 TOPS | 300W | 推理性价比之王 | $8,000~10,000 |
| L20 | 48GB GDDR6 ECC | 864GB/s | ~366 TOPS | 275W | 推理主力,能效出色 | $5,000~7,000 |
| A100 (80GB) | 80GB HBM2e | 2.0TB/s | ~624 TOPS | 300W | 上一代全能,仍可一战 | $12,000~15,000 |
| RTX 5090 | 32GB GDDR7 | 1.8TB/s | ~200 TOPS (消费级) | 575W | 开发测试/小规模部署 | $1,999 MSRP(实际溢价) |
| RTX 4090 | 24GB GDDR6X | 1.0TB/s | ~130 TOPS | 450W | 入门开发首选 | $1,500~1,800 |
| 模型规模 | 推荐GPU | 数量 | 理由 |
|---|---|---|---|
| 7B INT8 / INT4 | L20 / RTX 4090 | 1 | 显存足够,功耗可控 |
| 13B FP16 / 34B INT8 | L40S / A100 40GB | 1 | 48GB显存正好装下 |
| 34B FP16 | L40S / A100 80GB | 1 | 40GB不够,必须80GB |
| 70B INT8 | L40S(勉强)/ H200 / A100 80GB×2 | 1~2 | L40S 48GB装INT8刚好,但KV Cache紧张;H200单卡最优 |
| 70B FP16 | H200 / A100 80GB×2 / H100×2 | 2 | 144GB显存需求,H200单卡放不下FP16 |
| 400B MoE(稀疏) | H200×2~4 / B200×2 | 2~4 | MoE稀疏性降低显存压力,但依然需多卡 |
| 400B+ 稠密 | H100×8 / B200×8 | 8+ | 集群方案,需配备NVLink + InfiniBand |
很多团队在选推理服务器时,GPU选得很认真,CPU却随便配一颗“能用就行”——这是被低估的最大性能陷阱。
在推理pipeline中,CPU承担三大关键任务,直接影响用户体验:
| CPU型号 | 核心数 | 基础频率 | 最大频率 | 内存通道 | 适用场景 |
|---|---|---|---|---|---|
| Intel Xeon 6548N (Granite Rapids) | 96核 | 2.0GHz | 3.8GHz | 8通道DDR5 | 大并发推理,最强单路性能 |
| Intel Xeon 6538N | 64核 | 2.1GHz | 3.9GHz | 8通道DDR5 | 高性价比推理主力 |
| AMD EPYC 9755 (Turin) | 128核 | 2.7GHz | 4.1GHz | 12通道DDR5 | 极致多核,批处理优势明显 |
| AMD EPYC 9555 | 64核 | 3.0GHz | 4.4GHz | 12通道DDR5 | 均衡之选,主频优势 |
| Intel Xeon 4510T (Emerald Rapids) | 24核 | 2.1GHz | 3.7GHz | 8通道DDR5 | 边缘/单卡推理 |
选型建议:
2026年特别关注: Intel Granite Rapids系列在AMX(高级矩阵扩展)指令集上持续优化,对INT8推理有额外加速效果;AMD Turin系列则在能效比上更优(128核TDP仅360W)。做AI推理,建议至少选择32核以上的CPU,主频不低于2.5GHz。

这是推理集群中最容易被低估的组件。