中文
返回列表
“我们要上大模型,先告诉我——到底需要买几张GPU?”
这是过去半年里,我被企业客户问得最多的问题,没有之一。
回答“看情况”等于没回答。但张口就说“8张A100起步”的,要么想多卖你服务器,要么根本没做过生产级部署。
今天这篇文章,我会把这个问题拆解成一道可计算的算术题。看完你至少能回答三个问题:最少几张能跑?几张能干活?几张能见人?

GPU数量从来不是独立变量。它取决于三个核心维度:
| 维度 | 关键问题 |
|---|---|
| 模型大小 | 用7B、70B还是MoE架构? |
| 推理还是训练 | 微调还是全量预训练? |
| 并发与延迟 | 内部用还是对外服务?QPS多少? |
这三件事不确定,GPU规划就是玄学。
先说结论——单张GPU能跑大模型吗?能,但有严格限制。
基于主流配置,我们给出一个快速对照表(推理场景,FP16精度):
| 模型参数量 | 显存需求(估算) | 最低GPU配置 | 推荐配置 |
|---|---|---|---|
| 7B-8B | ~14-16GB | 1×RTX 4090 (24GB) | 1×A100 (40GB) |
| 13B-14B | ~26-28GB | 1×A100 (40GB) | 1×A100 (80GB) |
| 32B-34B | ~64-68GB | 2×A100 (40GB) | 2×A100 (80GB) |
| 70B-72B | ~140GB | 4×A100 (40GB) | 4×A100 (80GB) |
| 130B+ | ~260GB+ | 8×A100 (80GB) | 8×H100 (80GB) |
关键结论:对于绝大多数企业的第一部署场景(内部知识库问答、客服辅助、代码辅助),一张RTX 4090或A100就能跑通7B-13B模型。你需要2张以上GPU的唯一原因,是模型超过30B或需要承载高并发。
很多人按模型大小算完觉得够了,一上线就崩。问题出在忽略了这个四个变量:
策略建议:生产环境优先使用 4-bit量化(如GPTQ/AWQ),精度损失<1%,显存直接砍掉75%。
举例:70B模型FP16需140GB,4-bit量化后仅需约35-40GB——一张A100(80GB)即可承载,而不是4张。
上下文从4K扩展到128K,KV Cache显存消耗增长5-10倍。长文档场景(如财报分析、合同审查)务必把这一项算进去。

内部10人用和对外1000人用,需要的GPU数量差两个数量级。
经验公式:单卡A100(80GB)承载7B模型,FP16精度下约支持50-80路并发(假设平均输入2K/输出200 tokens)。并发每翻倍,GPU数量需相应增加。
GPU采购只是第一步,真正的TCO(总拥有成本)需要叠加以下隐性支出:
| 成本项 | 预估占比 | 说明 |
|---|---|---|
| GPU采购 | 50-60% | 单卡A100约10-15万元,H100约20-25万元 |
| 服务器与网络 | 15-20% | GPU服务器、InfiniBand/RoCE交换机、光模块 |
| 机柜与数据中心 | 10-15% | 单台8卡服务器功耗约5-8kW,年电费+制冷约5-8万元 |
| 软件与运维 | 10-15% | 容器平台、监控、Kubernetes、模型版本管理 |
真实案例:某金融客户采购8×A100(80GB)集群,硬件总投入约140万元,叠加3年运维成本后TCO接近200万元。
当你面对“到底买几张”这个问题时,按这个顺序走:
text
复制
下载
① 确定模型 → ② 是否量化 → ③ 预估单卡推理能力 → ④ 乘以并发倍数 → ⑤ 增加1卡冗余(高可用)把这个框架套到你的业务数据上,数字自己会说话。
最后说句实话:绝大多数企业不需要在第一天买满集群。
我看到的成功案例都有一个共同点——从单卡或双卡起步,快速验证业务价值,然后按需扩容。
所以我的标准建议是:
采购上:先买1-2张旗舰卡(如A100/H100)做POC。架构上:按8卡集群做设计,确保未来扩展不推翻重来。
一张卡跑通业务逻辑,两张卡做高可用,四张卡上生产,八张卡规模化——这个路径最稳,也最省钱。