返回列表
对于大模型预训练(Pre-training) 从零开始训一个千亿参数模型——绝对不行。 预训练要求极高频的梯度同步(每Token都要交换信息),通信开销与算力开销同等重要。没有高速互联,多卡训练的效率会呈指数级崩塌,100张卡可能还不如8张互联的卡快。
但对于模型推理(Inference) 和微调(Fine-tuning) ,不仅可行,而且有成熟的工程方案。

当GPU之间没有NVLink或RDMA网络时,意味着通信只能走PCIe总线或普通以太网(如万兆、千兆)。带宽相比NVLink(900GB/s)骤降至几十GB/s甚至几GB/s。这种“窄带”环境下,部署大模型主要靠以下三板斧:
张量并行是将一个Transformer层的权重切分到多张卡上,前向和反向传播时每走一步都需要All-Reduce通信。这种模式对带宽极度贪婪,在不互联的卡上使用TP,延迟会暴增数十倍。结论:不建议在不互联场景下启用TP。
将模型按层切分(如GPU 0放1-20层,GPU 1放21-40层)。只有前向传播结束传到下一张卡时才发生通信(传输激活值),通信频率远低于TP。在PCIe交换机或万兆网络下,流水线并行可以工作,但存在“气泡”(Bubble)问题,且单次推理延迟会线性增加。适合离线批处理,不适合实时对话。

这是不互联场景下的“王者方案”。 每张GPU各自独立加载一份完整的模型副本,处理不同的用户请求(或不同的Batch)。彼此之间除了在微调时需同步梯度(可改为异步或半同步),推理阶段完全不需要通信!
要踩通这条路,你的硬件和软件得满足以下底线要求:
| 条件项 | 最低要求 | 备注 |
|---|---|---|
| 操作系统 | Linux(Ubuntu 20.04+) | Windows/WSL2 存在网络栈开销,不推荐生产环境 |
| GPU通信协议 | 至少支持 PCIe P2P(同主机内) | 若跨主机,需万兆以上以太网,建议25Gbps |
| 软件框架 | vLLM、Text Generation Inference(TGI)、DeepSpeed、PyTorch | vLLM 对无互联的多卡推理支持最好,支持 --tensor-parallel-size 1 下启动多实例 |
| 内存带宽 | 每张卡显存需能装下完整模型 | 若单卡装不下70B模型,必须跨卡时,则必须接受TP带来的速度损失 |
既然通信是短板,那就扬长避短。以下三类场景是“孤岛GPU”的主战场:
如果你执意要在不互联的GPU上部署大模型,请收好这份“保命清单”:
假设你是高校实验室,手里有4张24GB显存的RTX 4090,想跑通Qwen2.5-72B(约140GB显存占用)。
多张GPU不互联,从来不是“能不能部署”的问题,而是“在什么效率下部署”的问题。
如果你追求的是 “让模型运行起来,且总吞吐量最大化” ,那么不互联的GPU集群依然是一笔巨大的沉睡资产;如果你追求的是 “单次请求延迟最低、训练速度最快” ,那么没有高速互联,确实寸步难行。
建议每一位面临此困境的工程师,先审视自己的业务容忍度——是实时聊天还是离线清洗?是增量微调还是全量预训练?明确边界后,你会发现:没有NVLink,我们依然有路可走,只不过那条路叫做 “数据并行与异步协同”。