两张显卡,是两个设备
在 T4 ×2 环境中,通常会看到两张各标称 16 GB 显存的 T4。系统上报的可用容量可能与标称值不同。它们不是一张具有统一 32 GB 显存的显卡。
推理框架支持多 GPU 时,可以将模型的一部分放到不同设备。但是否自动分配、怎么分配,以及哪些数据需要在设备间传输,都取决于框架和模型。
权重大小只是起点
粗略估算权重占用,可以用“参数量 × 每个参数的位数 ÷ 8”。例如 70 亿参数以 4 bit 存储,理论原始权重约 3.5 GB。这不是下载大小,也不是运行时显存保证。
量化元数据、未量化的张量、运行缓冲区和 KV cache 都需要空间。上下文越长、并发越多,缓存占用通常越大;具体还取决于模型结构、缓存精度与框架实现。
让运行状态回答问题
先用 nvidia-smi -L 检查设备,再在实际推理期间观察 nvidia-smi 的显存和利用率。使用 Ollama 时,结合 ollama ps 检查加载中的模型。
设置 CUDA_VISIBLE_DEVICES=0,1 只是在控制可见设备,不会强制模型跨两张卡执行。多卡也不保证比单卡更快。
开始时怎么选
先选择较小的模型和较短的上下文,完成一次真实请求,再逐步增加规模。遇到显存不足时,分别检查模型量化、上下文长度、并发和其他进程占用。
这篇是概念说明,没有给出该 Kaggle 环境的速度测试结果。