ENT Cloud 博客AI 工具与实操笔记
首页 / 基础与排错

双 T4 = 32 GB 显存?跑大模型前先看懂这个区别

两张显卡各有自己的显存。模型能不能装进去,要看框架如何分配,而不只是做一道加法。

2026 年 9 月 18 日 · ENT Cloud · 概念与命令说明

两张显卡,是两个设备

在 T4 ×2 环境中,通常会看到两张各标称 16 GB 显存的 T4。系统上报的可用容量可能与标称值不同。它们不是一张具有统一 32 GB 显存的显卡。

推理框架支持多 GPU 时,可以将模型的一部分放到不同设备。但是否自动分配、怎么分配,以及哪些数据需要在设备间传输,都取决于框架和模型。

权重大小只是起点

粗略估算权重占用,可以用“参数量 × 每个参数的位数 ÷ 8”。例如 70 亿参数以 4 bit 存储,理论原始权重约 3.5 GB。这不是下载大小,也不是运行时显存保证。

量化元数据、未量化的张量、运行缓冲区和 KV cache 都需要空间。上下文越长、并发越多,缓存占用通常越大;具体还取决于模型结构、缓存精度与框架实现。

让运行状态回答问题

先用 nvidia-smi -L 检查设备,再在实际推理期间观察 nvidia-smi 的显存和利用率。使用 Ollama 时,结合 ollama ps 检查加载中的模型。

设置 CUDA_VISIBLE_DEVICES=0,1 只是在控制可见设备,不会强制模型跨两张卡执行。多卡也不保证比单卡更快。

开始时怎么选

先选择较小的模型和较短的上下文,完成一次真实请求,再逐步增加规模。遇到显存不足时,分别检查模型量化、上下文长度、并发和其他进程占用。

这篇是概念说明,没有给出该 Kaggle 环境的速度测试结果。

参考:Ollama GPU 文档Ollama FAQ

接着阅读

在 Kaggle 跑模型前,先检查这 4 件事