ENT Cloud 博客AI 工具与实操笔记
首页 / 基础与排错

Ollama 下载成功了,为什么还要检查 GPU?

下载模型、加载模型和生成回答,是三个不同的阶段。下面几条命令分别帮你确认一件事。

2026 年 9 月 18 日 · ENT Cloud · 概念与命令说明

第一步:检查模型文件

ollama list

这个列表展示本机已有的模型。看到模型名称,说明文件已存在,不能据此判断它当前正在显卡上运行。

第二步:发起一次真实请求

ollama run qwen2.5:7b "用一句话解释什么是显存。"

这是使用 qwen2.5:7b 的示例,要求 Ollama 服务已经启动。模型尚不存在时,这条命令可能开始下载。成功得到回答后,再检查模型运行状态。

第三步:检查运行中的模型

ollama ps
nvidia-smi

在另一个终端或单元格检查。ollama ps 显示当前加载的模型;NVIDIA 工具帮助观察 GPU 显存与利用率。模型卸载后列表可能为空,生成结束后的瞬间利用率也可能降到零。

如果处理器列显示 CPU/GPU 混合,说明不能把这次运行描述为完全 GPU 推理。即使显示 GPU,也需要额外查看每张卡的占用,才能判断是否使用双卡。

最后:记录性能时写清条件

记录模型标签、量化方式、上下文长度、输入文本、首次加载与后续请求的区别。tokens/s 是 token 生成速度,不等于每秒汉字数。

本文提供命令含义与检查顺序;没有声称这些命令已在新的 Kaggle 会话跑通。完整教程会在端到端复测后补充。

参考:Ollama CLI 文档

接着阅读

在 Kaggle 跑模型前,先检查这 4 件事