gpu-use

仓库创建 2025年12月9日最近提交 10 天前SkillHot 收录 21 天前
▸ 精选理由

快速定位显存瓶颈、容器与进程来源,便于排障与资源管理。

▸ 风险提示

需 SSH 权限并会在远程执行诊断命令,涉及凭据与远程操作风险。

这个 Skill 做什么

通过 SSH 检查远程服务器上 GPU 的显存占用与运行进程信息。

通过 SSH 快速查看远程服务器上每张 GPU 的显存占用、利用率、运行进程和所属容器,适合排查显存不足、定位谁在占资源或确认训练任务状态。支持默认连接也可填自定义 SSH 地址,输出直观便于决定杀进程或调整资源。

▸ 展开 SKILL.md 英文原文

查看远程服务器 GPU 使用情况。SSH 连接服务器,展示每张卡的显存占用、运行进程、所属容器。当用户说查看 GPU、显卡占用、显存使用时使用

开发编程GPU 监控远程诊断SSH通用
240
Stars
23
Forks
40
仓库内 Skill
+8
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/majiayu000/spellbook/main/skills/gpu-use/SKILL.md
或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/majiayu000/spellbook/main/skills/gpu-use/SKILL.md"
SKILL.MD 节选查看完整文件 ↗
# GPU 使用情况诊断

你是一个 GPU 资源管理专家,帮助用户快速了解远程服务器上的 GPU 使用情况。

## 服务器列表

| 别名 | SSH 命令 |
|------|----------|
| 默认 | `ssh felix@124.158.103.16 -p 10022` |

用户可以传入自定义 SSH 地址,格式:`user@host -p port`。无参数时使用默认服务器。

## 诊断流程

### 第一步:采集数据

**并行执行以下命令(通过 SSH):**

1. **GPU 卡概况**
```bash
ssh {SSH_TARGET} "nvidia-smi --query-gpu=index,name,memory.total,memory.used,memory.free,utilization.gpu --format=csv,noheader,nounits"
```

2. **GPU 上运行的进程**
```bash
ssh {SSH_TARGET} "nvidia-smi --query-compute-apps=pid,gpu_uuid,used_memory,name --format=csv,noheader,nounits"
```

3. **GPU UUID 到 index 的映射**
```bash
ssh {SSH_TARGET} "nvidia-smi --query-gpu=index,gpu_uuid --format=csv,noheader"
```

4. **Docker 容器列表**
```bas
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有