5分钟跑通 gpu-burn:多GPU压力测试与稳定性验证

📅 2026/8/27 8:16:44
5分钟跑通 gpu-burn:多GPU压力测试与稳定性验证
5分钟跑通 gpu-burn多GPU压力测试与稳定性验证【免费下载链接】gpu-burnMulti-GPU CUDA stress test项目地址: https://gitcode.com/gh_mirrors/gp/gpu-burngpu-burn 是一款基于 CUDA 的多 GPU 压力测试工具。它会在机器上的所有 NVIDIA GPU 上并行跑计算内核边施加高负载边校验计算结果的正确性并按卡报告错误数量。如果你需要为 GPU 做稳定性验证、新机验收或故障定位这一个工具就能覆盖大部分常见需求。它的负载来自大量浮点读比较操作每个线程反复比较一个数组中的元素差值超过阈值就计为一个坏元素发热和验证正确性因此同时发生。克隆、编译、跑一次 5 分钟压测首次上手只需三步全部走默认选项。先拉取源码。项目很小编译只依赖本机的 CUDA 工具包。git clone https://gitcode.com/gh_mirrors/gp/gpu-burn cd gpu-burn拉取成功后本地会出现 gpu-burn 目录后续步骤都在该目录内执行。接着编译。Makefile 会自动探测 /usr/local/cuda 或 /usr 下的 CUDA默认按计算能力 7.5Turing编译。make编译成功后目录中会生成gpu_burn可执行文件和内核产物compare.fatbin整个过程通常在一分钟以内。最后对所有 GPU 跑一次压测末尾的 300 是持续秒数显存默认按可用量的 90% 分配。./gpu_burn 300结束时程序会打印每张卡达到的 GFLOPS 与坏元素数量各卡均为 0 errors 即算通过。运行时参数速查表参数以gpu_burn [OPTIONS] [TIME]形式传入TIME 为秒数参数作用示例备注TIME测试时长秒./gpu_burn 600缺省时持续运行直到手动停止-m X使用 X MB 显存./gpu_burn -m 4096 600适合按固定显存量测试-m N%使用 N% 可用显存./gpu_burn -m 80% 600百分比形式默认 90%-d双精度浮点测试./gpu_burn -d 3600GFLOPS 较低同时验证双精度计算-tc尝试使用 Tensor 核心./gpu_burn -tc 300仅在支持的卡上生效-l列出系统所有 GPU./gpu_burn -l打印后即退出便于确认编号-i N只在第 N 张卡上运行./gpu_burn -i 2 1800定位单张可疑卡-h显示帮助信息./gpu_burn -h—按 GPU 架构指定 COMPUTE 编译默认编译目标是 compute_75。机器上的卡如果是更新架构建议显式指定 COMPUTE否则预编译产物可能与卡不匹配架构典型卡COMPUTETuringRTX 20 系75AmpereRTX 30 系 / A10086AdaRTX 40 系89HopperH10090BlackwellB 系120make COMPUTE86需要多架构 fat binary 时把 COMPUTE 置空并通过NVCCFLAGS传入-gencode其余变量CUDAPATH、LDFLAGS 等见 Makefile。容器化构建不想改动宿主机的 CUDA 环境时可以直接用仓库自带的 Dockerfile通过 build args 指定 CUDA 版本、计算能力与基础镜像docker build --build-arg CUDA_VERSION13.0.0 --build-arg COMPUTE75 --build-arg IMAGE_DISTROubi8 -t gpu-burn .运行时把全部 GPU 挂进容器即可输出与判读和宿主机一致docker run --rm --gpus all gpu-burnWindows 版本win/ 目录是 Windows 移植版改用 CMake 与 Visual Studio 构建压测行为与 Linux 版一致CUDA 内核与主目录共享。cd win build.bat -c 89产物位于build\Release\gpu_burn.exe接受的参数与 Linux 版相同。两个典型用法新服务器验收长时间满载现象收到新多卡机器交付前需要确认每张卡都能长时间扛住满载。操作先列出显卡确认数量与编号再启动 24 小时双精度压测。./gpu_burn -l ./gpu_burn -d 86400判读-d模式下 GFLOPS 明显低于单精度属正常重点看结束时报错是否为 0以及 nvidia-smi 中各卡显存与功耗是否全程保持高位。定位可疑卡单卡压测现象作业偶发在某张卡上报错想单独复现。操作列出显卡确认编号后用-i锁定可疑卡同时用-m限制显存减少干扰。./gpu_burn -i 2 -m 80% 1800判读30 分钟内复现错误说明该卡内存或计算单元存在隐患未复现可改用-d再验证或延长时长。排错与监控编译时找不到 CUDA工具链装在非标准位置时编译时直接指定路径make CUDAPATH/usr/local/cuda-12.0仍报错时先用which nvcc确认工具链是否真正安装。配合 nvidia-smi 监控怎么看另开终端执行watch -n 1 nvidia-smi压测期间 GPU-Util 应接近 100%显存占用与-m设定一致温度爬升到平台期后稳定。若 Util 持续偏低通常是负载未打满例如显存被其他进程挤占或容器未挂到对应 GPU。测试中温度偏高压力测试温度普遍高于日常训练负载。某张卡接近功耗墙温度常见约 83~88°C视卡而定时可用-m 50%降低显存占用或缩短时长只要错误数保持为 0结论不受影响。最短启动方式是./gpu_burn 300其余参数见./gpu_burn -h、README.md 与手册页 gpu-burn.8。【免费下载链接】gpu-burnMulti-GPU CUDA stress test项目地址: https://gitcode.com/gh_mirrors/gp/gpu-burn创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考