본문 바로가기
[GPUaaS]/GPUmgt

[GPU] 📊 가용률 계산 방법 쉽게 이해하기!!

by METAVERSE STORY 2026. 6. 28.
반응형

 

 

 

GPU-Hour 기준으로 장애시간을 반영하는 방법

GPU 서버나 GPU 클러스터를 운영하다 보면 매월 이런 질문을 받게 됩니다.

“이번 달 GPU 가용률은 몇 %인가요?”
“장애시간을 반영하면 실제 서비스 가능한 비율은 어느 정도인가요?”
“가용률 계산 시 장애시간은 어떻게 반영해야 하나요?”

GPU 가용률은 단순히 GPU 사용률을 보는 지표가 아닙니다.
GPU가 사용 중이었는지보다 중요한 것은 사용자가 요청했을 때 GPU를 정상적으로 제공할 수 있었는지입니다.

이번 글에서는 GPU 가용률의 정의, 산식, 계산 예시, 주의사항까지 쉽게 정리해보겠습니다. 🚀


1. GPU 가용률이란? 🤔

GPU 가용률은 전체 GPU 운영시간 중 장애 없이 정상적으로 서비스 제공이 가능했던 시간의 비율입니다.

즉, GPU가 실제로 사용 중이었는지 여부와는 다릅니다.

예를 들어 GPU 사용률이 0%라고 해도, 서버와 GPU가 정상 상태이고 사용자가 요청하면 바로 사용할 수 있다면 이는 가용 상태입니다.

반대로 GPU 사용률이 낮더라도 GPU 고장, 서버 장애, 드라이버 장애 등으로 작업을 받을 수 없다면 이는 비가용 상태로 봐야 합니다.


2. GPU 가용률 산식 📐

GPU 가용률은 아래 산식으로 계산합니다.

GPU 가용률(%) =
(∑ GPU별 전체 운영시간 - ∑ 고장 GPU별 중단시간)
÷ ∑ GPU별 전체 운영시간
× 100

수식으로 표현하면 다음과 같습니다.

GPU 가용률(%) =
[ (전체 GPU 운영시간 합계 - 고장 GPU 중단시간 합계)
  / 전체 GPU 운영시간 합계 ] × 100

조금 더 쉽게 쓰면 다음과 같습니다.

GPU 가용률(%) =
(전체 운영시간 - 장애시간) ÷ 전체 운영시간 × 100

여기서 핵심은 다음 두 가지입니다.

1. 전체 운영시간은 GPU별 전체 운영시간의 합계로 계산한다.
2. 장애시간은 고장난 GPU별 중단시간의 합계로 계산한다.

3. 전체 운영시간이란? ⏱️

전체 운영시간은 운영 대상 GPU가 해당 기간 동안 운영 가능한 총 시간을 의미합니다.

예를 들어 GPU가 총 120장 있고, 4월 한 달 동안 운영했다고 가정해보겠습니다.

4월은 30일이므로 전체 운영시간은 다음과 같습니다.

120장 × 30일 × 24시간 = 86,400 GPU-Hour

즉, 전체 운영시간은 단순히 “한 달 720시간”이 아닙니다.

GPU가 여러 장이라면 다음처럼 계산해야 합니다.

전체 운영시간 = GPU 수 × 운영일수 × 24시간

단위는 보통 GPU-Hour로 표현합니다.


4. GPU-Hour란? 🧮

GPU-Hour는 GPU 운영시간을 계산하는 단위입니다.

예를 들어 GPU 1장이 10시간 동안 중단되었다면:

1장 × 10시간 = 10 GPU-Hour

GPU 8장이 장착된 서버 1대가 10시간 동안 중단되었다면:

8장 × 10시간 = 80 GPU-Hour

즉, 서버 장애시간이 10시간이라고 해서 장애시간을 단순히 10시간으로 계산하면 안 됩니다.

영향을 받은 GPU 수를 곱해서 고장 GPU별 중단시간으로 환산해야 합니다.


5. 장애시간 계산 방법 ⚠️

가용률 산식에서 차감하는 장애시간은 단순 장애 지속시간이 아니라 고장난 GPU별 중단시간의 합계입니다.

예를 들어 다음과 같은 장애가 있었다고 가정해보겠습니다.

구분장애 지속시간영향 GPU 수고장 GPU별 중단시간

GPU 단일 장애 5시간 1장 5 GPU-Hour
서버 전체 장애 3시간 8장 24 GPU-Hour
드라이버 장애 2시간 4장 8 GPU-Hour

이 경우 전체 장애시간은 단순히 5 + 3 + 2 = 10시간이 아닙니다.

정확한 고장 GPU별 중단시간은 다음과 같습니다.

5 + 24 + 8 = 37 GPU-Hour

따라서 가용률 계산에는 37 GPU-Hour를 사용해야 합니다.


6. 계획 정비시간은 어떻게 처리할까? 🛠️

GPU 인프라를 안정적으로 운영하려면 정기적인 점검과 업데이트가 필요합니다.

예를 들어 다음과 같은 작업이 있습니다.

- GPU 펌웨어 업그레이드
- NVIDIA Driver 업데이트
- Fabric Manager 점검
- BIOS/BMC 업데이트
- 서버 정기점검
- 안정성 확보를 위한 계획 재부팅

이처럼 사전에 계획된 필수 정비는 일반적으로 장애시간에서 제외할 수 있습니다.

즉, 계획 정비시간은 시스템 안정성을 위한 정상적인 운영 활동으로 보고, 가용률 계산 시 차감하지 않습니다.

다만 보고서에서는 투명성을 위해 계획 정비시간을 별도로 표시하는 것이 좋습니다.

예시:

구분시간

전체 GPU 운영시간 86,400 GPU-Hour
정상 운영시간 86,000 GPU-Hour
계획 정비시간 300 GPU-Hour
비계획 장애시간 100 GPU-Hour

이 경우 가용률 계산에서 차감하는 시간은 비계획 장애시간 100 GPU-Hour입니다.


 

7. 월별 GPU 가용률 계산 예시 📅

보안상 실제 운영 수량과 장애시간이 아닌 임의 예시 데이터로 설명하겠습니다.

예시 기준은 다음과 같습니다.

운영 GPU 수: 96장
장애시간: 고장 GPU별 중단시간 기준
계획 정비시간: 장애시간에서 제외
단위: GPU-Hour

구분3월4월5월6월

운영일수 20일 30일 31일 30일
운영 GPU 수 96장 96장 96장 96장
전체 GPU 운영시간 46,080 69,120 71,424 69,120
고장 GPU별 중단시간 76.4 22.7 18.5 0.9
GPU 가용률 99.8342% 99.9672% 99.9741% 99.9987%

위 표에서 중요한 점은 장애시간이 단순 장애 지속시간이 아니라 고장 GPU별 중단시간, 즉 GPU-Hour 기준이라는 점입니다.


8. 실제 계산 예시 🔢

3월 예시

3월은 20일만 운영했다고 가정합니다.

전체 GPU 운영시간 = 96장 × 20일 × 24시간
                 = 46,080 GPU-Hour

고장 GPU별 중단시간이 76.4 GPU-Hour라면:

GPU 가용률 =
(46,080 - 76.4) ÷ 46,080 × 100
= 99.8342%

4월 예시

4월은 30일 운영했다고 가정합니다.

전체 GPU 운영시간 = 96장 × 30일 × 24시간
                 = 69,120 GPU-Hour

고장 GPU별 중단시간이 22.7 GPU-Hour라면:

GPU 가용률 =
(69,120 - 22.7) ÷ 69,120 × 100
= 99.9672%

5월 예시

5월은 31일 운영했다고 가정합니다.

전체 GPU 운영시간 = 96장 × 31일 × 24시간
                 = 71,424 GPU-Hour

고장 GPU별 중단시간이 18.5 GPU-Hour라면:

GPU 가용률 =
(71,424 - 18.5) ÷ 71,424 × 100
= 99.9741%

6월 예시

6월은 30일 운영했다고 가정합니다.

전체 GPU 운영시간 = 96장 × 30일 × 24시간
                 = 69,120 GPU-Hour

고장 GPU별 중단시간이 0.9 GPU-Hour라면:

GPU 가용률 =
(69,120 - 0.9) ÷ 69,120 × 100
= 99.9987%

예시 데이터 해석 🏆

위 예시를 기준으로 보면 다음과 같이 해석할 수 있습니다.

3월: 99.8342% → 99.9% 미만, 개선 필요
4월: 99.9672% → 우수
5월: 99.9741% → 우수
6월: 99.9987% → 매우 우수

즉, 특정 월에 장애시간이 집중되면 가용률이 낮아질 수 있지만, 이후 장애시간이 줄어들면 월별 GPU 가용률은 빠르게 개선될 수 있습니다.


9. 가용률이 어느 정도면 좋은 수준일까? 🏆

GPU 가용률은 운영 환경과 서비스 기준에 따라 다르게 해석될 수 있습니다.

일반적으로는 다음과 같이 볼 수 있습니다.

가용률평가

99.5% 미만 개선 필요
99.5% 이상 일반적인 운영 수준
99.9% 이상 양호한 운영 수준
99.95% 이상 우수한 운영 수준
99.99% 이상 고가용성 수준
99.999% 이상 매우 높은 고가용성 수준

 

특정 월에 장애시간이 집중되면 가용률이 낮아질 수 있습니다.

하지만 이후 장애시간이 줄어들면 월별 가용률은 빠르게 개선될 수 있습니다.


10. 산식 사용 시 주의할 점 📌

1) 장애시간은 반드시 GPU-Hour 기준이어야 합니다.

서버 1대가 10시간 장애였다고 해서 장애시간을 10시간으로만 계산하면 안 됩니다.

서버에 GPU가 8장 있다면 다음처럼 계산해야 합니다.

10시간 × 8장 = 80 GPU-Hour

즉, 가용률 산식에 들어가는 장애시간은 장애 지속시간 × 영향 GPU 수입니다.


2) 운영 수량이 GPU 수인지 서버 수인지 확인해야 합니다.

가용률 산출 기준은 원칙적으로 GPU 수입니다.

만약 서버가 100대이고 서버당 GPU가 8장이라면:

총 GPU 수 = 100대 × 8장 = 800장

전체 운영시간은 다음과 같이 계산해야 합니다.

800장 × 운영일수 × 24시간

서버 대수를 그대로 GPU 수처럼 사용하면 가용률이 잘못 산출될 수 있습니다.


3) 계획 정비와 비계획 장애를 구분해야 합니다.

계획 정비는 시스템 안정성 확보를 위한 필수 작업이므로 장애시간에서 제외할 수 있습니다.

반면 아래와 같은 상황은 비계획 장애시간으로 보는 것이 적절합니다.

- GPU 하드웨어 고장
- Xid Error로 GPU 사용 불가
- ECC Uncorrectable Error
- 서버 장애로 GPU 제공 불가
- NVIDIA Driver 비정상
- Device Plugin 장애
- Slurm 또는 Kubernetes 스케줄링 불가

4) 중복 장애시간을 이중 계산하면 안 됩니다.

동일 GPU에서 같은 시간대에 여러 장애 원인이 겹칠 수 있습니다.

예를 들어 서버 장애와 GPU 장애가 같은 시간에 발생했다면, 같은 GPU의 같은 시간대를 두 번 더하면 안 됩니다.

가용률 산출 시에는 GPU별 타임라인 기준으로 중복 구간을 제거하는 것이 정확합니다.


11. 보고서 작성 시 추천 문구 ✍️

월별 GPU 가용률 보고서에는 다음과 같이 작성하면 좋습니다.

본 가용률은 월별 전체 GPU 운영시간 대비 비계획 장애로 인해 서비스 제공이 불가능했던 고장 GPU별 중단시간을 차감하여 산출하였다.

산출식은 다음과 같다.

GPU 가용률(%) =
(∑ GPU별 전체 운영시간 - ∑ 고장 GPU별 중단시간)
÷ ∑ GPU별 전체 운영시간
× 100

계획된 정비시간은 시스템 안정성 확보를 위한 필수 작업으로 판단하여 장애시간에서 제외하였으며, 비계획 장애시간만 가용률 산출에 반영하였다.

12. 최종 정리 ✅

GPU 가용률 계산의 핵심은 다음과 같습니다.

1. 전체 운영시간은 GPU 수 × 운영일수 × 24시간으로 계산한다.
2. 장애시간은 단순 장애시간이 아니라 고장 GPU별 중단시간으로 계산한다.
3. 서버 전체 장애는 영향받은 GPU 수를 곱해서 GPU-Hour로 환산한다.
4. 계획 정비시간은 일반적으로 장애시간에서 제외한다.
5. 최종 가용률은 전체 운영시간에서 고장 GPU별 중단시간을 차감해 계산한다.

최종 산식은 다음과 같습니다.

GPU 가용률(%) =
(∑ GPU별 전체 운영시간 - ∑ 고장 GPU별 중단시간)
÷ ∑ GPU별 전체 운영시간
× 100

GPU 가용률은 단순히 숫자만 보는 지표가 아닙니다.

산출 기준에서 가장 중요한 것은 전체 운영시간의 범위, 장애시간의 기준, 계획 정비 포함 여부, GPU-Hour 환산 여부입니다.

따라서 월별 보고 시에는 가용률뿐만 아니라 전체 운영시간, 장애시간, 정비시간, 장애 원인까지 함께 정리하는 것이 가장 정확합니다. 📊

 

반응형

댓글