본문 바로가기
[GPUaaS]/Serving

[2단계] AI 서빙 (Serving) 생성 화면, 초보자도 쉽게 이해하기 😊 !!

by METAVERSE STORY 2026. 7. 22.
반응형

 

 

모델·런타임·GPU·Replica·Endpoint가 도대체 뭘까?

안녕하세요 😊

지난 글에서는 AI 서빙이 무엇인지 아주 기초부터 알아봤습니다.

간단히 다시 말하면,

AI 서빙은 학습이 끝난 AI 모델을 사람들이 실제로 사용할 수 있게 서비스로 실행하는 것

이라고 볼 수 있습니다.

그런데 여기서 막상 Serving을 생성하려고 하면 갑자기 어려운 단어들이 등장합니다.

모델
런타임
GPU
Replica
Endpoint
CPU
Memory
Storage

처음 보면 솔직히 이런 생각이 듭니다.

“모델은 알겠는데 런타임은 뭐지?”
“GPU는 왜 설정해야 하지?”
“Replica는 또 뭐야?”
“Endpoint는 주소 같은 건가?”

저도 처음 보면 어렵게 느껴질 만하다고 생각합니다.
그래서 이번 글에서는 Serving 생성 화면에서 자주 나오는 항목들을 최대한 쉽게 풀어보겠습니다. 🚀


1. Serving 생성 화면은 뭐 하는 곳일까? 🧩

Serving 생성 화면은 쉽게 말하면,

AI 모델을 실제 서비스로 실행하기 위해 필요한 설정을 입력하는 화면

입니다.

조금 더 쉽게 표현하면,

“이 AI 모델을 어떻게 실행할 건지 정하는 화면”

이라고 보면 됩니다.

예를 들어 이런 것들을 정합니다.

어떤 AI 모델을 사용할지
그 모델이 어디에 저장되어 있는지
어떤 방식으로 실행할지
CPU와 메모리는 얼마나 줄지
GPU를 사용할지
같은 AI 서버를 몇 개 띄울지
사용자가 어떤 주소로 호출할지

처음에는 복잡해 보이지만, 사실은 AI 서비스를 열기 위한 준비 과정입니다.


2. 식당으로 비유하면 훨씬 쉽습니다 🍜

AI Serving을 식당으로 비유해보겠습니다.

식당을 열려면 메뉴만 있다고 되는 게 아니죠.

메뉴도 있어야 하고, 주방도 있어야 하고, 조리도구도 있어야 하고, 손님이 주문할 창구도 있어야 합니다.

AI Serving도 똑같습니다.

Serving 항목 쉽게 말하면 식당 비유
모델 사용할 AI 파일 요리 메뉴
런타임 AI를 실행하는 프로그램 주방 설비
GPU 빠른 계산 장비 고성능 조리기구
Replica AI 서버 개수 같은 주방 개수
Endpoint AI 호출 주소 주문 창구

즉, Serving 생성 화면은
AI 모델이라는 메뉴를 실제 손님에게 제공하기 위한 식당 오픈 준비 화면이라고 보면 됩니다. 😊


3. 모델이란? 🤖

Serving에서 말하는 모델은 학습이 끝난 AI 파일입니다.

쉽게 말하면,

AI가 공부를 끝내고 만들어진 결과물

입니다.

예를 들어 고양이와 강아지를 구분하는 AI를 만든다고 해보겠습니다.

AI에게 고양이 사진과 강아지 사진을 많이 보여주면서 학습시킵니다.

고양이 사진 학습
강아지 사진 학습
↓
고양이와 강아지를 구분하는 AI 모델 생성

이렇게 만들어진 결과물이 바로 모델입니다.

예를 들면 이런 파일이나 폴더가 모델이 될 수 있습니다.

model.pt
model.onnx
saved_model/
pytorch_model.bin

4. 모델만 있으면 바로 서비스가 될까? 😅

여기서 중요한 점이 있습니다.

모델 파일만 있다고 바로 서비스가 되는 것은 아닙니다.

모델은 그냥 파일입니다.
혼자서 사용자의 요청을 받을 수도 없고, 혼자서 결과를 돌려줄 수도 없습니다.

예를 들어 요리 레시피 책이 있다고 해보겠습니다.

레시피 책만 있다고 음식이 자동으로 나오지는 않죠.

요리를 하려면 이런 것들이 필요합니다.

레시피
주방
조리도구
요리사
주문 창구

AI도 마찬가지입니다.

모델 파일만 있음
→ 사용자가 바로 사용할 수 없음

모델 파일 + 실행 환경 + 서버 + 호출 주소
→ 사용자가 사용할 수 있음

그래서 필요한 것이 바로 Serving입니다.


5. 모델 경로란? 📁

Serving 생성 화면에서 모델 경로라는 항목이 나올 수 있습니다.

모델 경로는 쉽게 말하면,

AI 모델 파일이 저장되어 있는 위치

입니다.

예를 들면 이런 식입니다.

s3://model-bucket/cat-dog/v1/

또는

/models/cat-dog/

쉽게 말해 서버가 이렇게 묻는 것입니다.

“실행할 AI 모델 파일이 어디에 있나요?”

여기에 정확한 위치를 입력해야 Serving 서버가 모델을 가져와서 실행할 수 있습니다.


6. 모델 경로가 틀리면 어떻게 될까? ⚠️

모델 경로가 틀리면 서버가 모델을 찾지 못합니다.

이런 상황입니다.

서버: 모델을 실행해야 하는데 파일이 안 보여요.
서버: 경로가 틀린 것 같아요.
서버: 접근 권한이 없는 것 같아요.

그래서 이런 오류가 발생할 수 있습니다.

Model not found
Access denied
Model load failed

쉽게 말하면,

모델을 찾지 못해서 서빙이 시작되지 않는 상황

입니다.

그래서 Serving을 만들 때는 모델 경로를 꼭 정확하게 확인해야 합니다.


 

 

7. 런타임이란? ⚙️

이번에는 런타임(Runtime)입니다.

이 단어가 처음에는 조금 어렵게 느껴집니다.

하지만 아주 쉽게 말하면,

AI 모델을 실행해주는 프로그램

입니다.

모델은 파일이고, 런타임은 그 파일을 읽어서 실제로 실행해주는 역할을 합니다.


8. 런타임도 식당으로 비유하면 쉽습니다 🍳

모델이 요리 레시피라면,
런타임은 주방 설비입니다.

피자를 만들려면 피자 오븐이 필요합니다.
커피를 만들려면 커피 머신이 필요합니다.
라면을 끓이려면 냄비와 가스레인지가 필요합니다.

AI도 똑같습니다.

모델 종류에 맞는 런타임을 선택해야 합니다.

모델 종류 어울리는 런타임
TensorFlow 모델 TensorFlow Serving
PyTorch 모델 PyTorch 계열 런타임
ONNX 모델 ONNX Runtime
LLM 챗봇 모델 vLLM, Hugging Face 계열
특수한 모델 Custom Runtime

어렵게 외울 필요는 없습니다.

핵심은 이것입니다.

모델 종류에 맞는 실행 프로그램을 선택해야 한다.


9. 런타임을 잘못 고르면? 😵

모델과 런타임이 맞지 않으면 모델이 실행되지 않을 수 있습니다.

예를 들어 이런 경우입니다.

ONNX 모델인데 TensorFlow 런타임을 선택함
PyTorch 모델인데 맞지 않는 런타임을 선택함
LLM 모델인데 일반 런타임을 선택함

이건 쉽게 말하면,

라면을 끓이려고 하는데 커피머신에 넣은 상황

과 비슷합니다.

도구가 맞지 않으니 제대로 동작하지 않습니다.

그래서 Serving을 만들 때는
모델 형식과 런타임이 맞는지 꼭 확인해야 합니다.


 

 

10. CPU와 Memory는 무엇일까? 🧠

Serving 생성 화면에는 보통 CPU와 Memory 설정도 나옵니다.

예를 들면 이런 식입니다.

CPU: 2
Memory: 8Gi

이것도 어렵게 생각하지 않아도 됩니다.


11. CPU는 기본 일꾼입니다 👷

CPU는 서버에서 기본적인 일을 처리하는 장치입니다.

Serving에서는 이런 일을 합니다.

사용자 요청 받기
데이터 정리하기
모델 실행 준비하기
응답 보내기
로그 남기기

쉽게 말하면,

서버의 기본 일꾼

이라고 보면 됩니다.


12. Memory는 작업 공간입니다 🧺

Memory는 서버가 일할 때 사용하는 임시 공간입니다.

식당으로 비유하면 작업대입니다.

작업대가 넓으면 재료를 펼쳐놓고 편하게 요리할 수 있습니다.

반대로 작업대가 너무 좁으면 일이 꼬이겠죠.

AI도 마찬가지입니다.

Memory가 부족하면 이런 문제가 생길 수 있습니다.

서버가 느려짐
모델 실행 실패
Pod 재시작
Out of Memory 오류

쉽게 말하면,

작업할 공간이 부족해서 서버가 버티지 못하는 상황

입니다.


13. GPU란? 🎮

GPU는 AI 계산을 빠르게 처리하는 장비입니다.

초보자용으로 쉽게 말하면,

AI 모델을 빠르게 움직이게 해주는 고성능 계산 장치

입니다.

AI 모델은 내부적으로 숫자 계산을 엄청 많이 합니다.

특히 이미지 생성, 음성 인식, 챗봇, LLM 같은 모델은 계산량이 큽니다.

이때 GPU가 있으면 훨씬 빠르게 처리할 수 있습니다.


14. CPU와 GPU 차이 쉽게 보기

구분CPUGPU

쉬운 비유 일반 직원 계산 전문팀
역할 여러 일을 골고루 처리 많은 계산을 빠르게 처리
AI에서 용도 작은 모델, 기본 처리 큰 모델, 빠른 응답
특징 범용적 병렬 계산에 강함

CPU는 여러 일을 골고루 잘하는 직원이라면,
GPU는 계산을 빠르게 처리하는 전문팀이라고 보면 됩니다.


15. GPU를 꼭 써야 할까? 🤔

항상 GPU가 필요한 것은 아닙니다.

작은 모델은 CPU만으로도 충분할 수 있습니다.

하지만 이런 경우에는 GPU가 필요할 가능성이 높습니다.

모델 크기가 큰 경우
응답 속도가 빨라야 하는 경우
LLM 챗봇을 운영하는 경우
이미지 생성 모델을 운영하는 경우
동시에 여러 요청을 처리해야 하는 경우

특히 LLM 같은 대형 언어 모델은 GPU 없이 운영하면 너무 느리거나 실행 자체가 어려울 수 있습니다.


16. GPU 설정은 Replica와 같이 봐야 합니다 ⚠️

Serving 화면에서 GPU를 이렇게 설정할 수 있습니다.

GPU: 1

이 뜻은,

AI 서버 하나에 GPU 1개를 사용하겠다

는 의미입니다.

그런데 여기서 중요한 것이 있습니다.

GPU는 Replica와 함께 봐야 합니다.

예를 들어 이렇게 설정했다고 해보겠습니다.

GPU: 1
Replica: 3

그러면 AI 서버가 3개 뜨고, 각 서버가 GPU를 1개씩 사용할 수 있습니다.

AI 서버 1개당 GPU 1개
Replica 3개
↓
총 GPU 3개 필요

즉,

GPU 개수 × Replica 개수 = 실제 필요한 GPU 수

라고 생각하면 이해하기 쉽습니다.


17. Replica란? 🧱

Replica도 처음 보면 어려운 단어입니다.

하지만 쉽게 말하면,

같은 AI 서버를 몇 개 띄울 것인지 정하는 값

입니다.


18. Replica 1개는 이런 구조입니다

Replica: 1

이면 AI 서버가 1개 실행됩니다.

사용자 요청
↓
AI 서버 1개
↓
응답

테스트용이라면 보통 Replica 1개로 시작해도 됩니다.


19. Replica 3개는 이런 구조입니다

Replica: 3

이면 같은 AI 서버가 3개 실행됩니다.

사용자 요청
↓
AI 서버 1
AI 서버 2
AI 서버 3
↓
나눠서 처리

사용자가 많을 때는 여러 서버가 나눠서 처리하면 더 안정적입니다.


20. Replica를 늘리면 좋은 점 👍

Replica를 늘리면 이런 장점이 있습니다.

요청을 더 많이 처리할 수 있음
한 서버가 죽어도 다른 서버가 처리 가능
응답이 더 안정적일 수 있음

예를 들어 AI 서버가 1개뿐인데 문제가 생기면 서비스가 멈출 수 있습니다.

하지만 AI 서버가 3개라면 하나가 문제 생겨도 나머지가 요청을 처리할 수 있습니다.


21. Replica를 무조건 늘리면 좋을까? ❌

아닙니다.

Replica를 늘리면 자원도 더 많이 필요합니다.

특히 GPU를 사용하는 Serving이라면 더 조심해야 합니다.

GPU 1개 사용
Replica 4개
↓
GPU 4개 필요할 수 있음

그래서 Replica는 무조건 많이 늘리는 것이 아니라,
요청량과 필요한 자원에 맞게 설정하는 것이 중요합니다.


22. Endpoint란? 🌐

Endpoint는 사용자가 AI 모델을 호출하는 주소입니다.

쉽게 말하면,

AI에게 요청을 보내는 주소

입니다.

예를 들면 이런 주소입니다.

https://my-ai-service.com/predict

사용자나 프로그램은 이 주소로 데이터를 보냅니다.

그러면 AI 모델이 결과를 돌려줍니다.


23. Endpoint도 식당으로 비유해볼게요 🍽️

Endpoint는 식당의 주문 창구입니다.

손님이 음식을 먹으려면 주문 창구가 필요합니다.

AI도 마찬가지입니다.

사용자가 AI 모델을 사용하려면 요청을 보낼 주소가 필요합니다.

사용자
↓
Endpoint 주소로 요청
↓
AI 서버
↓
AI 모델 실행
↓
결과 응답

Endpoint가 없다면 외부에서 AI 모델을 호출하기 어렵습니다.


24. Endpoint가 생기면 끝일까? 🚨

아닙니다.

Endpoint 주소가 생겼다고 무조건 성공은 아닙니다.

반드시 실제로 요청을 보내서 결과가 오는지 확인해야 합니다.

확인해야 할 것은 다음과 같습니다.

Serving 상태가 준비 완료인지
Endpoint 주소가 있는지
요청을 보냈을 때 응답이 오는지
응답이 너무 느리지는 않은지
오류가 나지는 않는지

쉽게 말하면,

가게 간판만 달았다고 장사가 되는 것은 아니다

입니다.

주방도 정상이어야 하고, 요리사도 준비되어 있어야 하고, 주문도 제대로 받아야 합니다.

AI Serving도 똑같습니다.

Endpoint가 있어도 모델이 준비되지 않았다면 정상 응답이 오지 않습니다.


 

25. Serving 생성 화면 핵심 항목 정리 📌

Serving 생성 화면에서 꼭 기억해야 할 항목은 아래와 같습니다.

항목아주 쉬운 설명

모델 사용할 AI 파일
모델 경로 AI 파일이 저장된 위치
런타임 AI 모델을 실행하는 프로그램
CPU 기본 일을 처리하는 장치
Memory 작업할 공간
GPU AI 계산을 빠르게 해주는 장치
Replica 같은 AI 서버를 몇 개 띄울지
Endpoint AI에게 요청을 보내는 주소

이 표만 이해해도 Serving 생성 화면이 훨씬 덜 어렵게 느껴질 겁니다. 😊


26. 쉬운 예시로 다시 볼게요 🐱

고양이와 강아지를 구분하는 AI 서비스를 만든다고 해보겠습니다.

Serving 생성 화면에는 이렇게 입력할 수 있습니다.

Serving 이름: cat-dog-ai
모델 경로: 고양이/강아지 AI 모델이 저장된 위치
런타임: 이 모델을 실행할 수 있는 프로그램
CPU: 2개
Memory: 8Gi
GPU: 1개
Replica: 1개
Endpoint: 자동 생성된 호출 주소

이 설정의 의미는 다음과 같습니다.

고양이/강아지 구분 AI를
맞는 실행 프로그램으로 실행하고
CPU와 메모리와 GPU를 할당해서
AI 서버 1개로 띄운 다음
사용자가 주소로 호출할 수 있게 만든다

조금 더 쉽게 말하면,

고양이/강아지 구분 AI 가게를 하나 오픈하는 것

입니다. 🐾


27. LLM 챗봇 예시로도 볼게요 💬

이번에는 챗봇 AI를 만든다고 해보겠습니다.

Serving 이름: chatbot-ai
모델 경로: 챗봇 모델이 저장된 위치
런타임: vLLM 또는 챗봇 모델 실행용 런타임
CPU: 8개
Memory: 32Gi
GPU: 1개 이상
Replica: 1개
Endpoint: 챗봇 호출 주소

이 의미는 다음과 같습니다.

챗봇 모델을 서버에 올리고
GPU를 사용해서 빠르게 답변하게 만들고
사용자가 API 주소로 질문을 보내면
AI가 답변을 돌려준다

즉,

챗봇 AI 상담 창구를 만드는 것

이라고 보면 됩니다. 🤖


28. 초보자가 자주 헷갈리는 부분 😵

1) 모델만 있으면 되는 줄 안다

아닙니다.

모델은 AI 파일일 뿐입니다.

실제로 사용하려면 실행 환경과 서버와 호출 주소가 필요합니다.

모델만 있음 → 사용 어려움
모델 + 런타임 + 서버 + Endpoint → 사용 가능

2) 런타임을 아무거나 골라도 되는 줄 안다

아닙니다.

모델 종류에 맞는 런타임을 골라야 합니다.

ONNX 모델 → ONNX Runtime
TensorFlow 모델 → TensorFlow Serving
LLM 모델 → vLLM 계열

쉽게 말하면,

모델과 런타임은 짝이 맞아야 한다

입니다.


3) GPU를 많이 주면 무조건 좋은 줄 안다

GPU가 많으면 성능에 도움이 될 수 있습니다.

하지만 비용과 자원 사용량도 늘어납니다.

작은 모델은 GPU 없이도 가능할 수 있습니다.

반대로 큰 모델이나 LLM은 GPU가 필요할 가능성이 높습니다.


4) Replica를 늘리면 무조건 좋은 줄 안다

Replica를 늘리면 서버가 여러 개 생깁니다.

하지만 그만큼 CPU, 메모리, GPU도 더 필요합니다.

특히 GPU Serving에서는 Replica를 늘릴 때 조심해야 합니다.

GPU 1개 사용
Replica 4개
↓
GPU 4개 필요할 수 있음

5) Endpoint가 생기면 끝난 줄 안다

Endpoint는 입구일 뿐입니다.

실제로 AI 모델이 준비되어 있고, 요청에 정상 응답하는지 확인해야 합니다.

Endpoint 있음
↓
실제 요청 테스트
↓
정상 응답 확인

29. 가장 쉬운 한 장 요약 📝

Serving 생성 화면은 결국 이것을 정하는 화면입니다.

어떤 AI 모델을 사용할까?
어디에 있는 모델을 가져올까?
무슨 프로그램으로 실행할까?
CPU와 메모리는 얼마나 줄까?
GPU를 사용할까?
AI 서버를 몇 개 띄울까?
사용자는 어떤 주소로 호출할까?

한 문장으로 정리하면,

Serving 생성 화면은 AI 모델을 실제 서비스로 열기 위한 설정 화면입니다.


30. 오늘 꼭 기억할 핵심 문장 ✅

이번 2단계에서는 아래 문장만 기억해도 충분합니다.

모델은 사용할 AI 파일이다.
런타임은 그 AI 파일을 실행하는 프로그램이다.
GPU는 AI 계산을 빠르게 해주는 장비다.
Replica는 같은 AI 서버를 몇 개 띄울지 정하는 값이다.
Endpoint는 사용자가 AI에게 요청을 보내는 주소다.

그리고 전체 구조는 이렇게 이해하면 됩니다.

모델
↓
런타임으로 실행
↓
CPU / Memory / GPU 사용
↓
Replica 개수만큼 서버 실행
↓
Endpoint 주소로 사용자 요청 받기
↓
AI 결과 응답

마무리 🌱

Serving 생성 화면은 처음 보면 어렵습니다.

하지만 하나씩 뜯어보면 생각보다 단순합니다.

결국 Serving 생성 화면은,

AI 모델을 어디서 가져와서, 어떻게 실행하고, 어떤 자원으로, 몇 개 서버로, 어떤 주소에서 사용할지 정하는 것

입니다.

처음부터 모든 용어를 완벽히 외울 필요는 없습니다.

가장 먼저 이것만 기억하면 됩니다.

모델 = AI 파일
런타임 = 실행 프로그램
GPU = 빠른 계산 장비
Replica = 서버 개수
Endpoint = 호출 주소

이 다섯 가지만 이해해도 Serving 생성 화면을 보는 눈이 훨씬 편해질 겁니다. 🚀

다음 단계에서는 Serving을 만든 뒤 자주 보게 되는 상태값,
Ready, Running, Pending, Failed가 무엇을 의미하는지 쉽게 알아보겠습니다. 😊

 

반응형

댓글