08 · Insights /02 · Infrastructure

On-Prem LLM
vs SaaS.

Build or Buy. 하드웨어 매트릭스, 손익분기점, 의사결정 기준 — 자체 AI 인프라 시점에 대한 정량 검토.

감으로 결정할 수 없는 영역입니다. 숫자로 판단합니다.

SaaS 기본 단가
$60

User/月 · 엔터프라이즈 최소 150석
연 $108K (≒ 1.5억 원)

중급 On-Prem 1회 투자
3,000만

50~100명 동시 사용
한국어 강화 30B급 모델 운영

150명 손익분기
3.6개월

이후 매년 약 1.5억 원 절감
4년 누적 5억 원+ 절감

— 01 · Build vs Buy

두 가지
선택지.

OPTION A · 외부 SaaS

SaaS Subscription

$60 /user/月
≒ 8만 원 · 사용자당 매월
  • +최신 프런티어 모델 (GPT-5.4, Claude Opus 4.7) 즉시 사용
  • +인프라 관리 부담 0
  • +SSO · 감사로그 · 컴플라이언스 기본 제공
  • 엔터프라이즈 최소 150석 · 연간 계약 의무
  • 데이터가 외부 서버로 송신됨
  • 사용자 증가 = 비용 직선 증가
COST FORMULA

150명 × $60 × 12 = $108K/년 (≒ 1.5억)

500명 = $360K/년 (≒ 5억)

1,000명 = $720K/년 (≒ 10억)

OPTION B · 사내 인프라

On-Premise LLM Server

3,000만~수억 원
1회 투자 · 평균 4년 운영
  • +오픈 모델 무제한 사용 (Qwen · DeepSeek · Llama · EXAONE)
  • +데이터 100% 사내 유지 · 송신 0
  • +사용자 추가 시 추가 비용 0
  • +파인튜닝 자유 · 자체 도메인 모델 구축 가능
  • 관리 인력 필요 (DevOps 1명 정도)
  • 3~4년 후 GPU 교체 검토
COST FORMULA

초기 3,000만 + 운영비 연 600만

사용자 수 무관 — 50명도 500명도 동일

4년 TCO ≒ 5,400만 (≒ SaaS 4개월치)

핵심 결론

사용자 150명 이상 조직은 사내 구축이 거의 항상 유리합니다. SaaS 150석 1년 비용(1.5억 원)으로 중급 LLM 서버 + 4년 운영비 전체를 충당할 수 있습니다. 500명 이상 조직은 H100급 서버까지 정당화됩니다 (연 SaaS 5억 vs 서버 1억).

— 02 · Hardware Matrix

VRAM별 운영 가능
LLM 매트릭스.

서버 VRAM이 클수록 더 큰 LLM이 가능합니다. 하드웨어 등급에 따라 운영 가능한 모델 군이 명확히 구분되며, 이것이 사내 구축 의사결정의 핵심 변수입니다.

TIER 1ENTRY
32 GB
VRAM
RTX 5090 / RTX 4090 24GB
운영 가능 모델
  • Qwen 3.6 27B
  • DeepSeek R1-Distill 32B
  • SOLAR Pro 2 22B
  • EXAONE 4.0 30B
  • Llama 3.3 70B (Q4)
  • Gemma 3 27B
TIER 2WORKGROUP
64 GB
VRAM
RTX 5090 ×2 (NVLink)
운영 가능 모델
  • Qwen 3.6 72B (Full)
  • Llama 3.3 70B (Full)
  • DeepSeek R1-Distill 70B
  • Command R+ 104B (Q4)
  • Mistral Large 3 (Q4)
TIER 3ENTERPRISE ★
96 GB
VRAM
RTX Pro 6000 Blackwell
운영 가능 모델
  • DeepSeek V4-Flash (FP8)
  • K-EXAONE 236B (Q4)
  • Llama 4 Scout (8bit)
  • Qwen VL 72B (멀티모달)
  • 모든 70B Dense 풀스피드
TIER 4CORPORATE
80 GB
VRAM
NVIDIA H100 80GB
운영 가능 모델
  • Llama 4 Scout 풀스피드
  • DeepSeek V4-Flash (FP8)
  • 모든 70B Dense FP16
  • vLLM 프로덕션 서빙
  • 대량 동시 추론 (배치)
TIER 5ENTERPRISE+
282 GB
VRAM
NVIDIA H200 141GB ×2
운영 가능 모델
  • DeepSeek V4-Flash FP16
  • Llama 4 Maverick
  • GLM 5.1 754B (Q4)
  • K-EXAONE 236B (Full)
  • 1M 컨텍스트 운영
TIER 6DATACENTER
1.1 TB
VRAM
NVIDIA H200 141GB ×8
운영 가능 모델
  • DeepSeek V4-Pro 1.6T
  • Kimi K2.6 1.1T
  • GLM 5.1 Full
  • 오픈웨이트 프런티어 전체
  • 멀티 모델 동시 서빙

핵심 원리
VRAM 32GB는 30B급, 96GB는 200B급, 1TB는 1T급 모델을 운영합니다. 2026년 기준 오픈웨이트 성능은 클로즈드 프런티어와 거의 동급 — 하드웨어 등급이 모델 천장을 결정합니다.

— 03 · Server Tiers

서버 사양별
상세 견적.

각 등급별 GPU + CPU + RAM + 전력 + 운영비 종합. 2026년 5월 한국 시장 기준, 부가세 별도, 환율 1,400원/USD.

TIER 1PERSONAL / DEV

Single RTX 5090

~400만 원
1회 투자
GPU
RTX 5090 32GB ×1
CPU
AMD Threadripper 32C
RAM
128GB DDR5
POWER
1,200W · 사무실 OK
전력비
월 5~10만 원
동시 사용자
5~15명
TIER 2SMALL OFFICE

Dual RTX 5090

~800만 원
1회 투자
GPU
RTX 5090 32GB ×2 (NVLink)
CPU
AMD EPYC 32~64C
RAM
256GB DDR5 ECC
POWER
2,000W · 전용 회로 권장
전력비
월 10~15만 원
동시 사용자
20~50명
TIER 3MID-MARKET ★ 최적 균형

RTX Pro 6000

~3,000만 원
1회 투자
GPU
RTX Pro 6000 Blackwell 96GB
CPU
AMD EPYC 64C
RAM
512GB DDR5 ECC
POWER
1,600W · 서버 전용 회로
전력비
월 15~25만 원
동시 사용자
50~100명
TIER 4CORPORATE

Single H100

~5,000만 원
1회 투자
GPU
NVIDIA H100 80GB
CPU
Xeon Platinum / EPYC
RAM
768GB DDR5 ECC
POWER
2,000W · UPS 필수
전력비
월 30~50만 원
동시 사용자
100~300명
TIER 5ENTERPRISE

Dual H200

~1.5억 원
1회 투자
GPU
NVIDIA H200 141GB ×2
CPU
EPYC 96C × 2 Socket
RAM
1TB DDR5 ECC
POWER
3,200W · 듀얼 UPS
전력비
월 50~80만 원
동시 사용자
300~800명
TIER 6DATACENTER

8× H200 Cluster

~5억 원+
1회 투자
GPU
H200 141GB ×8 (NVLink Full)
NETWORK
InfiniBand HDR/NDR
RAM
2~4TB DDR5 ECC
POWER
10kW+ · 데이터센터급
전력비
월 200~400만 원
동시 사용자
1,000명+
조직별 진입점 (1)

50명 이하 : TIER 1~2 (400~800만) — PoC 후 확장.
100~200명 : TIER 3 (3,000만) — 한국어 모델까지 운영 가능.

조직별 진입점 (2)

300~500명 : TIER 4 (5,000만) 또는 TIER 5로 시작.
500명+ : TIER 5~6으로 본격 인프라 구축.

— 04 · Break-Even

사용자 수별
손익분기.

사용자SaaS 연간권장 등급서버 4년 TCO손익분기4년 순 절감
20명₩2,000만T1 · Single 5090₩700만5개월₩7,300만
50명₩5,000만T2 · Dual 5090₩1,500만4개월₩1.85억
150명₩1.5억T3 · RTX Pro 6000₩4,500만3.6개월₩5.5억
300명₩3억T4 · Single H100₩7,500만3개월₩11.25억
500명₩5억T5 · Dual H200₩2억4.8개월₩18억
1,000명₩10억T6 · 8× H200₩7억8.4개월₩33억

★ 가장 ROI가 좋은 시나리오

목표 사용자 규모
150

ChatGPT Enterprise 최소 인원과 일치. 이 지점부터 사내 구축이 압도적으로 유리.

손익분기점
3.6개월

TIER 3 서버 3,000만 원 = 4개월치 SaaS 비용. 이후 약 4년간 절감 지속.

4년 누적 순 절감
5.5

서버 + 운영비를 빼고도 5억 5천만 원 순 절감 — 추가 인프라 투자 여력 확보.

반드시 고려할 변수

위 ROI 계산은 전체 라이선스 사용자가 SaaS를 적극 활용한다는 가정입니다. 실제로는 라이선스 구매 후 30~40%만 적극 사용하는 패턴이 일반적입니다.

사내 서버는 "전 직원이 무료로 쓸 수 있는 인프라"가 되어 활용도가 오히려 높아지는 경향이 있습니다. 활용도 증가는 추가 비용 없이 직접적 ROI 개선으로 이어집니다.

— 05 · Paid SaaS

유료 SaaS
옵션 비교.

ChatGPT Enterprise

FLAGSHIP
$60/user/月
최소 150명

GPT-5.4. SSO · 감사로그 · 컴플라이언스. 연간 계약 의무.

ChatGPT Business

$25/user/月
최소 2명

중소 조직용. 월/연 결제 선택 가능.

ChatGPT Go

NEW
$35/user/月
최소 10명

Team과 Enterprise 중간 (10~149명 조직).

Claude Enterprise

FLAGSHIP
$60+/user/月
최소 협상

Claude Opus 4.7. 긴 컨텍스트. 컴플라이언스 강력.

Microsoft 365 Copilot

$30/user/月
최소 1명

Office 통합. MS 365 환경에 가장 자연스러움.

Gemini for Workspace

$30/user/月
최소 1명

Gmail · Docs 통합. Google Workspace 사용자용.

Perplexity Enterprise

$40/user/月
최소 250명

검색 특화. RAG 워크플로우.

DeepSeek API

가성비 ★
$0.14/M~
최소 없음

V4-Flash. SaaS 중 가장 저렴. 토큰 단위 과금. 데이터 정책 검토 필요.

— 06 · Free Local

무료 로컬
LLM 종합.

모두 사내 서버에서 무료로 운영 가능. 상업적 활용 가능성 순.

Qwen 2.5 / 3.6

· 한국어 강함

상업적 활용 자유 + 한국어 우수. 가장 균형 잡힌 선택.

크기7B~72B
등급T1~T3
라이선스Apache 2.0

DeepSeek R1-Distill

· 추론 ★

o1급 추론 능력. 32B는 TIER 1에 최적화.

크기1.5B~70B
등급T1~T2
라이선스Apache 2.0 / MIT

DeepSeek V4 Flash

· MoE

Q4 양자화면 TIER 1 단일 GPU 가능. 1M 컨텍스트.

크기284B / 13B 활성
등급T1 (Q4) ~ T5
라이선스MIT

DeepSeek V4 Pro

· FRONTIER

세계 최대 오픈웨이트. 데이터센터급 필요.

크기1.6T / 49B 활성
등급T6
라이선스MIT

GLM 5 / 5.1

· Web Agent

Z.AI · 칭화대. 웹 에이전트 최강. 라이선스 완전 자유.

크기754B MoE
등급T5~T6
라이선스MIT

Llama 4 Scout

· 10M 컨텍스트

세계 최대 컨텍스트. 멀티모달. 7억 MAU 이하 무료.

크기109B / 17B 활성
등급T3~T4
라이선스Llama License

Llama 3.3 70B

· 생태계 1위

안정성 1위 · 가장 큰 생태계 · 풍부한 자료.

크기70B Dense
등급T2~T4
라이선스Llama License

Kimi K2.6

· 에이전트 ★

에이전트 안정성 최강. 자율 코딩 13시간 연속.

크기1.1T
등급T5~T6
라이선스Modified MIT

EXAONE 4.0 / K-EXAONE

· 국산

한국 주권 LLM. 정부 컨소시엄. 라이선스 사전 검토 필수.

크기30B / 236B
등급T1 / T5
라이선스비상업 (검토 필요)

SOLAR Pro 2

· 국산

한국어 + 상업 친화. Frontier LM 리더보드 입성.

크기22B Dense
등급T1
라이선스Apache 2.0

Mistral Large 3 / Small 4

· GDPR

유럽 GDPR 친화. 함수 호출 · 도구 사용 강력.

크기24B~123B
등급T1~T4
라이선스Apache 2.0

Gemma 3 / 4

Google. 27B 멀티모달. 140+ 언어 지원.

크기2B~27B
등급노트북~T1
라이선스Gemma License
— 07 · Checklist

구축 시
고려 항목.

하드웨어 외의 의사결정 변수들 — 운영 단계에서 만나는 실제 변수.

실제 사용자 규모

라이선스 보유자와 실제 매일 사용자를 구분해야 합니다. 후자가 50명 이하라면 SaaS 유지가 합리적.

데이터 민감도

고객정보 · 계약서 · 재무자료 등 외부 송신 불가 데이터가 많다면 사내 구축이 절대적 우선.

전력 · 공조

H100 1대 700W · H200 2대 1.6kW · 8× H200 12kW+. 일반 사무실 전원 부족 — 전용 배전 · 냉각 필요.

관리 인력

최소 1명 (DevOps + AI 운영 가능자). 부재 시 백업 인력 또는 MSP 계약 검토.

소프트웨어 스택

Ollama (간편) · vLLM (프로덕션) · Qdrant (벡터DB) · LangGraph (에이전트). 모두 무료/오픈소스.

백업 · 가용성

서버 다운 시 SaaS 폴백 가능하게 LiteLLM 등 프록시로 라우팅. 99.9%는 어렵지만 99%는 충분.

사용자 인터페이스

OpenWebUI · LibreChat · AnythingLLM 등 무료 UI 활용. ChatGPT 동급 경험 구축 가능.

한국어 품질

Qwen 2.5/3.6 · EXAONE · SOLAR가 GPT-5 한국어와 큰 차이 없음. 일부 영역에선 더 자연스러움.

법무 · 라이선스

Apache 2.0 / MIT는 안전. Llama · EXAONE 비상업 조항 주의. 사내 활용은 대부분 문제없음.

GPU 노후화

3~4년 후 차세대 GPU 교체 검토 필요. 잔존 가치 + 신규 투자로 점진 업그레이드.

— Next

인프라 의사결정,
구조부터 설계합니다.

조직 규모 · 워크로드 · 데이터 민감도에 따라 답이 달라집니다. 아키텍처 레벨 검토부터 출발합니다.

Initial Technical Review Turnkey AI 백서 보기

Complimentary for qualified engagements