[로컬] 로컬 LLM 최소 사양: 2026년, 8GB VRAM으로도 가능한 오픈소스 AI 모델 구동 조건과 GPU 선택 가이드

로컬 LLM 최소 사양: 8GB VRAM이면 어디까지 되나

결론부터 말씀드리면 8GB VRAM이면 8B급 모델까지 무리 없이 돌아갑니다. 수백만 원짜리 그래픽카드가 필요하다는 말은 사실이 아닙니다. 다만 “몇 GB면 되나요”라는 질문에는 정확한 답이 있고, 그건 감이 아니라 간단한 계산으로 나옵니다.

VRAM 돌릴 수 있는 모델 해당 그래픽카드 시스템 RAM
8GB 8B급 (Q4 양자화) RTX 3060 Ti, 4060, 4060 Ti 8GB 16GB
12GB 12~14B급 RTX 3060 12GB, 4070, 5070 32GB
16GB 14B 여유 / 27B 빠듯 RTX 4060 Ti 16GB, 4080, 5070 Ti 32GB
24GB 27~32B급 쾌적 RTX 3090, 4090, 5090 64GB

VRAM이 모자라면 정확히 무슨 일이 생기나

모델이 아예 안 켜지는 경우도 있지만, 더 흔한 건 일부가 시스템 RAM으로 밀려나면서 속도가 급락하는 것입니다. GPU 안에서만 돌 때와 비교해 체감상 5~10배까지 느려질 수 있습니다. “돌아가긴 하는데 답답하다”의 대부분이 이 상황입니다.

그래서 VRAM은 CPU나 RAM보다 우선순위가 높습니다. VRAM이 부족하면 다른 부품이 아무리 좋아도 소용이 없지만, 반대로 VRAM만 충분하면 CPU가 평범해도 잘 돌아갑니다.

로컬 LLM 구동용으로 조립된 고성능 컴퓨터 본체

내 그래픽카드로 뭐가 되는지 30초 만에 계산하기

Q4_K_M 기준 계산 공식

로컬에서 가장 널리 쓰이는 양자화 방식은 Q4_K_M입니다. 이 기준으로 필요한 용량은 다음과 같이 나옵니다.

  • 모델 용량 = 파라미터 수(B) × 약 0.65GB
  • 여기에 컨텍스트 처리용 여유분 1~2GB를 더한 값이 실제 필요 VRAM

예를 들어 8B 모델이면 8 × 0.65 = 약 5.2GB, 여기에 여유분을 더해 6~7GB입니다. 8GB 카드에 들어갑니다. 반대로 14B 모델은 약 9.1GB + 여유분이라 8GB로는 안 되고 12GB가 필요합니다.

양자화 단계를 낮추면 어디까지 되나

Q4보다 더 낮은 Q3, Q2도 있습니다. 용량은 줄지만 답변 품질이 눈에 띄게 나빠지기 시작합니다. Q4_K_M이 품질과 용량의 균형점으로 통하는 이유고, 특별한 사정이 없으면 여기서 시작하는 게 맞습니다.

반대로 여유가 있다면 Q5, Q6, Q8로 올릴수록 원본에 가까워집니다. 다만 Q4에서 Q8로 올릴 때의 체감 향상은 크지 않은 반면 용량은 두 배가 되므로, 그 VRAM으로 더 큰 모델을 Q4로 돌리는 편이 대체로 낫습니다.

VRAM 용량별 로컬 LLM 모델 구동 범위 비교

2026년 지금 받아야 할 모델

8GB VRAM에서 쓸 만한 것들

  • Qwen3 8B — 코딩과 다국어(한국어 포함)에 강한 편. 8GB 환경의 무난한 기본값
  • Gemma 3 4B — 더 가볍고 빠름. 8GB에서 여유롭게 돌아가며 이미지 입력도 지원
  • Gemma 3 12B — 12GB 카드용. 8GB에서는 빠듯함

24GB 이상이라면 Gemma 3 27BQwen3 30B급으로 올라갈 수 있습니다. 최근에는 전체 파라미터는 크지만 실제 연산에는 일부만 쓰는 MoE 방식 모델(예: Gemma 4 26B A4B)도 나와서, 같은 VRAM에서 더 좋은 품질을 기대할 수 있는 선택지가 늘었습니다.

오래된 가이드를 그대로 따라하면 안 되는 이유

인터넷에 남아 있는 로컬 LLM 글 상당수가 Llama 2나 Mistral 7B, 심하면 GPT-J를 기준으로 씁니다. 전부 몇 년 전 모델입니다. 같은 8GB VRAM에서 지금 받을 수 있는 모델은 그때보다 훨씬 좋아졌습니다.

같은 하드웨어라도 어떤 모델을 올리느냐가 체감 품질을 가장 크게 좌우합니다. 장비를 바꾸기 전에 모델부터 최신으로 바꿔보는 게 순서입니다.

로컬 LLM 모델 다운로드 및 실행 과정

설치부터 첫 답변까지, 실제로 하는 법

Ollama — 가장 빠른 길

처음이라면 Ollama가 가장 간단합니다. 공식 사이트에서 설치 파일을 받아 설치한 뒤, 터미널(윈도우는 명령 프롬프트)에 아래 한 줄이면 모델을 받아 바로 대화가 시작됩니다.

ollama run qwen3:8b

양자화 버전을 직접 고르고 싶다면 ollama run qwen3:8b-q4_K_M 식으로 태그를 붙이면 됩니다. 별도 설정 없이 기본값이 Q4 계열이라 대부분은 그냥 첫 줄로 충분합니다.

LM Studio — 마우스로 하고 싶다면

터미널이 부담스러우면 LM Studio가 좋습니다. 프로그램 안에서 모델을 검색·다운로드하고 채팅창에서 바로 씁니다. 내 VRAM으로 이 모델이 되는지 안 되는지를 목록에서 표시해준다는 게 초보자에게 가장 큰 장점입니다.

llama.cpp — 세밀하게 조정하려면

위 두 프로그램 모두 내부적으로는 llama.cpp를 씁니다. GPU에 몇 개 레이어를 올릴지, 컨텍스트 길이를 얼마로 할지 직접 조정하고 싶다면 llama.cpp를 직접 쓰는 선택지도 있습니다. VRAM이 빠듯할 때 레이어 수를 조절해 억지로 밀어 넣는 식의 최적화가 가능합니다.

로컬 AI 구축에 필요한 CPU RAM GPU 하드웨어 부품

맥(Apple Silicon)은 계산법이 다릅니다

통합 메모리라 VRAM 개념이 없다

M 시리즈 맥은 CPU와 GPU가 메모리를 함께 씁니다. 별도 VRAM이 없는 대신 장착된 메모리 상당 부분을 모델에 쓸 수 있습니다. 그래서 24GB 맥이 8GB 그래픽카드보다 훨씬 큰 모델을 올릴 수 있습니다.

대략적인 기준은 전체 메모리의 60~70% 정도를 모델용으로 본다입니다. 16GB 맥이면 약 10GB, 24GB면 약 16GB, 32GB면 약 21GB 수준입니다.

맥과 지포스, 어느 쪽이 나은가

순수 속도는 같은 급에서 지포스 쪽이 앞섭니다. 대신 맥은 큰 모델을 올릴 수 있고, 조용하고, 전력을 훨씬 적게 씁니다. 노트북 하나로 끝내고 싶거나 24시간 켜둘 계획이라면 맥이, 최대 속도가 목적이면 지포스가 맞습니다.

속도는 어느 정도 나오나

속도는 초당 생성 토큰 수(tok/s)로 표시합니다. 한글은 대략 1토큰이 한 글자 안팎이라고 보면 감이 잡힙니다. 아래는 8B 모델 Q4 기준의 대략적인 참고 범위이며, 모델·설정·시스템에 따라 편차가 큽니다.

  • CPU만 사용 — 한 자릿수 수준. 읽는 속도보다 느려서 답답합니다
  • 8~12GB 그래픽카드 — 사람이 읽는 속도보다 확실히 빠름. 실사용 가능한 구간
  • 24GB 하이엔드 — 체감상 즉시 나옴
  • M 시리즈 맥 — 지포스보다는 느리지만 실사용에 충분한 편

중요한 건 “GPU에 다 올라갔느냐”가 속도의 거의 전부라는 점입니다. VRAM을 조금이라도 넘겨서 일부가 RAM으로 밀리는 순간 속도가 무너집니다. 그래서 모델을 한 단계 작게 잡아 완전히 GPU에 올리는 쪽이, 큰 모델을 억지로 걸치는 것보다 대부분 낫습니다.

로컬 LLM 워크스테이션 환경

예산별 그래픽카드 선택

로컬 LLM만 놓고 보면 같은 값이면 무조건 VRAM이 큰 쪽입니다. 게임과 달리 코어 성능보다 용량이 가능·불가능을 가릅니다. 중고 시장에서 RTX 3060 12GB가 꾸준히 추천되는 것도, 신품 상위 모델보다 저렴하면서 VRAM이 12GB라서입니다.

중고를 고려한다면 채굴에 쓰인 물건일 가능성을 확인하고, 가능하면 보증 기간이 남은 제품을 고르는 게 안전합니다. 파워서플라이도 함께 봐야 합니다. 용량이 부족하면 부하가 걸릴 때 시스템이 갑자기 꺼지는데, 로컬 LLM은 장시간 고부하가 걸리는 작업이라 게임보다 이 문제가 더 잘 드러납니다.

자주 묻는 질문

Q: 8GB VRAM으로 정말 쓸 만한가요?

A: 8B급 모델을 Q4로 돌리는 용도로는 충분합니다. 문서 요약, 번역, 간단한 코딩 보조 정도는 무리 없습니다. 다만 긴 문서를 한 번에 처리하거나 복잡한 추론을 시키려면 12GB 이상이 편합니다.

Q: 그래픽카드 없이 CPU만으로도 되나요?

A: 됩니다. 다만 속도가 한 자릿수 tok/s 수준이라 실시간 대화에는 답답합니다. 4B 이하의 작은 모델을 쓰면 그나마 견딜 만합니다.

Q: RAM을 늘리면 VRAM 부족이 해결되나요?

A: 실행은 되게 만들어주지만 속도 문제는 해결되지 않습니다. RAM으로 밀려난 부분이 병목이 되기 때문입니다. RAM은 모델 크기에 맞춰 넉넉히(8GB VRAM이면 16GB, 12GB 이상이면 32GB) 두되, 성능을 위한 투자는 VRAM 쪽이 맞습니다.

Q: 중고 그래픽카드를 사도 괜찮을까요?

A: VRAM 대비 가격이 좋아서 많이들 선택합니다. 다만 채굴에 장시간 사용된 제품일 수 있으니 사용 이력을 확인하고, 보증 기간이 남은 제품을 우선하는 것이 안전합니다.

Q: 로컬 LLM이 챗GPT 같은 서비스보다 나은 점은 뭔가요?

A: 데이터가 외부로 나가지 않고, 사용량 제한이나 월 요금이 없으며, 인터넷 없이도 됩니다. 반대로 최상위 모델의 품질은 아직 클라우드 서비스 쪽이 앞섭니다. 민감한 문서를 다루거나 대량으로 반복 처리할 때 로컬의 이점이 큽니다.

⚡ 로컬 LLM 최소 사양, 이것만은 꼭! 핵심 요약

필요한 VRAM은 파라미터 수 × 0.65GB + 여유분 1~2GB로 계산합니다. 8GB면 8B급, 12GB면 14B급이 기준선이고, 모델을 GPU에 완전히 올리는 것이 속도의 거의 전부입니다.

  • 8GB VRAM = Qwen3 8B 또는 Gemma 3 4B (Q4_K_M 기준)
  • 시작은 Ollama, GUI가 편하면 LM Studio
  • 맥은 통합 메모리라 전체 용량의 약 60~70%를 모델에 사용
  • 같은 값이면 코어 성능보다 VRAM 용량이 우선

자세한 정보는 TodayPress에서 계속 확인하실 수 있습니다.