최근 로컬 환경에서 LLM을 구동하는 것에 푹 빠져 있는데, 솔직히 이것이 제 새로운 취미 중 하나가 되었습니다. 로컬 AI 서버를 구축하고 나면 할 수 있는 멋진 일들이 정말 많습니다.
하지만 제가 계속해서 발견하는 한 가지는 사람들이 시작하기도 전에 막힌다는 점입니다. 첫 번째 모델을 선택하는 과정이 모두를 어렵게 만듭니다. 하지만 무엇을 봐야 하는지 이해하고 나면, 이 과정은 매우 쉬워집니다.
관련 기사
폰에서 로컬 LLM으로 할 수 있는 5가지 유용한 작업
개인정보 보호는 차치하더라도, 로컬 LLM은 정말 편리합니다.
필요한 모든 정보는 모델 이름에 담겨 있습니다
아니요, 코드를 이해할 필요는 없습니다
Hugging Face에 접속하여 모델을 둘러보기 시작하면, 모든 모델 이름이 글자와 숫자가 뒤섞인 것처럼 보인다는 것을 알게 될 것입니다. 예를 들어, gemma-4-26B-A4B 같은 모델을 마주칠 수 있는데, 확실히 읽기 어렵습니다.
중요한 점은 이 이름만으로도 모델 자체에 대해 많은 것을 알 수 있다는 것입니다. 이름은 기본적으로 사양서와 같습니다. 읽는 법을 알고 나면, 모델 페이지를 클릭하기도 전에 무엇을 보고 있는지 이미 상당 부분 파악할 수 있습니다.
다양한 모델을 살펴보다 보면 거의 모든 모델 이름에서 동일한 구성 요소가 나타저는 것을 볼 수 있습니다. 각 요소의 의미는 다음과 같습니다.
출처: Raghav Sethi/All Things N 다양한 모델을 살펴보다 보면 거의 모든 모델 이름에서 동일한 구성 요소가 나타저는 것을 볼 수 있습니다. 각 요소의 의미는 다음과 같습니다.
패밀리 이름 (Gemma, Qwen, Llama): 브랜드 이름이라고 생각하면 됩니다. 누가 모델을 만들었는지, 몇 세대 모델인지를 알려줍니다. Gemma는 Google, Qwen은 Alibaba, Llama는 Meta에서 만들었습니다. 총 파라미터 수 (26B): 모델의 전체 크기로, 파라미터 수십억 개 단위로 측정됩니다. 파라미터가 정확히 무엇인지 깊게 파고들지 않더라도, 모델이 얼마나 많은 지식을 가지고 있고 얼마나 유능한지를 나타내는 대략적인 척도라고 생각하면 됩니다. 숫자가 클수록 모델은 더 똑똑하지만, 실행하기에는 더 무겁습니다. 활성화 파라미터 (A4B): 이 항목은 특정 모델에만 나타나며, 이해하는 것이 매우 중요합니다. 이 모델의 총 파라미터는 300억 개이지만, 특정 시점에 실제로 작동하는 것은 30억 개뿐이라는 뜻입니다. 양자화 레벨 (Q4_K_M, Q8_0, 4bit): 모든 모델에서 볼 수 있는 것은 아니지만 언급할 가치가 있습니다. 압축 설정이라고 생각하면 됩니다. Q4와 같이 숫자가 낮을수록 모델 파일이 작고 더 빠르게 실행되며, 일상적인 사용에서는 거의 눈치채지 못할 정도의 미미한 품질 저하가 발생합니다. 이런 방식으로 모델 이름을 읽는 데 익숙해지면 이미 80%는 성공한 것입니다. 이제 자신의 컴퓨터에서 무엇을 실행할 수 있는지, 그리고 다양한 모델로부터 무엇을 기대할 수 있는지 파악하기만 하면 됩니다.
자신의 하드웨어에서 무엇을 실행할 수 있는지 이해해야 합니다
메모리가 핵심입니다
출처: Raghav Sethi/All Things N 로컬에서 LLM을 실행할 때 가장 중요한 것은 모델이 사용할 수 있는 메모리 양입니다. Apple Silicon Mac을 사용 중이라면 사용 가능한 메모리는 전체 통합 메모리(Unified Memory)입니다. 전용 GPU를 사용 중이라면 VRAM이 해당됩니다.
가장 기본적으로 염두에 두어야 할 것은 파라미터 수입니다. 수십억 단위의 이 숫자가 모델을 로드하는 데 필요한 메모리 양을 결정합니다. 대략적으로 추산하자면, 8GB 메모리로는 약 8B 모델을, 16GB로는 약 13~16B 모델을, 24GB로는 30B 이상의 모델을 사용할 수 있습니다. 이와 더불어 두 가지 요소가 큰 영향을 미칠 수 있습니다.
첫 번째는 양자화입니다. Q4 모델은 상당히 공격적으로 압축되어 필요한 메모리를 대략 절반으로 줄입니다. Q8 모델은 압축률이 낮아 더 크지만 원본에 더 가깝습니다. 대부분의 사람들에게 Q4는 충분히 훌륭하며, 일상적인 사용에서 품질 차이는 거의 느껴지지 않습니다.
관련 기사
저는 이제 클라우드 챗봇 대신 이 오프라인 AI 어시스턴트를 사용합니다
클라우드 기반 챗봇이 있더라도, 저는 제가 찾은 이 오프라인 AI 어시스턴트를 항상 사용할 것입니다.
마찬가지로 MoE(Mixture of Experts)도 살펴봐야 할 요소입니다. 예를 들어 A3B를 보면, 모델이 응답 중에 30억 개의 파라미터만 활성화하여 훨씬 더 빠르게 느껴지게 만든다는 것을 알 수 있습니다.
흔한 오해: A3B가 모델이 3GB 메모리에서 실행된다는 뜻은 아닙니다. 여전히 모델 전체를 메모리에 로드해야 하며, 활성화 파라미터는 응답을 더 빠르게 생성한다는 의미일 뿐입니다.
예를 들어 Qwen3.6-27B-4bit 같은 모델을 봅시다. 27B 모델이므로 실행하려면 약 27GB의 메모리가 필요합니다. 하지만 4비트 양자화가 적용되었기 때문에 약 13~14GB로 줄어듭니다. 즉, 기본형 Mac Mini 같은 기기에서도 편안하게 실행할 수 있다는 뜻입니다.
작게 시작하세요, 언제든 더 큰 모델로 갈아탈 수 있습니다
단계별로 올라가세요
출처: Gavin Phillips / All Things N 완벽한 모델은 없습니다. 모든 선택은 속도와 품질 사이의 타협입니다. 더 작은 모델은 더 빠르게 응답하지만 복잡한 작업에서는 가끔 부족함을 보일 수 있습니다. 더 큰 모델은 더 유능하지만 느립니다. 어느 쪽이 틀린 것은 없으며, 실제로 무엇을 위해 사용하는지에 따라 다를 뿐입니다. 이를 파악하는 유일한 방법은 직접 사용해보는 것입니다.
그러니 자신의 하드웨어에 맞는 것을 선택해서 며칠 동안 실행해보세요. 글쓰기, 코딩, 요약 등 실제로 하고 싶은 작업에 사용해보세요. 곧 모델의 한계를 파악하게 될 것이고, 그 한계가 다음에 무엇을 찾아야 할지 정확히 알려줄 것입니다. 그 과정을 두려워하지 마세요. 원래 그렇게 작동하는 것입니다.
어디서부터 시작해야 할지 여전히 잘 모르겠다면 llmfit을 시도해보는 것을 추천합니다. 이 도구는 기기 사양을 감지하고 시스템에서 현실적으로 처리할 수 있는 모델 순위를 매겨줍니다. 따라서 추측할 필요 없이 내 기기에서 실제로 잘 돌아갈 모델 목록을 바로 얻을 수 있습니다. 내 것이 아닌 하드웨어에 대한 벤치마크 스레드를 읽는 것보다 훨씬 더 나은 시작점입니다.
관련 기사
저는 다시는 AI 비용을 지불하지 않을 것입니다
AI에 돈을 쓸 필요가 없습니다. 로컬 모델은 빠르고 개인정보 보호가 되며, 마침내 전환할 가치가 있습니다.
실험하고, 실험하고, 또 실험하세요!
로컬 LLM 분야는 빠르게 변화합니다. 6개월 전에 인상적이었던 모델은 아마도 더 잘 작동하는 더 작은 모델로 대체되었을 것입니다.
그러니 첫 번째 선택을 완벽하게 하려고 고민할 필요는 전혀 없습니다. 일단 무언가를 실행하고, 무엇을 할 수 있고 무엇을 할 수 없는지 확인한 다음 거기서부터 시작하세요.
##### Ollama
OS Windows, macOS, Linux
개발자 Ollama
가격 모델 무료, 오픈 소스
단일 명령어로 자신의 기기에서 대규모 언어 모델을 다운로드하고 실행할 수 있는 가벼운 로컬 런타임입니다.
