최근 로컬 LLM에 푹 빠져서 심지어 스마트폰에서까지 실행해 보기에 이르렀습니다. AI 구독료는 시간이 갈수록 비싸질 것이고, 가격을 올리지 않더라도 토큰 제한을 줄이는 방식으로 성능을 제한할 가능성이 높습니다.

그래서 강제로 전환해야 하는 상황이 오기를 기다리기보다는, 지금 당장 로컬 추론 환경을 제대로 구축하기로 마음먹었습니다. 이제 노트북 환경 설정은 어느 정도 마무리된 것 같습니다.

관련 기사

LM Studio가 Ollama보다 모델을 더 빠르게 실행합니다

빠를수록 좋은 건 당연하죠

이미 Ollama를 설정해서 사용 중이며, 앞으로도 계속 사용할 예정입니다. Claude Code와 같이 외부 도구와 연결된 로컬 모델이 필요할 때는 Ollama를 사용합니다. 제 경험상 다른 도구 및 서비스와의 통합이 더 뛰어나기 때문에, 워크플로우의 이 부분을 변경할 이유는 없습니다.

하지만 단순히 모델과 대화하는 용도로는 LM Studio가 더 낫습니다. 제대로 된 데스크톱 앱이기 때문입니다. 앱을 열고, 모델을 찾아서 다운로드한 뒤 바로 대화를 시작하면 됩니다. 이 모든 과정이 몇 분이면 끝나며 터미널을 건드릴 필요도 없습니다.

Ollama에도 데스크톱 앱이 있다는 건 알지만, 그동안 큰 우선순위는 아니었습니다. Ollama의 가장 큰 장점은 항상 다른 앱과의 연결성이었습니다. 순수 성능 측면에서도 LM Studio에서 더 높은 초당 토큰(token/second) 속도가 나오기 때문에, 저에게는 이 논쟁이 사실상 종결된 셈입니다.

출처: Raghav Sethi/All Things N 모델 탐색 기능 또한 LM Studio가 앞서는 부분입니다. 파라미터 수, 양자화, 사용 사례별로 필터링할 수 있고, 다운로드하기 전에 파일 크기도 확인할 수 있습니다. 앱 내에서 여러 8B 모델을 나란히 놓고 비교하는 것이 브라우저 탭을 오가는 것보다 훨씬 실용적입니다.

LM Studio에는 플러그인 시스템도 있습니다. DuckDuckGo 플러그인을 사용하면 모델이 응답하기 전에 실시간 검색 결과를 가져올 수 있는데, 이는 로컬 모델의 정보가 최신이 아니라는 가장 흔한 불만을 해결해 줍니다. Wikipedia 플러그인도 있습니다. 둘 다 판도를 뒤흔들 정도는 아니지만, 일상적인 경험을 훨씬 더 실용적으로 만들어 줍니다.

이 글도 확인해 보세요:  AI 편향이란 무엇이며 개발자는 이를 어떻게 피할 수 있을까요?

앞서 언급했듯이, LM Studio가 부족한 점은 다른 앱을 위한 백그라운드 인프라로서의 역할입니다. 그 용도로는 여전히 Ollama를 찾게 됩니다. 두 프로그램은 서로 다른 포트에서 실행되므로 같은 컴퓨터에서 문제없이 공존할 수 있습니다. Ollama는 백그라운드에서 실행되어 Claude Code와 연결되어 있고, 모델을 직접 사용하고 싶을 때는 LM Studio를 엽니다.

현재 제 MacBook에서 실행 중인 모델들

4B 모델이 생각보다… 괜찮다고요?

출처: Amir Bohlooli / All Things N 첫 로컬 LLM을 선택하는 것은 생각보다 훨씬 쉽습니다. 모델을 고르기 전에 파라미터 수와 양자화라는 두 가지만 알면 됩니다.

"B" 앞의 숫자는 파라미터(매개변수)의 개수(십억 단위)를 의미합니다. 일반적으로 파라미터가 많을수록 모델의 성능이 뛰어나지만, 그만큼 무거워집니다. 4B 모델은 빠르게 로드되며 최신 Mac이라면 어디서든 잘 돌아갑니다. 12B 모델은 16GB RAM에서 작동하지만, 긴 대화를 나누기에는 여유 공간이 부족할 수 있습니다.

양자화는 모델의 가중치를 압축하여 메모리 사용량을 줄이는 방식입니다. 가장 흔한 형식인 Q4_K_M은 정밀도를 4비트로 낮춥니다. 품질이 크게 떨어질 것 같지만, 요즘 양자화 기술은 충분히 훌륭해서 대부분의 작업에서 차이를 느끼기 어렵습니다. 메모리를 약 75% 절약할 수 있습니다.

출처: Raghav Sethi/All Things N MacBook Air나 Pro의 16GB 통합 메모리라면 현재 로컬 AI를 즐기기에 충분한 환경입니다. macOS가 자체적으로 몇 GB를 사용하므로, 모델과 컨텍스트를 위해 약 12~13GB를 활용할 수 있습니다. 메모리 부족 현상 없이 괜찮은 모델을 실행하기에 충분한 용량입니다.

현재 제가 가장 많이 사용하는 모델은 Google의 최신 MoE 모델인 Gemma 4 E4B입니다. 16GB RAM에서 여유롭게 로드되고, 적절한 속도로 실행되며, 텍스트뿐만 아니라 이미지도 처리할 수 있습니다. 대화창에 스크린샷을 바로 넣을 수 있는 기능은 생각보다 훨씬 유용하게 쓰고 있습니다.

Gemma 4가 꽤 만족스럽긴 하지만, 특히 Qwen 계열과 같은 다른 모델들도 시도해 보시길 권장합니다. 하드웨어 사양과 모델을 사용하는 목적에 따라 결과가 달라질 수 있으니, 하나에 정착하기 전에 이것저것 실험해 보는 것이 좋습니다.

노트북으로 부족할 때는 어떻게 할까요?

나만의 클라우드를 사용하세요!

MacBook으로 대부분의 작업은 가능하지만, 모든 것을 다 할 수는 없습니다. 더 큰 모델, 더 긴 컨텍스트 윈도우, 여러 작업을 동시에 수행하기 위해 집에 작은 개인용 AI 서버를 구축했습니다. 메인 장비는 노트북보다 통합 메모리가 많은 Mac mini입니다. 여기에 Ollama를 실행하면 MacBook에서는 불가능했던 더 큰 모델들을 로드할 수 있습니다.

이 글도 확인해 보세요:  ChatGPT는 안전한가요? OpenAI 챗봇의 6가지 사이버 보안 리스크

저는 주로 코딩을 위해 Qwen 3.6 27B의 양자화 버전을 실행하는데, 제가 Sonnet으로 하던 작업 대부분을 처리할 수 있을 정도로 성능이 매우 좋습니다. 모든 기기를 연결하는 핵심은 Tailscale입니다. Tailscale은 모든 기기에 걸쳐 개인 암호화 네트워크를 설정해 주므로, 제가 어디에 있든 MacBook과 스마트폰으로 마치 같은 로컬 네트워크에 있는 것처럼 Mac mini에 접속할 수 있습니다.

외부에 나가 있더라도 공유기 포트를 열거나 공용 인터넷에 직접 노출할 필요 없이, 집에 실행 중인 더 큰 모델들에 접속할 수 있습니다.

이 설정의 또 다른 장점은 타사 서비스를 완전히 배제할 수 있다는 것입니다. API 키도, 사용량 제한도, 구독료 인상도 없습니다. 모델은 제가 소유한 하드웨어에 있고, 네트워크는 비공개이며, 특정 기업의 결정에 의존할 필요가 전혀 없습니다.

관련 기사

이제 다시는 AI 구독료를 내지 않겠습니다

AI 사용에 비용을 들일 필요가 없습니다. 로컬 모델은 빠르고, 개인정보 보호에 강하며, 이제는 전환할 가치가 충분합니다.

우리는 올바른 방향으로 가고 있습니다

목표는 가능한 한 많은 AI 구독을 해지하는 것이었고, 많은 진전을 이루었습니다. 완전히 해지했냐고요? 아니요. 여전히 복잡한 작업에는 Claude를 사용하며, 당분간은 그럴 것 같습니다. 하지만 6개월 전만 해도 제가 직접 소유한 하드웨어에서 로컬 모델을 이 정도로 활용하게 될 것이라고 했다면, 아마 농담이라고 생각했을 겁니다.

이 모델들이 발전하는 속도는 과장하기 어려울 정도입니다. 오늘날 괜찮다고 느껴지는 로컬 환경도 얼마 전까지만 해도 비현실적으로 보였을 것입니다. 1년 뒤에는 또 어떤 모습일지 누가 알겠습니까. 어쩌면 로컬 추론이 대부분의 사람들에게 기본값이 될지도 모릅니다. 그 가능성을 배제하지 않습니다.

##### LM Studio

OS Windows, macOS, Linux

개발자 Element Labs

가격 모델 무료

LM Studio는 대규모 언어 모델을 컴퓨터에서 직접 다운로드, 관리 및 실행할 수 있게 해주는 데스크톱 앱으로, 내장된 채팅 인터페이스를 제공합니다.

By 박준영

업계에서 7년간 경력을 쌓은 숙련된 iOS 개발자인 박준영님은 원활하고 매끄러운 사용자 경험을 만드는 데 전념하고 있습니다. 애플(Apple) 생태계에 능숙한 준영님은 획기적인 솔루션을 통해 지속적으로 기술 혁신의 한계를 뛰어넘고 있습니다. 소프트웨어 엔지니어링에 대한 탄탄한 지식과 세심한 접근 방식은 독자에게 실용적이면서도 세련된 콘텐츠를 제공하는 데 기여합니다.