대부분의 사람들은 AI 모델을 로컬에서 실행하려면 주말 내내 Python 환경, 명령줄, 그리고 가지고 있지도 않은 하드웨어와 씨름해야 한다고 생각합니다. 몇 년 전까지만 해도 그런 평판은 일리가 있었지만, 그 이후로 도구들은 비약적으로 발전했습니다. 저는 큰 노력 없이도 집에서 개인용 AI 서버를 만들 수 있다는 것을 깨달았습니다. 두려움에 기반한 추측으로 저와 같은 실수를 범하지 마십시오.

관련 기사

내 휴대폰에서 로컬 LLM으로 하는 5가지 유용한 작업

개인정보 보호는 차치하고서라도, 로컬 LLM은 정말 편리합니다.

인공지능 실행은 기술 천재들만의 전유물이 아닙니다

학위가 없어도 AI를 실행할 수 있습니다

사람들은 흔히 LLM이 연구자나 코딩 영재들만을 위한 것이라고 생각하지만, 이는 사실이 아닙니다. 이 분야의 초기 시절 영향으로 인해, 집에서 이런 시스템을 실행하려면 복잡한 코드를 작성해야 한다고 생각하는 것은 이해할 만합니다. 예전에는 클라우드가 필요했지만, 이제는 휴대폰에서도 실행할 수 있습니다.

기술의 현실은 바뀌었습니다. 오늘날 누구나 간편한 데스크톱 설치 프로그램을 사용하여 몇 분 안에 대화를 시작할 수 있습니다. 저는 비기술적 사용자를 위해 GPT4All 같은 앱을 사용하는 것을 좋아합니다. 이 앱들은 대화를 시작하는 가장 빠른 경로를 제공합니다. 설치 과정에서 터미널 창이나 복잡한 명령어를 사용할 필요가 없습니다. 설치 프로그램을 다운로드하고 실행한 뒤, 목록에서 모델을 선택하고 타이핑을 시작하기만 하면 됩니다.

LM Studio 역시 모델 브라우저와 내장 채팅 UI를 갖춘 데스크톱 애플리케이션을 제공합니다. 처음에는 로컬 AI 실행이 두렵게 느껴질 수 있지만, 시작하는 것은 이제 대부분 심리적인 장벽일 뿐입니다. AI에게 질문하기 위해 양자화(quantization) 수준이나 메모리 할당에 대한 세부 사항을 이해할 필요는 없습니다.

저장 공간은 컴퓨터의 가장 큰 병목 현상이 아닙니다

드라이브 용량보다 메모리 속도에 집중하세요

사람들은 LLM이 대용량 저장 장치와 테라바이트 단위의 빈 하드 드라이브 공간을 요구한다고 생각합니다. 실제로는 양자화가 모든 것을 완전히 바꾸어 놓았고 로컬 AI의 저장 공간 요구 사항을 줄였습니다. 이러한 파일을 압축함으로써 Llama 3.1 8B와 같은 모델은 5GB 미만의 저장 공간만 필요로 합니다. 이는 많은 비디오 게임보다 작은 용량입니다.

이 글도 확인해 보세요:  최고의 Mac 창 관리 도구 6가지

심지어 700억 개의 파라미터를 가진 대형 모델도 40~50GB의 저장 공간에 들어갑니다. 빠른 SSD가 초기 로딩 시간을 줄이는 데 도움이 되지만, 기본적인 디스크 저장소와 작동 메모리 사이에는 큰 차이가 있습니다. 모델이 활성화되면 컴퓨터의 빈 공간이 많은 것보다 데이터 전송 속도가 훨씬 더 중요합니다.

로컬 LLM 추론의 경우, VRAM 용량은 모델이 로드될 수 있는지 여부를 결정하는 상한선 역할을 하지만, 메모리 대역폭은 실제 토큰 생성 속도를 결정합니다. 메모리 대역폭은 순수 컴퓨팅 성능보다 대형 언어 모델의 추론 속도를 훨씬 더 많이 제한합니다.

AI를 호스팅하기 위해 테라바이트 단위의 빈 디스크 공간이 필요한 것은 아닙니다. 대신, 하드웨어에 모델을 담을 수 있는 VRAM 용량이 있는지 확인해야 할 가능성이 높습니다.

로컬 모델은 사람들이 주장하는 것처럼 나쁘거나 멍청하지 않습니다

생각보다 빠르고 똑똑합니다

일반 소비자용 노트북에서 실행되는 모델이 유료 클라우드 서비스의 거대한 규모와 경쟁할 수 없다고 생각하기 쉽습니다. 수십억 개의 파라미터를 가진 로컬 모델은 수천억 개의 파라미터를 가진 최고 수준의 상업용 LLM의 추론 능력이나 순수 성능을 따라갈 수는 없습니다. 그 점은 사실이지만, 실제로 그런 성능이 필요한 것은 아닙니다.

복잡한 워크플로를 변경하거나 방대한 코드베이스를 업데이트하는 것이 일상 업무라면, 클라우드 기반 도구가 필요할 수도 있습니다. 하지만 그렇다고 해서 로컬 모델이 쓸모없는 것은 아닙니다. 이러한 소형 버전들은 특정 작업을 놀라울 정도로 잘 처리합니다.

간단한 개인 프로젝트를 실행하거나, 레시피를 구상하거나, 앱을 프로그래밍하고 싶다면 LLM은 여전히 매우 유능합니다. 원하는 작업을 위해 초고급 LLM이 필요한 경우는 드뭅니다. Llama 3.1 8B와 같은 작은 모델로도 초당 90~120 토큰의 속도로 텍스트를 얻을 수 있는데, 이는 평균적인 사람이 읽는 속도보다 빠릅니다. 복잡한 전문적인 추론을 위해 유료 클라우드 구독을 계속 사용하고 싶을 수도 있지만, 빠른 개인 프로젝트를 위해서는 LLM을 로컬에서 실행할 수 있습니다.

이 글도 확인해 보세요:  Excel의 선택 함수를 사용하여 기준에 따라 데이터를 선택하는 방법

시작하기 위해 5,000달러짜리 장비가 필요한 것은 아닙니다

이미 가지고 있는 하드웨어를 사용하세요

최고급 그래픽 카드가 장착된 5,000달러짜리 워크스테이션이 필요하다고 생각하기 쉽지만, 이는 흔한 오해입니다. 양자화는 모델을 압축하는 방식입니다. 4비트 양자화를 사용하면 추론 능력의 눈에 띄는 손실 없이 모델의 메모리 점유율을 약 75%까지 줄일 수 있습니다.

이러한 대규모 압축 덕분에 70억 또는 80억 개의 파라미터를 가진 모델을 4~8GB의 메모리만으로 실행할 수 있습니다. 이제 막 시작하는 단계라면 기존 하드웨어로도 충분할 가능성이 매우 높습니다. 저는 오픈 소스이며 구형 PC에서도 LLM이 잘 돌아가는 GPT4All을 사용하는 것을 좋아합니다. AI와 대화하기 위해 전용 그래픽 카드조차 필요하지 않습니다.

Llama 3.2 3B와 같은 경량 모델은 Raspberry Pi와 같은 기본적인 장치에서도 실행할 수 있습니다. 또한, Apple Silicon이 탑재된 최신 Mac을 사용 중이라면 이미 강력한 AI 머신을 가지고 있는 셈입니다. Apple의 통합 메모리 아키텍처를 통해 시스템은 단일 대용량 RAM 풀을 공유할 수 있습니다. 이는 일반 노트북으로도 고가의 그래픽 카드가 여러 개 필요한 모델을 로드할 수 있음을 의미합니다.

저와 같은 실수를 하지 마세요

로컬 AI를 실행하는 것은 예전에는 여유 시간과 인내심이 있는 개발자들만이 시도하는 일이었습니다. 이제는 더 이상 그렇지 않습니다. 괜찮은 컴퓨터를 가지고 있다면, 심지어 아주 기본적인 컴퓨터를 가지고 있더라도 시작하기에 충분합니다. 이러한 모델들이 무거운 전문 작업을 위해 유료 클라우드 구독을 완전히 대체할 수는 없겠지만, 개인 프로젝트, 빠른 아이디어 구상, 일상적인 작업에는 충분히 훌륭합니다. 이미 가지고 있는 것보다 더 강력한 무언가가 필요하다고 확신하기 전에 직접 시도해 볼 가치가 있습니다.

##### GPT4All

OS Windows, macOS, Linux

개발자 Nomic AI

가격 모델 무료, 오픈 소스

클라우드 의존성 없이 자신의 PC에서 대형 언어 모델을 실행하는 무료 오픈 소스 로컬 AI 플랫폼입니다.

By 김민수

안드로이드, 서버 개발을 시작으로 여러 분야를 넘나들고 있는 풀스택(Full-stack) 개발자입니다. 오픈소스 기술과 혁신에 큰 관심을 가지고 있고, 보다 많은 사람이 기술을 통해 꿈꾸던 일을 실현하도록 돕기를 희망하고 있습니다.