최근 저는 로컬 LLM에 깊이 빠져들어 직접 로컬 AI 서버까지 구축했습니다. 문제는 이것이 매우 비용이 많이 드는 취미라는 점이며, 저에게는 그 갈증을 제대로 해소할 수 있는 수천 달러 상당의 하드웨어가 갖춰져 있지 않다는 것입니다.
하지만 여전히 가장 큰 오픈 웨이트(open-weight) 모델들을 사용해보고 싶었고, 이에 대한 꽤 괜찮은 해결책을 찾은 것 같습니다.
관련 기사
이제 다시는 AI에 돈을 쓰지 않겠습니다
AI를 사용하는 데 비용이 들 필요는 없습니다. 로컬 모델은 빠르고 개인정보 보호가 뛰어나며, 이제는 전환할 가치가 충분합니다.
하드웨어가 지원하지 않는 오픈 웨이트 모델을 실행하게 해주는 Nvidia Build
무료 추론(Inference)
Nvidia Build는 기본적으로 로컬 LLM을 실행하기 위한 Nvidia의 클라우드 추론 플랫폼입니다. 복잡하게 설명할 것 없이, Nvidia Build는 오픈 웨이트 모델을 가져와 자사의 DGX Cloud 하드웨어에서 실행되도록 최적화하고, 해당 모델에 대한 API 액세스를 제공합니다.
시작하려면 Nvidia Build 웹사이트에 접속하여 새 계정을 만드세요. 계정을 만든 후에는 카탈로그를 살펴보고 ‘Free Endpoint’ 플래그가 표시된 모델을 찾아보는 것을 추천합니다. 해당 모델들은 비용 지불 없이 사용할 수 있습니다. 무료 티어의 토큰 제한에 대한 공식 문서는 찾을 수 없었지만, 분당 40회 요청이라는 속도 제한이 있으며 이는 개인적인 용도로 사용하기에는 크게 문제 되지 않을 것입니다.
특히 코딩 작업과 관련하여 어떤 모델부터 시작해야 할지 모르겠다면, MiniMax M2.7을 먼저 시도해보는 것을 제안합니다. GLM-4.7과 같은 다른 모델들도 시도해 볼 수 있지만, 일부 모델 제품군은 무료 티어에서 이전 버전만 제공될 수 있다는 점을 유의하세요.
관련 기사
여기서 이해해야 할 핵심은 이것들이 장난감 모델이나 기능이 제한된 데모 버전이 아니라는 점입니다. MiniMax M2.7은 2,300억 개의 파라미터를 가진 모델입니다. 수백 GB의 VRAM을 갖춘 멀티 GPU 서버가 없다면 집에서 이를 실행할 현실적인 방법은 없습니다. Nvidia가 자사의 인프라에서 이 모든 것을 호스팅하고 있는 것입니다.
모델을 결정했다면 오른쪽 상단의 프로필 아이콘을 클릭하고 API Keys로 이동하여 키를 생성하세요. 키를 얻었다면 이제 정말 멋진 작업들을 시작할 수 있습니다.
이 플랫폼으로 할 수 있는 수많은 멋진 일들
GPU가 없어도 문제없습니다
저는 한동안 오픈 웨이트 모델을 연결하여 Claude Code를 사용해 왔는데, 최근 OpenCode를 시험해 보게 되어 Nvidia Build와 함께 사용해 보기로 했습니다. 다행히 OpenCode에는 Nvidia 통합 기능이 내장되어 있어 /connect를 실행하고 NVIDIA를 선택한 뒤 API 키를 입력하기만 하면 끝이었습니다. 30초도 안 되어 MiniMax M2.7을 실행할 수 있었고, 특히 비용이 전혀 들지 않는다는 점을 고려하면 매우 인상적이었습니다.
하지만 이것이 전부가 아닙니다. Nvidia Build의 모든 모델은 OpenAI 호환 API 엔드포인트를 제공하며, 이는 생각보다 훨씬 중요합니다. OpenAI API 형식은 이제 AI 도구의 보편적인 표준이 되었습니다. Cursor나 Zed와 같은 코딩 도구들도 이를 지원합니다.
Claude Code도 작동하지만, Anthropic 형식을 기본으로 사용하기 때문에 OpenCode보다는 약간의 추가 설정이 필요합니다. 설정을 원하신다면 Nvidia에서 제공하는 지원 페이지를 참고하세요.
단순히 챗봇으로 모델을 사용하고 싶다면, 자신의 컴퓨터에서 ChatGPT 스타일의 인터페이스를 실행할 수 있게 해주는 Open WebUI와 같은 로컬 채팅 인터페이스를 쉽게 연결할 수 있습니다.
수천 달러를 쓰지 않고 오픈 웨이트 모델을 시도하는 가장 쉬운 방법
메모리? 이 경제 상황에서요?
큰 모델을 로컬에서 실행하는 것은 확실히 매력적입니다. 완전한 제어권을 가질 수 있고, 속도 제한이 없으며, 데이터가 기기 밖으로 나가지 않기 때문입니다. 사람들이 왜 이를 원하는지 이해합니다. 하지만 이를 제대로 수행하기 위해 필요한 하드웨어는 저렴하지 않으며, 그 비용은 많은 사람을 당황하게 합니다.
70B 모델을 단일 기기에서 원활하게 실행하려면 128GB 통합 메모리를 갖춘 Mac과 같은 사양이 필요하며, 이는 약 5,000달러부터 시작합니다(64GB로도 만족스러운 결과를 얻을 수는 있습니다). 또는 듀얼 RTX 5090 구성을 고려할 수 있는데, 나머지 부품까지 고려하면 9,000달러에서 12,000달러 사이의 비용이 듭니다.
이 글을 쓰는 시점에서 Apple은 128GB Mac Studio 구성을 삭제했습니다. 순수하게 메모리가 목적이라면 현재 가장 좋은 선택은 128GB 통합 메모리를 갖춘 M5 Max MacBook Pro입니다.
그렇다 하더라도 70B 모델은 Nvidia Build에서 가장 큰 모델이 아닙니다. MiniMax M2.7은 2,300억 개의 파라미터를 가진 모델입니다. 집에서 이를 전체 정밀도로 실행할 수 있는 현실적인 소비자용 하드웨어 경로는 없습니다.
하드웨어 구매를 서두르는 것의 문제는 자신이 무엇이 필요한지 실제로 알기 전에 구매하게 될 수 있다는 점입니다. 그런 큰돈을 쓰고 나서야 자신의 기기에 맞는 모델이 생각했던 작업에 충분하지 않다는 것을 깨닫는 것은 고통스러운 상황입니다. 반대의 경우도 마찬가지입니다. 자신의 요구 사항이 정확히 어디에 있는지 몰라 불필요하게 많은 돈을 쓰게 될 수도 있습니다.
무언가를 결정하기 전에, 실제로 자신에게 중요한 작업에서 가장 큰 오픈 웨이트 모델을 전체 정밀도로 몇 주 동안 사용해 볼 수 있습니다. 만약 70B 모델로 필요한 모든 작업이 가능하다는 것을 알게 된다면, 128GB 메모리의 Mac으로 충분할지도 모릅니다.
더 작은 모델로도 충분하다면 그렇게 많은 돈을 쓸 필요가 없을 수도 있습니다. 그리고 만약 200B 범위의 모델이 정기적으로 필요하다는 것을 알게 된다면, 돈을 쓰기 전에 미리 그 사실을 파악한 셈이 됩니다.
관련 기사
장기적인 해결책은 아닙니다
Nvidia Build는 모델을 로컬에서 실행하는 것을 대체할 수 없습니다. 여전히 데이터를 타인의 서버로 보내야 하고, 속도 제한이 있으며, 로컬 추론을 설정하는 근본적인 이유인 완전한 제어권을 가질 수 없기 때문입니다. 하지만 그것이 이 플랫폼의 본질은 아닙니다.
이것을 테스트 환경으로 생각하세요. 무언가를 결정하기 전에 실제로 이러한 모델을 실제 작업에 사용해 볼 수 있는 방법입니다. Nvidia Build는 현재 그 정보를 얻을 수 있는 가장 쉽고 저렴한 방법일 뿐입니다.
##### NVIDIA Build
NVIDIA Build는 NVIDIA의 자체 하드웨어에서 호스팅되는 오픈 웨이트 AI 모델에 무료 API 액세스를 제공하는 클라우드 추론 플랫폼입니다.