Developer Lab Tools

LM Studio에 MCP를 붙이면 로컬 AI가 달라질까, 정답률 1%가 99%가 됐다 (RTX 5090)

EVUELA 2026년 10월 01일 9회 2시간 전
LM Studio에 MCP를 붙이면 로컬 AI가 달라질까, 정답률 1%가 99%가 됐다 (RTX 5090)

LM Studio에 MCP 서버 3개(웹 페이지 읽기, 현재 시간, 파일 읽기)를 붙이고, 로컬 모델 4개에 같은 질문 30개를 도구 없이 한 번, 도구를 주고 한 번 물어봤습니다. 최신 정보나 파일이 필요한 질문에서 도구 없이는 240번 중 3번만 맞혔고, 도구를 주자 240번 중 237번을 맞혔습니다. 도구가 필요 없는 질문에서는 네 모델 모두 도구를 한 번도 부르지 않았습니다.

더 눈여겨볼 점은 도구가 없을 때의 반응입니다. 대부분은 "볼 수 없다"고 솔직하게 답했지만, 실제 LM Studio 문서 주소를 주자 네 모델 모두 문서를 읽은 것처럼 틀린 버전을 답했습니다. 이 글에는 LM Studio에 MCP를 붙이는 방법, 채팅에서 써 보는 과정, 모델별 결과를 차례로 정리했습니다.

한눈에 보기

모델도구가 필요한 질문 60번
(도구 없음 → 있음)
도구가 필요 없는 질문 30번
(도구 없음 → 있음)
도구를 쓸 때 한 문제 시간
Qwen3.8 27B0 → 5930 → 301.7~2.2초
Gemma 4 26B A4B0 → 5830 → 301.1~1.6초
Gemma 4 31B0 → 6030 → 303.0~4.7초
Muse Glimmer3 → 6030 → 306.0~7.6초

도구를 주면 네 모델 모두 거의 다 맞혔습니다. 도구가 필요 없는 질문의 정답률은 도구를 줘도 떨어지지 않았습니다. 시간은 가운데 값이고, 생각(Thinking)을 가장 낮게 두고 잰 결과입니다.

테스트 환경

항목내용
그래픽카드RTX 5090 (VRAM 32GB)
실행 프로그램LM Studio 0.4.25
모델 설정LM Studio 기본값 그대로 로드
MCP 서버fetch(웹 페이지 읽기), time(현재 시간, 한국 시간), filesystem(파일 읽기, 테스트 폴더 하나만)
날짜2026년 9월 30일
모델구조파일 크기LM Studio 기본 컨텍스트로드 뒤 VRAM
Qwen3.8 27B (Q4_K_M)보통 구조(Dense)17.74GB8,19221.1GB
Gemma 4 26B A4B QAT (Q4_0)MoE(활성 파라미터 약 4B)15.63GB100,09619.6GB
Gemma 4 31B QAT (Q4_0)보통 구조(Dense)18.85GB70,14428.7GB
Muse Glimmer (Q4_K_M)보통 구조(Dense)18.16GB8,19218.8GB

LM Studio가 모델마다 기본 컨텍스트 길이를 다르게 잡았습니다. 두 Gemma 모델은 컨텍스트를 길게 잡아서 VRAM을 더 썼습니다. 네 모델 모두 LM Studio 모델 정보에 "도구 사용 학습됨"으로 표시되어 있습니다.

MCP가 무엇인가요

MCP(Model Context Protocol)는 AI 모델이 바깥 도구를 쓰는 방법을 정한 규칙입니다. 모델은 원래 학습한 내용만 알고, 인터넷이나 내 PC의 파일을 직접 볼 수 없습니다. MCP 서버를 붙이면 모델이 "이 페이지를 읽어 줘", "이 파일을 열어 줘" 같은 요청을 만들고, 프로그램이 대신 실행해서 결과를 모델에게 돌려줍니다.

LM Studio는 0.3.17부터 MCP를 지원합니다. 설정 파일 하나에 서버를 적으면 채팅에서 바로 쓸 수 있습니다.

LM Studio에 MCP 서버 붙이기

MCP 서버는 LM Studio 설정 폴더의 mcp.json 파일에 적습니다. 윈도우에서는 %USERPROFILE%\.lmstudio\mcp.json 입니다. LM Studio 채팅 화면 오른쪽 Program 탭에서 Install → Edit mcp.json 을 눌러 열 수도 있습니다. 이번 테스트에 쓴 설정은 아래와 같습니다.

{
  "mcpServers": {
    "fetch": {
      "command": "uvx",
      "args": ["mcp-server-fetch"]
    },
    "time": {
      "command": "uvx",
      "args": ["mcp-server-time", "--local-timezone=Asia/Seoul"]
    },
    "filesystem": {
      "command": "npx",
      "args": ["-y", "@modelcontextprotocol/server-filesystem", "C:\\테스트\\폴더\\경로"]
    }
  }
}

세 서버 모두 MCP 프로젝트가 공개한 공식 예제 서버입니다. uvx와 npx로 실행하므로 PC에 uv와 Node.js가 있어야 합니다. 처음 실행할 때 패키지를 자동으로 내려받습니다. filesystem 서버의 마지막 값은 모델이 볼 수 있는 폴더입니다. 꼭 필요한 폴더 하나만 적는 것이 안전합니다.

파일을 저장하면 LM Studio가 바로 알아보고 서버를 켭니다.

LM Studio MCP Server Added 알림 세 개

mcp.json 을 저장하자 fetch, time, filesystem 서버가 추가됐다는 알림이 떴습니다.

mcp.json 편집 화면을 처음 열면 경고 창이 뜹니다. MCP 서버는 내 컴퓨터에서 어떤 코드든 실행할 수 있으니, 믿을 수 있는 개발자가 만든 서버만 쓰라는 내용입니다.

LM Studio MCP 보안 경고 창

"MCP는 유용하지만 위험할 수 있다"는 경고. 모르는 곳에서 받은 MCP 서버는 설치하지 않는 것이 좋습니다.

LM Studio 안에서 연 mcp.json

LM Studio 안에서 연 mcp.json. 저장하면 MCP 서버를 다시 불러옵니다.

채팅에서 써 보기

채팅 입력창 왼쪽 아래의 도구 버튼을 누르면 Integrations 목록이 나옵니다. 여기서 mcp/fetch, mcp/filesystem, mcp/time 을 켜면 그 채팅에서 도구를 쓸 수 있습니다.

LM Studio Integrations 에서 MCP 서버 켜기

Integrations 에서 MCP 서버 세 개를 켠 모습.

Gemma 4 31B에게 테스트용 페이지를 읽고 제품 가격과 출시일을 알려 달라고 했습니다. 모델이 fetch 도구를 부르겠다고 하면, LM Studio가 실행 전에 확인을 받습니다. 모델이 넘긴 값(여기서는 페이지 주소)을 보고 Proceed(실행)나 Deny(거절)를 고릅니다.

LM Studio 도구 실행 확인 창

"Model wants to call fetch". 도구마다 실행 전에 확인을 받습니다. "항상 허용"도 고를 수 있습니다.

fetch 로 페이지를 읽고 답한 결과

페이지를 읽고 가격 1,890,000원, 출시일 2026년 11월 3일을 정확히 답했습니다.

파일 질문도 해 봤습니다. "sales.csv 파일에서 3월 매출 합계를 구해 줘"라고 하자, 모델이 먼저 폴더 목록을 보고(list_directory) 파일을 연 다음(read_text_file) 줄마다 계산해서 합계를 냈습니다.

filesystem 도구로 CSV 를 읽고 계산한 결과

도구 두 개를 차례로 쓰고 3월 매출 26,100,000원을 맞혔습니다.

테스트 방법

질문 30개를 세 묶음으로 나눴습니다. 정답은 미리 정해 두고, 프로그램이 답에 정답이 들어 있는지 자동으로 채점했습니다.

묶음개수예
A. 최신 정보가 필요한 질문10페이지를 읽고 제품 가격 알려 주기, 새 가격표로 비용 계산하기, LM Studio 문서의 버전 조건, 지금 한국 시간과 요일
B. 파일을 봐야 하는 질문10CSV 매출 합계, 회의 메모의 다음 회의 날짜, 설정 파일의 포트 번호, 로그의 ERROR 개수
C. 도구가 필요 없는 질문1017×23, HTTP 404의 뜻, 파이썬 리스트 뒤집기, 1부터 100까지의 합
  • A 묶음의 제품 페이지 5개는 이 테스트를 위해 만든 가상 자료입니다. 모델이 학습했을 리 없는 내용이어야 도구의 효과를 볼 수 있어서입니다. 페이지는 테스트 PC 안에서만 열었고, 페이지마다 가상 자료라고 적어 두었습니다. LM Studio 문서 페이지는 실제 페이지를 썼습니다.
  • 질문마다 도구 없이 한 번, 도구를 주고 한 번 묻고, 이것을 3번 반복했습니다. 모델마다 180번 물은 셈입니다.
  • 생각(Thinking)은 가장 낮게 뒀습니다. Qwen과 Gemma는 끔, Muse Glimmer는 끌 수 없어서 가장 낮은 low 입니다. 생각을 켜면 한 문제에 수십 초씩 걸려 비교가 흐려지기 때문입니다. 생각을 켰을 때는 아래에 따로 적었습니다.
  • filesystem 서버에는 파일 쓰기와 수정 도구도 있지만, 테스트에서는 읽기 도구만 모델에게 줬습니다.
  • 측정은 파이썬 프로그램으로 했습니다. MCP 서버에 직접 붙어서 도구 목록을 받고, LM Studio의 OpenAI 호환 주소로 모델에게 넘기는 방식입니다. 코딩 도우미들이 로컬 모델에 MCP를 붙이는 방식과 같습니다.

결과 1: 도구를 주면 거의 다 맞혔다

모델A. 최신 정보
(없음 → 있음)
B. 파일
(없음 → 있음)
C. 도구 필요 없음
(없음 → 있음)
C에서 도구를 부른 횟수
Qwen3.8 27B0 → 300 → 2930 → 300
Gemma 4 26B A4B0 → 300 → 2830 → 300
Gemma 4 31B0 → 300 → 3030 → 300
Muse Glimmer3 → 300 → 3030 → 300

도구를 준 뒤 틀린 3번은 모두 같은 질문이었습니다. "테스트 폴더 안에 파일이 모두 몇 개 있어?"라는 질문을 두 모델이 "'테스트'라는 이름의 폴더"로 알아듣고, 그런 폴더가 없다고 답했습니다. 질문 문장이 모호했던 탓도 있습니다. 도구 호출이 실패하거나 없는 도구를 부른 경우는 한 번도 없었습니다.

Muse Glimmer가 도구 없이 맞힌 3번은 "오늘 무슨 요일이야?"였습니다. 도구 없이도 오늘 날짜를 알고 있었는데, 모델이 대화를 시작할 때 날짜를 함께 받는 것으로 보입니다.

결과 2: 도구가 없으면 문서를 읽은 척했다

도구 없이 물었을 때 240번 중 219번은 "페이지에 접속할 수 없다", "파일을 볼 수 없다"고 솔직하게 답했습니다. 문제는 나머지입니다. 실제 LM Studio 문서 주소를 주고 "API로 MCP를 쓰려면 몇 버전 이상이어야 하는지" 물었을 때, 네 모델 모두 문서를 읽을 수 없는데도 읽은 것처럼 답했습니다. 문서에 적힌 정답은 0.4.0입니다.

모델도구 없이 한 답 (3번)
Qwen3.8 27B0.3.11, 0.3.16~0.3.19, 0.2.24 (매번 다름)
Gemma 4 26B A4B"문서에 버전 요구 사항이 적혀 있지 않다" (3번 모두)
Gemma 4 31B0.3.5 (3번 모두, 문서의 특정 절에 적혀 있다고 인용까지 함)
Muse Glimmer0.3.0, 0.3.18 (인용문을 지어냄)

테스트 PC 안에서만 열리는 가상 페이지 주소에는 대부분 "접속할 수 없다"고 답했습니다. 반면 실제로 있을 법한 공식 문서 주소에는 아는 척을 했습니다. Qwen3.8 27B는 오늘 날짜를 "2024년 5월 21일 화요일"이라고 지어내기도 했습니다. 도구가 없는 상태에서 모델이 자신 있게 말하는 버전 번호나 날짜는 그대로 믿으면 안 됩니다.

채팅 화면에서도 똑같았습니다. 도구를 끄고 물으니 Gemma 4 31B가 생각 기능을 켠 상태에서도 0.3.5라고 답했고, 같은 채팅에서 fetch 도구를 켜고 다시 묻자 문서를 읽고 0.4.0으로 바로잡았습니다.

도구 없이 문서를 읽은 척한 답

도구 없이 물었을 때. "문서를 확인한 결과"라며 틀린 버전 0.3.5를 답했습니다.

fetch 로 문서를 읽고 바로잡은 답

fetch 도구를 켜고 다시 물었을 때. 문서의 "Requires LM Studio 0.4.0 or newer" 문장을 찾아 바로잡았습니다.

결과 3: 속도와 입력 토큰

모델A 시간
(없음 → 있음)
B 시간
(없음 → 있음)
C 입력 토큰
(없음 → 있음)
B 도구 호출 수
Qwen3.8 27B3.8 → 1.7초3.4 → 2.2초24 → 1,8902.5번
Gemma 4 26B A4B1.4 → 1.1초1.4 → 1.6초25 → 1,4562.6번
Gemma 4 31B2.8 → 3.0초4.9 → 4.7초25 → 1,4562.2번
Muse Glimmer3.4 → 6.0초3.1 → 7.6초68 → 2,0843.1번

도구를 줘도 크게 느려지지 않았습니다. 도구 없이 답할 때는 "접속할 수 없으니 이렇게 해 보세요" 같은 긴 안내를 쓰느라 시간이 들었고, 도구가 있으면 짧게 답을 찾아 끝냈기 때문입니다. Muse Glimmer는 폴더 목록을 여러 번 확인하느라 도구를 가장 많이 불렀고, 그만큼 느렸습니다.

대신 입력 토큰은 크게 늘었습니다. 도구 설명(도구 이름, 쓰는 법, 넘길 값)이 요청마다 함께 가기 때문에, "17×23은?" 같은 짧은 질문도 입력이 25토큰에서 1,500~2,000토큰이 됐습니다. 도구를 많이 붙일수록 이 몫이 커지고, 컨텍스트가 짧은 모델에서는 대화에 쓸 자리가 줄어듭니다. 쓰지 않는 MCP 서버는 꺼 두는 것이 좋습니다.

결과 4: 같은 Gemma 4, MoE와 보통 구조

Gemma 4 26B A4B는 전체 파라미터 중 일부(약 4B)만 골라 쓰는 MoE 구조이고, Gemma 4 31B는 전체를 다 쓰는 보통 구조입니다. 영어권 테스트 중에는 "MoE 모델이 도구 호출에 약하다"는 결과도 있어서 같은 조건으로 비교했습니다.

항목Gemma 4 26B A4B (MoE)Gemma 4 31B (보통 구조)
도구가 필요한 질문 60번58번 정답60번 정답
한 문제 시간 (도구 있음)1.1~1.6초3.0~4.7초
로드 뒤 VRAM19.6GB28.7GB

31B가 2번 더 맞혔지만, 틀린 2번은 앞에서 말한 모호한 질문이었습니다. 이번 질문들로는 두 구조의 정확도 차이가 크지 않았습니다. 속도는 MoE인 26B A4B가 2~3배 빨랐습니다. 도구를 여러 번 주고받는 작업이라면 이 속도 차이가 체감됩니다.

결과 5: 생각을 켜고 도구를 주면

계산이 들어간 질문 5개를 골라, 생각을 모델 기본값으로 켜고 도구를 준 상태로 한 번씩 더 물었습니다.

모델 (생각 기본값)맞힌 수한 문제 시간한 문제에 만든 토큰
Qwen3.8 27B (xhigh)5/53.5~5.9초248~608
Gemma 4 26B A4B (켬)4/54.5~45.0초783~8,045
Gemma 4 31B (켬)5/53.8~15.6초139~763
Muse Glimmer (high)5/56.9~23.2초393~1,342

생각을 켜도 정답률은 거의 같았고, 시간만 늘었습니다. Gemma 4 26B A4B는 가격 계산 문제 하나에 45초, 토큰 8천 개를 썼고, 참가비와 정원을 묻는 문제는 도구를 6번 부른 끝에 틀렸습니다. 이번처럼 도구가 답을 찾아 주는 질문에서는 생각을 꺼도 충분했습니다.

파이썬으로 로컬 모델에 도구를 붙일 때 주의할 점

측정 프로그램을 만들며 두 가지 함정을 만났습니다.

  • 생각 끄기 옵션 이름: LM Studio의 OpenAI 호환 주소(/v1/chat/completions)에서는 "reasoning": "off"가 무시됩니다. "reasoning_effort": "none"을 보내야 생각이 꺼집니다. 처음에 이것을 모르고 재서, 생각이 켜진 채로 측정이 돌았습니다. 짧은 질문으로 확인했을 때 생각 글자 수가 1,062자에서 0자로, 걸린 시간이 5.0초에서 0.5초로 줄었습니다.
  • API로 mcp.json 서버를 부르려면 인증이 필요: LM Studio의 자체 API로 mcp.json에 적은 서버를 쓰려면 서버 설정에서 "Allow calling servers from mcp.json"을 켜야 하는데, 이 설정은 "Require Authentication"을 켜야만 켜집니다. 인증을 켜면 이 서버를 쓰는 모든 프로그램에 토큰이 필요해집니다. 채팅 화면에서는 인증 없이 쓸 수 있습니다.
from openai import OpenAI

client = OpenAI(base_url="http://localhost:1234/v1", api_key="lm-studio")
r = client.chat.completions.create(
    model="google/gemma-4-31b-qat",
    messages=[{"role": "user", "content": "17 곱하기 23은?"}],
    tools=tools,                                  # MCP 서버에서 받은 도구 목록
    extra_body={"reasoning_effort": "none"},      # 생각 끄기
)

정리

  • LM Studio에 MCP를 붙이는 것은 mcp.json에 몇 줄을 적는 것으로 끝납니다. 채팅에서 도구를 켜고, 실행할 때마다 확인하면 됩니다.
  • 도구를 주자 네 모델 모두 최신 정보와 파일 질문을 거의 다 맞혔습니다(240번 중 237번). 도구가 필요 없는 질문에서 괜히 도구를 부르지도 않았습니다.
  • 도구가 없을 때 대부분은 "모른다"고 했지만, 실제 있을 법한 문서에는 네 모델 모두 틀린 답을 자신 있게 말했습니다.
  • 도구 설명 때문에 질문마다 입력이 1,500~2,000토큰 늘어납니다. 쓰지 않는 서버는 꺼 두는 것이 좋습니다.
  • 같은 Gemma 4에서 MoE 구조(26B A4B)가 보통 구조(31B)보다 2~3배 빨랐고, 정확도 차이는 크지 않았습니다.
  • MCP 서버는 PC에서 코드를 실행할 수 있습니다. 믿을 수 있는 서버만 쓰고, 파일 서버에는 꼭 필요한 폴더 하나만 열어 두는 것이 안전합니다.

이번에 쓴 모델들의 속도와 VRAM은 Qwen3.8 27B 테스트, Muse Glimmer 테스트, RTX 5060 Ti 16GB에서 Gemma 4 26B를 돌린 결과에 있습니다. 내 그래픽카드에 어떤 모델이 들어가는지는 GPU 체험에서 볼 수 있습니다.

자주 묻는 질문

LM Studio에서 MCP를 쓰려면 몇 버전이 필요한가요?

채팅 화면에서 MCP 서버를 쓰는 기능은 0.3.17부터 들어왔습니다. LM Studio 자체 API로 MCP를 부르려면 0.4.0 이상이 필요합니다. 이번 테스트는 0.4.25에서 했습니다.

MCP 서버를 쓰려면 무엇을 설치해야 하나요?

이번에 쓴 공식 예제 서버는 uv(파이썬 실행 도구)와 Node.js로 실행합니다. 둘 다 설치돼 있으면 처음 실행할 때 서버 패키지를 자동으로 내려받습니다.

도구를 붙이면 로컬 모델이 느려지나요?

이번 테스트에서는 한 문제 시간이 크게 늘지 않았습니다. 대신 도구 설명 때문에 입력이 질문마다 1,500~2,000토큰 늘었습니다. 컨텍스트가 짧은 모델은 이 몫만큼 대화에 쓸 자리가 줄어듭니다.

도구를 안 주면 모델이 모른다고 하나요?

대부분은 그랬지만 항상 그렇지는 않았습니다. 실제 LM Studio 문서 주소를 주자 네 모델 모두 문서를 읽은 척 틀린 버전을 답했습니다. 최신 정보나 버전 번호는 도구로 확인하게 하는 것이 안전합니다.

MCP 서버는 안전한가요?

MCP 서버는 PC에서 프로그램을 실행하고 파일과 네트워크에 접근할 수 있습니다. 믿을 수 있는 곳에서 만든 서버만 쓰고, 파일 서버에는 필요한 폴더 하나만 열어 두세요. LM Studio는 도구를 실행하기 전에 확인을 받으니, 모델이 넘긴 값을 보고 허락하는 것이 좋습니다.

관련 게시글

댓글 0개