GYMCODING

Claude Desktop에 Ollama 연결하기: 무료 로컬 모델 설정·명령어·실전 프롬프트

Claude Desktop에 Ollama 로컬 모델을 연결하는 방법부터 복구 명령어, 모델 선택 기준, 성능 비교용 복사 프롬프트까지 정리했습니다.

이런 분을 위한 글입니다

  • Claude Desktop을 계속 쓰면서 로컬 AI도 활용하고 싶은 분
  • AI 사용량 한도와 비용이 부담스러운 분
  • 내 컴퓨터에 맞는 Ollama 모델을 고르고 싶은 분

읽고 나면 이렇게 달라집니다

  • Claude Desktop에 Ollama를 연결하고 원래 설정으로 되돌리는 방법
  • 로컬 모델과 Ollama 클라우드 모델의 비용·데이터 차이
  • 모델 성능을 직접 비교하는 명령어와 복사 프롬프트

2026년 8월 25일, Ollama가 Claude Desktop 공식 지원을 발표했습니다.

핵심은 간단합니다. Claude Desktop의 화면은 그대로 두고, 답변을 만드는 모델만 Ollama 모델로 바꿀 수 있습니다. 내 컴퓨터에서 실행하는 로컬 모델을 선택하면 메시지 한도나 토큰 요금 없이 사용할 수 있습니다. 필요할 때는 토글을 끄고 기존 Claude 설정으로 돌아갈 수 있습니다.

예전에는 Claude와 로컬 모델을 연결하려면 설정 파일을 직접 수정하거나 비공식 프록시를 사용해야 했습니다. 이번 방식은 Claude Desktop에 마련된 서드파티 게이트웨이 경로를 Ollama가 공식적으로 설정해 주는 방식입니다.

이 글은 2026년 9월 11일 기준입니다. 현재 ollama launch claude-desktop 명령으로 새 연결을 만드는 방식은 지원되지 않습니다. Claude Desktop은 Ollama 앱의 Claude 토글로 연결하세요. 터미널의 ollama launch claude는 Claude Desktop이 아니라 Claude Code를 실행하는 명령입니다.

30초 요약

  • Ollama 앱에서 Claude를 선택하고 토글을 켜면 됩니다.
  • Claude Desktop 안에서 로컬 모델과 Ollama 클라우드 모델을 선택할 수 있습니다.
  • 로컬 모델은 별도의 토큰 요금이 없지만 컴퓨터 성능과 메모리를 사용합니다.
  • 클라우드 모델은 인터넷으로 실행되며 사용량·요금 정책이 적용됩니다.
  • 원래 Claude 설정으로 돌아가려면 Ollama 앱에서 토글을 끕니다.

무엇이 달라졌을까?

Claude Desktop을 다른 앱으로 교체하는 것이 아닙니다. 대화 화면, 프로젝트, 파일을 다루는 방식 등 익숙한 사용 환경은 유지됩니다. 모델로 요청을 전달하는 경로만 Ollama로 바뀝니다.

구분기존 우회 방식Ollama 공식 연결
Claude 앱프록시 또는 별도 앱 필요그대로 사용
설정설정 파일 수동 편집앱에서 토글
모델우회 도구가 지원하는 모델Ollama의 로컬·클라우드 모델
되돌리기설정 파일 복구토글 끄기
유지보수업데이트 때 깨질 수 있음Ollama가 연결 설정 관리

이 변화가 반가운 이유는 선택지가 생겼기 때문입니다.

간단한 요약과 초안은 로컬 모델로 처리하고, 높은 정확도나 긴 문맥이 필요한 작업은 Anthropic 모델 또는 Ollama 클라우드 모델로 넘길 수 있습니다. 한 가지 모델과 요금제에 모든 일을 맡길 필요가 없습니다.

시작하기 전에 준비할 것

다음 세 가지가 필요합니다.

  1. 최신 버전의 Ollama 앱
  2. Claude Desktop
  3. 로컬 모델을 저장할 디스크 공간과 실행할 메모리

Ollama가 설치되어 있는지 터미널에서 확인하려면 다음 명령을 실행합니다.

ollama --version

설치된 모델 목록은 다음 명령으로 확인할 수 있습니다.

ollama ls

아무 모델도 보이지 않아도 괜찮습니다. Claude 연결 과정에서 모델을 선택하거나, 터미널에서 직접 내려받을 수 있습니다.

ollama pull qwen3.5

모델 이름과 권장 모델은 자주 바뀝니다. 특정 이름을 무조건 복사하기보다 Ollama 앱에 표시되는 최신 권장 모델과 내 컴퓨터의 메모리 사용량을 함께 확인하세요.

Claude Desktop에 Ollama 연결하기

1단계: Ollama 앱 열기

Ollama 앱을 실행합니다. 처음 실행할 때 계정 로그인을 권할 수 있지만, 로컬 모델만 사용할 예정이라면 로그인 없이 로컬 사용을 선택할 수 있습니다.

2단계: Claude 선택하기

Ollama 앱의 통합 목록에서 Claude를 선택합니다. Claude Desktop이 설치되어 있어야 관련 설정이 표시됩니다.

3단계: 토글 켜기

Claude 연결 토글을 켭니다. Ollama가 Claude Desktop의 서드파티 게이트웨이 설정을 구성합니다. 별도의 프록시 주소를 복사하거나 설정 파일을 직접 편집할 필요가 없습니다.

4단계: 모델 지정하기

Claude의 모델 선택지마다 사용할 Ollama 모델을 지정합니다. 가벼운 작업에는 작은 로컬 모델을, 복잡한 코딩이나 리서치에는 성능이 높은 모델을 연결할 수 있습니다.

5단계: Claude Desktop에서 확인하기

Claude Desktop을 열고 새 대화를 시작합니다. 지정한 모델로 짧은 질문을 보내 답변이 생성되는지 확인합니다.

정말 로컬에서 실행되는지 확인하는 방법

모델 이름만 보고 판단하기보다 실행 상태를 직접 확인하는 편이 안전합니다.

Claude Desktop에서 답변을 생성하는 동안 터미널에서 다음 명령을 실행합니다.

ollama ps

현재 메모리에 올라간 모델이 표시되면 로컬 Ollama가 요청을 처리하고 있는 것입니다. 작업이 끝난 뒤 모델을 메모리에서 내리고 싶다면 다음처럼 실행합니다.

ollama stop 모델이름

예를 들어 gemma 계열 모델을 실행 중이라면 실제 목록에 표시된 정확한 이름을 넣습니다.

ollama stop gemma4:e2b

추가로 인터넷 연결을 잠시 끊은 상태에서도 답변이 생성되는지 확인할 수 있습니다. 다만 Claude Desktop 자체의 일부 기능은 네트워크를 요구할 수 있으므로, 이 방법만으로 모든 데이터 흐름을 판단하지는 마세요. 가장 확실한 기준은 로컬 모델 선택 여부와 ollama ps의 실행 상태를 함께 확인하는 것입니다.

Claude Desktop과 Claude Code는 다릅니다

이 부분에서 가장 많이 헷갈립니다.

  • Claude Desktop: 창을 열어 대화하는 데스크톱 앱입니다. Ollama 앱의 Claude 토글로 연결합니다.
  • Claude Code: 터미널에서 프로젝트 파일을 읽고 수정하는 코딩 에이전트입니다. ollama launch claude 명령으로 연결합니다.

Claude Code를 Ollama 모델로 실행하려면 다음 명령을 사용합니다.

ollama launch claude

특정 모델을 바로 지정할 수도 있습니다.

ollama launch claude --model qwen3.5

실행하지 않고 설정만 구성하려면 다음과 같이 입력합니다.

ollama launch claude --config

Codex도 같은 방식으로 연결할 수 있습니다.

ollama launch codex

Codex 앱을 사용한다면 다음 명령을 사용합니다.

ollama launch codex-app

ollama launch claude-desktop은 현재 신규 연결용 명령이 아닙니다. 과거 이 명령으로 설정한 환경을 원래 Claude 프로필로 복구할 때는 ollama launch claude-desktop --restore를 사용할 수 있습니다.

로컬 모델과 클라우드 모델, 무엇을 골라야 할까?

Ollama 안에 보인다고 해서 모두 무료 로컬 모델인 것은 아닙니다.

구분로컬 모델Ollama 클라우드 모델
실행 위치내 컴퓨터Ollama의 서버
인터넷모델 다운로드 후 추론은 로컬필요
토큰 요금별도 토큰 요금 없음현재 요금·사용량 정책 적용
속도내 CPU·GPU·메모리에 좌우서버 성능과 네트워크에 좌우
데이터프롬프트가 로컬에서 처리됨요청 처리를 위해 서버로 전송
추천 작업요약, 초안, 반복 작업, 민감한 로컬 자료큰 모델이 필요한 코딩·리서치

로컬 모델은 ‘공짜 서버’가 아닙니다. 내 컴퓨터의 전기, 저장 공간, 메모리를 사용합니다. 그래도 요청할 때마다 발생하는 API 요금은 없고, 서비스의 메시지 한도에도 묶이지 않습니다.

Ollama의 공식 개인정보 안내에 따르면 로컬 실행 시 프롬프트와 응답은 기기 밖으로 전송되지 않습니다. 클라우드 모델은 요청 처리를 위해 데이터를 일시적으로 처리하지만 프롬프트와 응답을 학습에 사용하지 않고 보존하지 않는다고 설명합니다.

작은 모델이 항상 빠른 것은 아닙니다

그래픽카드가 없는 2017년형 사무용 PC에서 같은 질문을 네 모델에 입력해 비교한 결과입니다. 테스트 컴퓨터는 i3-8100과 내장 그래픽을 사용했습니다.

모델다운로드 용량답변 시간생성 속도한국어 결과
qwen3.5:2b2.7GB9.5초9.82 tok/s중국어 한자가 섞임
qwen3.5:4b3.4GB26초6.10 tok/s문장은 자연스럽지만 내용 오류
qwen3.5:9b6.6GB40초3.65 tok/s답은 맞지만 느림
gemma4:e2b7.2GB18.5초12.30 tok/s네 모델 중 가장 정확

가장 큰 gemma4:e2b가 qwen3.5:9b보다 약 3.4배 빠른 결과가 나왔습니다. 혼합 전문가 구조처럼 전체 모델을 메모리에 올리더라도 질문마다 일부만 계산하는 모델이 있기 때문입니다.

이 결과를 모든 컴퓨터에 그대로 적용하면 안 됩니다. 운영체제, Ollama 버전, 양자화 방식, 메모리 속도, 프롬프트 길이에 따라 순위가 바뀔 수 있습니다. 중요한 교훈은 하나입니다.

다운로드 용량으로 속도를 추측하지 말고, 내 컴퓨터에서 같은 프롬프트로 직접 비교하세요.

모델을 공정하게 비교하는 5분 테스트

좋은 모델은 단순히 첫 답변이 빠른 모델이 아닙니다. 다음 네 가지를 함께 보세요.

  1. 첫 글자가 나오기까지 걸린 시간
  2. 전체 답변이 끝날 때까지 걸린 시간
  3. 지시한 형식과 조건을 지켰는지
  4. 한국어 오류와 사실 오류가 있는지

모델마다 새 대화를 만들고 같은 프롬프트를 그대로 입력합니다. 답변 길이와 형식을 고정해야 속도 비교가 쉬워집니다.

복사 프롬프트 1: 한국어 정확도와 지시 준수

김치찌개를 맛있게 끓이는 핵심 원칙 세 가지를 설명해 주세요.

조건:
- 각 원칙은 한 문장으로 작성합니다.
- 근거를 한 문장씩 덧붙입니다.
- 확인되지 않은 팁은 넣지 않습니다.
- 전체 답변은 250자 이내로 제한합니다.
- 사고 과정은 출력하지 말고 최종 답변만 보여 주세요.

이 프롬프트는 한국어 자연스러움, 상식, 길이 제한 준수를 한 번에 볼 수 있습니다.

복사 프롬프트 2: 실무 문서 작성

아래 메모를 팀 공지로 바꿔 주세요.

메모:
금요일 오후 3시 배포. 목요일 정오까지 코드 리뷰 완료. 결제 오류가 있으면 배포 연기. 담당자는 민수.

조건:
- 제목 1개와 본문 3문단으로 작성합니다.
- 해야 할 일, 마감 시간, 배포 연기 조건을 빠뜨리지 않습니다.
- 과장된 표현과 이모지는 사용하지 않습니다.
- 원문에 없는 정보는 추가하지 않습니다.

이 프롬프트는 누락, 정보 왜곡, 문서 구조를 확인하기 좋습니다.

복사 프롬프트 3: 코드 작성과 자체 검증

JavaScript로 debounce 함수를 작성해 주세요.

요구사항:
- delay 동안 추가 호출이 없을 때 마지막 인수로 한 번 실행합니다.
- this 컨텍스트를 유지합니다.
- cancel 메서드로 예약된 실행을 취소할 수 있어야 합니다.
- 구현 코드와 Vitest 테스트 코드를 함께 작성합니다.
- 경계 사례를 먼저 목록으로 정리한 뒤 코드를 작성합니다.
- 확신할 수 없는 부분은 추측하지 말고 가정을 명시합니다.

코딩 모델은 코드가 그럴듯해 보이는지만 확인하면 안 됩니다. 테스트 케이스가 요구사항을 실제로 검증하는지도 함께 보세요.

복사 프롬프트 4: 내 컴퓨터에 맞는 모델 판정

여러 모델의 결과를 저장한 다음, 가장 신뢰하는 모델에 아래 프롬프트와 결과를 함께 입력합니다.

아래는 동일한 과제를 여러 AI 모델에 입력한 결과입니다.

평가 기준:
1. 요구사항을 빠짐없이 지켰는가
2. 사실 또는 논리 오류가 있는가
3. 한국어가 자연스러운가
4. 불필요하게 길지 않은가
5. 실무에서 수정 없이 사용할 수 있는가

각 항목을 5점 만점으로 평가하고 근거를 한 문장으로 설명해 주세요.
마지막에는 용도별 추천 모델을 정리해 주세요.
확인할 수 없는 내용은 점수를 추측하지 말고 ‘검증 필요’라고 표시해 주세요.

[여기에 모델별 답변과 생성 시간을 붙여 넣기]

모델 선택은 한 번의 벤치마크로 끝내지 마세요. 내가 자주 하는 업무에서 3개 이상의 프롬프트를 반복하고, 속도보다 ‘수정에 드는 시간’이 적은 모델을 선택하는 것이 실용적입니다.

답변이 7분씩 걸린다면 확인할 것

추론 또는 thinking 기능이 켜져 있으면 짧은 질문에도 많은 토큰을 만들 수 있습니다. 실제 테스트에서는 같은 과제가 7분 51초와 9.46초로 벌어졌고, 생성량도 4,066토큰과 91토큰으로 차이가 났습니다.

간단한 요약, 번역, 형식 변환처럼 깊은 추론이 필요 없는 작업에서는 thinking을 끈 결과도 비교해 보세요. 반대로 복잡한 디버깅이나 계획 수립에서는 추론을 무조건 끄기보다 결과의 정확도와 시간을 함께 판단해야 합니다.

빠른 답변이 필요할 때는 프롬프트에도 출력 범위를 명확히 적습니다.

사고 과정은 출력하지 마세요.
최종 답변만 5개 항목 이내로 작성하세요.
전체 분량은 500자 이내로 제한하세요.

이 문장이 모델 내부 계산을 항상 완전히 끄는 것은 아닙니다. 다만 불필요하게 긴 사고 과정이 답변에 출력되는 것을 줄이는 데 도움이 됩니다. 모델 설정에 thinking 옵션이 있다면 프롬프트와 함께 설정도 확인하세요.

자주 막히는 문제

어떤 작업부터 로컬로 옮기면 좋을까?

처음부터 모든 작업을 로컬 모델로 바꾸지 않아도 됩니다. 다음처럼 결과를 쉽게 검토할 수 있는 일부터 시작하세요.

  • 긴 글을 항목별로 정리하기
  • 회의 메모를 공지문으로 바꾸기
  • 문장의 말투와 길이 다듬기
  • 반복되는 코드 틀 만들기
  • 공개해도 되는 자료로 아이디어 확장하기

법률, 의료, 재무 판단처럼 오류 비용이 큰 작업이나 최신 정보가 필요한 조사는 로컬 모델의 답만 믿지 마세요. 원문과 공식 자료를 다시 확인해야 합니다.

결론: 앱을 바꾸는 기능이 아니라 모델 선택권을 넓히는 기능

Ollama의 Claude Desktop 지원이 의미 있는 이유는 무료 모델 하나가 추가돼서가 아닙니다.

익숙한 앱을 버리지 않고도 작업에 따라 모델을 바꿀 수 있게 됐기 때문입니다. 반복 작업은 로컬 모델로 처리하고, 더 어려운 작업은 성능이 높은 클라우드 모델로 넘길 수 있습니다. 로컬 모델이 맞지 않으면 토글을 끄고 원래 Claude로 돌아가면 됩니다.

처음 시작한다면 다음 순서만 기억하세요.

  1. 최신 Ollama 앱을 설치합니다.
  2. Ollama 앱에서 Claude 토글을 켭니다.
  3. 로컬 모델 하나를 선택합니다.
  4. 이 글의 비교 프롬프트를 같은 조건으로 실행합니다.
  5. 속도보다 수정 시간이 가장 적은 모델을 남깁니다.

‘가장 큰 모델’이나 ‘가장 유명한 모델’보다 내 컴퓨터와 내 업무에서 가장 덜 틀리는 모델이 좋은 모델입니다.

짐코딩 뉴스레터
AI 개발·클로드 코드 실전 노하우를 이메일로 받아보세요. 도움 되는 글만.

구독하면 마케팅 정보 수신 및 개인정보처리방침에 따른 이메일 수집·이용에 동의하게 됩니다. 언제든 수신거부할 수 있어요.