로컬 모델 서빙과 학습 실무
8개 개념, 총 학습 약 116분
로컬 AI 중급: 서빙, 파인튜닝, 음성과 이미지
로컬 AI 중급은 내 컴퓨터에 올린 모델을 서버로 열어 에이전트와 문서 검색에 쓰고, 파인튜닝과 음성, 이미지 생성까지 넓힌 뒤 성능과 보안을 관리하는 방법을 정리한 코스입니다. 모델을 설치하고 대화해 보는 단계를 넘어, 로컬 모델을 다른 도구와 엮어 실제 작업에 쓰려는 분을 위해 만들었습니다.
로컬 AI가 무엇이고 어떤 기기에서 어느 크기의 모델이 돌아가는지는 1차 코스 로컬 AI 시작하기 입문에서 다뤘고, 이 코스는 그 내용을 반복하지 않고 링크로 잇습니다. 도구 버전과 기본값은 2026년 9월 28일 공식 문서 기준이라, 올라마나 컴피UI를 업데이트한 뒤에는 달라진 부분이 있을 수 있습니다.
📚 다루는 개념 8가지
- 모델을 도구와 잇기: 로컬 모델 서빙 기초, 코딩 에이전트와 로컬 모델 연결
- 모델에 내 자료와 방식 더하기: 로컬 RAG 구성, 파인튜닝 기초와 LoRA
- 글 밖으로 넓히기: 로컬 음성 합성과 목소리 학습, 컴피UI로 로컬 이미지 생성
- 운영하기: 성능 측정과 모니터링, 보안과 백업
서빙 편을 먼저 읽으면 나머지 편에서 나오는 주소와 설정이 쉬워지고, 원격으로 쓸 계획이라면 보안 편을 함께 읽는 편이 좋습니다.
❓ 자주 묻는 질문
어느 정도 기기가 있어야 따라 할 수 있나요?
서빙과 RAG, 성능 측정은 작은 모델로도 따라 할 수 있습니다. 파인튜닝과 음성 미세조정, 큰 이미지 모델은 메모리를 많이 써서, 각 편에 실측한 기기와 메모리 사용량을 조건과 함께 적었습니다.
코드를 몰라도 되나요?
명령어와 설정 파일은 예시를 그대로 옮기면 되고, 코드가 나오는 곳은 RAG 편의 짧은 파이썬 예시 정도입니다. 컴피UI와 Open WebUI처럼 화면에서 쓰는 방법도 함께 적었습니다.
클라우드 AI 대신 로컬 AI만 쓰면 되나요?
용도에 따라 나눠 쓰는 편이 현실적입니다. 코딩 에이전트 연결 편에 적었듯 긴 자율 작업은 아직 클라우드 모델이 앞서고, 로컬은 밖으로 보내기 어려운 자료와 반복 작업에서 쓸모가 큽니다.
🔗 함께 보는 코스
- 로컬 AI 시작하기 입문: 로컬 AI의 뜻, 하드웨어, 모델 크기, 양자화, 올라마와 컴피UI 기초를 다룹니다
- 코딩 에이전트 입문: 클로드 코드, 코덱스 CLI 같은 코딩 에이전트와 권한 설정을 다룹니다
- AI 에이전트 중급: 원리와 설계: RAG와 에이전트 루프 같은 원리를 도구와 관계없이 다룹니다
3줄 요약
이번 방문에서 한 편은 바로 볼 수 있습니다.
로컬 모델 서빙 기초 (올라마 서버, OpenAI 호환 API, 동시 요청)
로컬 모델 서빙은 내 컴퓨터에서 돌리는 모델을 API 서버로 열어 다른 프로그램이 주소와 요청 형식만으로 쓰게 하는 일입니다. 올라마는 11434 포트에서 자체 API와 OpenAI 호환 API, Anthropic 호환 API를 함께 제공하고, 동시 요청 수와 컨텍스트 길이가 메모리 사용량을 정합니다.
코딩 에이전트와 로컬 모델 연결하기 (클로드 코드, 코덱스, 올라마)
코딩 에이전트를 로컬 모델에 연결한다는 것은 에이전트가 요청을 보내는 주소를 내 컴퓨터의 모델 서버로 바꿔, 파일 읽기와 명령 실행 같은 에이전트 동작을 로컬 모델의 판단으로 돌리는 일입니다. 도구 호출을 지원하는 모델과 64k 이상의 컨텍스트가 필요하고, 긴 작업에서는 품질과 속도의 한계가 분명합니다.
로컬 RAG 구성하기 (청크, 임베딩, 검색 품질 확인)
로컬 RAG 구성은 내 문서를 조각(청크)으로 나눠 내 컴퓨터의 임베딩 모델로 벡터를 만들고, 질문과 가까운 조각을 찾아 로컬 모델의 답에 붙이는 일을 모두 내 기기 안에서 하는 방식입니다. 만든 뒤에는 정답 조각이 검색 상위에 나오는지 질문 세트로 확인합니다.
파인튜닝 기초와 LoRA (데이터 준비, 언제 필요한지)
파인튜닝은 이미 학습된 모델에 내 예시 데이터를 더 학습시켜 답의 형식과 어투, 특정 작업 방식을 고정하는 일입니다. LoRA는 원래 가중치는 얼려 두고 작은 행렬 두 개만 학습해, 필요한 메모리와 결과 파일 크기를 크게 줄이는 파인튜닝 방법입니다.
로컬 음성 합성과 목소리 학습 (Qwen3-TTS, 동의와 표시)
로컬 음성 합성은 글을 음성으로 바꾸는 TTS 모델을 내 컴퓨터에서 돌리는 것이고, 목소리 학습은 몇 초짜리 참조 음성이나 수십 분 분량의 녹음으로 특정 사람의 목소리를 흉내 내게 만드는 것입니다. 목소리 주인의 동의를 받고, 결과물을 내보낼 때는 AI로 만든 음성임을 표시합니다.
컴피UI(ComfyUI)로 로컬 이미지 생성하기 (워크플로, 모델 폴더, VRAM)
컴피UI로 로컬 이미지를 생성한다는 것은 모델 파일을 정해진 models 폴더에 받아 두고, 노드를 이은 워크플로 파일을 불러와 내 컴퓨터의 GPU로 이미지를 만드는 일입니다. 모델마다 라이선스와 필요한 메모리가 달라서 받기 전에 두 가지를 먼저 확인합니다.
로컬 AI 성능 측정과 모니터링 (토큰 속도, 메모리, 온도)
로컬 AI 성능 측정은 같은 조건에서 입력 처리 속도와 생성 속도, 메모리 사용과 기기 상태를 기록해 비교하는 일이고, 모니터링은 이 값을 작업 중에 계속 지켜보는 일입니다. 올라마의 --verbose와 ollama ps, llama-bench, 운영체제의 모니터링 도구를 함께 씁니다.
로컬 AI 보안과 백업 (원격 접속 잠금, 모델과 데이터 보관)
로컬 AI 보안은 모델 서버와 원격 접속을 내 기기에서만 닿게 잠그고 모델 파일을 안전한 형식으로 받아 두는 일이고, 백업은 다시 받을 수 없는 데이터와 학습 결과를 골라 암호화해 따로 보관하는 일입니다. 로컬 모델 서버 상당수는 기본으로 인증 기능이 없어서 어디에 열려 있는지부터 확인합니다.

