RAG(검색 증강 생성) 뜻과 파인튜닝의 차이
RAG(Retrieval-Augmented Generation, 검색 증강 생성)는 모델이 답을 만들기 전에 학습 데이터 밖의 자료를 찾아 질문에 붙여 주는 방식입니다. 모델 자체를 바꾸는 파인튜닝과 달리 모델에 들어가는 입력만 바꿉니다.
같은 말:RAG 뜻검색 증강 생성RAG 파인튜닝 차이파인튜닝Retrieval-Augmented Generation
목차
🤔 회사 문서를 AI에 물리려는데 방법이 두 가지로 나뉠 때
사내 규정이나 제품 매뉴얼을 근거로 AI가 답하게 만들고 싶을 때 가장 먼저 부딪히는 말이 RAG와 파인튜닝입니다. 둘 다 모델에 우리 자료를 알려 주는 방법처럼 들리지만, 바꾸는 대상이 다릅니다. 잘못 고르면 매주 바뀌는 요금표 때문에 모델을 매주 다시 학습시키거나, 답 형식이 매번 달라지는 문제를 자료만 더 붙여서 풀려는 일이 생깁니다.
에이전트에게도 이 구분은 중요합니다. 에이전트가 사내 문서를 찾아 읽고 판단하게 하려면 어떤 자료를 언제 어떻게 가져올지부터 정해야 하기 때문입니다. 이 편에서는 RAG가 무엇이고 파인튜닝과 어디서 달라지는지, 어떤 순서로 고르는지를 정리합니다. 고르는 기준 다섯 가지와 GraphRAG는 RAG와 파인튜닝 차이 정리에 더 자세히 있습니다.
🔑 RAG의 정의
RAG(Retrieval-Augmented Generation, 검색 증강 생성)는 모델이 답을 만들기 전에 학습 데이터 밖의 자료를 찾아 질문에 붙여 주는 방식입니다.
AWS 공식 설명은 RAG를 대규모 언어 모델이 답을 만들기 전에 학습 데이터 밖의 신뢰할 수 있는 지식 기반을 참조하게 해 출력을 개선하는 과정으로 정의합니다. 핵심은 모델을 건드리지 않는다는 점입니다. 모델은 그대로 두고, 모델에 들어가는 입력에 찾아온 자료를 덧붙입니다.
파인튜닝(fine-tuning)은 반대 방향입니다. 입력과 출력 예시를 모아 이미 완성된 모델에 추가로 학습시켜, 모델이 그 형식과 어투와 판단 방식을 따르게 만듭니다. 모델 자체가 바뀝니다.
📚 오픈북 시험과 몸에 밴 습관
시험에 비유하면 차이가 분명해집니다. RAG는 오픈북 시험입니다. 문제를 받으면 참고서에서 관련 쪽을 찾아 펼쳐 놓고 답을 씁니다. 참고서가 새 판으로 바뀌면 새 책을 들고 들어가면 되고, 답에 몇 쪽을 봤는지 적을 수도 있습니다.
파인튜닝은 시험 전에 답안 쓰는 연습을 반복해 습관을 들이는 쪽입니다. 서론, 본론, 결론 순서로 쓰는 습관은 몸에 배지만, 연습할 때 없던 새 사실을 알게 되지는 않습니다. 내용이 바뀌면 다시 연습해야 하고, 답의 어느 부분이 어떤 연습에서 왔는지 가리키기도 어렵습니다.
| 항목 | RAG | 파인튜닝 |
|---|---|---|
| 바꾸는 대상 | 모델에 들어가는 입력 | 모델 자체 |
| 잘하는 일 | 최신 자료 반영, 출처 표시 | 형식 고정, 어투 통일, 분류 일관성 |
| 자료가 바뀔 때 | 검색 색인만 다시 만듭니다 | 다시 학습해야 합니다 |
| 출처 표시 | 가능합니다 | 어렵습니다 |
| 준비물 | 정리된 문서와 검색 장치 | 잘 만든 입출력 예시 |
🔁 RAG가 도는 네 단계
RAG는 미리 해 두는 준비 두 단계와 질문마다 도는 두 단계로 이뤄집니다.
- 문서를 조각냅니다: 긴 문서를 청크(chunk)라고 부르는 작은 조각으로 나눕니다. 한 번에 다 넣을 수 없는 양을 필요한 부분만 꺼내 쓰기 위해서입니다
- 조각을 색인에 넣습니다: 조각마다 임베딩을 만들어 저장합니다. 임베딩은 글의 뜻을 숫자 목록으로 바꾼 것이라, 뜻이 가까운 글끼리 숫자도 가깝게 나옵니다
- 질문으로 찾습니다: 질문도 같은 방식으로 숫자로 바꾼 뒤 가까운 조각을 찾아옵니다. 단어가 그대로 일치하는지 보는 검색을 함께 쓰기도 합니다
- 찾은 조각을 붙여 답을 만듭니다: 질문과 찾아온 조각을 함께 모델에 보내고, 모델은 그 자료를 근거로 답합니다
에이전트에서는 3번이 도구 호출로 들어갑니다. 에이전트가 문서 검색 도구를 필요할 때 불러 자료를 가져오는 구조입니다. 앤트로픽은 에이전트 개발 도구를 소개하면서, 뜻으로 찾는 검색을 붙이기 전에 에이전트가 파일을 직접 검색하고 필요한 부분만 읽는 방식부터 시작하라고 권했습니다. 코드 저장소처럼 파일 이름과 폴더가 잘 정리된 자료는 이 방식으로도 충분한 경우가 많습니다.
🧭 프롬프트, RAG, 파인튜닝을 고르는 순서
RAG와 파인튜닝 가운데 하나를 고르기 전에 더 간단한 방법이 두 가지 있습니다.
먼저 자료를 통째로 넣을 수 있는지 봅니다. 앤트로픽은 지식 기반이 20만 토큰(약 500쪽) 아래라면 RAG 없이 자료 전체를 프롬프트에 넣어도 된다고 설명합니다. 같은 자료를 반복해서 보내는 비용은 프롬프트 캐시로 줄일 수 있고, 앤트로픽은 이 조합으로 응답 시간을 두 배 넘게 줄이고 비용을 최대 90% 줄일 수 있다고 밝혔습니다. 모델이 한 번에 볼 수 있는 양에는 컨텍스트 윈도우라는 한계가 있으니 그 안에 들어가는지가 기준입니다.
다음으로 지시문을 다듬습니다. OpenAI 모델 최적화 안내는 먼저 결과를 측정할 평가를 만들고, 프롬프트 엔지니어링만으로 충분할 수도 있다고 적고 있습니다. 파인튜닝 안내도 평가를 먼저 만들고 난 뒤에 파인튜닝에 투자하라고 강조합니다.
그다음 순서는 이렇게 정리됩니다.
| 상황 | 먼저 검토할 방식 |
|---|---|
| 자료가 20만 토큰 아래이고 자주 안 바뀝니다 | 자료 전체를 프롬프트에 넣고 캐시를 씁니다 |
| 자료가 많거나 자주 바뀌고 출처를 보여 줘야 합니다 | RAG |
| 답의 형식과 어투가 매번 달라집니다 | 지시문과 예시를 다듬고, 그래도 안 되면 파인튜닝 |
| 없는 지식을 채워야 합니다 | RAG. 파인튜닝은 지식을 넣는 데 맞지 않습니다 |
파인튜닝을 검토한다면 조건 하나를 먼저 확인해야 합니다. OpenAI 지도 파인튜닝 안내는 최소 예시 10개, 개선이 보이는 구간으로 50개에서 100개를 들고 있지만, 2026년 9월 28일 기준 같은 문서에 OpenAI가 파인튜닝 플랫폼을 단계적으로 종료하고 있으며 새 사용자는 더 이상 쓸 수 없다는 안내가 붙어 있습니다. 파인튜닝을 제공하는 곳과 조건은 공급사마다 달라지고 있어서, 시작 전에 해당 공급사의 현재 문서를 확인해야 합니다.
🔧 RAG의 성능은 검색이 정합니다
RAG를 붙였는데 답이 시원치 않다면 모델보다 검색부터 봅니다. 앤트로픽은 2024년 9월 공개한 맥락 검색(Contextual Retrieval) 기법에서 검색 방식에 따라 실패율이 얼마나 달라지는지 수치로 밝혔습니다. 실패율은 관련 조각이 상위 20개 검색 결과에 들어오지 못한 비율입니다.
| 검색 구성 | 검색 실패율 | 기존 방식 대비 |
|---|---|---|
| 기존 조각 검색 | 5.7% | 기준 |
| 조각마다 맥락 설명을 붙인 임베딩 | 3.7% | 35% 감소 |
| 위에 단어 일치 검색(BM25)을 더함 | 2.9% | 49% 감소 |
| 위에 결과 재정렬을 더함 | 1.9% | 67% 감소 |
맥락 설명은 "이 조각은 2024년 2분기 실적 보고서의 매출 부분"처럼 조각이 어디서 왔는지 알려 주는 한두 문장입니다. 조각을 자르면서 잃어버린 앞뒤 사정을 되살려 주는 셈입니다. 같은 문서와 같은 모델이라도 검색을 어떻게 만드느냐에 따라 실패율이 세 배 차이 납니다.
⚠️ RAG를 붙일 때 자주 하는 실수
- 문서 정리 없이 붙입니다: 같은 내용의 문서가 여러 판으로 흩어져 있으면 낡은 판이 검색되어 답에 들어갑니다
- 검색 결과를 확인하지 않습니다: 답이 틀렸을 때 모델이 틀린 것인지, 애초에 엉뚱한 조각을 찾아온 것인지를 나눠 봐야 고칠 곳이 보입니다
- 형식 문제를 RAG로 풀려 합니다: 답의 형식이 들쭉날쭉한 문제는 자료를 더 붙여도 해결되지 않습니다
- 출처를 버립니다: RAG의 큰 장점이 근거 문서를 보여 줄 수 있다는 점인데, 답만 남기면 사람이 확인할 방법이 사라집니다
❓ 자주 묻는 질문
사내 문서를 AI가 읽게 하려면 파인튜닝을 해야 하나요?
대부분은 RAG가 맞습니다. AWS 설명처럼 조직의 자료를 위해 모델을 다시 학습시키는 것보다 RAG가 비용 면에서 유리하고, 문서가 바뀌어도 색인만 다시 만들면 됩니다. 자료가 많지 않다면 RAG도 없이 프롬프트에 통째로 넣는 방법부터 봅니다.
클로드 프로젝트에서 RAG를 따로 켜야 하나요?
켤 필요가 없습니다. 앤트로픽 도움말은 클로드 프로젝트에 올린 자료가 컨텍스트 한계에 가까워지면 RAG가 자동으로 켜지고, 저장할 수 있는 분량이 최대 10배까지 늘어난다고 설명합니다. 2026년 9월 28일 기준 유료 플랜에서 제공됩니다.
RAG를 쓰면 할루시네이션이 사라지나요?
줄어들 수는 있지만 사라지지는 않습니다. 엉뚱한 조각을 찾아오면 모델은 그 자료를 근거로 그럴듯한 답을 만들고, 찾아온 자료에 없는 내용을 덧붙이기도 합니다. 출처를 함께 보여 주게 해서 사람이 근거를 확인할 수 있게 두는 편이 안전합니다. 원인은 할루시네이션에서 다뤘습니다.
📋 3줄 요약
-
RAG는 모델이 답을 만들기 전에 학습 데이터 밖의 자료를 찾아 질문에 붙여 주는 방식이고 모델 자체를 바꾸는 파인튜닝과 달리 입력만 바꿉니다.
-
앤트로픽 실험에서 문서 조각에 맥락 설명을 붙이고 단어 일치 검색과 재정렬을 더하자 검색 실패율이 5.7%에서 1.9%로 67% 줄었습니다.
-
자료가 20만 토큰 아래면 프롬프트에 통째로 넣는 편이 간단하고 자주 바뀌는 자료와 출처 표시가 필요하면 RAG, 답하는 형식을 고정할 때만 파인튜닝을 검토합니다.
📚 참고 자료
- AWS, What is RAG: https://aws.amazon.com/what-is/retrieval-augmented-generation/
- 앤트로픽, Introducing Contextual Retrieval (2024-09-19): https://www.anthropic.com/news/contextual-retrieval
- OpenAI, Model optimization: https://developers.openai.com/api/docs/guides/model-optimization
- OpenAI, Supervised fine-tuning: https://developers.openai.com/api/docs/guides/supervised-fine-tuning
- 앤트로픽 도움말, RAG for Projects: https://support.claude.com/en/articles/11473015-retrieval-augmented-generation-rag-for-projects

제대로 이해했는지 한 문제로 확인해 볼까요?
답을 고르면 바로 풀이가 나와요.
매주 바뀌는 요금표와 환불 규정을 근거로 고객 문의에 답하고, 답마다 어느 문서를 참고했는지 함께 보여 줘야 합니다. 먼저 검토할 방식은 무엇일까요?

