AI 아부(Sycophancy) 알아보기: 모델이 동의만 하는 이유
홍승협(준이아빠) / 데이터 분석, AI 실무 교육
AI가 사용자의 의견, 감정에 맞춰 사실보다 동의를 선택하는 경향을 말합니다. 사용자가 틀린 답을 주장해도 "맞다"고 동의하거나, 칭찬, 비판에 답이 흔들리는 현상이 대표적인 예입니다.
이 글은 앤트로픽이 운영하는 Anthropic Academy의 AI Fluency 자료 중 모델 아부(Sycophancy) 관련 내용을 한국 입문자가 보기 편하게 정리한 글입니다. 원문 링크는 글 끝 참고 자료에 모았습니다.
🤔 AI가 내 편을 들어준다고요?
AI에게 의견을 물으면 거의 매번 "좋은 생각이네요"부터 시작하는 답을 받게 됩니다. "이 기획안 어때?"라고 물으면 좋은 점부터 길게 나오고, 약점을 따져달라고 해야 단점이 나옵니다.
처음에는 친절하게 느껴지지만, 일이 진지해지면 문제가 생깁니다. 잘못된 가설이나 틀린 분석을 그대로 동의해버리는 답이 반복되면, AI는 검증 도구가 아니라 동의 기계가 됩니다.
🔑 모델 아부, 무엇일까요?
모델 아부(Sycophancy)는 AI가 사용자의 의견, 감정에 맞춰 사실보다 동의를 선택하는 경향을 말합니다.
대형 언어 모델은 학습 단계에서 사람의 피드백을 받습니다(RLHF). 이 과정에서 사람은 "동의해주는 답"에 더 자주 좋은 점수를 주는 경향이 있고, 모델은 그 패턴을 그대로 학습합니다. 결과적으로 사용자가 원하는 방향으로 답을 기울이는 습관이 모델에 자리 잡습니다.
🚨 아부가 자주 나타나는 자리
다음 상황에서 아부가 두드러집니다.
- 사용자가 자기 의견을 먼저 말한 뒤 AI에게 평가를 요청할 때
- 사용자가 답에 불만을 표시한 뒤 다시 물을 때 ("아니야 다시 생각해봐")
- 칭찬, 격려, 동조 같은 감정 표현이 섞여 있을 때
- 사용자가 권위, 전문성을 내세울 때 ("나는 마케팅 10년차야")
이런 자리에서 AI는 객관적 분석보다 사용자에게 동의하는 답을 골라내기 쉽습니다.
🔍 아부를 알아채는 3가지 신호
1. 의견을 바꿨는데도 동의가 이어짐
- "이 안 좋지?"에 "맞다"고 답하고, "사실 별로 같지?"에도 "맞다"고 답하면 아부 신호입니다.
2. 약점, 반론이 너무 부드러움
- 분명한 약점을 짚어달라고 했는데도 "다만 이 부분은 더 보강하면 좋을 듯합니다" 같은 표현으로만 끝난다면 의심해야 합니다.
3. 자기 비판 회피
- "AI가 만든 답에 오류가 있는지 비판해 줘"라고 시켜도 진짜 오류를 잘 짚지 않으면, 모델이 자기 답을 보호하는 아부 패턴입니다.
🛡️ 아부를 줄이는 4가지 방법
1. 의견 없이 자료만 주기
- "내 의견은 X다, 어떻게 생각해?" 대신 "다음 자료를 분석해 약점을 5개 짚어 달라"고 분석 요청만 합니다.
2. 정반대 입장으로 다시 묻기
- 같은 자료를 "강점만 찾아줘"와 "약점만 찾아줘"로 두 번 따로 물어 결과를 비교합니다. 두 답에서 일관된 부분이 진짜 분석에 가깝습니다.
3. 역할 부여하기
- "이 분야 전문가이자 회의적인 검토자로서 답해 달라. 동의하는 평가는 금지하고, 약점만 짚어 달라"고 역할을 명시합니다.
4. 4D 프레임워크의 Discernment 적용
- 앤트로픽 AI Fluency 4D 프레임워크의 Discernment(분별력) 단계가 아부와 환각을 함께 다루는 도구입니다.
💼 아부가 가장 위험한 3가지 자리
1. 의사결정 자료 검토
- "이 안에 투자해도 될까?" 같은 결정형 질문에 AI가 동의해버리면, 사용자는 자기 의견의 근거를 강화한 셈이 되어 버립니다.
2. 보고서 자기 검수
- 자기가 쓴 글을 AI에 검수시키면 AI는 자연스럽게 글의 강점을 더 키우는 답을 내기 쉽습니다. 다른 사람의 시각에서 검수하도록 역할 부여가 필요합니다.
3. 데이터 해석
- "이 그래프에서 매출이 늘었다는 의미가 맞지?"라고 결론을 먼저 던지면 AI는 그 결론을 보강하는 해석만 만들어냅니다. 결론을 빼고 "이 그래프를 어떻게 해석할 수 있나?"로 물어야 합니다.
📋 3줄 요약
-
모델 아부는 AI가 사용자의 의견과 감정에 맞춰 사실보다 동의를 고르는 경향입니다.
-
사용자가 자기 의견을 먼저 말하거나 불만을 표시하며 다시 묻거나 경력을 내세울 때 특히 두드러집니다.
-
의견을 빼고 자료만 준 뒤 약점을 짚어 달라고 하고 정반대 입장으로 한 번 더 물어 답이 달라지는지 봅니다.
📚 참고 자료
- What is sycophancy in AI models? (Anthropic Academy): https://claude.com/resources/tutorials
- Anthropic Academy: https://www.anthropic.com/learn
- Constitutional AI 연구 소개: https://www.anthropic.com/research/constitutional-ai-harmlessness-from-ai-feedback
이 글이 도움이 되셨다면 공유해 주세요
메신저로 바로 보내거나 링크를 복사할 수 있습니다.
AI에게 보고서 초안을 보여주면서 "이 부분은 좀 약한 것 같지?"라고 물었더니 즉시 "네 맞습니다, 약합니다"라고 답합니다. 이 답이 신뢰할 만한지 확인하는 가장 좋은 방법은 무엇일까요?
이어서 배우면 좋은 개념
할루시네이션(환각, Hallucination) 알아보기
AI가 사실이 아닌 내용을 사실처럼 자신 있게 만들어내는 현상입니다. 출처가 없는 통계, 존재하지 않는 논문 인용, 실제 인물을 둘러싼 거짓 일화가 대표적인 예입니다.
책임감 있는 AI 사용 익히기
AI를 일에 쓸 때 사실 검증, 개인정보 보호, 법적 책임, 편향 점검을 본인이 책임지는 태도와 절차를 말합니다. AI는 도구이고, 그 결과의 책임은 사용자에게 있습니다.
AI Fluency 4D 프레임워크 (4단계) 알아보기
앤트로픽이 제안하는 AI 활용 행동 프레임워크입니다. 무엇을 맡길지(Delegation), 어떻게 설명할지(Description), 결과를 어떻게 분별할지(Discernment), 책임감 있게 다룰지(Diligence) 네 단계로 구성됩니다.
생성형 엔진 최적화 (GEO) 이해하기
생성형 엔진 최적화(GEO)는 챗GPT, 제미나이 같은 AI가 만드는 답변에 내 콘텐츠가 인용되도록 만드는 작업입니다.
관련 인사이트
- AI 생산성 역설, 일이 늘어난 게 아니라 눈높이가 올라간 것AI 생산성 역설은 개인의 작업 속도는 빨라졌는데 조직의 생산성 지표는 거의 움직이지 않는 현상입니다. 일하는 시간이 늘었다는 말이 함께 나오는 배경을, 속도가 느려진 쪽이 아니라 그동안 넘어가던 품질을 이제야 챙기기 시작한 쪽에서 살펴봤습니다.
- BYOK 뜻과 AI 도구에서 쓰이는 상황: 내 API 키로 쓰기와 암호화 키 직접 관리BYOK(Bring Your Own Key)는 도구가 정해 준 계정 대신 내가 직접 받은 API 키나 암호화 키를 가져와 쓰는 방식입니다. AI 도구의 설정 화면에 자주 보이는 이 말이 어디서 왔는지, 구독과 무엇이 다른지, 개인과 코딩 도구와 회사와 도구 제작자의 네 가지 상황에서 어떤 판단이 필요한지 2026년 9월 기준으로 정리했습니다.
- 클로드 커머스 에이전트 정리: 쇼핑 에이전트와 판매자 에이전트가 하는 일과 GA4 측정클로드 커머스 에이전트(Claude Commerce Agents)는 앤트로픽이 2026년 9월 2일 공개한, 쇼핑 에이전트와 판매자 에이전트를 만드는 공개 청사진입니다. 두 에이전트가 무엇을 하고 무엇을 하지 않는지, 결제를 뺀 설계가 챗GPT와 구글의 접근과 어떻게 다른지, 장바구니 35%와 구매 완료 60%라는 수치를 어떻게 읽을지, 에이전트가 만든 방문과 주문이 GA4에서 어디로 잡히는지 정리했습니다.
- 힉스필드 N3on 무한 AI 라이브 정리: GPT-6 아스트라로 24시간 돌아가는 AI 스트리머의 실제힉스필드 무한 AI 라이브는 힉스필드가 만들고 GPT-6 아스트라가 움직이는, 스트리머 N3on의 모습을 실시간으로 계속 생성하는 킥 방송입니다. 2026년 9월 7일 시작된 이 방송이 어떻게 굴러가는지, 무한이라는 말과 달리 킥 채널에 남은 실제 길이는 얼마인지, 처음이 아니라는 커뮤니티 노트와 팔아넘겼다는 반응은 무엇인지, 스트리머와 마케터에게 무엇이 남는지 정리했습니다.
- 오픈클로 2.0에서 달라진 것과 업그레이드 전 확인할 점오픈클로 2.0은 오픈클로 재단이 2026년 8월 30일 공개한 개인 AI 에이전트 v2026.8.1입니다. 혼자 쓰던 도구에 여러 사람이 같은 세션으로 들어오는 공유 기능이 붙었고, 저장 방식이 SQLite로 바뀌면서 업그레이드가 막히는 문제도 함께 보고됐습니다.
- SSOT(Single Source of Truth) 뜻과 AI 시대에 문서를 한곳에서만 고쳐야 하는 이유SSOT(Single Source of Truth)는 하나의 정보를 한곳에서만 고치고 나머지 곳은 전부 그곳을 참조하게 만드는 원칙입니다. 데이터베이스 설계에서 나온 이 말이 지표 정의서와 노션 문서, 클로드 코드의 CLAUDE.md까지 이어지는 이유와 작은 팀에서 만드는 순서를 정리했습니다.
