AI & Tech

Kimi K3, Claude Fable 5, GPT-5.6 Sol 비교: 모델별 장점 정리

2026년 7월에 출시된 Kimi K3와 Claude Fable 5, GPT-5.6 Sol의 스펙, 벤치마크, 가격, 커뮤니티 반응을 비교하고 작업 성격별 선택 기준을 정리합니다.

2026년 6월과 7월 사이에 최상위 AI 모델 세 개가 연이어 나왔습니다. 6월 9일 Anthropic의 Claude Fable 5, 7월 9일 OpenAI의 GPT-5.6 Sol, 그리고 7월 16일 중국 Moonshot AI의 Kimi K3입니다. 세 모델의 공식 발표 자료와 벤치마크, 커뮤니티 반응을 바탕으로 각 모델의 장점과 선택 기준을 정리했습니다.

앤트로픽 공식 벤치마크 표. Claude Fable 5가 SWE-Bench Pro 80.3%, GDPval-AA 1932점 등 대부분 항목에서 Claude Opus 4.8, GPT-5.5, Gemini 3.1 Pro를 앞서는 결과

위 이미지는 Anthropic이 Fable 5 발표 페이지에 공개한 공식 벤치마크 표입니다. 이 표에는 그 이후에 나온 GPT-5.6 Sol과 Kimi K3가 없기 때문에, 아래에서 세 모델을 같은 기준으로 다시 비교하겠습니다.

세 모델은 어떤 배경에서 나왔을까요?

2026년 7월 기준으로 세 모델의 기본 정보를 표로 정리하면 다음과 같습니다.

항목Kimi K3Claude Fable 5GPT-5.6 Sol
개발사Moonshot AI (중국)Anthropic (미국)OpenAI (미국)
출시일2026년 7월 16일2026년 6월 9일2026년 7월 9일 정식 출시
구조약 2.8조 파라미터 MoE비공개비공개
컨텍스트 창100만 토큰비공개 (수백만 토큰 규모 장기 작업 지원)비공개
가중치 공개2026년 7월 27일까지 공개 예고미공개미공개
입력 가격 (100만 토큰)$3 (캐시 적중 시 $0.30)$10$5
출력 가격 (100만 토큰)$15$50$30
  • Claude Fable 5: Anthropic이 Opus보다 위에 새로 만든 Mythos급 체계의 첫 일반 공개 모델입니다. 안전장치를 제거한 Claude Mythos 5와 같은 모델을 공유하며, Mythos 5는 승인된 기관에만 제공됩니다.
  • GPT-5.6 Sol: OpenAI의 GPT-5.6 제품군 중 최상위 모델입니다. 아래로 중간 등급 Terra, 경량 등급 Luna가 함께 나왔습니다.
  • Kimi K3: Moonshot AI의 최상위 모델로, K3 Max와 대규모 병렬 처리용 K3 Swarm Max 두 가지로 출시됐습니다.

Kimi K3는 어떤 모델이고 무엇이 강할까요?

MoE라는 용어가 낯설 수 있습니다. 쉽게 말하면 모델 전체를 한 번에 쓰지 않고, 질문마다 필요한 전문가 조각만 골라 쓰는 구조입니다. Kimi K3는 총 2.8조 파라미터 규모에 896개의 전문가 조각을 두고, 토큰마다 그중 16개(약 1.8%)만 활성화합니다. 덕분에 규모는 역대 최대 수준이면서 실행 비용은 낮게 유지합니다.

공개된 정보 기준으로 Kimi K3의 강점은 세 가지입니다.

  • 오픈 웨이트 공개 예고: 2026년 7월 27일까지 모델 가중치를 공개하겠다고 예고했습니다. 공개되면 역대 가장 큰 오픈 웨이트 모델이 됩니다. 가중치가 공개되면 기업이 자체 서버에서 직접 운영할 수 있습니다.
  • 프런트엔드 코딩: 개발자들이 결과물만 보고 투표하는 Arena의 Frontend Code 평가에서 1,679점으로 1위를 기록해 Fable 5를 앞섰습니다.
  • 가격 대비 성능: 출력 100만 토큰당 $15로 Fable 5($50)의 3분의 1 수준입니다. 벤치마크 집계 자료에서는 작업당 평균 비용이 약 $0.94로, Claude Opus 4.8(약 $1.80)의 절반 수준이라는 분석이 있습니다.

다만 절대 성능이 1위는 아닙니다. Moonshot AI가 직접 공개한 벤치마크에서도 Kimi K3는 Claude Opus 4.8과 GPT-5.5보다는 대체로 앞서지만, Claude Fable 5와 GPT-5.6 Sol에는 밀리는 결과를 보였습니다. 자동화 관련 평가(AutomationBench, SpreadsheetBench 2, BrowseComp 등) 8개 중 4개에서 1위를 기록했다는 발표도 있어, 에이전트형 작업에서는 최상위권과 겨루는 수준으로 보입니다.

Kimi K3가 SVG 코드로 그린 자전거 타는 펠리컨 그림. 파란 하늘과 도로 배경에 흰 펠리컨이 빨간 자전거를 타고 있는 벡터 일러스트

위 이미지는 개발자 Simon Willison이 Kimi K3에 "자전거 타는 펠리컨을 SVG 코드로 그려 달라"고 요청해 받은 결과물입니다. 이 테스트는 그가 새 모델이 나올 때마다 반복하는 기본 능력 확인용 테스트인데, Kimi K3는 한 번의 요청에 13,241개의 추론 토큰을 사용해 비용이 약 25센트 나왔다고 합니다. 결과물 품질은 준수하지만 추론 토큰을 많이 쓰는 편이라는 특성이 여기서도 드러납니다.

Claude Fable 5의 장점은 무엇일까요?

Fable 5의 장점은 절대 성능, 그중에서도 길고 복잡한 작업에서의 성능입니다. Anthropic 공식 발표 기준 주요 결과는 다음과 같습니다.

  • 에이전트 코딩: SWE-Bench Pro 80.3%로 Claude Opus 4.8(69.2%), GPT-5.5(58.6%), Gemini 3.1 Pro(54.2%)를 앞섰습니다. Terminal-Bench 2.1에서도 88.0%를 기록했습니다.
  • 지식 노동: 실제 직업 업무를 평가하는 GDPval-AA에서 1932점으로 비교 대상 중 가장 높았습니다.
  • 장기 자율 작업: 수백만 토큰에 걸친 장기 작업에서 파일 기반 메모리를 활용해 성능을 유지한다고 발표했습니다. 작업이 길고 복잡할수록 다른 모델과의 격차가 커진다는 것이 Anthropic의 설명입니다.

가격은 셋 중 가장 비쌉니다. 입력 $10, 출력 $50으로 GPT-5.6 Sol의 약 1.7배, Kimi K3의 약 3.3배입니다. 또 하나 알아 둘 점은 안전장치입니다. 사이버보안과 생물학 관련 일부 질문은 Fable 5 대신 Claude Opus 4.8이 응답하도록 설계되어 있으며, Anthropic은 이 장치가 평균적으로 전체 세션의 5% 미만에서 작동한다고 밝혔습니다.

GPT-5.6 Sol의 장점은 무엇일까요?

Sol의 장점은 효율입니다. OpenAI는 Artificial Analysis Coding Agent Index에서 Sol이 80점으로 새로운 최고 기록을 세웠고, 이는 Fable 5보다 2.8점 높은 수치라고 발표했습니다. 주목할 부분은 점수 자체보다 조건입니다. 절반 이하의 출력 토큰과 절반 이하의 시간으로 이 점수를 냈고, 비용은 약 3분의 1 수준이었습니다.

정리하면 Sol의 강점은 다음과 같습니다.

  • 코딩 효율: 이전 세대 대비 코딩 작업에서 토큰 효율이 54% 개선됐다고 발표했습니다. 같은 작업을 더 적은 토큰과 시간으로 처리합니다.
  • 사이버보안 방어 작업: 위협 모델링, 코드 리뷰, 패치, 방어 훈련 시뮬레이션 같은 방어 목적 보안 업무에 특화됐다고 소개합니다.
  • 제품군 구성: 최상위 Sol 아래에 Terra($2.50/$15), Luna($1/$6)가 있어 작업 난도에 따라 같은 제품군 안에서 등급을 내려 비용을 줄일 수 있습니다.

Kimi K3에 대한 커뮤니티 반응은 어떨까요?

Hacker News 등 개발자 커뮤니티의 반응을 종합하면 기대와 회의가 함께 존재합니다. 커뮤니티 의견은 개인 경험 기반이므로 참고 수준으로 보는 것이 좋습니다.

긍정적인 반응은 크게 두 갈래입니다.

  • 오픈 웨이트의 의미: 최상위권 성능의 모델이 가중치 공개를 예고한 것 자체를 큰 사건으로 받아들이는 분위기가 있습니다. 데이터 주권이나 자체 운영이 중요한 기업에는 실질적인 선택지가 생기기 때문입니다.
  • 가격 대비 만족도: "비용을 신경 쓰지 않아도 될 만큼 저렴하다, 중국 모델 중 가장 마음에 든다"는 사용 후기가 있습니다.

회의적인 반응도 있습니다.

  • 추론 토큰 과다 사용: 추론 과정에서 같은 내용을 반복해 다시 생각하는 패턴으로 토큰을 많이 소모한다는 지적이 있습니다.
  • 벤치마크와 실사용의 격차: "벤치마크에서는 몇 달 전 Opus만큼 좋다고 하는데, 복잡한 작업에 써 보면 그만큼 잘 되지 않는다"는 의견이 있습니다.
  • 요금제 불투명성: 구독 요금제의 사용량 한도가 명확하지 않다는 불만이 있습니다.

한편 가격을 두고는 시각이 갈립니다. 미국 모델 대비로는 저렴하지만, 같은 중국 모델인 GLM-5.2(출력 $4.40)나 DeepSeek V4(출력 $0.87)와 비교하면 Kimi K3의 출력 $15는 비싼 편이라는 비교도 있습니다.

실무에서는 어떤 기준으로 골라야 할까요?

벤치마크 순위보다 작업 성격이 기준이 되어야 합니다. 실무 시나리오 하나로 예를 들어 설명하겠습니다. GA4 데이터를 매일 수집해 보고서를 만드는 자동화 에이전트를 만든다고 가정하면, 단계마다 적합한 모델이 다릅니다.

  • 초기 설계와 복잡한 리팩터링: 파이프라인 전체 구조를 잡거나 여러 파일에 걸친 코드를 고치는 작업은 길고 복잡한 작업에 강한 Fable 5가 유리합니다. 실수를 되돌리는 비용이 크기 때문에 모델 단가보다 결과 품질이 중요합니다.
  • 매일 돌아가는 반복 작업: 하루에 수백 번 실행되는 보고서 생성처럼 비용이 누적되는 작업은 토큰 효율이 좋은 GPT-5.6 Sol이나 한 등급 아래 Terra가 적합합니다.
  • 데이터를 외부로 보낼 수 없는 환경: 고객 데이터를 외부 API로 보낼 수 없는 보안 요건이 있다면, 가중치가 공개된 뒤의 Kimi K3를 자체 서버에서 운영하는 선택지를 검토할 수 있습니다.
  • 화면 만들기: 대시보드 화면처럼 프런트엔드 결과물이 중요한 작업은 Frontend Code 평가 1위인 Kimi K3를 시험해 볼 만합니다.

마지막으로, 어떤 모델이든 도입 전에 실제로 쓰는 작업 한두 개를 골라 직접 비교해 보는 것이 좋습니다. 벤치마크는 평균적인 경향을 보여줄 뿐, 특정 업무에서의 성능 차이는 직접 확인해야 알 수 있습니다.

3줄 요약:

  • Claude Fable 5는 길고 복잡한 작업에서의 절대 성능, GPT-5.6 Sol은 토큰과 시간 효율, Kimi K3는 오픈 웨이트 공개 예고와 가격이 각각의 장점입니다.
  • Kimi K3는 Opus 4.8과 GPT-5.5보다는 대체로 앞서지만 Fable 5와 Sol에는 밀리며, 프런트엔드 코딩과 에이전트형 작업에서는 최상위권과 겨루는 수준입니다.
  • 모델 선택은 벤치마크 순위가 아니라 작업 성격(복잡도, 반복 횟수, 보안 요건)을 기준으로 하고, 실제 업무로 직접 비교한 뒤 결정하는 것이 좋습니다.

Sources

다음으로 읽어볼 글

퀴즈

2026년 7월 기준, 세 모델 중 오픈 웨이트(모델 가중치) 공개가 예고된 모델은 무엇일까요?