AI & Tech

업스테이지 Solar Open 2, Solar Pro 4 정리: 벤치마크와 클로드 코드 연동

Solar Open 2는 업스테이지가 2026년 7월 22일 가중치까지 공개한 250B 규모의 오픈웨이트 언어 모델입니다. 공식 벤치마크에서 이긴 항목과 뒤진 항목, 클로드 코드에 연결하는 공식 방법, 8월 6일 공개된 상용 모델 Solar Pro 4와의 역할 차이를 정리했습니다.

Share
업스테이지 Solar Open 2, Solar Pro 4 정리: 벤치마크와 클로드 코드 연동 대표 이미지

Solar Open 2는 업스테이지가 2026년 7월 22일 가중치까지 공개한 250B 규모의 오픈웨이트 언어 모델입니다. Solar Pro 4는 같은 회사가 2026년 8월 6일 API로 공개한 상용 모델이고, 이쪽은 가중치를 공개하지 않았습니다. 2주 남짓한 간격으로 성격이 다른 두 모델이 나왔고, 그 사이에 정부의 독자 AI 파운데이션 모델 사업 2차 평가가 걸려 있습니다.

국산 모델 소식은 자주 나오지만 실제로 무엇을 할 수 있는지까지 확인하기는 번거롭습니다. 이 글에서는 업스테이지 공식 블로그와 허깅페이스 모델 카드에 공개된 수치를 근거로, Solar Open 2가 어떤 항목에서 이기고 어떤 항목에서 뒤졌는지, 클로드 코드에 어떻게 연결하는지, Solar Pro 4는 어떤 자리를 맡는지 정리하겠습니다.

지능 지수 차트에서 업스테이지 모델이 놓여 있던 위치

먼저 배경부터 봅니다. 아래 차트는 여러 모델을 평가 시점 순서로 놓고 지능 지수(AAII)를 표시한 것입니다. 빨간 박스가 업스테이지 모델입니다.

모델별 지능 지수를 평가 날짜순으로 표시한 계단 차트, 빨간 박스로 표시된 업스테이지 모델 3개가 하단에 위치

업스테이지 모델은 세 지점에 있습니다. Solar Mini가 2024년 1월, Solar Pro 2가 2025년 6월, Upstage Open이 2025년 12월입니다. 셋 다 차트 아래쪽에 모여 있고, 같은 시기 상위 모델들과 간격이 뚜렷합니다.

이 차트에는 이번에 나온 Solar Open 2와 Solar Pro 4가 아직 없습니다. 한국 오픈 모델 중 가장 최근 지점은 모티프테크놀로지스의 Motif3 Beta입니다. 두 회사 모두 정부 독자 AI 파운데이션 모델 사업의 평가 대상이고, 국민 평가단 200명의 평가가 8월 8일부터 11일까지 진행됩니다. 4개 팀을 3개 팀으로 좁히는 2차 평가 결과는 이르면 8월 12일에 나올 예정이라고 보도됐습니다.

Solar Open 2의 공식 벤치마크에서 이긴 항목과 뒤진 항목

업스테이지가 공개한 벤치마크 결과입니다. 진한 보라색 막대가 Solar Open 2입니다.

업스테이지가 공개한 Solar Open 2 벤치마크 차트 모음, 지식과 추론, 에이전트, 한국어 세 묶음으로 나뉘어 항목별 막대그래프가 배치됨

허깅페이스 모델 카드의 표를 기준으로 항목별 결과를 정리하면 다음과 같습니다.

벤치마크무엇을 재는가Solar Open 2비교군 최고
MMLU-Pro전반적 지식과 추론86.2 (1위)DeepSeek-V4-Flash 85.9
LiveCodeBench v6코딩 문제 해결92.4 (1위)DeepSeek-V4-Flash 92.3
APEX-Agents에이전트 종합 수행16.6 (1위)MiMo-V2.5 13.4
MCP-Atlas도구 호출 정확도58.2 (공동 2위)MiMo-V2.5 63.9
SWE-Bench Verified실제 코드 저장소 수정70.4 (3위)DeepSeek-V4-Flash 73.8
Terminal Bench Hard터미널 작업 수행28.3 (4위)MiMo-V2.5 41.7
CLIcK한국 문화와 상식90.7 (1위)DeepSeek-V4-Flash 89.2
Ko-GDPval한국어 실무 산출물86.8 (1위)DeepSeek-V4-Flash 85.0

지식과 코딩 문제 풀이, 한국어 항목에서는 비교군 안에서 1위입니다. 반면 실제 코드 저장소를 고치는 SWE-Bench Verified에서는 3위, 터미널 작업을 수행하는 Terminal Bench Hard에서는 4위입니다. 도구 호출을 재는 MCP-Atlas도 MiMo-V2.5에 5.7점 뒤집니다.

여기서 확인해야 할 것이 하나 더 있습니다. 비교 대상으로 고른 모델이 어느 급인가입니다. 공식 차트의 범례는 open models (Under 320B)fast-tier closed models입니다. 오픈 모델은 320B 미만으로 제한했고, 상용 모델은 Claude Haiku 4.5와 GPT-5.4 mini 같은 경량 모델을 놓았습니다. 최상위 상용 모델은 비교군에 없습니다. 따라서 이 수치는 그 범위 안에서 나온 순위이고, 발표 자체는 정직하게 범례로 이 조건을 표시하고 있습니다.

에이전트 벤치마크 4종이 각각 재는 것

에이전트 벤치마크는 지식 벤치마크보다 상대적으로 낯설 수 있습니다. 쉽게 말하면 모델이 답을 얼마나 아는지가 아니라, 도구를 써서 일을 끝까지 해내는지를 재는 시험입니다. 네 가지가 서로 다른 것을 측정합니다.

  • APEX-Agents: 여러 단계를 거치는 업무를 끝까지 수행하는지 종합적으로 평가합니다. 점수대가 전반적으로 낮습니다. 비교군 여섯 모델이 모두 20점 아래이고, 그중 Solar Open 2가 16.6으로 가장 높습니다. 절대 점수가 낮은 것은 이 시험이 어렵다는 뜻이지 모델만의 문제는 아닙니다.
  • MCP-Atlas: 모델 컨텍스트 프로토콜(MCP)로 연결된 도구를 정확히 골라 호출하는지 확인합니다. 외부 도구를 붙여 쓸 계획이라면 이 항목이 실제 사용감에 가깝습니다.
  • SWE-Bench Verified: 실제 오픈소스 저장소의 이슈를 받아 코드를 고치고 테스트를 통과시키는지 판정합니다.
  • Terminal Bench Hard: 터미널에서 명령을 실행해 작업을 끝내는지 봅니다.

정리하면 Solar Open 2는 여러 단계를 계획하고 진행하는 종합 항목에서는 비교군 1위지만, 코드 저장소를 직접 고치거나 터미널에서 명령을 실행하는 항목에서는 상위권이 아닙니다. 이 구분을 알고 보면 뒤에서 다룰 Solar Pro 4의 설명이 자연스럽게 이어집니다.

한국어 처리에서 확인되는 토큰 효율

업스테이지가 함께 공개한 자료 중 하나는 토큰 효율입니다. 세로축은 토큰 하나가 담는 바이트 수이고, 값이 클수록 같은 문장을 더 적은 토큰으로 처리합니다.

언어와 영역별 토큰당 바이트 수를 비교한 막대그래프, 한국어 영역에서 Solar Open 2가 글로벌 모델보다 높은 값을 보임

한국어 영역에서 Solar Open 2는 차트에 함께 놓인 글로벌 모델 전부보다 높은 값을 보입니다. 국내 모델 중에는 A.X-K1과 K-EXAONE이 조금 더 높습니다. 영어에서는 모델 사이 차이가 거의 없습니다. API 요금이 토큰 단위로 매겨지므로, 한국어 문서를 많이 처리하는 작업이라면 같은 분량에 드는 토큰이 줄어드는 만큼 비용에서 이점이 생길 수 있습니다.

클로드 코드에 Solar Open 2를 연결하는 공식 방법

허깅페이스 모델 카드에는 클로드 코드 연동 방법이 공식으로 적혀 있습니다. vLLM 서버가 앤트로픽 호환 /v1/messages 엔드포인트를 제공하므로 중간에 별도 프로그램을 두지 않고 바로 붙습니다.

export ANTHROPIC_BASE_URL=http://localhost:8000 export ANTHROPIC_AUTH_TOKEN=dummy export ANTHROPIC_MODEL=solar-open2-250b export ANTHROPIC_SMALL_FAST_MODEL=solar-open2-250b claude

모델 이름은 vLLM 서버를 띄울 때 지정한 --served-model-name 값과 같아야 합니다. 같은 서버 하나가 OpenAI 호환 엔드포인트도 함께 제공하므로 다른 에이전트 도구에도 연결됩니다. MCP로 붙인 도구는 같은 도구 호출 방식으로 모델에 전달됩니다.

문제는 이 서버를 띄우는 조건입니다. 모델 카드에 적힌 하드웨어 요구사항은 최소 H200 4장, 권장 8장입니다. 예제 코드도 141GB 이상 메모리를 가진 GPU 8장을 가정합니다. 개인 장비로 감당할 수 있는 규모가 아니고, 회사에서도 별도 결정이 필요한 수준입니다.

  • 양자화 모델을 쓰는 경우: 노타에이아이가 만든 공식 양자화 버전이 INT4와 NVFP4 형태로 공개돼 있습니다. 업스테이지는 양자화 모델이 H200 2장에서 구동될 수 있다고 밝혔습니다.
  • 직접 돌리지 않는 경우: 가중치가 공개됐다는 사실이 곧 개인이 로컬에서 쓸 수 있다는 뜻은 아닙니다. 클라우드에서 GPU를 빌리거나, 뒤에서 다룰 상용 API를 쓰는 쪽이 현실적입니다.

라이선스는 Upstage Solar License입니다. 상업적 이용과 파인튜닝, 증류를 통한 파생 모델 개발을 허용하되, 파생 모델 이름 앞에 Solar-를 붙이고 공개 자료에 Built with Solar를 표시하는 조건이 붙습니다.

Solar Pro 4가 맡는 자리와 오픈웨이트와의 역할 차이

Solar Pro 4는 2026년 8월 6일 API로 공개됐습니다. 업스테이지 콘솔에는 8월 10일까지 무료로 쓸 수 있다고 표시돼 있습니다. 오픈웨이트인 Solar Open 2와 달리 가중치는 공개하지 않는 상용 모델이고, 앞서 나온 Solar Pro 3의 후속입니다.

김성훈 업스테이지 대표는 Solar Pro 4가 문서 작업과 터미널 수행, 멀티턴 도구 사용에서 Solar Open 2 대비 20~30% 나아졌다고 밝혔습니다. 앞에서 본 벤치마크와 겹쳐 읽으면 방향이 맞습니다. Solar Open 2가 상대적으로 약했던 항목이 정확히 터미널 수행과 도구 호출이었고, 상용 모델은 그 지점을 보강해서 나왔습니다.

두 모델을 나란히 놓으면 다음과 같습니다. 2026년 8월 6일 기준입니다.

구분Solar Open 2Solar Pro 4
공개 형태가중치 공개(오픈웨이트)API 상용 서비스
공개일2026년 7월 22일2026년 8월 6일
규모250B 중 토큰당 15B 활성미공개
컨텍스트100만 토큰미공개
실행 조건H200 4장 이상 직접 준비API 호출
요금하드웨어 비용만 부담8월 10일까지 무료, 이후 요금은 미공개
배경정부 독자 AI 파운데이션 모델 사업 산출물상용 라인업

참고로 업스테이지 요금 안내에 적힌 Solar Pro 3의 요금은 입력 100만 토큰당 0.15달러, 출력 100만 토큰당 0.6달러입니다. 부가세는 별도입니다. Solar Pro 4의 정식 요금은 2026년 8월 6일 기준으로 아직 공개되지 않았습니다.

Solar Pro 4는 데스크톱 AI 에이전트 룸(Loom)에 기본 모델로 탑재됐다고 보도됐습니다. 룸은 컴퓨터 안의 업무 폴더를 연결해 문서와 엑셀, PDF를 함께 읽고 결과물을 만드는 프로그램입니다.

업스테이지가 공개한 실제 업무 결과물 예시

업스테이지 공식 블로그에는 Solar Open 2가 만들어 낸 결과물 예시가 실려 있습니다.

Solar Open 2가 생성한 업무 산출물 예시, 왼쪽은 거래 모니터링 통계가 담긴 한국어 보고서 문서이고 오른쪽은 거래 내역과 위험등급이 색으로 구분된 표

왼쪽은 거래 유형별 통계와 국가별 노출도를 표로 정리한 한국어 보고서이고, 오른쪽은 거래 건별 위험등급을 색으로 구분한 표입니다. 질문에 답하는 형태가 아니라 문서와 표를 함께 만들어 내는 작업입니다. 공식 블로그에 실린 시연용 예시입니다.

이런 형태의 작업이 앞에서 본 Ko-GDPval 항목이 재는 것과 가깝습니다. 한국어 실무 산출물을 얼마나 쓸 만하게 만드는지 보는 지표이고, Solar Open 2는 이 항목에서 86.8로 비교군 1위입니다.

지금 상황에서 선택할 수 있는 경우별 정리

정리하면 상황에 따라 선택지가 갈립니다.

  • 국산 모델을 실제 업무에 넣어 볼 회사: Solar Pro 4 API가 8월 10일까지 무료이므로 이 기간에 자기 업무 데이터로 확인해 보는 편이 낫습니다. 정식 요금이 아직 공개되지 않았으므로 도입 결정은 요금 발표 후로 미뤄 두는 편이 안전합니다.
  • 가중치를 직접 다뤄야 하는 경우: 파인튜닝이나 사내 서버 운영이 목적이라면 Solar Open 2를 검토할 수 있습니다. 다만 H200 4장이라는 최소 조건과 파생 모델 명명 규칙을 먼저 확인해야 합니다.
  • 개인이 클로드 코드에 붙여 보려는 경우: 연동 방법 자체는 환경 변수 몇 개로 끝나지만, 서버를 띄울 장비가 별도로 필요합니다. 지금 쓰는 도구가 작업을 잘 처리하고 있다면 서두를 이유는 없습니다.
  • 소식만 따라가려는 경우: 8월 12일 전후로 나올 독자 AI 파운데이션 모델 2차 평가 결과를 보면 국산 모델 판도가 어떻게 정리되는지 확인할 수 있습니다.

업스테이지가 가중치와 기술 보고서를 함께 공개했으므로 다른 팀이 이어서 연구할 바탕이 생겼습니다. 실제로 노타에이아이의 양자화 버전이 공개 직후 나왔습니다. 다만 벤치마크 수치는 비교군을 확인하고 읽어야 하고, 항목별로 성적이 갈린다는 점도 함께 봐야 합니다.

3줄 요약

  • Solar Open 2는 업스테이지가 2026년 7월 22일 가중치까지 공개한 250B 오픈웨이트 모델이고, 지식과 코딩 문제 풀이, 한국어 항목에서는 비교군 1위지만 실제 코드 저장소 수정과 터미널 작업에서는 상위권이 아닙니다.
  • 공식 벤치마크의 비교 대상은 320B 미만 오픈 모델과 경량 상용 모델이므로, 점수를 읽을 때 이 범위를 함께 봐야 합니다.
  • 클로드 코드 연동은 환경 변수 네 개로 끝나지만 최소 H200 4장이 필요하고, 장비 없이 써 보려면 8월 10일까지 무료인 Solar Pro 4 API 쪽이 현실적입니다.

Sources

이 글이 도움이 되셨다면 공유해 주세요

메신저로 바로 보내거나 링크를 복사할 수 있습니다.

디지털마케터 뉴스레터

GA4, SEO, AI 마케팅 실무 인사이트를 월 1~2회 이메일로 보내드립니다.

다음으로 읽어볼 글

Qwen3.8-Max 정리: 사양, 가격, 자율작업 성적, 오픈웨이트 공개 상태 (2026년 8월 기준) 썸네일
AI & TechQwen3.8-Max 정리: 사양, 가격, 자율작업 성적, 오픈웨이트 공개 상태 (2026년 8월 기준)

Qwen3.8-Max는 알리바바 Qwen 팀이 2026년 8월 3일 공개한 2조 4천억 파라미터 규모의 MoE 모델입니다. 공개 자료에 적힌 사양과 가격, 16일 자율 코딩을 포함한 장기 작업 실험 결과, 벤치마크를 읽을 때 주의할 점을 정리했습니다.

2026. 8. 4.
헤드리스 AI의 개념과 특징: AI 에이전트 활용하기 썸네일
AI & Tech헤드리스 AI의 개념과 특징: AI 에이전트 활용하기

화면 없이 백그라운드에서 실행되는 헤드리스 AI의 개념과 채팅형 AI와의 차이를 정리했습니다. 이벤트 기반 동작 구조, 이메일 자동 분류와 주간 리포트 자동화 같은 실무 사례, 클로드 코드로 직접 실행하는 방법까지 다룹니다.

2026. 7. 29.
Kimi K3, Claude Fable 5, GPT-5.6 Sol 비교: 모델별 장점 정리 썸네일
AI & TechKimi K3, Claude Fable 5, GPT-5.6 Sol 비교: 모델별 장점 정리

2026년 7월에 출시된 Kimi K3와 Claude Fable 5, GPT-5.6 Sol의 스펙, 벤치마크, 가격, 커뮤니티 반응을 비교하고 작업 성격별 선택 기준을 정리합니다.

2026. 7. 20.
메타 Muse Code 정리: 기능, 벤치마크, 클로드 코드와의 차이 썸네일
AI & Tech메타 Muse Code 정리: 기능, 벤치마크, 클로드 코드와의 차이

Muse Code는 메타가 2026년 8월 5일 베타로 공개한 터미널 기반 AI 코딩 에이전트입니다. 상주형 백그라운드 에이전트, 병렬 하위 에이전트, 이벤트 로그 복구 같은 핵심 기능과 Muse Spark 1.2 벤치마크, 요금 구조를 클로드 코드와 나란히 놓고 정리했습니다.

2026. 8. 6.
퀴즈

공식 발표에 실린 벤치마크 차트를 볼 때 점수보다 먼저 확인해야 하는 것은 무엇일까요?