업스테이지 Solar Open 2, Solar Pro 4 정리: 벤치마크와 연동법
홍승협(준이아빠) / 데이터 분석, AI 실무 교육
Solar Open 2는 업스테이지가 2026년 7월 22일 가중치까지 공개한 250B 규모의 오픈웨이트 언어 모델입니다. 공식 벤치마크에서 이긴 항목과 뒤진 항목, 클로드 코드에 연결하는 공식 방법, 8월 6일 공개된 상용 모델 Solar Pro 4와의 역할 차이를 정리했습니다.

3줄 요약
이번 방문에서 한 편은 바로 볼 수 있습니다.
Solar Open 2는 업스테이지가 2026년 7월 22일 가중치까지 공개한 250B 규모의 오픈웨이트 언어 모델입니다. Solar Pro 4는 같은 회사가 2026년 8월 6일 API로 공개한 상용 모델이고, 이쪽은 가중치를 공개하지 않았습니다. 2주 남짓한 간격으로 성격이 다른 두 모델이 나왔고, 그 사이에 정부의 독자 AI 파운데이션 모델 사업 2차 평가가 걸려 있습니다.
국산 모델 소식은 자주 나오지만 실제로 무엇을 할 수 있는지까지 확인하기는 번거롭습니다. 이 글에서는 업스테이지 공식 블로그와 허깅페이스 모델 카드에 공개된 수치를 근거로, Solar Open 2가 어떤 항목에서 이기고 어떤 항목에서 뒤졌는지, 클로드 코드에 어떻게 연결하는지, Solar Pro 4는 어떤 자리를 맡는지 정리하겠습니다.
지능 지수 차트에서 업스테이지 모델이 놓여 있던 위치
먼저 배경부터 봅니다. 아래 차트는 여러 모델을 평가 시점 순서로 놓고 지능 지수(AAII)를 표시한 것입니다. 빨간 박스가 업스테이지 모델입니다.
업스테이지 모델은 세 지점에 있습니다. Solar Mini가 2024년 1월, Solar Pro 2가 2025년 6월, Upstage Open이 2025년 12월입니다. 셋 다 차트 아래쪽에 모여 있고, 같은 시기 상위 모델들과 간격이 뚜렷합니다.
이 차트에는 이번에 나온 Solar Open 2와 Solar Pro 4가 아직 없습니다. 한국 오픈 모델 중 가장 최근 지점은 모티프테크놀로지스의 Motif3 Beta입니다. 두 회사 모두 정부 독자 AI 파운데이션 모델 사업의 평가 대상이고, 국민 평가단 200명의 평가가 8월 8일부터 11일까지 진행됩니다. 4개 팀을 3개 팀으로 좁히는 2차 평가 결과는 이르면 8월 12일에 나올 예정이라고 보도됐습니다.
Solar Open 2의 공식 벤치마크에서 이긴 항목과 뒤진 항목
업스테이지가 공개한 벤치마크 결과입니다. 진한 보라색 막대가 Solar Open 2입니다.
허깅페이스 모델 카드의 표를 기준으로 항목별 결과를 정리하면 다음과 같습니다.
| 벤치마크 | 무엇을 재는지 | Solar Open 2 | 비교군 최고 |
|---|---|---|---|
| MMLU-Pro | 전반적 지식과 추론 | 86.2 (1위) | DeepSeek-V4-Flash 85.9 |
| LiveCodeBench v6 | 코딩 문제 해결 | 92.4 (1위) | DeepSeek-V4-Flash 92.3 |
| APEX-Agents | 에이전트 종합 수행 | 16.6 (1위) | MiMo-V2.5 13.4 |
| MCP-Atlas | 도구 호출 정확도 | 58.2 (공동 2위) | MiMo-V2.5 63.9 |
| SWE-Bench Verified | 실제 코드 저장소 수정 | 70.4 (3위) | DeepSeek-V4-Flash 73.8 |
| Terminal Bench Hard | 터미널 작업 수행 | 28.3 (4위) | MiMo-V2.5 41.7 |
| CLIcK | 한국 문화와 상식 | 90.7 (1위) | DeepSeek-V4-Flash 89.2 |
| Ko-GDPval | 한국어 실무 산출물 | 86.8 (1위) | DeepSeek-V4-Flash 85.0 |
지식과 코딩 문제 풀이, 한국어 항목에서는 비교군 안에서 1위입니다. 반면 실제 코드 저장소를 수정하는 SWE-Bench Verified에서는 3위, 터미널 작업을 수행하는 Terminal Bench Hard에서는 4위입니다. 도구 호출을 재는 MCP-Atlas도 MiMo-V2.5에 5.7점 뒤집니다.
여기서 확인해야 할 것이 하나 더 있습니다. 비교 대상으로 고른 모델이 어느 급인가입니다. 공식 차트의 범례는 open models (Under 320B)와 fast-tier closed models입니다. 오픈 모델은 320B 미만으로 제한했고, 상용 모델은 Claude Haiku 4.5와 GPT-5.4 mini 같은 경량 모델을 놓았습니다. 최상위 상용 모델은 비교군에 없습니다. 따라서 이 수치는 그 범위 안에서 나온 순위이고, 발표 자체는 정직하게 범례로 이 조건을 표시하고 있습니다.
에이전트 벤치마크 4종이 각각 재는 것
에이전트 벤치마크는 지식 벤치마크보다 상대적으로 낯설 수 있습니다. 쉽게 말하면 모델이 답을 얼마나 아는지가 아니라, 도구를 써서 일을 끝까지 해내는지를 재는 시험입니다. 네 가지가 서로 다른 것을 측정합니다.
- APEX-Agents: 여러 단계를 거치는 업무를 끝까지 수행하는지 종합적으로 평가합니다. 점수대가 전반적으로 낮습니다. 비교군 여섯 모델이 모두 20점 아래이고, 그중 Solar Open 2가 16.6으로 가장 높습니다. 절대 점수가 낮은 것은 이 시험이 어렵다는 뜻이지 모델만의 문제는 아닙니다.
- MCP-Atlas: 모델 컨텍스트 프로토콜(MCP)로 연결된 도구를 정확히 골라 호출하는지 확인합니다. 외부 도구를 붙여 쓸 계획이라면 이 항목이 실제 사용감에 가깝습니다.
- SWE-Bench Verified: 실제 오픈소스 저장소의 이슈를 받아 코드를 수정하고 테스트를 통과시키는지 판정합니다.
- Terminal Bench Hard: 터미널에서 명령을 실행해 작업을 끝내는지 봅니다.
정리하면 Solar Open 2는 여러 단계를 계획하고 진행하는 종합 항목에서는 비교군 1위지만, 코드 저장소를 직접 고치거나 터미널에서 명령을 실행하는 항목에서는 상위권이 아닙니다. 이 구분을 알고 보면 뒤에서 다룰 Solar Pro 4의 설명이 자연스럽게 이어집니다.
한국어 처리에서 확인되는 토큰 효율
업스테이지가 함께 공개한 자료 중 하나는 토큰 효율입니다. 세로축은 토큰 하나가 담는 바이트 수이고, 값이 클수록 같은 문장을 더 적은 토큰으로 처리합니다.
한국어 영역에서 Solar Open 2는 차트에 함께 놓인 글로벌 모델 전부보다 높은 값을 보입니다. 국내 모델 중에는 A.X-K1과 K-EXAONE이 조금 더 높습니다. 영어에서는 모델 사이 차이가 거의 없습니다. API 요금이 토큰 단위로 매겨지므로, 한국어 문서를 많이 처리하는 작업이라면 같은 분량에 드는 토큰이 줄어드는 만큼 비용에서 이점이 생길 수 있습니다.
클로드 코드에 Solar Open 2를 연결하는 공식 방법
허깅페이스 모델 카드에는 클로드 코드 연동 방법이 공식으로 적혀 있습니다. vLLM 서버가 앤트로픽 호환 /v1/messages 엔드포인트를 제공하므로 중간에 별도 프로그램을 두지 않고 바로 붙습니다.
export ANTHROPIC_BASE_URL=http://localhost:8000
export ANTHROPIC_AUTH_TOKEN=dummy
export ANTHROPIC_MODEL=solar-open2-250b
export ANTHROPIC_SMALL_FAST_MODEL=solar-open2-250b
claude모델 이름은 vLLM 서버를 띄울 때 지정한 --served-model-name 값과 같아야 합니다. 같은 서버 하나가 OpenAI 호환 엔드포인트도 함께 제공하므로 다른 에이전트 도구에도 연결됩니다. MCP로 붙인 도구는 같은 도구 호출 방식으로 모델에 전달됩니다.
문제는 이 서버를 띄우는 조건입니다. 모델 카드에 적힌 하드웨어 요구사항은 최소 H200 4장, 권장 8장입니다. 예제 코드도 141GB 이상 메모리를 가진 GPU 8장을 가정합니다. 개인 장비로 감당할 수 있는 규모가 아니고, 회사에서도 별도 결정이 필요한 수준입니다.
- 양자화 모델을 쓰는 경우: 노타에이아이가 만든 공식 양자화 버전이 INT4와 NVFP4 형태로 공개돼 있습니다. 업스테이지는 양자화 모델이 H200 2장에서 구동될 수 있다고 밝혔습니다.
- 직접 돌리지 않는 경우: 가중치가 공개됐다는 사실이 곧 개인이 로컬에서 쓸 수 있다는 뜻은 아닙니다. 클라우드에서 GPU를 빌리거나, 뒤에서 다룰 상용 API를 쓰는 쪽이 현실적입니다.
라이선스는 Upstage Solar License입니다. 상업적 이용과 파인튜닝, 증류를 통한 파생 모델 개발을 허용하되, 파생 모델 이름 앞에 Solar-를 붙이고 공개 자료에 Built with Solar를 표시하는 조건이 붙습니다.
Solar Pro 4가 맡는 자리와 오픈웨이트와의 역할 차이
Solar Pro 4는 2026년 8월 6일 API로 공개됐습니다. 업스테이지 콘솔에는 8월 10일까지 무료로 쓸 수 있다고 표시돼 있습니다. 오픈웨이트인 Solar Open 2와 달리 가중치는 공개하지 않는 상용 모델이고, 앞서 나온 Solar Pro 3의 후속입니다.
김성훈 업스테이지 대표는 Solar Pro 4가 문서 작업과 터미널 수행, 멀티턴 도구 사용에서 Solar Open 2 대비 20~30% 나아졌다고 밝혔습니다. 앞에서 본 벤치마크와 겹쳐 읽으면 방향이 맞습니다. Solar Open 2가 상대적으로 약했던 항목이 정확히 터미널 수행과 도구 호출이었고, 상용 모델은 그 지점을 보강해서 나왔습니다.
두 모델을 나란히 놓으면 다음과 같습니다. 2026년 8월 6일 기준입니다.
| 구분 | Solar Open 2 | Solar Pro 4 |
|---|---|---|
| 공개 형태 | 가중치 공개(오픈웨이트) | API 상용 서비스 |
| 공개일 | 2026년 7월 22일 | 2026년 8월 6일 |
| 규모 | 250B 중 토큰당 15B 활성 | 미공개 |
| 컨텍스트 | 100만 토큰 | 미공개 |
| 실행 조건 | H200 4장 이상 직접 준비 | API 호출 |
| 요금 | 하드웨어 비용만 부담 | 8월 10일까지 무료, 이후 요금은 미공개 |
| 배경 | 정부 독자 AI 파운데이션 모델 사업 산출물 | 상용 라인업 |
참고로 업스테이지 요금 안내에 적힌 Solar Pro 3의 요금은 입력 100만 토큰당 0.15달러, 출력 100만 토큰당 0.6달러입니다. 부가세는 별도입니다. Solar Pro 4의 정식 요금은 2026년 8월 6일 기준으로 아직 공개되지 않았습니다.
Solar Pro 4는 데스크톱 AI 에이전트 룸(Loom)에 기본 모델로 탑재됐다고 보도됐습니다. 룸은 컴퓨터 안의 업무 폴더를 연결해 문서와 엑셀, PDF를 함께 읽고 결과물을 만드는 프로그램입니다.
업스테이지가 공개한 실제 업무 결과물 예시
업스테이지 공식 블로그에는 Solar Open 2가 만들어 낸 결과물 예시가 실려 있습니다.
왼쪽은 거래 유형별 통계와 국가별 노출도를 표로 정리한 한국어 보고서이고, 오른쪽은 거래 건별 위험등급을 색으로 구분한 표입니다. 질문에 답하는 형태가 아니라 문서와 표를 함께 만들어 내는 작업입니다. 공식 블로그에 실린 시연용 예시입니다.
이런 형태의 작업이 앞에서 본 Ko-GDPval 항목이 재는 것과 가깝습니다. 한국어 실무 산출물을 얼마나 쓸 만하게 만드는지 보는 지표이고, Solar Open 2는 이 항목에서 86.8로 비교군 1위입니다.
지금 상황에서 선택할 수 있는 경우별 정리
정리하면 상황에 따라 선택지가 달라집니다.
- 국산 모델을 실제 업무에 넣어 볼 회사: Solar Pro 4 API가 8월 10일까지 무료이므로 이 기간에 자기 업무 데이터로 확인해 보는 편이 낫습니다. 정식 요금이 아직 공개되지 않았으므로 도입 결정은 요금 발표 후로 미뤄 두는 편이 안전합니다.
- 가중치를 직접 다뤄야 하는 경우: 파인튜닝이나 사내 서버 운영이 목적이라면 Solar Open 2를 검토할 수 있습니다. 다만 H200 4장이라는 최소 조건과 파생 모델 명명 규칙을 먼저 확인해야 합니다.
- 개인이 클로드 코드에 붙여 보려는 경우: 연동 방법 자체는 환경 변수 몇 개로 끝나지만, 서버를 띄울 장비가 별도로 필요합니다. 지금 쓰는 도구가 작업을 잘 처리하고 있다면 서두를 이유는 없습니다.
- 소식만 따라가려는 경우: 8월 12일 전후로 나올 독자 AI 파운데이션 모델 2차 평가 결과를 보면 국산 모델 판도가 어떻게 정리되는지 확인할 수 있습니다.
업스테이지가 가중치와 기술 보고서를 함께 공개했으므로 다른 팀이 이어서 연구할 바탕이 생겼습니다. 실제로 노타에이아이의 양자화 버전이 공개 직후 나왔습니다. 다만 벤치마크 수치는 비교군을 확인하고 읽어야 하고, 항목별로 성적이 달라진다는 점도 함께 봐야 합니다.
자주 묻는 질문
Solar Open 2와 Solar Pro 4는 무엇이 다른가요?
가중치 공개 여부가 다릅니다. Solar Open 2는 오픈웨이트라 직접 내려받아 돌릴 수 있고, Solar Pro 4는 가중치를 공개하지 않는 상용 모델로 API로 씁니다. 업스테이지 대표는 Pro 4가 문서 작업과 터미널 수행, 멀티턴 도구 사용에서 Open 2 대비 20~30% 나아졌다고 밝혔습니다.
한국어를 쓰면 정말 비용이 덜 드나요?
같은 분량에 드는 토큰이 줄어드는 만큼은 이점이 있습니다. 업스테이지가 공개한 토큰 효율 자료에서 한국어 영역의 Solar Open 2는 함께 놓인 글로벌 모델 전부보다 토큰당 처리하는 바이트가 많습니다. API 요금이 토큰 단위라 한국어 문서를 많이 처리하는 작업일수록 차이가 쌓입니다. 영어에서는 모델 사이 차이가 거의 없습니다.
클로드 코드에 Solar Open 2를 붙일 수 있나요?
붙일 수 있습니다. 허깅페이스 모델 카드에 연동 방법이 공식으로 적혀 있습니다. vLLM 서버가 앤트로픽 호환 엔드포인트를 제공해서 중간에 별도 프로그램을 두지 않고 환경 변수만 바꿔 연결합니다.
Sources
- 업스테이지 공식 블로그, Solar Open 2: Agentic Use 최적화 한국형 독자 파운데이션 모델
- Hugging Face, upstage/Solar-Open2-250B 모델 카드
- Solar Open 2 Technical Report (arXiv)
- Upstage Console, 모델 문서
- Upstage, API 요금 안내
- ZDNet Korea, 업스테이지 하반기 AI 모델 2연타 상용 시장 공략 속도
- The Korea Times, Upstage unveils Solar Open 2, open-weight AI model built for autonomous tasks
이 글이 도움이 되셨다면 공유해 주세요
메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Written by
데이터로 설명하는 마케터
공식 발표에 실린 벤치마크 차트를 볼 때 점수보다 먼저 확인해야 하는 것은 무엇일까요?
이 글이 도움이 되었나요?
다음 단계
이어서 읽기 좋은 글
GLM 모델 정리: Z.ai 버전별 차이와 쓰는 방법 4가지
GLM은 중국 AI 기업 Z.ai가 만드는 오픈 웨이트 언어 모델 계열입니다. 2026년 9월 기준 현행 모델 네 가지의 규모와 가격, 라이선스를 나란히 놓고 웹 화면과 API, 코딩 구독, 가중치 내려받기까지 쓰는 방법을 공식 자료로 정리했습니다.
같이 보면 좋은 글

클로드 페이블 5.1은 앤트로픽이 2026년 9월 1일 공개한 코딩과 지식 업무용 상위 모델입니다. 벤치마크 변화와 캐시 읽기 75% 인하, 안전장치 완화, 플랜별 이용 조건, 클로드 코드에서 바꾸는 방법을 공식 자료 기준으로 정리했습니다.
2026. 9. 2.
CLAUDE.md는 클로드 코드가 세션마다 읽는 지시 파일입니다. 권장 길이 300줄, 절대 금지 섹션, 9월 모델 가격 인상처럼 널리 도는 이야기를 앤트로픽 공식 문서와 하나씩 맞춰 정리했습니다. 2026년 8월 28일 기준입니다.
2026. 8. 28.
Ox Alpha는 Z.AI의 GLM-5.3-Flash입니다. 클로드 코드와 코덱스 CLI는 모두 Z.AI 공식 지원 목록에 올라 있습니다. 도구를 바꾸지 않고 요청을 보내는 주소만 Z.AI로 돌리면 되며, 두 도구의 설정 파일과 값이 서로 다릅니다. 공식 문서 기준으로 설정 방법과 요금제, 붙이기 전에 확인할 것을 정리했습니다.
2026. 8. 27.
Ox Alpha는 중국 Z.AI가 만든 곳을 감춘 채 OpenRouter에 무료로 공개했던 GLM-5.3-Flash의 프리뷰 모델입니다. 2026년 8월 21일 이름 없이 등장해 닷새 만에 사용량 1위에 올랐고, 8월 26일 정체가 공개되면서 MIT 라이선스로 가중치까지 풀렸습니다. 공개 경과와 공식 스펙, 벤치마크 점수가 측정 방식에 따라 달라진 사례를 정리했습니다.
2026. 8. 27.ADVERTISEMENT