커뮤니티 입장하기

리플렉션 AI Beam 정리: 501B 오픈 웨이트 모델의 실제 성능과 공개 일정

리플렉션 AI가 501B 규모의 오픈 웨이트 모델 Beam을 발표했습니다. SNS에 퍼진 수치를 공식 발표와 대조하고, 벤치마크에서 앞서는 모델과 뒤지는 모델, 가중치 공개 시점과 지금 쓸 수 있는 방법을 구분합니다.

새로 올라온 글이에요. 먼저 읽어 보고 퀴즈도 풀어 보세요
Share
리플렉션 AI Beam 정리: 501B 오픈 웨이트 모델의 실제 성능과 공개 일정 대표 이미지
목차
  1. Beam과 리플렉션 AI
  2. SNS 주장과 공식 발표 대조
  3. 벤치마크로 본 위치
  4. "서구권 첫 괴물"이라는 소개가 틀린 이유
  5. 리플렉션 AI의 효율 주장과 계산 방식
  6. 지금 써 볼 수 있는 방법
  7. 가중치가 공개되면 필요한 장비
  8. 공개 전까지 확인할 것

세 줄로 먼저 읽기

이번 방문에서 한 편은 바로 볼 수 있습니다.

"중국 모델이 독점하던 오픈소스 판에 서구권 괴물이 나왔다"는 소개 글과 함께 리플렉션 AI(Reflection AI)의 Beam이 퍼지고 있습니다. 총 501B 파라미터, GB300 GPU 10,500장, SWE-bench 80.9, 100만 토큰, 이번 달 무료 배포라는 숫자가 한꺼번에 붙어 있습니다.

2026년 10월 5일 공식 발표문과 개발자 문서를 대조해 보면 숫자 자체는 대부분 발표와 같습니다. 사실과 다르게 퍼진 내용은 두 가지입니다. 가중치는 아직 받을 수 없고, Beam은 서구권 최초의 대형 오픈 웨이트 모델이 아닙니다. 이 글은 10월 7일에 확인한 공식 자료를 기준으로 무엇이 확정이고 무엇이 약속인지 나눕니다.

Beam과 리플렉션 AI

리플렉션 AI는 구글 딥마인드 연구원 출신인 미샤 라스킨(Misha Laskin)과 요아니스 안토노글루(Ioannis Antonoglou)가 2024년 뉴욕에서 세운 회사입니다. 2025년 10월 엔비디아가 주도한 투자에서 20억 달러를 유치하며 "누구나 쓸 수 있는 최전선 공개 모델"을 만들겠다고 밝혔습니다. Beam은 이 계획에 따라 발표한 대형 모델입니다.

Beam은 오픈 웨이트(open weight) 모델로 예고됐습니다. 오픈 웨이트는 학습이 끝난 모델의 가중치 파일을 공개해 누구나 내려받아 자기 서버에서 실행하고 수정할 수 있게 하는 방식입니다. 학습 데이터와 학습 코드까지 공개하는 완전 오픈소스와는 다릅니다. 라스킨은 이전 인터뷰에서 데이터셋과 학습 파이프라인은 대체로 비공개로 둔다고 말했습니다.

구조는 MoE(Mixture of Experts, 전문가 혼합)입니다. 모델 안에 여러 전문가 신경망을 두고, 토큰 하나를 처리할 때마다 그중 일부만 골라 계산하는 방식입니다. Beam은 전체 501B 파라미터 가운데 토큰마다 23B만 계산에 씁니다. API 모델 이름인 Beam-501B-A23B도 이 두 숫자를 뜻합니다.

SNS 주장과 공식 발표 대조

아래 표는 퍼진 소개 글의 항목을 공식 블로그와 개발자 문서에 하나씩 맞춰 본 결과입니다.

SNS 주장공식 자료의 내용판정
총 501B, 활성 23B발표문과 모델 이름이 같습니다맞음
GB300 10,500장 투입강화학습 단계에서 4주 동안 쓴 GPU 수입니다. 사전학습은 GB300 NVL72 시스템의 GPU 6,144장으로 4주가 채 안 걸렸습니다범위를 좁혀야 함
1억 회 이상 RL 학습공식 표현은 1억 개 이상의 롤아웃 생성입니다. 롤아웃은 모델이 과제를 처음부터 끝까지 한 번 풀어 본 시도입니다표현이 다름
SWE-bench 80.9SWE-bench Verified 기준입니다. 더 어려운 SWE-bench Pro v1은 65.5입니다맞음, 종류 확인 필요
AIME 97.8%2026년 AIME 기준입니다. 같은 표에서 GLM 5.2는 99.2입니다맞음
100만 토큰 컨텍스트학습으로 실효 컨텍스트를 1M까지 늘렸다고 했지만 현재 베타 API 문서의 컨텍스트 창은 256K입니다조건부
이번 달 Apache 2.0 무료 배포"later this month"라고만 했고 날짜가 없습니다. 10월 7일 Hugging Face에서 리플렉션 AI 계정과 Beam 저장소를 검색했지만 결과가 없었습니다아직 약속

SWE-bench Verified는 실제 오픈소스 저장소의 이슈를 모델이 코드로 고치게 하고 테스트 통과 여부로 채점하는 벤치마크입니다. 사람이 검수한 500개 문제로 구성됩니다. AIME는 미국 수학 경시대회 문제로 수학 추론 능력을 측정합니다. 두 수치 모두 리플렉션 AI가 직접 측정한 값이고, 평가에 쓴 실행 환경과 조건은 공개하지 않았습니다.

라이선스로 예고한 Apache 2.0은 상업적 이용과 수정, 재배포를 허용하는 대표적인 허용형 라이선스입니다. 실제 가중치와 함께 올라오는 라이선스 문서에 추가 조건이 붙는지는 공개 시점에 확인해야 합니다.

벤치마크로 본 위치

리플렉션 AI 발표문에는 Beam과 다른 오픈 웨이트 모델 7개를 21개 벤치마크로 비교한 표가 실려 있습니다. 경쟁 모델 점수는 Artificial Analysis 같은 외부 평가 기관의 공개 값을 가져왔다고 밝혔습니다. 아래는 그 표에서 코딩, 추론, 긴 문서 항목 일부를 옮긴 것입니다. 빈칸은 발표문에 점수가 없는 경우입니다.

벤치마크BeamInklingNemotron 3 UltraGLM 5.3Kimi K3DeepSeek V4.1 Flash
SWE-bench Verified80.977.670.7
SWE-bench Pro v165.554.346.4
Terminal Bench v2.180.163.856.488.288.390.6
DeepSWE v1.144.461.068.074.2
HLE(도구 없음)36.229.726.742.346.939.1
GPQA Diamond90.587.28791.793.590.9
AA-LCR(긴 문서)79.377.379.379.788.784.0

Inkling은 Thinking Machines, Nemotron 3 Ultra는 엔비디아의 미국 모델이고, GLM 5.3은 Z.ai, Kimi K3는 문샷 AI, DeepSeek V4.1 Flash는 딥시크의 중국 모델입니다.

표를 가로로 읽으면 Beam의 위치가 분명해집니다. 서구권 오픈 모델인 Inkling과 Nemotron 3 Ultra보다는 대부분 항목에서 높습니다. 반면 위 표에서 중국 상위 모델 세 개와 비교한 항목은 모두 낮습니다. 터미널 작업 벤치마크에서 DeepSeek V4.1 Flash와 10점 넘게, 실제 저장소 수정 과제인 DeepSWE에서 30점 가까이 차이가 납니다. 리플렉션 AI도 발표문에서 순수 성능은 Kimi K3가 앞선다고 인정했습니다.

SWE-bench Verified 80.9를 근거로 "오픈 모델 1위"라고 소개하는 글도 있지만, 발표 표에서 이 항목 점수를 함께 실은 모델은 Inkling과 Nemotron 3 Ultra뿐입니다. 다른 평가 기관이 측정한 중국 모델들의 같은 항목 점수는 83점 안팎으로 보도됐습니다. 측정 조건이 달라 바로 비교할 수는 없으므로 순위는 아직 판단할 수 없습니다.

"서구권 첫 괴물"이라는 소개가 틀린 이유

Beam 이전에도 서구권 기업은 오픈 웨이트 모델을 꾸준히 공개했고, 500B를 넘는 대형 모델도 이미 두 개가 있습니다.

모델개발사공개규모라이선스
gpt-oss-120b오픈AI2025년 8월117B, 활성 5.1BApache 2.0
Nemotron 3 Ultra엔비디아2026년 6월550B, 활성 55BOpenMDW 1.1
InklingThinking Machines2026년 7월975B, 활성 41BApache 2.0
Beam리플렉션 AI2026년 10월 발표, 가중치 미공개501B, 활성 23BApache 2.0 예정

Inkling은 가중치가 이미 Hugging Face에 올라와 있고, 출시 당시 Artificial Analysis가 미국 오픈 웨이트 모델 가운데 1위로 평가했습니다. 미스트랄도 1T 규모의 Mistral Large 4 가중치를 10월 27일 공개한다고 보도됐습니다.

그래서 정확한 소개는 "중국 모델이 독점한 시장에 처음 나온 서구권 모델"이 아니라 "자체 비교표에서 다른 서구권 오픈 모델보다 코딩과 에이전트 점수가 높게 나온, 활성 파라미터가 적은 모델"에 가깝습니다. 리플렉션 AI 스스로도 발표문에서 서구권 오픈 웨이트의 수준을 끌어올린다고 표현했을 뿐 세계 1위를 내세우지는 않았습니다.

리플렉션 AI의 효율 주장과 계산 방식

리플렉션 AI가 성능보다 앞세운 것은 효율입니다. GLM 5.2와 비슷한 추론 점수를 3분의 1에서 4분의 1 수준의 추론 연산으로 낸다는 주장입니다. 활성 파라미터가 23B로 GLM 5.2의 약 40B보다 적고, 답을 만들 때 쓰는 토큰도 적다는 근거입니다.

이 수치는 연산량을 2 × 활성 파라미터 × 평균 생성 토큰 수로 계산한 추정치입니다. 리플렉션 AI는 질문을 처음 읽어 들이는 단계(프리필)와 어텐션 계산, 실제 서버 운영 부담은 계산에서 뺐다고 밝혔습니다. 긴 문서를 넣는 작업일수록 빠진 부분의 비중이 커지므로, 실제 요금이나 응답 시간이 3~4배 줄어든다고 옮겨 읽으면 안 됩니다.

컨텍스트도 같은 방식으로 구분합니다. 발표문은 학습 과정에서 실효 컨텍스트를 1M 토큰까지 늘렸다고 설명하지만, 현재 베타 API 문서는 입력 256K, 최대 출력 128K로 안내하고 베타 기간 중 바뀔 수 있다고 적었습니다. 지금 API로 확인할 수 있는 한도는 256K입니다.

지금 써 볼 수 있는 방법

10월 7일 기준으로 Beam을 쓰는 방법은 대기자 명단을 거친 베타 API 하나입니다. 리플렉션 AI 플랫폼에서 대기자 등록을 하고, 승인되면 API 키를 받습니다. 개발자 문서에 따르면 오픈AI SDK와 호환되는 주소를 제공하므로 기존 코드에서 주소와 모델 이름만 바꿔 호출할 수 있습니다. 오픈AI 호환 주소는 Chat Completions와 모델 목록 조회만 지원합니다.

아래는 개발자 문서의 주소와 모델 이름으로 작성한 예시입니다. 대기자 승인을 받지 못해 직접 실행해 보지는 않았습니다. REFLECTION_API_KEY는 발급받은 키를 넣어 둘 환경 변수 이름으로 임의로 정한 것입니다.

import os from openai import OpenAI client = OpenAI( base_url="https://api.reflection.ai/openai/v1", api_key=os.environ["REFLECTION_API_KEY"], ) response = client.chat.completions.create( model="Beam-501B-A23B", reasoning_effort="medium", # low, medium, high, xhigh, max messages=[{"role": "user", "content": "이 함수의 버그를 찾아 줘: ..."}], ) print(response.choices[0].message.content)

Beam은 항상 추론 과정을 거쳐 답합니다. reasoning_effort로 추론에 쓰는 양을 다섯 단계 중에서 고르고 기본값은 medium입니다. 지식 기준일은 2026년 6월 30일입니다. 가격은 공개되지 않았고, 문서에는 분당 요청 수와 토큰 수 제한만 적혀 있습니다.

가중치가 공개되면 필요한 장비

MoE 모델은 계산량이 활성 파라미터를 따라가지만, 어떤 전문가가 선택될지 미리 알 수 없어 메모리에는 전체 파라미터를 올려야 합니다. 활성 23B라는 숫자만 보고 23B 모델처럼 개인 PC에서 돌릴 수 있다고 생각하면 안 됩니다.

모델 카드가 아직 없어서 아래는 501B 파라미터에 정밀도별 바이트 수를 곱한 계산값입니다. 긴 대화를 처리할 때 필요한 KV 캐시 메모리는 따로 더 듭니다.

정밀도가중치 크기장비 예시
BF16(16비트)약 1.0TBH100(80GB) 16장 수준
FP8(8비트)약 500GBH200(141GB) 8장
4비트약 250~280GBB200 2~4장, 맥 스튜디오 512GB는 이론상 탑재 가능

비슷한 크기인 Nemotron 3 Ultra(550B)는 4비트 형식 기준 최신 GPU 4장, 16비트 기준 H100 16장을 공식 최소 사양으로 안내합니다. Beam도 회사 서버나 클라우드 GPU가 아니면 실행하기 어려운 모델로 보는 편이 맞습니다.

공개 전까지 확인할 것

Beam을 업무 후보로 검토한다면 지금은 다음 네 가지를 기다리며 기록해 두는 단계입니다.

  1. 가중치 공개일과 라이선스 원문. Hugging Face 저장소가 생기면 Apache 2.0 원문 외에 별도 이용 조건이 붙는지 확인합니다.
  2. 독립 평가 점수. Artificial Analysis가 접근 권한을 받아 측정 중입니다. 자체 측정과 외부 측정이 크게 다른 사례가 이전에도 있었으므로 외부 점수를 기준으로 비교합니다.
  3. API 가격. 효율 주장이 실제 요금으로 이어지는지는 가격표가 나와야 판단할 수 있습니다.
  4. 내 과제의 결과. 코딩 에이전트 용도라면 이미 공개된 Kimi K3나 GLM 5.3과 같은 과제를 맡겨 결과와 비용을 함께 비교합니다.

현재 공개된 오픈 웨이트 모델 중에서 바로 고른다면 성능 기준으로는 중국 상위 모델이, 미국 기업 모델이어야 한다는 조건이 있다면 Inkling이 비교 기준입니다. Beam은 독립 평가와 가중치가 나온 뒤 이 두 기준과 다시 비교할 모델입니다.

Share

제대로 이해했는지 한 문제로 확인해 볼까요?

답을 고르면 바로 풀이가 나와요.

2026년 10월 7일 기준으로 Beam을 사용하는 방법으로 맞는 것은 무엇인가요?

이 글이 도움이 되었나요?

이 글 다음 배우기로컬 AI 시작하기 입문입문 코스 · 12편

내 컴퓨터에서 AI를 돌릴 때 필요한 하드웨어, 모델 크기, 실행 도구를 순서대로

  1. 1로컬 AI 뜻과 클라우드 AI와 다른 점
  2. 2오픈 웨이트와 오픈 소스 차이, 라이선스 확인법
  3. 3로컬 AI 하드웨어 기초, VRAM과 통합 메모리와 대역폭
코스 전체 보기 →
이어서 읽기 좋은 글K2 호라이즌 이해하기: 공개 범위와 모델 성능 확인하는 법 →

K2 호라이즌의 공개 범위와 실행 조건을 구분합니다. 모델 카드에서 자료 상태를 확인하고, 벤치마크 보정 점수를 직접 계산해 봅니다.