애플 LensVLM-9B 정리: 긴 문서를 이미지로 압축해 훑고 필요한 쪽만 펼쳐 읽는 모델
LensVLM-9B는 애플이 2026년 9월 21일 허깅페이스에 공개한 94억 파라미터 비전 언어 모델입니다. 긴 글을 작은 이미지로 찍어 토큰을 줄인 뒤, 질문에 필요한 쪽만 골라 원문으로 다시 펼쳐 읽습니다. 작동 방식과 벤치마크, RAG와 견준 결과, 연구 목적으로만 쓸 수 있는 라이선스 조건을 모델 카드와 논문 기준으로 정리했습니다.

목차
세 줄로 먼저 읽기
이번 방문에서 한 편은 바로 볼 수 있습니다.
긴 계약서나 보고서 수십 쪽을 AI 모델에 통째로 넣으면 그만큼 토큰이 들어갑니다. 토큰은 모델이 글을 쪼개 읽는 단위이고, 많이 넣을수록 비용과 메모리 사용량이 함께 늘어납니다. 그래서 문서를 잘라 필요한 조각만 찾아 넣는 RAG(검색 증강 생성) 방식이 널리 쓰여 왔습니다.
최근에는 다른 길도 시험되고 있습니다. 글을 글자로 넣지 않고 이미지로 찍어서 넣는 방법입니다. 이미지 한 장은 크기가 같으면 늘 같은 수의 토큰으로 바뀌므로, 글을 작게 찍을수록 토큰이 줄어듭니다. 문제는 작게 찍을수록 글자가 뭉개져 모델이 읽지 못한다는 점입니다.
LensVLM-9B는 애플이 2026년 9월 21일 허깅페이스에 공개한 94억 파라미터 비전 언어 모델(VLM)로, 압축된 이미지로 문서 전체를 훑은 뒤 필요한 쪽만 골라 원문으로 다시 펼쳐 읽습니다. 비전 언어 모델은 이미지와 글을 함께 입력받는 모델을 말합니다. 파라미터는 모델이 학습하면서 맞춰 놓은 숫자이고, 이 숫자들을 담은 파일을 가중치라고 부릅니다. 지금부터 모델 카드와 논문, 공식 코드 저장소를 2026년 9월 29일 기준으로 대조해 작동 방식과 성능, 쓸 수 있는 범위를 정리합니다. 모델을 직접 내려받아 실행하지는 않았고, 성능 수치는 모두 논문에 실린 값입니다.
LensVLM-9B 한눈에 보기
모델 카드와 논문에 흩어진 기본 정보를 표로 정리했습니다.
| 항목 | 내용 |
|---|---|
| 공개 | 허깅페이스 2026년 9월 21일, 코드 저장소 9월 22일 |
| 논문 | arXiv 2605.07019, 2026년 5월 7일 제출 |
| 만든 곳 | 애플과 듀크 대학교 연구진 |
| 기반 모델 | 알리바바의 Qwen3.5-9B-Base (논문 기준. 모델 카드는 Qwen3.5-9B로 표기) |
| 크기 | 파라미터 약 94억 개, BF16(숫자 하나를 16비트로 저장하는 형식), 가중치 파일 18.8GB |
| 압축 옵션 | 5배, 10배, 15배 |
| 모델 라이선스 | Apple Machine Learning Research Model License (연구 목적 전용) |
| 코드 라이선스 | Apple Sample Code License |
논문은 넉 달여 전에 나왔고 당시에는 코드와 모델이 법무 검토 중이라고 적혀 있었습니다. 이번에 공개된 것은 그 검토를 마친 가중치와 코드입니다. 2026년 9월 29일 조회 기준으로 허깅페이스 좋아요는 263개, 최근 한 달 다운로드는 1,956회입니다.
글을 이미지로 넣을 때 생기는 문제
글을 이미지로 찍어 넣는 방식을 논문은 시각 텍스트 압축이라고 부릅니다. 같은 글을 더 작은 이미지에 더 빽빽하게 찍으면 이미지 한 장이 차지하는 시각 토큰이 줄어듭니다. 시각 토큰은 이미지를 잘게 나눈 조각 하나하나가 모델 안에서 차지하는 단위입니다.
아래는 논문에 실린 이미지로, 같은 글을 세 가지 크기로 찍은 것을 나란히 놓았습니다. 왼쪽부터 5배, 10배, 15배 압축입니다.
단계마다 이미지 크기와 글꼴이 정해져 있습니다.
| 압축 | 이미지 크기 | 글꼴 크기 | 이미지당 시각 토큰 | 1만 토큰 문서의 시각 토큰 |
|---|---|---|---|---|
| 5배 | 256 x 284 | 8pt | 72 | 1,800 |
| 10배 | 192 x 252 | 6pt | 48 | 912 |
| 15배 | 128 x 190 | 5pt | 24 | 648 |
1만 토큰짜리 문서가 15배 압축에서는 648토큰으로 줄어듭니다. 대신 모델이 글자를 제대로 읽지 못합니다. 학습하지 않은 기반 모델에 압축 이미지만 주고 질문하면 5배 압축에서 정확도가 31.3%였고, 원문을 글자로 전부 넣었을 때는 72.4%였습니다. 논문의 표현으로는 압축이 어느 선을 넘으면 픽셀에 정보가 아예 남아 있지 않습니다.
지금까지의 연구는 뭉개진 글자를 더 잘 읽도록 모델을 훈련하는 방향이었습니다. LensVLM 연구진은 방향을 바꿔, 모델이 읽기 어려운 이미지는 위치를 찾는 데만 쓰고 내용은 원문에서 읽게 했습니다.
LensVLM이 답을 찾는 순서
서류 수십 장을 축소 복사해 책상에 펼쳐 놓고 필요한 장만 원본으로 꺼내 읽듯, LensVLM은 압축 이미지 전체를 먼저 보고 필요한 쪽만 원문으로 불러옵니다. 순서는 네 단계입니다.
- 문서를 쪽 단위로 나눠 압축 이미지로 찍고, 질문과 함께 전부 모델에 넣습니다
- 모델이 이미지를 훑으며 어느 쪽에 근거가 있을지 추론합니다
- Expand 도구를 호출해 고른 쪽의 원문을 받습니다. 한 번에 한 쪽씩 부릅니다
- 받은 원문으로 답하거나, 더 필요하면 다른 쪽을 다시 부릅니다
공식 저장소의 예시 실행 결과가 이 과정을 그대로 보여 줍니다. 질문은 영화 「Kiss and Tell」에서 코를리스 아처를 연기한 배우가 맡았던 정부 직책이 무엇인지였고, 모델에는 압축 이미지 15장이 들어갔습니다. 모델은 10쪽에 미국 배우 이야기가 있다고 보고 도구 이름이 read_page인 Expand 도구로 10쪽을 불러왔습니다. 돌아온 원문에서 미국 의전장을 지냈다는 문장을 찾아 두 번 주고받은 끝에 답을 냈습니다. 저장소 README에 실린 출력입니다.
한 질문에 주고받는 횟수는 여섯 번까지로 제한돼 있는데 도구 호출의 실제 평균은 1.3번이었습니다. 한 번만 불러도 정확도 상승분의 대부분이 나왔습니다.
도구가 돌려주는 것은 세 종류로 실험됐습니다.
- 원문 텍스트: 글을 찍어 만든 이미지라면 가장 정확합니다
- OCR 텍스트: 원문이 없을 때 이미지 속 글자를 인식해 뽑은 글입니다. 글을 찍어 만든 이미지 실험에서는 원문과 비슷한 성능을 냈고, 실제 PDF에서는 고해상도 이미지보다 낮았습니다
- 고해상도 이미지: 표와 그림 배치가 중요한 PDF에서는 글만 뽑는 것보다 나았습니다
LensVLM 학습 방법과 단계별 효과
기반 모델은 Expand 도구를 쓸 줄 모르기 때문에 연구진은 세 단계로 가르쳤습니다.
준비로 연구진은 기반 모델이 압축 이미지만 보고는 틀린 문제를 골라냈는데, 전체의 73.5%가 여기에 해당했습니다. 첫 단계는 모범 풀이 만들기입니다. 더 큰 모델인 Qwen3.5-397B에 질문과 정답, 근거 원문을 함께 주고 추론과 도구 호출이 섞인 풀이를 쓰게 했습니다. 둘째 단계는 이 풀이를 쓴 지도 미세조정(SFT)으로, 정답이 있는 예시를 따라 하게 하는 추가 학습입니다. 셋째 단계는 강화학습(RL)이고 모델이 직접 풀어 본 뒤 답이 맞으면 점수를 받습니다.
| 단계 | 5배 | 10배 | 15배 |
|---|---|---|---|
| 기반 모델 | 31.3% | 21.0% | 18.1% |
| 지도 미세조정 뒤 | 63.7% | 56.9% | 45.7% |
| 강화학습까지 (LensVLM) | 68.9% | 62.1% | 52.1% |
도구 사용법은 지도 미세조정에서 거의 다 익혔고, 강화학습은 어느 쪽을 고를지 판단을 다듬는 역할이었습니다. 근거가 있는 쪽을 맞게 고른 비율은 5배에서 76.8%, 10배에서 71.0%, 15배에서 52.1%입니다. 이미지를 읽는 시각 인코더는 학습 내내 고정했고 언어 모델 부분만 고쳤습니다.
모델 크기도 시험했습니다. 같은 방법으로 세 가지 크기의 모델을 학습시킨 결과입니다.
| 모델 크기 | 5배 압축 정확도 |
|---|---|
| 2B | 45.5% |
| 4B | 56.3% |
| 9B | 68.9% |
이미지 이해와 여러 단계 계획, 독해를 한꺼번에 하려면 9B가 최소 규모라는 것이 논문의 설명입니다.
RAG와 견준 벤치마크 결과
평가 지표는 질의응답 벤치마크 일곱 개의 평균 정확도입니다. 넷은 학습에 쓴 데이터셋과 같은 종류이고 셋은 학습에 쓰지 않은 종류입니다. 비교 대상도 답을 읽고 쓰는 모델은 모두 Qwen3.5-9B-Base로 맞췄습니다. 표의 BM25는 낱말이 겹치는 정도로 문서를 찾는 검색이고, 임베딩 검색은 글을 숫자 묶음으로 바꿔 뜻이 가까운 문서를 찾는 검색입니다.
| 방식 | 5배 | 10배 | 15배 |
|---|---|---|---|
| 원문 전체 (상한) | 72.4% | 72.4% | 72.4% |
| 압축 이미지만 | 31.3% | 21.0% | 18.1% |
| LLMLingua-2 (덜 중요한 토큰 삭제) | 47.2% | 37.6% | 33.0% |
| BM25 (키워드 검색) | 62.5% | 55.7% | 50.8% |
| BGE-M3 (임베딩 검색) | 65.1% | 57.1% | 51.9% |
| LensVLM | 68.9% | 62.1% | 52.1% |
| LensVLM의 실효 압축 | 4.3배 | 7.4배 | 10.1배 |
실효 압축은 원문 토큰 수를 모델이 실제로 처리한 토큰 수로 나눈 값입니다. LensVLM은 도구가 돌려준 원문까지 읽으므로 이름에 붙은 5배보다 낮은 4.3배가 됩니다.
표에서 알 수 있는 점은 세 가지입니다.
- 낮은 압축에서는 상한에 가깝습니다. 5배 설정에서 68.9%로, 원문을 전부 넣은 72.4%와 3.5퍼센트포인트 차이입니다
- 15배 설정에서는 검색 방식과 차이가 거의 없습니다. 10배 설정에서는 표의 두 검색 방식보다 5.0에서 6.4퍼센트포인트 앞섰는데, 15배에서는 LensVLM 52.1%, BGE-M3 51.9%입니다. 이때 검색 방식의 실효 압축은 11.9배로 LensVLM의 10.1배보다 높았습니다
- 데이터셋에 따라 검색이 앞서기도 합니다. 학습에 쓰지 않은 데이터셋 가운데 5배 설정의 RULER에서는 BM25와 임베딩 검색이, Qasper에서는 일부 임베딩 검색이 LensVLM보다 높았습니다
그래서 LensVLM이 RAG를 대체한다고 보기는 어렵습니다. 논문도 두 방식이 보완 관계라고 적었습니다. 검색 방식은 질문을 받기 전에 문서 전체로 색인(검색용 목록)을 만들어야 하고 임베딩 검색은 그 과정에 GPU가 필요한데, LensVLM은 사전 작업이 이미지를 찍는 CPU 작업뿐입니다. 반대로 같은 문서에 질문이 여러 번 들어온다면 색인 비용은 한 번만 들기 때문에 검색 방식이 유리합니다.
글이 아닌 자료에서도 시험했습니다. 이 가운데 PDF 실험은 문서 데이터로 따로 학습한 변형 모델의 결과이고, 공개된 LensVLM-9B로 측정한 값이 아닙니다.
| 과제 | 방식 | 5배 | 10배 | 15배 |
|---|---|---|---|---|
| 긴 PDF 문서 (MMLongBench-Doc) | 압축 이미지만 | 51.2% | 40.3% | 31.1% |
| 긴 PDF 문서 (MMLongBench-Doc) | LensVLM + 고해상도 확대 | 50.5% | 46.6% | 41.9% |
| 코드 이해 | 압축 이미지만 | 26.7% | 6.1% | 3.2% |
| 코드 이해 | LensVLM | 38.1% | 26.1% | 20.0% |
PDF 문서는 5배 압축에서 도구 없이 읽었을 때가 조금 높았고, 압축이 커질수록 도구를 썼을 때가 앞섰습니다. 코드는 코드 데이터로 따로 학습하지 않고도 효과가 있었지만 원문을 넣은 65.6%와는 차이가 큽니다.
메모리는 줄고 응답 시간은 늘어납니다
논문 부록에 효율 측정이 있습니다. 측정 장비는 엔비디아 B200 GPU 여덟 장입니다.
| 입력 | 원문 전체 | LensVLM (15배) | 줄어든 비율 |
|---|---|---|---|
| 이미지 20장 분량 | 10,686토큰 | 2,288토큰 | 78.6% |
| 이미지 100장 분량 | 51,273토큰 | 8,090토큰 | 84.2% |
토큰이 줄어든 만큼 KV 캐시, 곧 모델이 앞서 읽은 내용을 다시 계산하지 않으려고 GPU 메모리에 쌓아 두는 값도 줄어듭니다. 100장 분량에서 약 1.6GB가 약 0.25GB로 내려갔습니다.
치르는 값은 시간입니다. 도구를 한 번 부르면 추론을 두 번 이어서 해야 하므로, 원문을 한 번에 읽을 때 약 8초 걸리던 답이 약 17초로 늘었습니다. 애플도 이 방법의 목표가 속도가 아니라 압축으로 잃은 정확도를 되찾는 것이라고 적었습니다. 응답을 바로 돌려줘야 하는 서비스보다는 메모리가 빠듯한 환경에서 긴 문서를 처리하는 작업에 맞는 구성으로 보입니다.
LensVLM-9B 라이선스와 실행 조건
가중치를 받기 전에 라이선스를 먼저 봐야 합니다. 모델 파일에는 Apple Machine Learning Research Model License가 적용되고 조건은 이렇습니다.
| 항목 | 내용 |
|---|---|
| 허용 범위 | 비영리 과학 연구와 학술 목적의 사용, 복제, 수정, 재배포 |
| 허용되지 않는 것 | 상업적 이용, 제품 개발, 상업 제품이나 서비스에 넣는 것 |
| 파생 모델 | 미세조정하거나 고친 모델도 연구 목적으로만 쓸 수 있음 |
| 재배포 | 라이선스 사본과 출처 문구를 함께 제공하고 수정 내용을 밝혀야 함 |
| 해지 | 조건을 어기면 애플이 해지할 수 있고, 해지되면 사본을 지워야 함 |
허깅페이스에는 이 모델을 양자화한, 즉 숫자 정밀도를 낮춰 파일을 줄인 변형이 아홉 개 올라와 있는데, 원래 모델을 수정해 만든 것이라 파생 모델에 해당해 같은 조건을 따르는 것으로 보입니다. 기반 모델인 Qwen3.5의 라이선스와는 별개로 애플이 고친 부분까지 포함한 전체 파일에 이 조건이 걸립니다. 코드는 Apple Sample Code License로 따로 배포됩니다.
실행 방법은 모델 카드에 적힌 그대로입니다.
git clone https://github.com/apple-aiml-research/ml-lensvlm
cd ml-lensvlm
pip install -r requirements.txt
python scripts/run_demo.py --model apple/LensVLM-9B자기 문서로 시험할 때는 텍스트 파일과 질문, 압축 단계를 넘깁니다.
python demo.py \
--model apple/LensVLM-9B \
--text_file document.txt \
--question "What is the main finding?" \
--compression 10x필요한 하드웨어는 공식 자료에 적혀 있지 않습니다. 확인되는 것은 가중치 파일이 18.8GB라는 점까지입니다. 논문의 B200 여덟 장은 학습과 측정에 쓴 장비이지 추론의 최소 사양이 아닙니다. 입력 형식도 확인해야 합니다. 예시 명령은 텍스트 파일을 받아 직접 이미지로 찍는 구조입니다. 논문은 언어별 성능을 따로 보고하지 않아서, 한국어 문서에서 같은 정확도가 나오는지는 공개된 자료로는 알 수 없습니다.
LensVLM 방식 가운데 실무에 적용할 수 있는 것
라이선스 때문에 이 모델을 서비스에 바로 넣을 수는 없습니다. 그래도 방식은 가져갈 수 있습니다. 연구진은 학습하지 않은 모델 두 가지에 프롬프트만으로 같은 절차를 적용했습니다. 압축 이미지를 주고 어느 쪽에 답이 있을지 고르게 한 뒤 그 쪽의 원문을 넘기는 방식인데, 압축 이미지만 줬을 때보다 Qwen3.5-9B-Base는 7.9에서 10.2퍼센트포인트, Claude Sonnet 4.6은 평균 4.8에서 9.0퍼센트포인트 올랐습니다. 다만 오른 뒤의 정확도는 따로 봐야 합니다. 학습하지 않은 Qwen3.5-9B-Base는 5배 설정에서 39.2%로 BM25의 62.5%에 못 미쳤고, 논문도 위치를 제대로 고르려면 추가 학습이 필요하다고 적었습니다.
어느 방식이 맞는지는 문서와 질문의 성격에 따라 달라집니다.
| 상황 | 맞는 방식 |
|---|---|
| 근거가 문서 여러 곳에 흩어져 있어 상위 몇 조각만 뽑으면 빠지는 경우 | 압축 이미지로 전체를 보는 방식 |
| 표와 그림 배치가 답에 영향을 주는 PDF | 압축 이미지와 고해상도 확대 |
| 색인을 미리 만들 시간이 없거나 문서가 한 번만 쓰이는 경우 | 압축 이미지 방식 |
| 근거가 몇 군데에 몰려 있고 같은 문서에 질문이 반복되는 경우 | RAG |
| 응답 속도가 중요한 서비스 | RAG 또는 원문 직접 입력 |
RAG와 미세조정 가운데 무엇을 고를지는 RAG와 파인튜닝 차이에 따로 정리해 두었습니다.
자주 묻는 질문
LensVLM-9B를 회사 서비스에 써도 되나요?
쓸 수 없습니다. 라이선스가 비영리 과학 연구와 학술 목적으로 범위를 정했고 상업적 이용과 제품 개발, 상업 서비스에 넣는 것을 명시적으로 제외했습니다. 미세조정하거나 양자화한 파생 모델도 같은 조건을 따릅니다.
LensVLM이 RAG를 대체하나요?
논문 결과만 보면 대체보다 보완에 가깝습니다. 5배 압축에서는 LensVLM이 텍스트 검색 방식보다 3.8에서 6.4퍼센트포인트 높았지만 15배에서는 임베딩 검색과 거의 같았고, 일부 데이터셋에서는 검색이 앞섰습니다. 값싼 검색으로 관련 없는 부분을 먼저 걸러 낸 뒤 이미지로 찍는 조합도 가능하다고 논문에 적혀 있습니다.
맥이나 개인 컴퓨터에서 실행할 수 있나요?
공식 자료에는 최소 사양이 없습니다. 가중치 파일이 18.8GB이므로 메모리가 그보다 넉넉해야 한다는 정도만 알 수 있습니다. 파일 크기가 메모리보다 작아도 GPU에 올라가지 않는 경우가 있다는 점은 Qwen3.8 27B 로컬 실행 결과에서 다뤘습니다.
정리
| 항목 | 내용 |
|---|---|
| 무엇 | 글을 압축 이미지로 넣어 훑고 필요한 쪽만 원문으로 펼쳐 읽는 94억 파라미터 모델 |
| 성능 | 질의응답 일곱 종 평균에서 실효 압축 4.3배에 68.9%, 원문 전체는 72.4% |
| 한계 | 15배 설정에서는 기존 검색 방식과 비슷, 응답 시간 약 두 배 |
| 라이선스 | 비영리 연구 전용, 파생 모델 포함 |
| 확인되지 않은 것 | 추론 최소 사양, 한국어 문서 성능, 공개 모델의 PDF 성능 |
지금 이 모델에서 얻을 것은 가중치보다 방식이라고 생각하는 편입니다. 문서를 흐릿하게라도 전부 보여 주고 모델이 필요한 부분을 스스로 고르게 하는 절차는 다른 모델에 프롬프트로도 적용할 수 있습니다. 긴 문서를 다루는 작업에서 메모리가 먼저 부족해지는지 응답 시간이 먼저 문제가 되는지를 확인하고, 메모리가 문제라면 작은 범위에서 시험해 볼 만합니다.
Sources

제대로 이해했는지 한 문제로 확인해 볼까요?
답을 고르면 바로 풀이가 나와요.
글자를 알아보기 어려운 15배 압축 이미지에서 LensVLM-9B가 답을 찾는 방법은 무엇일까요?
이 글이 도움이 되었나요?
메일, 회의록, 리포트처럼 반복되는 일을 AI로 자동화하는 순서와 안전장치를 다룹니다
코스 전체 보기 →
새 글과 AI 소식을 메일로 받아 보세요
AI가 바꾸는 일과 도구, 측정 실무 이야기를 매주 한 번 보내 드려요.
