장기 과제(Long-Horizon Task)와 컴퓨터 조작 에이전트의 한계
장기 과제는 사람이 한 시간 넘게 걸리는 일처럼 에이전트가 수백 번의 도구 호출을 이어 가야 끝나는 작업입니다. 짧은 과제에서 높은 점수를 내는 모델도 과제가 길어지면 제약을 놓치고 중간에 바뀐 정보를 반영하지 못해 성공률이 크게 떨어집니다.
같은 말:장기 과제롱 호라이즌컴퓨터 유즈 한계에이전트 긴 작업METR 타임 호라이즌
목차
🤔 데모에서는 되는데 실제 업무에서는 끊길 때
AI가 화면을 보고 마우스와 키보드를 움직여 항공권을 검색하고 표를 채우는 데모는 이제 익숙합니다. 짧은 과제는 실제로 잘 됩니다. 그런데 사람이 한두 시간 걸리는 실제 업무를 통째로 맡기면 중간 어딘가에서 멈추거나, 끝났다고 했는데 절반이 틀려 있는 경우가 많습니다.
짧은 과제와 긴 과제 사이에는 점수 차이 이상의 무엇이 있습니다. 이 편에서는 에이전트가 긴 작업에서 어디서 끊기는지를 공개된 측정 자료로 보고, 그 한계 안에서 일을 맡기는 방법을 정리합니다. 컴퓨터 조작 기능의 현황과 벤치마크 세부는 AI 컴퓨터 유즈 현황에 따로 있습니다.
🔑 장기 과제의 정의
장기 과제(long-horizon task)는 사람이 한 시간 넘게 걸리는 일처럼 에이전트가 수백 번의 도구 호출을 이어 가야 끝나는 작업입니다.
호라이즌(horizon)은 앞을 내다보는 거리를 뜻합니다. 과제가 길다는 것은 단계가 많다는 뜻이고, 단계가 많으면 앞 단계의 작은 실수가 뒤로 갈수록 쌓입니다. 에이전트 루프가 수백 번 돌아야 하는 일에서는 한 번 한 번의 판단이 조금만 어긋나도 전체가 틀어집니다.
컴퓨터 조작 에이전트는 이 한계가 가장 잘 드러나는 경우입니다. 앤트로픽의 컴퓨터 유즈(computer use)는 화면을 캡처해 모델에 보내고, 모델이 클릭이나 입력 같은 다음 동작을 정하면 프로그램이 실행한 뒤 다시 화면을 캡처하는 반복입니다. 2026년 9월 28일 기준 앤트로픽 API와 구글 클라우드에서는 정식 기능이고 도구 17개로 구성되며, 아마존 베드록과 마이크로소프트 파운드리에서는 아직 베타입니다.
📏 작업 길이로 AI의 능력을 측정하는 방법
AI 평가 연구 기관 METR은 모델이 해낼 수 있는 작업의 길이로 능력을 나타냅니다. 50% 타임 호라이즌은 전문가가 걸리는 시간을 기준으로 과제를 나열했을 때, 모델이 절반의 확률로 해낼 수 있는 과제의 길이입니다. AI가 실제로 일한 시간이 아니라 과제가 얼마나 어려운지를 사람의 시간으로 나타낸 값입니다.
2026년 9월 28일 METR 페이지 기준으로 이 길이는 2023년 이후 약 129일마다 두 배로 늘어 왔습니다. 2026년 5월 갱신에서는 가장 앞선 모델의 값이 16시간을 넘었는데, METR은 현재 과제 모음으로는 16시간이 넘는 측정값을 믿기 어렵다고 함께 적었습니다. 모델이 다룰 수 있는 길이는 빠르게 늘고 있지만, 그 길이의 과제를 절반 확률로 해낸다는 뜻이라 맡긴 일이 끝까지 된다는 보장과는 거리가 있습니다.
🖥️ 짧은 과제 80%와 긴 과제 30%대의 차이
컴퓨터 조작 에이전트의 표준 시험은 OSWorld입니다. 실제 운영체제 위에서 과제를 주고 성공 여부를 채점하는데, 짧은 과제로 이뤄진 1.0 버전에서는 2026년 들어 상위 모델이 80%를 넘겼습니다.
2026년 6월 공개된 OSWorld 2.0은 긴 업무로 시험을 다시 짰습니다. 사람이 중앙값 약 1.6시간 걸리는 업무 108개를 모았고, 클로드 오퍼스 4.7을 최대 사고량으로 돌렸을 때 과제당 평균 318번의 도구 호출이 필요했습니다. 1.0에서는 약 30번이었습니다.
| 항목 | OSWorld 2.0에서 확인된 값 |
|---|---|
| 과제 수와 길이 | 108개, 사람 기준 중앙값 약 1.6시간 |
| 과제당 도구 호출 | 평균 318번 (1.0은 약 30번) |
| 최고 완전 성공률 (2026-08-08 공개 결과) | 클로드 오퍼스 5 최대 사고량 31.43%, 부분 점수 68.31 |
| 같은 결과의 2위 | GPT-5.6 Sol 최대 사고량 27.34% |
| 긴 과제의 한계 | 163분을 넘는 과제는 모든 모델의 완전 성공이 0 |
리더보드는 계속 갱신되고 있어서, 2026년 9월 17일 갱신된 최신 결과(v2.1)에서는 같은 오퍼스 5가 44.33%로 올라 있습니다. 결과 버전마다 과제 구성과 채점이 조금씩 달라 두 숫자를 곧바로 비교하기는 어렵습니다. 어느 쪽이든 짧은 과제의 80%대와는 큰 차이가 있다는 점은 같습니다.
사고량을 늘리면 점수가 오르지만 효율은 떨어집니다. 오퍼스 5는 낮은 사고량에서 과제당 약 3만 3천 토큰을 쓰고 22.3%를, 최대 사고량에서 약 10만 3천 토큰을 쓰고 31.4%를 기록했습니다. 토큰을 세 배 넘게 써서 9%포인트를 올린 셈입니다.
🧩 에이전트가 긴 작업에서 끊기는 다섯 지점
OSWorld 2.0 연구진은 에이전트의 실패 습관을 네 가지로 정리했습니다. 제약 조건을 도중에 놓치고, 작업 중간에 도착한 정보를 반영하지 않고, 사용자에게 묻는 대신 추측하고, 결과 확인을 건너뜁니다. 앤트로픽이 긴 작업 하네스를 소개하며 밝힌 실패 하나를 더하면 다섯 지점이 됩니다.
| 끊기는 지점 | 무슨 일이 생기는지 | 대응 |
|---|---|---|
| 제약을 놓침 | 초반에 받은 조건을 수십 단계 뒤에 잊습니다 | 조건을 파일에 두고 단계마다 다시 읽게 합니다 |
| 중간 정보를 반영하지 않음 | 작업 중 새 메일이 와서 대상이 바뀌어도 앞의 계획대로 갑니다 | 새 정보가 올 수 있는 곳을 구간마다 확인하게 합니다 |
| 묻지 않고 추측함 | 자료가 서로 맞지 않을 때 한쪽을 골라 계속합니다 | 모순이 보이면 멈추고 묻게 지시합니다 |
| 확인을 건너뜀 | 입력한 값이 실제로 저장됐는지 보지 않고 넘어갑니다 | 단계마다 화면을 캡처해 결과를 평가하게 합니다 |
| 일찍 끝났다고 선언함 | 진척된 흔적을 보고 다 됐다고 판단합니다 | 완료 조건 목록을 두고 하나씩 확인한 뒤에만 표시합니다 |
화면을 읽지 못해서 실패하는 경우보다 흩어진 정보를 하나로 맞추지 못해서 실패하는 경우가 많습니다. 긴 작업에서는 대화가 컨텍스트 윈도우를 넘기 쉽고, 오래된 내용을 요약해 비우는 과정에서 초반의 조건이 빠지기도 합니다. 앤트로픽은 요약만으로는 충분하지 않다고 적고, 진행 기록과 기능 목록을 파일로 남겨 다음 세션이 읽게 하는 하네스를 해법으로 제시했습니다.
앤트로픽 공식 문서의 권장 사항도 같은 곳을 겨냥합니다. 각 단계 뒤에 화면을 캡처해 의도한 결과가 나왔는지 꼼꼼히 평가하라고 지시에 적고, 드롭다운이나 스크롤 막대처럼 마우스로 다루기 까다로운 요소는 키보드 단축키를 쓰게 하라고 권합니다.
🔐 화면에 적힌 글이 지시로 작동하는 위험
컴퓨터 조작에는 다른 자동화에 없는 위험이 하나 더 있습니다. 모델이 화면의 글자를 읽고 판단하기 때문에, 웹 페이지나 이미지에 심어 둔 문장이 사용자의 지시를 덮어쓰거나 실수를 유도할 수 있다고 앤트로픽 문서가 경고합니다. 이런 공격을 프롬프트 인젝션이라고 부릅니다. 앤트로픽은 도구가 돌려주는 화면을 자동으로 검사하는 장치를 두고 있지만, 문서는 권한을 최소로 준 전용 가상 머신이나 컨테이너에서 실행하라고 먼저 권합니다.
- 격리된 환경: 개인 계정이 로그인된 컴퓨터가 아니라 전용 가상 머신이나 컨테이너에서 돌립니다
- 민감 정보 차단: 로그인 정보처럼 새어 나가면 곤란한 자료는 접근 대상에서 뺍니다
- 사람 확인: 결제, 발송, 약관 동의처럼 되돌릴 수 없는 동작은 사람이 승인합니다
✂️ 긴 업무를 맡기는 방법
지금 수치를 기준으로 하면 판단은 비교적 단순합니다. 연동 통로가 있는지, 작업이 긴지, 되돌릴 수 있는지를 봅니다.
- 연동 통로가 있으면 그쪽을 씁니다: API나 MCP 연결은 화면 조작보다 빠르고 결과가 일정합니다. 컴퓨터 조작은 다른 길이 없을 때의 선택지입니다
- 구간을 짧게 나눕니다: 한 시간짜리 업무를 5분에서 10분 단위로 나눠 맡기면 짧은 과제의 높은 성공률을 그대로 씁니다
- 구간마다 결과를 확인합니다: 사람이 보거나, 별도 검사가 확인한 뒤에 다음 구간으로 넘어갑니다
- 상태를 파일에 남깁니다: 무엇을 끝냈고 무엇이 남았는지 기록해 두면 세션이 끊겨도 이어 갈 수 있습니다
구간을 나눠 여러 에이전트에게 맡기는 구조는 멀티 에이전트 오케스트레이션에서 다뤘습니다.
❓ 자주 묻는 질문
추론 강도를 최대로 올리면 긴 과제도 해결되나요?
점수는 오르지만 비용만큼 오르지는 않습니다. OSWorld 2.0에서 클로드 오퍼스 5는 최대 사고량에서 낮은 사고량보다 토큰을 세 배 넘게 쓰고 9%포인트를 올렸습니다. 긴 과제의 실패는 생각할 시간이 모자라서보다 흩어진 정보를 맞추지 못해서 생기는 경우가 많아, 구간을 나누고 상태를 파일에 남기는 편이 효과가 큽니다.
컴퓨터 조작 에이전트를 내 컴퓨터에서 바로 돌려도 되나요?
권하지 않습니다. 앤트로픽 문서는 권한을 최소로 준 전용 가상 머신이나 컨테이너에서 실행하라고 안내합니다. 화면에 심어 둔 문장이 지시로 작동할 수 있어서, 개인 계정이 로그인된 컴퓨터에서 돌리면 피해 범위가 그 계정 전체가 됩니다.
타임 호라이즌이 16시간을 넘었다면 하루치 일을 맡길 수 있다는 뜻인가요?
그렇게 보기는 어렵습니다. 50% 타임 호라이즌은 그 길이의 과제를 절반 확률로 해낸다는 값이고, METR 스스로 16시간을 넘는 측정값은 현재 과제 모음으로는 믿기 어렵다고 적었습니다. 시험 과제에서의 성공과 실제 업무를 믿고 맡기는 것 사이에는 여전히 거리가 있습니다.
📋 3줄 요약
-
장기 과제는 사람이 한 시간 넘게 걸리는 일처럼 에이전트가 수백 번의 도구 호출을 이어 가야 끝나는 작업이고 짧은 과제 점수로는 이 구간의 성공률을 알 수 없습니다.
-
사람이 중앙값 1.6시간 걸리는 업무 108개로 이뤄진 OSWorld 2.0에서 2026년 8월 공개 결과의 최고 완전 성공률은 31.43%였고 163분을 넘는 과제는 모든 모델이 끝까지 해내지 못했습니다.
-
실패는 여러 출처를 대조하거나 중간에 바뀐 정보를 반영하는 데서 많이 나오므로 긴 업무는 짧은 구간으로 나누고 구간마다 사람이 결과를 확인합니다.
📚 참고 자료
- 앤트로픽 개발자 문서, Computer use tool: https://platform.claude.com/docs/en/agents-and-tools/tool-use/computer-use-tool
- METR, Task-Completion Time Horizons of Frontier AI Models: https://metr.org/time-horizons/
- XLANG Lab, OSWorld 2.0: https://osworld-v2.xlang.ai/
- 앤트로픽, Effective harnesses for long-running agents: https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents

제대로 이해했는지 한 문제로 확인해 볼까요?
답을 고르면 바로 풀이가 나와요.
사람이 두 시간 걸리는 경비 정산 업무를 컴퓨터 조작 에이전트에게 맡기려 합니다. 공개 벤치마크 결과에 비춰 가장 알맞은 방식은 무엇일까요?

