AI

Claude Opus 5.5 발표, 1M 토큰·가격·게임·Three.js 사례까지 정리

1M 컨텍스트와 128K 출력, $4/$20 가격보다 더 눈에 띄는 변화는 장시간 에이전트 작업과 게임·Three.js 결과물에서 보이는 ‘덜 반복하는 능력’입니다.

Claude Opus 5.5의 1M 컨텍스트, 128K 출력, 입력·출력 가격과 게임·Three.js 활용을 요약한 이미지
Anthropic 공식 사양과 가격을 바탕으로 직접 만든 요약 이미지입니다.

Anthropic이 2026년 9월 22일 Claude Opus 5.5를 공개했습니다. 숫자만 보면 1M 토큰 컨텍스트, 최대 128K 출력, 입력 100만 토큰당 4달러와 출력 20달러가 먼저 눈에 들어옵니다.

그런데 이번 발표를 실제 사례까지 같이 보면 더 중요한 변화는 따로 있습니다. 복잡한 일을 한 번에 끝내는 능력보다, 몇 시간짜리 작업에서 문맥을 유지하고 도구 호출과 재시도를 줄이는 능력이 강조됐습니다. 게임과 Three.js 데모가 유독 많이 등장하는 것도 이 변화와 연결됩니다. Anthropic 공식 발표

우선 공식 숫자부터 보면

항목Claude Opus 5.5
발표일2026년 9월 22일
API 모델 IDclaude-opus-5-5
컨텍스트 윈도1M tokens
최대 출력128K tokens
Reliable knowledge cutoff2026년 6월
기본 effortmedium
ThinkingAdaptive, 항상 활성화
입력 / 출력 가격$4 / $20 per 1M tokens

Anthropic의 현재 모델 문서에서 Opus 5.5는 1M 토큰 컨텍스트와 128K 토큰 최대 출력을 지원합니다. 기본 effort는 medium이고 adaptive thinking은 항상 켜집니다. Claude Platform 모델 문서

여기서 1M 토큰을 100만 단어로 읽으면 안 됩니다. 토큰은 모델의 tokenizer가 나누는 단위라 언어와 코드 비중에 따라 실제 문서 분량은 달라집니다. 그래도 대규모 코드베이스, 여러 문서, 로그와 관련 파일을 한 작업 안에서 오래 유지하기에는 상당히 큰 범위입니다.

가격은 정말 얼마나 내려갔을까

1M tokens 기준Opus 5Opus 5.5변화
Input$5$4-20%
Output$25$20-20%
Cache write$6.25$5-20%
Cache read$0.50$0.20-60%
Claude Opus 5를 100으로 놓고 Opus 5.5의 입력, 출력, 캐시 쓰기, 캐시 읽기 단가를 비교한 그래프
Anthropic 공식 가격을 기준으로 직접 만든 비교 그래프입니다. Opus 5 단가를 100으로 두었습니다.

같은 양의 토큰만 쓴다고 가정하면 입력과 출력은 정확히 20% 싸졌습니다. 캐시 읽기는 60% 내려갔습니다. Anthropic이 말하는 “일반적인 작업에서 약 40% 낮은 비용”은 여기서 한 단계 더 나갑니다. 토큰 단가뿐 아니라 같은 일을 끝내는 데 필요한 토큰과 단계도 줄었다는 회사 자체 테스트를 합친 숫자입니다. 출력 생성 속도도 Opus 5보다 30% 이상 빠르다고 설명합니다. 가격·효율 원문 같은 날 나온 GPT-6 Sol·Luna와의 가격 비교는 따로 정리했습니다.

Fast mode도 있습니다. 최대 약 2.5배 속도를 목표로 하고 입력 8달러, 출력 40달러입니다. 사람이 응답을 기다리는 짧은 반복 작업에서는 의미가 있지만, 긴 마이그레이션처럼 밤새 돌리는 일이라면 기본 모드의 비용 효율이 더 중요할 수 있습니다.

벤치마크보다 ‘몇 단계 만에 끝내나’가 더 중요해졌다

벤치마크Opus 5Opus 5.5
Terminal-Bench 4.052.3%66.4%
FrontierCode v1.148.0%54.4%
CursorBench 4.046.6%57.8%
GDPval-AA v2.117081846
AutomationBench26.9%40.0%
OSWorld 2.074.0%81.8%
Anthropic이 공개한 Terminal-Bench, FrontierCode, CursorBench에서 Claude Opus 5와 Opus 5.5를 비교한 그래프
Anthropic 공개 자료 중 코딩 관련 세 항목을 직접 시각화했습니다.

숫자만 보면 상당한 상승입니다. 다만 Anthropic의 대표 표에 들어간 Opus 5.5 결과는 대부분 adaptive thinking의 max effort 조건이고, 기본값은 medium입니다. Terminal-Bench에서는 Opus 5.5를 xhigh로 돌린 결과가 쓰였습니다. 따라서 표의 최고점과 기본 사용 경험을 같은 것으로 보면 안 됩니다. 벤치마크 조건

Anthropic도 상위 모델끼리는 작은 벤치마크 차이가 실제 작업 차이를 충분히 설명하지 못한다고 적었습니다. 이번에 더 흥미로운 숫자는 작업당 단계와 토큰입니다.

한 얼리 테스터는 20만 줄 코드베이스 감사와 수정 작업을 3시간 안에 마쳤다고 보고했습니다. Opus 5는 같은 작업에 20시간 이상 걸렸고 토큰도 2.5배 사용했다는 설명입니다. 다른 사례로는 68만 줄 코드 마이그레이션을 하루 안에 끝냈다는 보고가 있습니다. 둘 다 Anthropic이 선택해 소개한 얼리 액세스 사례라는 점은 감안해야 합니다.

GitHub는 Copilot CLI와 VS Code 테스트에서 Opus 5.5가 측정한 모델 가운데 토큰과 단계가 적은 축에 속했고, VS Code에서는 Opus 5보다 더 많은 터미널 작업을 풀면서 단계 수는 절반 이하였다고 밝혔습니다. Lovable, Quantium, Optiver 등의 사전 테스트도 “재시도와 단계가 줄었다”는 방향으로 비슷한 설명을 내놨습니다. 얼리 테스터 사례

왜 요즘 게임과 Three.js가 체감형 벤치마크가 됐을까

최근 신모델이 나오면 개발자들이 계산 문제보다 브라우저 게임이나 Three.js 장면을 먼저 만들어보는 경우가 많습니다. 결과가 눈에 바로 보이고, 한 작업 안에서 여러 능력을 동시에 요구하기 때문입니다. GPT-6 Astra 때도 3D 게임 사례가 많았는데, 그 이야기는 따로 정리했습니다.

3D 게임 하나만 해도 오브젝트 배치, 카메라, 조명, 재질, 애니메이션, 입력 처리, 물리, 게임 상태, UI와 프레임 성능이 같이 맞아야 합니다. 코드를 많이 쓰는 것만으로는 부족하고, 실제 화면을 보면서 다시 고치는 루프가 필요합니다.

Anthropic도 이번 Opus 5.5 공식 발표에서 이 점을 직접 강조했습니다. 여러 Claude 모델에 같은 단일 프롬프트로 게임을 만들게 한 테스트에서 Opus 5.5가 그래픽과 완성도에서 가장 높은 평가를 받았다고 밝혔습니다. 다만 구체적인 게임 코드와 전체 평가 절차는 공개 발표에 포함되지 않았기 때문에 독립 재현 벤치마크로 보기는 어렵습니다. 공식 발표의 게임 사례

출시 당일 나온 Opus 5.5 Three.js 벚꽃 사례

출시 당일 Reddit의 한 사용자는 Opus 5.5, effort high로 Three.js 기반 벚꽃 3D 장면을 만들었다고 공개했습니다. 프롬프트는 “Build me a high quality 3D Sakura using threejs in HTML CSS js”처럼 짧았고, 작성자는 약 15분이 걸렸다고 설명했습니다. Reddit 원 게시물

이런 사례는 시각적으로 강하지만, 한 사용자의 한 번의 세션이라는 한계도 분명합니다. 실패한 시도 수, 중간 수정, 브라우저 도구 사용 방식까지 모두 공개된 재현 실험은 아닙니다. 그래서 “15분이면 누구나 같은 결과가 나온다”는 식으로 일반화하기보다는 출시 직후의 실사용 신호로 보는 편이 맞습니다.

Rocket Arena와 Claude of Duty는 왜 같이 봐야 할까

여기서 중요한 구분이 있습니다. 최근 X에서 다시 돌고 있는 화려한 Three.js 게임 상당수는 Opus 5.5가 아니라 7월의 Opus 5로 만들어진 사례입니다. 5.5의 직접 성능 증거로 섞으면 안 됩니다.

대표적인 선행 사례가 개발자 am.will의 Rocket Arena입니다. 공개 저장소를 보면 Three.js 렌더링, Rapier 물리, Vite와 TypeScript를 사용한 브라우저 자동차 축구 게임입니다. 1대1·2대2 봇, 연습 모드, 부스트·점프·플립, 게임패드 입력까지 구현돼 있습니다. Rocket Arena GitHub · 실행 링크

당시 X에는 Opus 5가 결과물을 만든 뒤 브라우저에서 직접 게임을 조작하며 동작을 확인하는 영상도 공개됐습니다. 이것은 단순 코드 생성보다 “만든 결과를 실제로 써보고 다시 수정하는 에이전트 루프”가 왜 중요한지 잘 보여준 사례였습니다. 제작 영상 · 플레이 검증 영상

Matt Shumer의 Claude of Duty는 이 흐름을 더 극단적으로 밀어붙인 사례입니다. 공개 저장소 설명 기준으로 Three.js r180과 WebGL2 기반 브라우저 FPS이며 약 5만5천 줄, 11개 서브시스템으로 구성됩니다. 외부 모델·HDRI·이미지·오디오 파일 없이 텍스처, 메시, 애니메이션과 소리를 코드로 절차적으로 생성합니다. Claude of Duty GitHub

원 프롬프트도 공개돼 있습니다. 단순히 “FPS를 만들어라”가 아니라 여러 하위 에이전트가 기능을 나눠 만들고, 별도 비평 에이전트가 실제 Call of Duty와 비교하며 품질 기준을 통과할 때까지 반복하라는 구조입니다. Shumer는 이후 이 방식을 Gauntlet Loop라고 설명했습니다. 공개 프롬프트 · 제작 과정 설명 · X 원 영상

더 중요한 것은 저장소의 자체 회고입니다. 병렬로 여러 에이전트를 투입하는 것만으로 계속 좋아진 게 아니었습니다. 렌더링처럼 서로 강하게 연결된 영역에서는 각 에이전트가 따로 고치면서 오히려 문제를 만들었고, 결합된 관심사를 한 소유자가 순차적으로 수정하는 방식이 더 효과적이었다고 기록돼 있습니다.

즉 “AI가 한 프롬프트로 AAA 게임을 만들었다”는 제목보다, 실제 품질을 높인 핵심이 반복 검증과 에이전트 역할 설계였다는 점이 더 의미 있습니다.

Opus 5.5에서 게임 사례가 더 중요해진 이유

Opus 5의 Rocket Arena와 Claude of Duty가 보여준 것은 “복잡한 시각 결과물을 만들고 스스로 확인할 수 있다”는 가능성이었습니다. Opus 5.5에서 Anthropic이 내세우는 변화는 그 루프의 비용과 반복을 줄이는 쪽입니다.

게임이나 Three.js는 이 차이를 보기 좋습니다. 같은 화면을 만들더라도 카메라가 깨져 다시 고치는 횟수, 도구 호출 수, 스크린샷을 다시 읽는 횟수, 물리나 렌더링 버그를 고치는 반복 횟수가 줄면 결과 체감이 바로 달라집니다.

그래서 앞으로 Opus 5.5의 게임 사례를 볼 때는 화려한 20초 영상보다 다음 정보를 같이 보는 편이 좋습니다.

  • 정확히 어떤 모델과 effort를 사용했는가
  • 처음 프롬프트 외에 사람이 몇 번 개입했는가
  • 브라우저·컴퓨터 사용 도구로 결과를 직접 검증했는가
  • 전체 작업 시간과 토큰 사용량은 얼마인가
  • 실행 가능한 코드나 데모가 공개됐는가

X의 짧은 영상은 결과를 보여주기에는 좋지만 이 조건을 거의 설명하지 않는 경우가 많습니다. 이번 글에서 Opus 5.5 직접 사례와 Opus 5 선행 사례를 분리한 이유도 여기에 있습니다.

개발자가 바로 바꾸기 전에 확인할 부분

API 모델 ID는 claude-opus-5-5입니다. 기존 Opus 5 연동에서 모델 이름만 바꾸고 끝내기보다는 thinking과 tool 호출 동작을 다시 확인하는 편이 좋습니다.

Opus 5.5는 adaptive thinking이 항상 활성화되고 기본 effort가 medium입니다. 기존 시스템이 thinking을 끄는 것을 전제로 하거나 출력 한도를 아주 타이트하게 잡고 있었다면 마이그레이션 테스트가 필요합니다. 공식 모델 문서

비용도 단순한 입력·출력 단가만 비교하면 부족합니다. 실제 서비스에서는 cache hit, tool call 수, 재시도 횟수, effort, 작업 완료 시간까지 함께 재야 합니다. Opus 5.5의 가장 큰 약속이 바로 “비싼 모델 한 번”이 아니라 “전체 작업을 더 적은 단계로 끝낸다”는 데 있기 때문입니다.

안전성 수치도 함께 봐야 한다

Anthropic은 약 2,000개의 시나리오를 사용하는 자동 행동 감사에서 Opus 5.5가 최근 Claude 모델보다 전반적으로 더 좋은 결과를 냈다고 밝혔습니다. 특히 격리 경계를 우회하려는 시도는 Opus 5나 Claude Mythos 5.1보다 약 85% 적었다고 설명합니다.

다만 Anthropic 자신도 사전 평가가 모든 실제 실패를 잡아내는 문제는 아직 해결되지 않았다고 적었습니다. 사이버보안과 생물학 일부 작업에는 별도 safeguard와 fallback이 적용됩니다. 이 수치는 독립적인 일반 성능 점수라기보다 Anthropic의 안전성 평가 결과로 읽어야 합니다. 안전성 설명

그래서 이번 업데이트에서 무엇을 봐야 할까

Opus 5.5는 1M 컨텍스트와 128K 출력, 낮아진 토큰 가격만으로도 큰 업데이트입니다. 하지만 실제로 더 중요한 변화는 긴 작업에서 덜 헤매고, 덜 반복하고, 더 적은 단계로 결과를 끝낼 수 있느냐에 있습니다.

게임과 Three.js가 주목받는 이유도 같습니다. 화려해서만이 아니라 코드·디자인·물리·도구 사용·시각 검증이 한꺼번에 필요해 에이전트의 약점이 빠르게 드러납니다.

출시 직후 기준으로 공식 자료와 초기 사례는 긍정적입니다. 다만 커뮤니티의 멋진 데모가 곧 재현 가능한 평균 성능을 뜻하지는 않습니다. 앞으로 볼 숫자는 벤치마크 한 줄보다 내 실제 작업 하나를 끝내는 데 든 총 토큰, 도구 호출, 시간, 재시도와 사람의 수정량입니다.

출처와 직접 확인 링크

확인한 자료

01Anthropic — Claude Opus 5.5https://www.anthropic.com/claude-opus-5-502Claude Platform Docs — Models overviewhttps://platform.claude.com/docs/en/models/overview03Reddit — Opus 5.5 High Benchmarkhttps://www.reddit.com/r/ClaudeAI/comments/1wngwwq/opus_55_high_benchmark/04GitHub — am-will/rl-opushttps://github.com/am-will/rl-opus05GitHub — mshumer/Claude-of-Dutyhttps://github.com/mshumer/Claude-of-Duty06Matt Shumer — Gauntlet Loophttps://somethingbig.ai/gauntlet-loop07Claude of Duty prompthttps://github.com/mshumer/Claude-of-Duty/blob/main/prompt.md

글 검색