
앤트로픽이 2026년 9월 22일 Claude Opus 5.5를 공개했습니다. Claude 5.5 제품군의 첫 모델로, 대규모 코드 작업과 장시간 실행되는 에이전트, 전문 지식 업무에 초점을 맞췄습니다.
이번 발표에서 눈에 띄는 부분은 단순한 성능 향상보다 Fable 5.1에 가까운 작업 능력을 Opus 계열의 효율로 구현했다는 점입니다.
Fable 5.1과 비교하면 어느 정도일까?
앤트로픽은 새 모델이 대부분의 업무에서 Fable 5.1 수준으로 작동한다고 설명했습니다. 공개된 평가에서는 Terminal-Bench 4.0, FrontierCode, CursorBench처럼 실제 개발 환경과 가까운 항목에서 Fable 5.1보다 높은 점수를 기록했습니다. 지식 업무를 다루는 GDPval-AA와 컴퓨터 조작 능력을 측정하는 OSWorld에서도 근소하게 앞섰습니다.

수치만 보면 격차가 커 보이는 항목도 있지만, 앤트로픽은 실제 사용에서 두 모델의 차이가 벤치마크만큼 크지는 않다고 밝혔습니다. 평가마다 사고 수준과 실행 조건이 다르기 때문에 순위를 단정하기보다, 복잡한 개발 작업을 끝까지 처리하는 능력이 Fable 5.1에 근접했다는 의미로 보는 편이 정확합니다.
코드 한 줄보다 전체 작업을 얼마나 잘 끝내는지가 중요해졌다
이번 버전은 여러 파일과 저장소를 오가며 진행하는 긴 작업에서 변화가 두드러집니다. 초기 사용자는 68만 줄 규모의 코드 마이그레이션을 하루 안에 마쳤고, 다른 테스트에서는 20만 줄 코드베이스를 세 시간 이내에 점검하고 수정했습니다. 같은 작업에 Opus 5는 20시간 이상 걸렸으며 토큰도 2.5배 더 사용했습니다.
웹 애플리케이션 전체의 로딩 시간을 줄이는 실험에서는 40회 중 39회 목표를 달성했습니다. 이전 모델은 개선 폭이 작았고 기존 동작까지 바꾸는 경우가 있었습니다. 속도만 높이는 데 그치지 않고 기능을 보존하면서 수정했는지를 함께 확인한 사례라 실제 개발과도 맞닿아 있습니다.
Fable 5.1과 직접 비교한 HAProxy 변환 실험도 공개됐습니다. C로 작성된 코드를 Rust로 옮겼을 때 두 결과물 모두 기존 회귀 테스트를 거의 통과했지만, 작업 시간은 12시간에서 9.5시간으로 줄었고 비용은 51% 낮았습니다. 이 수치는 해당 실험에 한정되지만, 장시간 코딩 작업에서 필요한 단계와 토큰을 줄였다는 점은 분명합니다.
토큰 가격보다 작업을 끝내는 비용이 낮아졌다.
API 가격은 100만 토큰 기준으로 입력 4달러, 출력 20달러입니다. Opus 5의 5달러와 25달러에서 각각 20% 내려갔습니다. 에이전트와 코딩 작업에서 사용 비중이 큰 캐시 읽기는 0.50달러에서 0.20달러로 60% 낮아졌으며, 캐시 쓰기는 6.25달러에서 5달러로 조정됐습니다.
앤트로픽의 기본 설정 테스트에서는 단가 인하와 토큰 사용량 감소가 합쳐져 일반적인 작업 비용이 Opus 5보다 약 40% 줄었습니다. 출력 생성 속도도 30% 이상 빨라졌습니다. 더 빠른 응답이 필요한 경우 Claude Code와 Claude Platform에서 최대 2.5배 속도의 Fast mode를 선택할 수 있으며, 입력과 출력 가격은 각각 8달러와 40달러입니다.
설명 방식도 개발자가 검토하기 쉽게 바뀌었다
Opus 5에 자주 제기됐던 피드백 중 하나는 답변이 길고 핵심을 찾기 어렵다는 점이었습니다. 새 버전은 결론을 먼저 제시하고, 전문 용어와 특유의 표현을 줄이며, 사용자가 지정한 문체를 더 잘 따르도록 개선됐습니다.
개발 과정에서는 수정 결과만큼 변경 이유와 확인 범위가 중요합니다. 원인을 먼저 밝히고 어떤 코드가 영향을 받았는지 짧게 설명한다면 리뷰 과정에서 다시 질문하는 횟수를 줄일 수 있습니다. 문서나 분석 자료를 만들 때도 초안을 손보는 부담이 적어질 것으로 보입니다.
오래 실행되는 에이전트를 고려한 안전 장치
모델이 여러 도구를 사용하며 오랜 시간 작업할수록 잘못된 판단 한 번의 영향도 커집니다. 앤트로픽의 자동 행동 감사에서는 지금까지 테스트한 자사 모델 중 가장 높은 점수를 받았으며, 지시 범위를 벗어나거나 되돌리기 어려운 행동을 선택하는 빈도도 낮아졌습니다. 코딩·도구 사용·컴퓨터 조작·웹 탐색 환경의 프롬프트 인젝션 방어 역시 Opus 5와 같거나 더 나은 결과를 보였습니다.
모든 오류를 막는다는 뜻은 아닙니다. 실제 서비스에서는 권한 범위를 제한하고, 중요한 변경 전에 검토 단계를 두며, 테스트와 로그로 결과를 확인하는 운영 방식이 여전히 필요합니다.
어디에서 사용할 수 있을까?
Claude 앱에서는 Pro, Max, Team, Enterprise 요금제에 적용됐습니다. 개발자는 Claude Platform을 비롯해 AWS, Google Cloud, Microsoft Foundry에서 사용할 수 있으며 API 모델 ID는 claude-opus-5-5입니다. 공식 문서에 안내된 컨텍스트 윈도는 100만 토큰, 최대 출력은 12만 8천 토큰입니다.
기존 Opus 5 연동을 옮긴다면 호환성 변경을 먼저 확인해야 합니다. 사고 기능을 끌 수 없고, 강제 도구 호출은 오류를 반환합니다. 사고 블록은 모델과 대화에 연결되며, Claude API와 Google Cloud에서는 이전 computer_20251124 컴퓨터 사용 도구를 받지 않습니다.
대규모 리팩터링이나 코드베이스 감사, 여러 저장소에 걸친 기능 변경, 자료 조사와 문서 작성처럼 중간 단계가 많은 업무라면 이번 업데이트의 차이를 확인하기 좋습니다. 기존에 여러 번 지시해야 끝났던 작업을 같은 조건으로 맡긴 뒤 완료 시간, 수정 횟수, 테스트 결과와 사용량을 함께 비교해 보면 실제 도입 효과를 판단할 수 있습니다.
출처
'AI' 카테고리의 다른 글
| [바미] GPT-6 Sol·Luna가 출시되었습니다! (0) | 2026.09.24 |
|---|---|
| [바미] AI는 미래의 버그를 미리 예측할 수 있을까? (0) | 2026.09.21 |
| [바미] AI가 일을 대신해 주면 사람은 무엇을 준비해야 할까? (0) | 2026.09.10 |
| [바미] AI 에이전트 하나로 충분할까? 작업 흐름과 GraphRAG 이해하기 (0) | 2026.09.09 |
| [바미] Claude와 Figma를 연결하면 화면 디자인부터 웹페이지까지 만들 수 있을까? (0) | 2026.09.08 |