AI 뉴스

클로드 오퍼스 5.5 출시 — 페이블급 성능에 비용 40% 절감, 가격·벤치마크 총정리

sombaragi 2026. 9. 23. 11:30
🤖 AI 뉴스

앤트로픽이 9월 22일 클로드 오퍼스 5.5를 출시했다. 오퍼스 5.5는 페이블 5.1급 성능을 내면서 오퍼스 5보다 운영 비용이 40% 낮다. 가격, 벤치마크, 안전장치, 사용법을 정리했다.

클로드 오퍼스 5.5 출시를 표현한 빛나는 신경망 노드와 상승하는 벤치마크 막대 형태의 3D 일러스트

앤트로픽이 미국 시간 9월 22일 새 모델 클로드 오퍼스 5.5를 공개했다. 7월 24일 오퍼스 5가 나온 지 두 달 만이고, 새 클로드 5.5 제품군의 첫 모델이다. 앤트로픽은 오퍼스 5.5가 대부분의 작업에서 상위 모델인 클로드 페이블 5.1 수준의 성능을 내면서, 일반적인 작업량 기준 비용은 오퍼스 5보다 40% 적게 든다고 밝혔다. 무엇이 달라졌는지, 가격과 벤치마크, 사용법을 순서대로 정리한다.

오퍼스 5.5, 무엇이 달라졌나

오퍼스 5.5의 핵심은 성능과 효율을 함께 올렸다는 점이다. 앤트로픽은 오퍼스 5.5를 코딩과 지식 업무에서 가장 앞선 모델로 소개했다. 초기 테스터 사례도 구체적이다. 한 테스터는 68만 줄 규모의 코드 마이그레이션을 하루 안에 끝냈고, 웹 앱 전체 페이지의 로딩 속도를 줄이라는 과제에서 오퍼스 5.5는 40번 중 39번 성공했다. 20만 줄 코드베이스 감사·수정은 3시간이 안 걸렸는데, 오퍼스 5는 20시간 넘게 걸리고 토큰을 2.5배 썼다.

글쓰기도 바뀌었다. 오퍼스 5에 대한 가장 흔한 불만이 장황하고 따라가기 어려운 답변이었는데, 오퍼스 5.5는 중요한 정보를 앞에 두고 전문용어를 줄이며 사용자가 준 작성 규칙을 더 잘 따른다고 앤트로픽은 설명했다. 출력 속도는 오퍼스 5보다 30% 이상 빠르다. 소네트 5.5와 하이쿠 5.5도 몇 주 안에 나올 예정이다.

클로드 오퍼스 5.5 핵심 요약

  • 출시: 2026년 9월 22일(미국 시간), 발표 주체 앤트로픽
  • 성능: 대부분 작업에서 클로드 페이블 5.1 수준, 오퍼스 5 대비 큰 폭 향상
  • 비용: 일반 작업량 기준 오퍼스 5보다 40% 저렴, 출력 속도 30% 이상 향상
  • 모델 ID: claude-opus-5-5, AWS·구글 클라우드·마이크로소프트 애저에서도 제공

오퍼스 5.5 가격 — 토큰 단가와 캐시 비용

오퍼스 5.5의 API 요금은 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러다. 오퍼스 5의 5달러·25달러보다 20% 낮다. 에이전트와 코딩 작업 비용의 대부분을 차지하는 캐시 읽기는 100만 토큰당 0.2달러로 오퍼스 5의 0.5달러보다 60% 낮고, 캐시 쓰기는 6.25달러에서 5달러로 내려갔다.

토큰 단가만 내려간 것이 아니다. 앤트로픽은 오퍼스 5.5가 같은 작업을 더 적은 토큰으로 끝내기 때문에, 단가 인하와 합치면 전체 비용이 40% 줄어든다고 설명했다. 클로드 코드와 클로드 플랫폼에서는 최대 2.5배 빠른 패스트 모드도 쓸 수 있는데, 요금은 입력 8달러·출력 40달러다.

구독 사용자에게도 변화가 있다. 프로, 맥스, 팀, 좌석 기반 엔터프라이즈 요금제의 5시간 사용 한도가 늘었고, 사용 한도 초기화 기회를 한 번 저장해 두었다가 원하는 때 쓸 수 있게 됐다.

오퍼스 5.5 벤치마크 — 페이블 5.1·GPT-6와 비교

앤트로픽이 공개한 표에서 오퍼스 5.5는 터미널 작업을 평가하는 Terminal-Bench 4.0에서 66.4%를 기록했다. 페이블 5.1은 55.8%, 오퍼스 5는 52.3%, 오픈AI의 GPT-6 Astra는 57.9%였다. 코딩 에이전트 평가인 CursorBench 4.0에서는 57.8%로 페이블 5.1(51.8%), 오퍼스 5(46.6%), GPT-5.6 Sol(41.7%)을 앞섰다. 병합 가능한 코드 변경을 보는 FrontierCode v1.1에서도 54.4%로 GPT-6 Astra(53.3%)보다 높았다.

지식 업무에서도 격차가 난다. 44개 직업의 실제 업무를 평가하는 GDPval-AA v2.1에서 오퍼스 5.5는 1,846 Elo로 페이블 5.1(1,735), 오퍼스 5(1,708), GPT-6 Astra(1,542)를 앞섰다. 도구를 쓴 인류의 마지막 시험(Humanity's Last Exam)은 67.7%, 컴퓨터 사용 평가 OSWorld 2.0은 81.8%였다. 반면 비즈니스 워크플로 평가 AutomationBench(40.0% 대 41.4%)와 과학 연구 평가 Terminal-Bench-Science(58.7% 대 64.6%)에서는 GPT-6 Astra가 앞섰다.

앤트로픽은 이 수준에서는 벤치마크 격차가 실제 체감 차이를 정확히 보여주지 못한다며, 실사용에서 오퍼스 5.5와 페이블 5.1의 차이는 점수보다 작다고 스스로 덧붙였다. 대신 분명한 강점으로 비용 효율을 꼽았다. 기본 설정(medium)의 오퍼스 5.5가 FrontierCode에서 GPT-6 Astra 최고 점수를 과제당 비용 약 5분의 1로 넘어섰다는 것이다.

오퍼스 5.5 안전성과 안전장치

오퍼스 5.5는 앤트로픽이 AI 발전 속도 조절을 제안한 이후 처음 나온 모델이다. 출시 전 METR와 Frontier Design 같은 외부 평가 기관의 검증을 거쳤고, 약 2,000개 시나리오로 이뤄진 자동 행동 감사에서 지금까지 테스트한 모델 중 가장 좋은 점수를 받았다고 밝혔다. 샌드박스 같은 격리 경계를 넘으려는 시도는 오퍼스 5 대비 약 85% 줄었다.

사이버보안과 생물학 역량이 크게 오른 만큼 안전장치도 강화됐다. 오퍼스 5.5는 페이블 5.1과 비슷한 수준의 안전장치를 적용한 첫 오퍼스 모델로, 대부분의 사이버보안 작업은 오퍼스 4.8로 자동 전환된다. 생물학 연구 기관은 생명과학 검증 프로그램에 신청해 제한을 완화받을 수 있다. 다만 앤트로픽은 모델이 평가 상황임을 눈치채는 경우가 잦아 실제 환경에서의 행동을 완벽히 검증하기는 어렵다는 한계도 함께 밝혔다.

오퍼스 5.5 사용법과 선택 기준

오퍼스 5.5는 클로드 앱과 클로드 코드, 코워크에서 바로 선택할 수 있고, API에서는 모델 ID claude-opus-5-5로 호출한다. 아마존 웹 서비스, 구글 클라우드, 마이크로소프트 애저에서도 제공된다. 참고로 오퍼스 5.5는 사고(thinking) 모드를 끌 수 없고, 8월 31일 이후 만든 API 계정에는 이전 추론 내용을 편집하지 못하게 하는 증류 방지 장치가 적용된다.

누구에게 맞을지는 비교적 명확하다. 페이블 5.1이 필요했던 긴 코딩·문서 작업을 더 낮은 비용으로 돌리고 싶은 팀이라면 오퍼스 5.5가 우선 후보다. 초기 테스터 중 팩토리는 오퍼스 5.5를 중간 강도(medium)에서 기본으로 쓸 수 있는 첫 모델이라고 평가했다. 가격만 보면 입력 2달러·출력 6달러인 그록 4.7이 더 싸지만, 터미널 작업과 코딩 벤치마크에서는 오퍼스 5.5가 크게 앞선다.

직접 긴 리팩터링 세션을 돌려 보면 차이는 결과물보다 중간 보고에서 먼저 드러난다. 개인적으로 오퍼스 5를 쓸 때 가장 번거로웠던 것은 긴 진행 보고를 다시 요약해 읽는 일이었는데, 오퍼스 5.5가 결론을 먼저 말하도록 바뀌었다는 점이 실무에서는 벤치마크 몇 점보다 크게 느껴질 수 있다. 한국어 답변 품질과 요금 체감은 출시 초기라 몇 주 더 지켜볼 만하다.

반응형