Claude Opus 5.5를 소개합니다

TMT

원문: Introducing Claude Opus 5.5

새로운 Claude 5.5 제품군의 첫 모델인 Claude Opus 5.5를 소개합니다. 대부분의 작업에서 Claude Fable 5.1 수준의 성능을 발휘하면서도, 실행 비용은 Opus 5보다 40% 적게 듭니다.

Claude Opus 5.5는 우리가 최첨단 AI의 발전 속도를 조절하자고 제안한 이후 처음 출시하는 모델입니다. 출시 전에 Frontier Design과 METR을 비롯한 외부 평가 기관의 테스트를 거쳤습니다. 우리가 실시하는 가장 포괄적인 정렬 평가인 자동화된 행동 감사에서, Opus 5.5는 지금까지 테스트한 모델 중 가장 뛰어난 성적을 거뒀습니다. 또한 우리가 가장 강력한 모델들을 위해 개발한 안전장치도 갖추고 있습니다.

Opus 5.5에서 기대할 수 있는 개선 사항은 다음과 같습니다.

성능. Opus 5.5는 Opus 5보다 크게 발전한 모델입니다. 성능 면에서 새로운 선두에 올랐으며, 초기 테스터들은 가장 복잡한 작업에서 성능이 크게 향상되었다고 평가했습니다. 한 테스터는 엔지니어링 팀이 몇 주에 걸쳐 해야 할 68만 줄 규모의 코드 마이그레이션을 하루도 안 되어 마쳤습니다. 소프트웨어의 비효율을 찾아 개선하는 데도 능숙합니다. 웹 앱의 모든 페이지에서 로딩 시간을 줄여 달라고 요청했을 때, Opus 5.5는 40번 중 39번 성공했습니다. 반면 Opus 5는 개선 폭이 더 작았고, 앱의 동작까지 바꾸었습니다. 또 다른 테스터는 여러 Claude 모델에 프롬프트 하나로 게임을 만들게 했습니다. Opus 5.5는 그래픽과 완성도에서 좋은 평가를 받아 다른 모든 모델보다 높은 점수를 얻었습니다.

안전성. 수천 가지 시뮬레이션 시나리오에서 Claude를 테스트하는 정렬 평가 도구인 자동화된 행동 감사에서, Opus 5.5는 지금까지의 모든 모델 중 가장 좋은 점수를 기록했습니다. 최근 모델들보다 되돌리기 어려운 행동을 하거나 주어진 범위를 벗어날 가능성이 훨씬 낮으며, 프롬프트 인젝션에도 Opus 5보다 강합니다. 정렬 테스트의 범위도 넓혀 더 오래 걸리는 작업, 수행할 수 없는 작업, 실제 사건을 바탕으로 만든 시나리오를 포함했습니다. 다만 여전히 한계는 있습니다. 자세한 평가 내용은 Opus 5.5 시스템 카드에서 확인할 수 있습니다.

Opus 5.5는 생물학과 사이버보안 분야에서 Claude Mythos 5.1에 견줄 만한 역량을 갖췄기 때문에, Claude Fable 5.1과 비슷한 안전장치를 적용해 배포합니다. 검증받은 기관은 오늘부터 생명과학 검증 프로그램에 신청해 생물학 연구에 Opus 5.5를 사용할 수 있습니다. 앞으로 몇 주 안에 사이버 검증 프로그램의 접근 범위도 확대할 예정이며, 검증받은 사이버보안 실무자는 업무에 Opus 5.5를 사용할 수 있게 됩니다.

비용과 속도. Opus 5.5는 Opus 5보다 서비스 제공에 필요한 연산량이 적고, 가격에도 이를 반영했습니다. 테스트 결과, 기본 설정에서 일반적인 작업을 수행할 때 비용이 Opus 5보다 40% 적게 듭니다. 입력 토큰과 출력 토큰 가격은 각각 100만 토큰당 4달러와 20달러로, Opus 5보다 20% 저렴합니다. 에이전트 작업과 코딩 작업 비용의 대부분을 차지하는 캐시 읽기 가격은 100만 토큰당 0.20달러로, Opus 5보다 60% 저렴합니다. 출력 생성 속도도 Opus 5보다 30% 이상 빠릅니다.

가격 인하와 함께 Pro, Max, Team, 좌석 기반 Enterprise 요금제의 5시간 단위 사용 한도를 늘립니다. 구독 사용자에게는 사용 한도를 초기화할 기회도 제공합니다. 이제 이 초기화 기회를 보관해 두었다가 원하는 때 사용할 수 있습니다.

의사소통. Opus 5.5는 이전 모델보다 자연스럽게 소통합니다. 초기 테스터들은 글이 더 명확하고 이해하기 쉬워졌다고 평가했습니다. 이는 Opus 5에 대해 자주 받았던 피드백을 반영한 결과입니다. 가장 중요한 정보를 먼저 제시하고, 장시간 함께 작업하기에 더 적합한 방식으로 소통합니다. 한 초기 테스터는 “제가 쓰는 방식으로 글을 써요”라고 표현했습니다. 우리도 직접 사용하면서 Opus 5.5의 작업 내용을 더 쉽게 이해하고 검토할 수 있었습니다. 이는 실용적인 이점일 뿐 아니라 안전성 측면에서도 도움이 됩니다.

앞으로 몇 주 안에 Claude Sonnet 5.5와 Claude Haiku 5.5도 출시됩니다. 이 모델들에도 성능, 효율성, 안전성 측면에서 같은 개선 사항이 다수 적용됩니다.

성능과 비용 효율성

자체 벤치마크에서 Claude Opus 5.5는 에이전트 코딩, 컴퓨터 사용, 지식 업무 분야에서 선두를 달리고 있습니다. 다만 모델의 역량이 이 수준에 이르면 벤치마크 점수 차이가 실제 사용에서의 차이를 얼마나 잘 보여 주는지는 예전보다 불확실해집니다. 우리가 직접 사용했을 때 Opus 5.5와 Claude Fable 5.1의 차이는 이 점수들이 보여 주는 것보다 작았습니다.

평가 분야·벤치마크Opus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
에이전트 코딩 · Terminal-Bench 4.0166.4%55.8%52.3%57.9%37.3%
에이전트 코딩 · FrontierCode v1.1 (Main)54.4%50.3%48.0%53.3%47.5%
에이전트 코딩 · CursorBench 4.057.8%51.8%46.6%—41.7%
지식 업무 · GDPval-AA v2.118461735170815421588
비즈니스 워크플로 · AutomationBench240.0%31.4%26.9%41.4%28.8%
다분야 추론 · Humanity's Last Exam67.7% (도구 사용)65.6% (도구 사용)63.6% (도구 사용)57.2% (도구 사용)—
에이전트 과학 연구 · Terminal-Bench-Science 0.1358.7%52.6%29.0%64.6%22.4%
컴퓨터 사용 · OSWorld 2.081.8% (partial)80.7% (partial)74.0% (partial)——
시각적 차트 인식 · Chartography89.0% (도구 사용)88.4% (도구 사용)83.4% (도구 사용)——

별도 설명이 없는 한 Claude Opus 5.5의 모든 결과는 추론 강도(effort)를 max로 설정한 적응형 사고(adaptive thinking)를 사용했습니다. Terminal-Bench 4.0 결과는 Claude Opus 5.5의 경우 xhigh, GPT-6 Astra의 경우 OpenAI가 발표한 high 설정에서 얻은 점수입니다. 각 모델의 최고 점수에 해당합니다. Claude Opus 5.5는 실제 서비스에 적용되는 안전장치를 활성화한 상태로 평가했습니다. 안전장치가 개입하면 사이버보안 작업은 Claude Opus 4.8이, 생물학 및 최첨단 LLM 개발 작업은 Claude Opus 5가 완료했습니다. 이로 인해 해당 벤치마크에서 Claude Opus 5.5의 성능이 낮아졌을 가능성이 있습니다.

Opus 5.5의 우위가 뚜렷하게 드러나는 부분은 효율성입니다. Opus 5보다 토큰당 가격이 낮고 작업당 사용하는 토큰도 적어, 전체적으로 비용이 40% 줄어듭니다.

요금

100만 토큰당 가격Claude Opus 5.5Claude Opus 5
캐시 읽기0.20달러0.50달러
입력 토큰4달러5달러
출력 토큰20달러25달러
캐시 쓰기5달러6.25달러

Claude Code와 Claude Platform에서는 최대 2.5배 빠른 Opus 5.5의 빠른 모드도 사용할 수 있습니다. 가격은 입력 100만 토큰당 8달러, 출력 100만 토큰당 40달러입니다.

코딩

Opus 5.5는 코드베이스 전체의 마이그레이션이나 점검처럼 시간이 오래 걸리고 범위가 넓은 작업에 특히 강합니다. 한 초기 테스터는 20만 줄 규모의 코드베이스를 점검하고 수정하는 작업을 3시간도 안 되어 마쳤습니다. 같은 작업에 Opus 5는 20시간 넘게 걸렸고, 토큰도 2.5배 사용했습니다. 내부 테스트에서는 Opus 5.5와 Fable 5.1에 웹 트래픽 부하를 여러 서버에 분산하는 데 널리 쓰이는 HAProxy를 C에서 Rust로 다시 작성해 달라고 요청했습니다. 두 모델이 작성한 코드는 모두 HAProxy 자체 회귀 테스트를 거의 전부 통과했습니다. 하지만 Fable 5.1이 12시간 걸린 데 비해 Opus 5.5는 9.5시간 만에 작업을 마쳤고, 비용도 51% 적게 들었습니다.

Opus 5.5는 훨씬 적은 비용으로 에이전트 코딩에서 최첨단 성능을 제공합니다. FrontierCode에서는 기본 추론 강도로 GPT-6 Astra를 능가하면서도 작업당 비용은 약 20%에 불과합니다. Terminal-Bench 4.0에서는 약 40%의 비용으로 Astra와 동등한 성능을 내며, CursorBench에서는 약 3분의 1의 비용으로 GPT-5.6 Sol보다 11점 높은 점수를 기록합니다.

에이전트 터미널 코딩

Terminal-Bench 4.0: 정확도와 비용 비교. 세로축은 점수(%), 가로축은 시도당 비용(미국 달러, 로그 척도)입니다

Terminal-Bench 4.0은 모델이 명령줄 인터페이스에서 여러 단계로 이루어진 복잡한 전문 작업을 얼마나 잘 수행하는지 측정합니다. Opus 5.5는 기본 추론 강도에서, 추론 강도를 최대로 설정한 Opus 5보다 좋은 성능을 내면서 비용은 약 5분의 1만 듭니다. GPT-6 Astra와는 약 40%의 비용으로 동등한 성능을 냅니다.

에이전트 코딩: FrontierCode

FrontierCode v1.1, 주요 평가 세트: 정확도와 비용 비교. 세로축은 점수(%), 가로축은 작업당 비용(미국 달러, 로그 척도)입니다

FrontierCode는 에이전트가 수정한 코드가 실제로 병합될 만한지 평가합니다. 기본 추론 강도인 medium에서 Opus 5.5는 54.6%를 기록해 다른 모든 모델보다 높은 점수를 얻었습니다. GPT-6 Astra의 최고 점수인 53.3%를 넘으면서도 작업당 비용은 약 5분의 1에 불과합니다.

에이전트 코딩: CursorBench

CursorBench 4.0: 정확도와 비용 비교. 세로축은 점수(%), 가로축은 작업당 비용(미국 달러, 로그 척도)입니다

CursorBench는 실제 Cursor 세션에서 가져온, 요구사항이 모호하고 여러 파일에 걸친 작업으로 코딩 에이전트를 평가합니다. 기본 추론 강도인 medium에서 Opus 5.5는 52.5%를 기록했습니다. 추론 강도를 max로 설정한 Fable 5.1은 51.8%, Opus 5는 46.6%였습니다. GPT-5.6 Sol의 최고 점수인 41.7%보다 11점 높으면서도 작업당 비용은 약 3분의 1에 불과합니다.

초기 테스터들도 효율성과 지능이 비슷하게 향상되었다고 보고했습니다.

GitHub
“개발자는 실제 소프트웨어 작업을 맡아서 끝까지 해내는 에이전트를 원합니다. GitHub Copilot CLI와 VS Code에서 테스트했을 때 Claude Opus 5.5는 우리가 측정한 모델 중 토큰과 작업 단계 수가 가장 적은 축에 속했습니다. VS Code에서는 Opus 5의 절반도 안 되는 단계로 더 많은 터미널 작업을 해결했습니다. 개별 작업의 효율을 높이는 데 그치지 않고, 개발자가 더 큰 프로젝트를 실현할 수 있게 해 줍니다.”

Mario Rodriguez, 최고제품책임자(CPO) · GitHub

Clio
“Claude Opus 5.5에 저장소 여섯 개에 걸친 대규모 엔지니어링 작업을 맡기고, 밤새 감독 없이 실행하도록 두었습니다. 18시간 넘게 작업에 집중하면서 서비스 간 통신 방식을 정의하고 각 서비스에 이를 어떻게 적용할지 구체화했습니다. Opus 5보다 주요 단계를 더 빨리 완료했고, 다시 손봐야 할 부분도 거의 없었습니다. 코드 주석은 장황한 설명 대신 짧고 유용한 내용으로 작성했습니다. 단점을 찾기가 어려울 정도입니다.”

Sean Heintz, 스태프 소프트웨어 개발자 · Clio

Lovable
“Lovable로 개발하는 사용자에게 Opus 5.5는 처음부터 새로 만들든 운영 중인 앱을 수정하든, 같은 품질로 더 빠르게 개발할 수 있다는 뜻입니다. 맥락을 한 번 파악한 뒤, 수정 횟수는 줄이면서 한 번에 더 완결된 수정을 하고, 재시도를 반복하며 막히는 일도 없습니다. 작업 단계는 3분의 1에서 절반까지 줄고, 그 과정에서 쓰는 토큰도 크게 줄어듭니다.”

Fabian Hedin, 최고기술책임자(CTO) 겸 공동 창업자 · Lovable

Quantium
“우리 팀이 일하는 방식 전반을 아우르도록 Chat, Cowork, Claude Code에서 Claude Opus 5.5를 테스트했습니다. 이전에는 나흘 동안 프롬프트 38개가 필요했던 복잡한 코딩 작업을, 프롬프트 11개로 3시간 만에 끝냈습니다. 결과물은 실제 서비스에 적용하기에 더 적합했고, 재작업도 줄었습니다. 복잡한 문제를 빠르게 해결해야 하는 우리 팀으로서는 반복 수정에 쓰는 시간을 줄이고, 가정을 검증하고 결과물을 엄격하게 점검하며 고객에게 가장 적합한 해결책을 찾는 데 더 많은 시간을 쓸 수 있다는 뜻입니다.”

Harley Barnes, AI 기술 총괄 매니저 · Quantium

Spotify
“Claude Opus 5.5를 사용하면서 내부 평가 전반에서 토큰 효율이 뚜렷하게 개선되었습니다. 같은 작업을 더 저렴하고 빠르게 완료할 수 있었습니다.”

Aleksandar Mitic, 시니어 엔지니어 · Spotify

Optiver
“우리는 실제 엔지니어링 업무와 트레이딩 데스크 업무로 모델을 테스트합니다. 에이전트 코딩 작업에서 Claude Opus 5.5는 대화 턴 수, 소요 시간, 출력 토큰을 약 절반으로 줄이면서 Opus 5와 같은 품질을 냈고, 해당 작업의 비용을 40~50% 절감했습니다. 한 데스크의 트레이딩 지원 평가에서는 이전 Claude 모델들이 실패한 작업을 통과하며 역대 최고 점수를 기록했고, 분석 작업에서도 평가한 모델 여덟 개 중 1위를 차지했습니다.”

Noyan Tokgozoglu, AI 엔지니어링 글로벌 총괄 · Optiver

Column
“Claude Opus 5.5는 하위 에이전트에 훨씬 효과적으로 작업을 맡기고, 창의적인 방법으로 자신의 작업을 검증합니다. 스스로 검증을 반복하는 절차를 구성하기도 더 쉬워졌습니다. 이전 모델들이 놓쳤던 클라우드 비용 절감 기회를 찾아냈고, 코드 리뷰에서는 외부 문서를 확인해 버그를 발견했습니다. 여러 커밋 전에 외부 서비스 연동 방식을 잘못 모델링해 둔 부분이었습니다.”

Mitch Fierro, 엔지니어링 담당 · Column

Kiro
“에이전트가 호출할 때마다 개발자는 그에 따른 시간과 비용을 체감합니다. 실제 명령줄 작업으로 구성된 공개 벤치마크에서 Claude Opus 5.5는 호출 횟수를 약 40% 줄이고 토큰은 절반만 사용하면서 Opus 5보다 더 많은 작업을 해결했습니다. Kiro로 개발하는 사용자에게 이는 일상적인 작업부터 복잡한 문제까지 에이전트 세션을 더 빠르고 저렴하게 실행할 수 있다는 뜻입니다. Opus 5.5는 곧 Kiro에서도 제공됩니다.”

Deepak Singh, 에이전트 AI 부문 부사장 · Kiro

가장 안전한 코딩 에이전트

시스템 안에서 에이전트를 사용하는 기업은 에이전트가 의도대로 작동하는지 확인할 수 있어야 합니다. 특히 에이전트가 여러 시간 동안 자율적으로 실행될 때는 더욱 그렇습니다. Opus 5.5에는 실행 전에 모든 행동을 검사하는 분류기, 보안팀이 점검할 수 있는 오픈소스 샌드박스, 코드가 병합되기 전에 취약점을 찾아내는 코드 리뷰 기능이 있습니다.

모델 자체의 방어 능력도 강화되었습니다. 코딩, 도구 사용, 컴퓨터 사용, 웹 탐색 등 우리가 테스트한 모든 환경에서 프롬프트 인젝션 공격에 대한 방어 성능이 Opus 5와 같거나 더 좋았습니다. AI 보안 기업 Gray Swan이 실시한 벤치마크에서는 Fable 5.1과 함께 테스트 대상 모델 중 가장 낮은 프롬프트 인젝션 성공률을 기록했습니다.

지식 업무

Opus 5.5는 조사에 능숙하고 신뢰할 만합니다. 한 내부 테스트에서는 실적 발표 자료를 찾기 어렵게 구성한 웹 복제 환경에서, 그 안에서 찾은 정보만으로 기업의 분기 실적 보고서를 작성하도록 Opus 5.5, Fable 5.1, Opus 5에 요청했습니다. 자동 채점기는 모든 수치와 인용문을 출처와 대조했습니다. 수치나 인용문을 하나라도 지어내면 탈락하는 품질 기준이었는데, 여러 추론 강도에서 작성한 Opus 5.5의 보고서 18개 중 16개가 이를 통과했습니다. Fable 5.1과 Opus 5는 어느 시도에서도 그 기준을 통과하지 못했습니다.

재무 분석과 비즈니스 업무에도 강합니다. 투자 회사이자 초기 테스터인 Walleye Capital은 Opus 5.5가 가장 낮은 설정에서도 자사의 평가 문제를 대부분 해결했다고 보고했습니다. 더 높은 설정에서는 평가 지침의 오류를 발견해 이를 바로잡아 처리하는 등 한층 뛰어난 성능을 보였습니다. 이전에 이 오류를 발견한 모델은 없었습니다.

또 다른 테스트에서는 Opus 5.5와 Opus 5에 가상의 HR 소프트웨어 기업 두 곳의 합병 제안을 분석하도록 했습니다. 각 모델은 Excel로 재무 모델을 만든 뒤, 제안된 가격에 거래하는 것이 타당한지 설명하는 경영진용 발표 자료를 작성했습니다. 두 모델은 거래에 대해 같은 결론에 도달했지만, Opus 5.5의 재무 모델은 더 철저했고 발표 자료도 읽기 쉬웠습니다. 반면 Opus 5의 결과물에는 사소한 오류가 있었습니다. Opus 5가 93분 걸린 데 비해 Opus 5.5는 63분 만에 작업을 마쳤고, 비용도 50% 적게 들었습니다.

지식 업무 평가에서도 Opus 5.5는 더 적은 토큰으로 다른 모델보다 뛰어난 성능을 냅니다. 44개 직종의 실제 업무를 평가하는 GDPval-AA v2.1에서 Opus 5.5는 Elo 1846점을 기록해 Fable 5.1과 Opus 5를 앞섰습니다. 기본 추론 강도인 medium에서도 추론 강도를 최대로 설정한 GPT-6 Astra보다 높은 성능을 내면서 작업당 비용은 약 5분의 1에 불과합니다. 비즈니스 워크플로와 대규모 데이터 수집을 측정하는 벤치마크에서도 다른 모델을 능가했습니다.

GDPval-AA v2.1

GDPval-AA v2.1: Elo와 비용 비교. 세로축은 Elo 점수, 가로축은 작업당 추정 비용(미국 달러, 로그 척도)입니다

Artificial Analysis의 GDPval-AA v2.1은 44개 직종의 실제 전문 업무를 대상으로 에이전트를 평가합니다. 추론 강도를 최대로 설정했을 때 Opus 5.5는 Elo 1846점, Fable 5.1은 1735점, Opus 5는 1708점을 기록했습니다. 기본 추론 강도인 medium에서 Opus 5.5는 추론 강도를 최대로 설정한 GPT-6 Astra보다 뛰어난 성능을 내면서 작업당 비용은 약 5분의 1에 불과합니다.

AutomationBench

AutomationBench: 정확도와 비용 비교. 세로축은 통과율(%), 가로축은 작업당 비용(미국 달러, 로그 척도)입니다

Zapier가 만든 AutomationBench는 에이전트가 서로 연결된 여러 앱에 걸쳐 실제 비즈니스 워크플로를 수행할 수 있는지 테스트합니다. Opus 5.5는 모든 추론 강도에서 Opus 5와 GPT-5.6 Sol보다 높은 점수를 기록합니다.

WANDR

WANDR: 정확도와 비용 비교. 세로축은 점수(%), 가로축은 시도당 비용(미국 달러, 로그 척도)입니다

Perplexity의 WANDR 벤치마크는 대규모 데이터 수집 작업으로 에이전트를 평가합니다. Opus 5.5는 작업당 비용이 더 낮으면서도 Fable 5.1과 Opus 5보다 뛰어난 성능을 냅니다.4

고객들도 비슷한 결과를 보고했습니다. 이 모델과 함께 작업한 경험에 대해 다음과 같이 전했습니다.

Deloitte Consulting LLP
“Claude Opus 5.5는 가장 낮은 추론 강도에서도 코드 리뷰에서 이미 알려진 버그의 72%를 찾아냈습니다. 추론 강도를 high로 설정한 Opus 5의 56%보다 높았고, 잘못된 경고도 더 적었으며 출력량도 훨씬 적었습니다. 미국 컨설팅 분석 업무에서는 낮은 추론 강도로도 높은 설정과 같은 수준의 성능을 내면서 출력량은 절반에 불과했고, 우리의 품질 검증도 통과했습니다. 실제 서비스에서 낮은 추론 강도를 더 많이 활용하면 고객에게 바로 전달할 수 있는 결과물을 효율적으로 만들어 낼 수 있습니다.”

Carl Bennett, 최고정보책임자(CIO) · Deloitte Consulting LLP

Rogo
“금융회사에는 일관되게 정확한 결과물이 필요합니다. Claude Opus 5.5는 가장 낮은 추론 강도에서, 추론 강도를 high로 설정한 Opus 5보다 우리의 BigFinance Bench에서 높은 성능을 내면서 출력 토큰은 약 60% 적게 사용했습니다. 답변은 더 짧고 구조가 잘 잡혀 있으며, 슬라이드는 정보 밀도가 높아져 업계 표준에 더 가까워졌습니다.”

Strib Walker, 제품 총괄 · Rogo

LexisNexis Legal & Professional
“새 모델을 평가하는 일은 LexisNexis Legal Intelligence Engine의 멀티모델 접근법에서 핵심입니다. 초기 평가에서 Claude Opus 5.5는 관련성이 매우 높은 인용 근거를 일관되게 찾아냈고, 법령을 다루는 데 강점을 보였으며, 핵심 법체계와 주요 쟁점을 중심으로 답변을 구성했습니다. 고객이 Protégé를 탑재한 Lexis+로 더 많은 일을 해내도록 돕기 위해 우리가 찾는 역량이 바로 이런 것입니다.”

Min Chen, 최고AI책임자 · LexisNexis Legal & Professional

Walleye Capital
“퀀트 연구에서는 잘못된 가정 하나가 결과를 무너뜨릴 수 있습니다. Claude Opus 5.5는 가장 낮은 추론 강도에서 우리의 평가 과제를 대부분 해결했습니다. 높은 설정에서는 한 걸음 더 나아갔습니다. 우리가 작성한 지침에서 분 단위 인덱스가 하나씩 어긋나 있다는 점을 발견하고 이를 바로잡았으며, 그렇게 하면 채점기에서 감점받을 것이라고도 밝혔습니다. 모델의 판단이 맞았습니다. 지금까지 테스트한 모델 중 이 문제를 발견하고 그에 맞게 처리한 모델은 없었습니다.”

Frank Corrao, 중앙 주식 퀀트 연구 엔지니어링 총괄 · Walleye Capital

Hex
“모델이 데이터 작업을 더 잘하게 되면서, 데이터가 뒷받침하지 않는데도 그럴듯하게 들리는 결론을 내놓는 경우를 더 많이 보고 있습니다. Claude Opus 5.5는 처음 찾은 그럴듯한 답에서 멈추지 않고 계속 파고듭니다. 우리의 DataBench 벤치마크에는 소포가 늦게 도착한 것인지, 아니면 배송 추적 정보의 갱신만 늦었던 것인지 묻는 과제가 있습니다. Opus 5는 배송 완료 기록을 확인한 뒤 추적 기능이 정상이라고 판단했습니다. Opus 5.5는 소포도 늦었고 추적 기능에도 문제가 있었다는 점을 찾아냈습니다. 이 작업을 위해 Hex 에이전트에 이 모델을 도입하고 있습니다.”

Izzy Miller, AI 엔지니어 · Hex

Thomson Reuters Labs
“CoCounsel은 복잡한 법률 업무를 위해 여러 모델에 우리의 콘텐츠와 전문성을 결합합니다. Claude Opus 5.5를 사용하면서 전문가 평가와 내부 벤치마크에서 더 좋은 결과를 얻었고, 속도와 토큰 효율도 개선되었습니다. 고객이 CoCounsel과 의견을 주고받으며 증거를 검토하고 생각을 다듬는 과정에서 그 차이를 경험하기를 기대합니다. 이런 변화는 벤치마크만으로 온전히 측정하기 어렵습니다.”

Omar Bari, 응용 연구 부문 부사장 · Thomson Reuters Labs

Hebbia
“전문가가 만든 채점 기준으로 금융 업무 전 과정을 평가했을 때, Claude Opus 5.5는 우리가 요구하는 항목의 86.6%를 충족했습니다. Opus 5는 60.3%였습니다. 검색 평가에서는 역대 최고의 인용 재현율을 기록했고, 토큰 효율도 Opus 5보다 높았습니다. 덕분에 조사 작업당 비용을 관리할 수 있습니다.”

Aabhas Sharma, 최고기술책임자(CTO) · Hebbia

Viktor
“Viktor는 Slack과 Microsoft Teams에서 일하는 AI 직원이므로, 한 단계씩 작업할 때마다 비용이 발생합니다. 같은 추론 강도에서 Claude Opus 5.5는 Opus 5보다 작업당 단계 수와 도구 호출이 적고 비용은 거의 절반이면서, 가장 어려운 과제를 올바르게 해결한 수는 두 배입니다.”

Peter Albert, 공동 창업자 · Viktor

의사소통

Opus 5에 대해 가장 자주 받았던 피드백 중 하나인 글쓰기와 의사소통 방식을 크게 개선했습니다. 메시지를 한눈에 이해하기가 훨씬 쉬워졌으며, 테스터들은 장시간 작업할 때 도움이 되었다고 평가했습니다. 가장 중요한 정보를 먼저 제시하고, 전문 용어나 특이한 표현을 덜 쓰며, 사용자가 제시한 글쓰기 규칙을 따릅니다. 우리는 이런 변화 덕분에 Opus 5.5가 눈에 띄게 더 나은 협업 상대가 되었다고 느낍니다. 두 모델의 응답을 비교하면 다음과 같습니다.

버그 설명

이 문제가 무엇인지 설명해 주세요.

Claude Opus 5

확인한 내용

추가로 줄어든 금액은 무료 요금제 때문이 아닙니다. 0552feb 커밋에서 발생한 회귀 버그입니다. 이 커밋은 “청구 기간 경계를 periods.py로 분리”하는 변경이었고, “동작 변경 없음”이라고 표시되어 있었습니다.

버그

기존 aggregate.monthly_usage는 반열린 구간을 사용했습니다.

start, end = month_start(year, month), next_month_start(year, month)
if start <= e.ts < end:

지금은 다음과 같습니다.

if period.contains(e.ts)

그리고 periods.py에는 다음 코드가 있습니다.

@property
def last_day(self) -> datetime:
    return next_month_start(...) - timedelta(days=1)   # 2026-08-31 00:00:00 UTC

def contains(self, ts):
    return self.first_day <= ts <= self.last_day

last_day는 하루 전체가 아니라 자정 시점의 datetime 값입니다. 9월 1일 00:00에서 하루를 빼면 8월 31일 00:00이 되고, 비교 연산은 그 시점을 포함하므로 기간이 사실상 31일이 시작되는 순간에 끝납니다. 매월 마지막 날 자정 이후의 타임스탬프가 찍힌 모든 이벤트가 아무런 경고 없이 누락됩니다. 계정마다 매달 대략 하루치 사용량이 빠지는 셈입니다.

새로 추가된 test_periods.py도 이 문제를 잡지 못합니다. last_day.date()만 확인하는데, 이 값은 2026-08-31로 올바르게 나옵니다. contains는 8월 1일 00:00, 8월 15일 12:00, 7월 31일 23:59, 9월 1일 00:00에서만 테스트합니다. 31일 중간의 어느 시점도 확인하지 않습니다.

Claude Opus 5.5

추가로 줄어든 금액은 청구 코드 리팩터링의 버그 때문입니다

acme의 8월 금액 감소분 중 무료 요금제 변경으로 설명되는 금액은 1.50달러뿐입니다. 나머지 9.92달러는 0552feb 커밋의 버그 때문에 발생했습니다. 이 커밋에는 “동작 변경 없음”이라고 표시되어 있었지만, 실제로는 매월 마지막 날의 사용량을 집계하지 않게 되었습니다.

무엇이 바뀌었나요

병합 전 aggregate.py는 반열린 구간을 사용했습니다.

start <= e.ts < next_month_start(year, month)    # [8월 1일 00:00, 9월 1일 00:00)

리팩터링 과정에서 이 로직을 Period.contains로 옮기면서, 잘못된 경곗값을 끝점으로 포함하는 닫힌 구간으로 바꾸었습니다.

last_day = next_month_start(...) - timedelta(days=1)    # = 2026-08-31T00:00:00Z
return self.first_day <= ts <= self.last_day

last_day는 하루 전체가 아니라 자정 시점의 타임스탬프입니다. 따라서 2026-08-31T00:00:00Z 이후의 모든 이벤트가 제외됩니다. 9월의 집계 기간은 9월 1일부터 시작하므로 이 이벤트들은 9월에도 포함되지 않습니다. 사용량이 다른 달로 넘어가는 것이 아니라, 아예 청구되지 않는 것입니다.

스레드 요약

관리자에게 전달할 수 있도록 이 Slack 스레드를 세 개의 항목으로 요약해 주세요.

[09:41] Dana Osei: 제가 전달할게요. 금요일 파일을 다른 사람이 사용하는지도 확인하겠습니다.
[09:43] Marcus Webb: 일정은 제가 옮길 수 있어요. cron 한 줄만 바꾸면 됩니다. 다만 Dana가 확인해 준 다음에 할게요.
[10:02] Dana Osei: 재무팀에서는 금요일 파일을 월요일에만 쓴다고 합니다. 일요일 밤에 실행해도 괜찮아요.

Claude Opus 5

금요일 주문 내보내기 · #data-platform, 화요일

  • 문제: 금요일 주문 내보내기가 데이터 웨어하우스 쿼리를 2시간 실행한 뒤 다시 시간 초과로 실패했습니다. 이번 달 두 번째 실패입니다. 여름 할인 행사 이후 주문량은 약 40% 늘었습니다. 재무팀은 월요일 오전 9시 검토에 필요한 주말 수치를 받지 못했고, 두 번 모두 월요일이 되어서야 실패 사실이 드러났습니다.
  • 당일 조치 완료: 토요일 운영 대시보드의 타일이 내보낸 파일 대신 실시간 테이블을 읽도록 바꿨고(Sam), 재무팀이 금요일 파일을 월요일에만 사용한다는 점을 확인했습니다(Dana). 실패하면 온콜 채널로 알림이 가도록 했으며(Priya), 다음 주부터 내보내기를 일요일 오후 10시로 옮기고 금요일 실행은 없앱니다(Marcus). 이번 금요일은 임시 조치로 약 300달러를 들여 데이터 웨어하우스를 한 차례 증설해 대응합니다.
  • 진행 중: Ji-woo가 쿼리를 증분 처리 방식으로 다시 작성합니다. 늦게 들어온 주문을 놓치지 않도록 최근 3일을 다시 스캔하며, 실행 시간을 수시간에서 수분으로 줄일 것으로 예상합니다. 설계 문서는 목요일까지 작성하고, 테스트를 포함해 약 2주가 걸립니다. 그동안은 일정 변경으로 시간을 확보합니다.

Claude Opus 5.5

  • 문제: 금요일 주문 내보내기가 이번 달 두 번 실패했습니다. 여름 할인 행사 이후 주문량이 약 40% 늘면서 데이터 웨어하우스 쿼리가 2시간 후 시간 초과로 끝납니다. 그 결과 재무팀은 월요일 오전 9시 검토에 필요한 주말 수치를 받지 못했습니다.
  • 즉시 조치: 다음 주부터 내보내기를 일요일 오후 10시로 옮기고 금요일 실행은 없앱니다(Marcus). 재무팀도 이 일정에 문제가 없다고 확인했습니다(Dana). 금요일 파일에 의존하던 운영 대시보드 타일은 이제 실시간 테이블을 읽습니다(Sam, 완료). 실패 알림은 온콜 채널로 전달됩니다(Priya, 구현 및 테스트 완료). 이번 금요일에 한해서는 Marcus가 약 300달러를 들여 데이터 웨어하우스 슬롯을 늘리는 임시 조치를 취하며, Dana가 이를 승인했습니다.
  • 장기 해결책: Ji-woo가 새 주문만 처리하도록 쿼리를 다시 작성합니다. 늦게 들어온 주문을 놓치지 않도록 최근 3일을 다시 스캔합니다. 이렇게 하면 실행 시간이 수시간에서 수분으로 줄어들 것으로 예상합니다. 테스트를 포함해 약 2주가 걸리며, 목요일까지 검토용 설계 문서를 제출할 예정입니다.

설계 변경 설명

Claude Opus 5

체스 포지션(FEN)을 읽고 어떤 말이 공격받고 있는지 나열하는 Python 코드를 작성해 주세요. 속도를 높이기 위해 TensorFlow를 사용하세요. 제가 생각한 설계는 이렇습니다. 8×8 텐서로 체스판을 만들고, 말 종류별 이동 방식에 따라 공격 맵을 생성한 뒤, 공격받는 칸에 있는 상대 말을 표시합니다. 잘못되었다고 생각하는 부분은 무엇이든 바꾸고, 마지막 요약에서 무엇을 왜 바꿨는지 각각 설명해 주세요.

비트 스캔을 tf.math.cumsum으로 대체했습니다. 체스판의 위치 관계는 각 칸에서 바깥쪽으로 순서대로 나아가는 ray_targets[square, direction, step] 배열로 펼쳤습니다. step 축을 따라 현재 위치를 제외한 누적합을 구하면 각 단계 이전에 경로를 막는 말의 수를 셀 수 있습니다. 따라서 한 방향에서 처음 경로를 막는 말은, 그 칸에는 말이 있지만 앞선 칸에는 경로를 막는 말이 하나도 없는 유일한 단계에 해당합니다. 이는 비트보드 엔진의 비트 스캔을 벡터화한 형태입니다. 실제 64비트 비트보드를 구현하기 위해 bitwise_ops도 검토했습니다. population_count는 있지만, hyperbola-quintessence 기법에 필요한 바이트 순서 반전 기본 연산을 TensorFlow가 제공하지 않으므로 결국 방향별 반복문으로 돌아가야 했을 것입니다.

Claude Opus 5.5

체스 포지션(FEN)을 읽고 어떤 말이 공격받고 있는지 나열하는 Python 코드를 작성해 주세요. 속도를 높이기 위해 TensorFlow를 사용하세요. 제가 생각한 설계는 이렇습니다. 8×8 텐서로 체스판을 만들고, 말 종류별 이동 방식에 따라 공격 맵을 생성한 뒤, 공격받는 칸에 있는 상대 말을 표시합니다. 잘못되었다고 생각하는 부분은 무엇이든 바꾸고, 마지막 요약에서 무엇을 왜 바꿨는지 각각 설명해 주세요.

경로가 막히는 경우를 처리했습니다(비숍, 룩, 퀸). 고정된 마스크만으로는 “경로에서 처음 만나는 말에서 멈추라”는 조건을 표현할 수 없습니다. 같은 선상에 있는 모든 두 칸에 대해, 양 끝을 제외하고 그 사이에 놓인 칸들을 표시하는 마스크 묶음을 하나 더 추가했습니다. 체스판에서 말이 놓인 위치를 나타내는 행렬과 한 번 곱하면 모든 경로에서 가로막는 말의 수를 한꺼번에 셀 수 있고, 그 수가 0일 때만 공격을 유효하게 처리합니다. 나이트의 이동이나 한 칸 이동에는 그 사이에 거치는 칸이 없으므로, 하나의 규칙으로 모든 말을 처리할 수 있습니다.

고객들의 피드백도 이러한 결과를 뒷받침합니다.

Ramp
“최첨단 모델을 쓸 때 가장 답답했던 점은 장황하고 따라가기 어려운 출력이었는데, Claude Opus 5.5는 이 문제를 해결했습니다. 좋은 동료처럼 글을 쓰고, 우리가 정한 글쓰기 규칙을 따릅니다. 설계 명세는 아주 조금만 수정해도 쓸 수 있었고, 우리의 프롬프트 하나를 다시 작성하게 했더니 제가 쓴 것보다 모델이 쓴 쪽이 더 마음에 들었습니다. 테스트 모음을 최적화할 때도 추론을 쉽게 따라갈 수 있어 확신을 갖고 변경 사항을 반영했습니다.”

John Ruelas, 스태프 소프트웨어 엔지니어 · Ramp

Stripe
“저는 매일 Claude Code로 긴 작업 세션을 진행합니다. 서로 의존하는 풀 리퀘스트 40개를 며칠에 걸쳐 리베이스하는 작업에서, Claude Opus 5.5 세션 하나가 다른 세션 열두 개를 지휘하며 모든 충돌을 명확히 정리했습니다. 판단을 보류한 사안도 분명하게 설명해 줘서, 몇 시간 자리를 비우고 돌아와도 몇 분 안에 답할 수 있었습니다. 다음 날 오후에는 40개 모두 CI를 통과했습니다. Opus 5에 비해 상당히 발전했습니다.”

Cristian Rivera, 스태프 소프트웨어 엔지니어 · Stripe

Box
“우리 고객은 방대한 콘텐츠에 Box AI를 사용하므로 속도와 비용이 최우선입니다. 평가에서 Claude Opus 5.5는 Opus 5가 쓴 토큰의 3분의 1만 사용했고, 정확도를 유지하면서 답변의 길이도 40% 줄었습니다. 금융 서비스나 공공 부문처럼 보유 콘텐츠 전반에 에이전트를 사용하는 팀에 큰 차이를 만들어 줄 것으로 기대합니다.”

Yashodha Bhavnani, AI 제품 부문 부사장 · Box

Chicago Trading Company
“제가 원인을 분석할 시간이 없었던 Lakehouse 서비스 계층의 버그를 Claude Opus 5.5가 밤새 자율적으로 처리했습니다. 스스로 조사하고 수정 방안을 설계한 뒤 구현했습니다. 아침에는 수정이 끝나 있었고 테스트도 모두 통과했습니다. 글은 이해하기 쉽고 Opus 5보다 일관성이 있습니다. 풀 리퀘스트와 사용자용 문서는 거의 수정할 필요가 없었습니다.”

Austen Tomek, 프린시펄 엔지니어 · Chicago Trading Company

Factory
“Claude Opus 5.5는 우리가 기본 추론 강도를 medium으로 설정해 쓰고 싶은 첫 모델입니다. 테스트에서는 추론 강도를 high로 설정한 Opus 5와 같은 성능을 내면서 출력 토큰은 20~25% 적게 사용했습니다. 오래 걸리고 복잡하게 얽힌 조사에서도 언제나 명확하고 실행에 옮길 수 있는 답을 내놓았습니다. 고객이 더 적은 비용으로 더 많은 일을 해낼 수 있다는 뜻입니다.”

Zimu Li, 기술 연구원 · Factory

안전성

최첨단 AI의 발전 속도 조절

지난주 다리오 아모데이 CEO는 안전성 확보를 위한 관행이 모델의 역량보다 앞서갈 수 있도록 AI의 발전 속도를 조절해야 한다고 주장했습니다. 속도 조절은 AI의 안전성을 유지하고 중국과의 경쟁력을 지키면서, 특히 생물학과 의학 같은 분야에서 AI의 혜택을 실현하기 위한 접근법입니다.

우리는 현재 모델이 초래하는 위험을 대체로 이해하고 있으며, 이를 관리할 준비도 잘 갖추고 있습니다. 하지만 역량이 향상되면 더 심각한 위험이 빠르게 나타날 수 있으므로 지금부터 대비해야 합니다. 이런 이유로 우리의 안전성 연구는 현재와 미래, 두 시점을 동시에 고려해 진행됩니다.

현재 모델을 위한 안전성 확보 관행. 현재 세대의 모델에는 이미 확립된 일련의 관행을 적용하고 있습니다. 광범위한 정렬 테스트, METR과 Frontier Design 같은 외부 기관의 출시 전 평가, 사이버보안과 생물학 등 고위험 분야에서 각 모델의 역량에 맞춘 안전장치가 여기에 포함됩니다. 우리는 모델을 출시할 때마다 이런 관행을 개선합니다. 이러한 관행은 현재 모델이 초래할 수 있는 최악의 위험에 대응하기에 적합하며, 완벽하지는 않더라도 다양한 심각한 위험을 폭넓게 파악할 수 있게 해 준다고 생각합니다.

또한 정렬된 모델을 훈련하고 평가할 수 있는 우리의 역량을 추적하고, 책임 있는 확장 정책에 따라 발행하는 위험 보고서에서 공개 모델과 내부 모델을 모두 보고합니다. 이 정책은 첨단 AI 시스템에서 발생할 수 있는 파국적 위험을 관리하기 위해 우리가 자발적으로 마련한 체계입니다.

미래 모델에 대한 대비. 더 발전한 모델에 대비해 훈련 및 평가 절차를 준비하고 있습니다. 결함이 있는 환경은 정렬에서 벗어난 행동의 주요 원인이므로, 강화 학습에 사용하는 환경을 더 엄격하게 걸러내고 있습니다. 정렬을 유도하는 보상도 개선하고, 안전성 훈련에 쓸 새롭고 다양한 시나리오를 자동으로 생성하는 절차를 개발하고 있습니다. 아울러 보안과 모니터링을 강화하면서, 해석 가능성에 기반한 모니터링과 평가를 개선하는 데 집중하고 있습니다. 이런 기법을 통해 모델의 사고 과정, 즉 작업 중 글로 적어 내는 추론을 감사하는 방식에 대한 의존도를 줄일 수 있기를 기대합니다.

AI 연구 자체를 완전히 자동화할 수 있는 모델처럼 더 큰 역량을 가진 모델에는 한층 높은 안전 기준이 필요합니다. 우리가 속도 조절을 제안한 데에는 이런 모델을 곧 훈련할 수 있게 되리라는 전망이 크게 작용했습니다. 이런 모델의 경우 앞서 설명한 조치만으로 그 안전 기준을 충족할 수 있다고 가정하지 않습니다. AI의 역량이 커질수록 사람들이 의존하는 시스템의 안전성을 확보하는 데 공공 정책이 더 큰 역할을 해야 합니다. 그런 역량을 갖추려면 시간이 걸립니다. 우리는 「최첨단 AI의 발전 속도를 조절해야 한다」와 최근 Accenture와의 발표에서 설명했듯이, 이를 뒷받침할 기반을 마련하기 시작했습니다. 조만간 이 노력에 관해 더 자세한 내용을 공유할 예정입니다. 규제 방식과 국제 공조를 비롯해 정부 및 업계와의 정책 논의에도 계속 기여하겠습니다.

정렬

약 2,000가지 시나리오에서 Claude를 평가하는 주요 평가 도구인 자동화된 행동 감사에서, Opus 5.5는 정렬에서 벗어난 행동을 측정하는 거의 모든 지표에서 최근의 어떤 Claude 모델보다도 좋은 성적을 거뒀습니다. 정직성을 측정하는 대부분의 지표에서도 우리가 만든 모델 중 가장 뛰어납니다.

특히 Opus 5.5는 최근 사이버보안 사고에 영향을 미쳤던 여러 행동에서 이전 모델보다 개선되었습니다. 편향되거나 원하는 결론에 맞춘 추론, 샌드박스 탈출 시도, 자신이 시뮬레이션 환경에 있다고 판단한 뒤 해로운 행동을 하는 경우 등이 여기에 해당합니다. 모델이 격리 경계를 넘으려는 성향을 테스트하기 위해 새로 설계한 평가에서, Opus 5.5가 경계를 우회하려고 시도한 횟수는 Opus 5나 Claude Mythos 5.1보다 약 85% 적었습니다. 모든 시도는 심각도가 낮았고 모델이 스스로 보고했습니다. 코드베이스와 시스템 전반에서 Claude를 사람의 감독 없이 실행하는 팀에는 이런 특성이 순수한 성능만큼 중요합니다.

하지만 최근 정렬 평가에서 설명했듯이, 배포 전에 모든 실패를 확실하게 잡아내는 평가를 만드는 일은 여전히 해결되지 않은 문제입니다. Opus 5.5가 자신이 평가받고 있다고 자주 의심하는 징후가 보입니다. 이는 모델이 배포되는 매우 다양한 실제 환경에서 어떻게 행동할지 평가하기 어렵게 만듭니다. 해석 가능성 연구에서 진전이 없다면, 사용 환경이 넓어지고 모델의 역량이 커질수록 이 문제도 커질 것으로 예상합니다. 측정 가능한 영역에서 Opus 5.5가 전반적으로 개선되었다는 점에는 확신이 있지만, 자체 정렬 연구와 함께 아래에서 설명하는 안전장치도 적용합니다.

안전장치

모델의 역량이 커질수록 새로운 능력이 악용 도구가 되지 않도록 막는 방법 중 하나는 안전장치를 더 엄격하게 적용하는 것입니다. Opus 5.5는 사이버보안, 생물학, 증류에 관해 Fable 5.1과 비슷한 수준의 안전장치를 갖추고 출시되는 첫 Opus 모델입니다. 이 안전장치들은 모두 필요할 때 별도의 조작 없이 다른 모델로 전환해 처리합니다.

사이버보안. Opus 5.5는 사이버보안 역량이 매우 뛰어나기 때문에 Fable 5.1과 비슷한 사이버보안 안전장치를 적용합니다. 사용자는 일반적인 소프트웨어 개발 과정에서 코드의 버그를 찾아 수정할 수 있지만, 대부분의 사이버보안 작업은 Opus 4.8로 전환해 처리합니다.

사이버 방어 업무를 하는 사용자를 위해 곧 사이버 검증 프로그램을 확대해 Opus 5.5도 포함할 예정입니다. 새 프로그램에는 신뢰할 수 있는 사용자에게 단계적으로 더 폭넓은 접근을 허용하는 세 등급이 마련되며, Claude Mythos 모델에 대한 접근도 포함됩니다. Claude Security에서는 이미 Claude Mythos 5.1을 사용할 수 있습니다.

생물학. Opus 5.5는 생물학 분야에서도 매우 뛰어납니다. 여러 작업 영역에서 Opus 5를 능가하고 Claude Mythos 5.1과 같거나 더 나은 성능을 냅니다. 예를 들어 Dyno Therapeutics와 함께 실시한 장기 분자 예측 및 설계 평가에서 개선된 성과를 거뒀으며, 전문 레드팀 평가자들은 과학적 참신성이 자신들이 테스트한 최고의 모델에 견줄 만하다고 평가했습니다.

이런 이유로 Opus 5.5에는 Fable 5.1과 동일한 생물학 안전장치를 적용합니다. 이 안전장치로 인해 제약을 받는 연구개발 업무에 Opus 5.5를 사용하려면 새 생명과학 검증 프로그램에 신청할 수 있습니다. 이 프로그램은 대학 연구실, 스타트업, 제약회사 등 검증받은 기관에 생물학 관련 업무 전반을 고려해 설계된 안전장치를 적용하여 접근을 허용합니다. 관심 있는 기관은 여기에서 신청할 수 있습니다.

증류

공격자가 수천 개의 가짜 계정을 이용해 모델의 역량을 산업적 규모로 추출하는 증류 공격은 안전과 국가 안보에 위험을 초래합니다. 증류를 이용하면 악의적인 행위자가 우리가 Claude에 적용한 안전장치 없이도 강력한 모델을 만들 수 있습니다. 지금까지 탐지하고 차단한 불법 증류 활동은 2026년 9월 위협 인텔리전스 보고서에 자세히 설명되어 있습니다.

Opus 5.5에는 Fable 5.1에서 도입한 증류 방지 안전장치인 사고 과정 보존(preserved thinking)이 적용됩니다. 이 기능은 API 사용자가 Claude의 추론을 추출하려고 이전 컨텍스트를 편집하는 것을 막습니다. 2026년 8월 31일 이후 생성된 API 계정에서 Fable 5.1과 Opus 5.5에 적용됩니다. 변경 사항은 도움말 센터 문서에, 기존 연동을 테스트하고 업데이트하는 방법은 사고 과정 보존 문서에 설명되어 있습니다.

데이터 보존과 규정 준수

이전 Opus 모델과 마찬가지로 Opus 5.5도 데이터를 보존하지 않는 조건으로 사용할 수 있습니다.

Fable 5.1과 마찬가지로 Opus 5.5에도 EU AI Act를 준수하기 위한 워터마킹 조치를 적용합니다. 자세한 내용은 여기에서 설명합니다. 또한 이 문서에서 설명하듯이, 이제는 ‘사고(thinking)’ 모드를 끈 상태로 사용할 수 없습니다.

이용 가능 여부

Claude Opus 5.5는 이제 Amazon Web Services, Google Cloud, Microsoft Azure를 비롯한 모든 플랫폼에서 사용할 수 있습니다. 개발자는 Claude Platform에서 claude-opus-5-5로 시작할 수 있습니다.

Footnotes

  1. Terminal-Bench 4.0: 표준오차는 Claude Opus 5.5가 ±2.6%포인트, 다른 Claude 모델들이 ±1.6~2%포인트입니다. 공개 순위표에서는 작업당 5회 시도하고 Claude Code 실행 환경을 사용했을 때 Claude Opus 5가 51.8%를 기록했습니다. 우리 환경에서 재현한 결과는 52.3%로, 오차 범위 안에 있습니다. GPT-6 Astra와 GPT-5.6 Sol의 수치는 OpenAI가 발표한 값입니다. ↩

  2. AutomationBench: AutomationBench 평가는 Zapier가 실행하고 결과를 발표했습니다. 이 평가에서는 대체 모델을 사용하지 않았기 때문에 안전장치의 개입을 실패로 처리했습니다. 그 결과 Claude Opus 5.5가 실제 사용에서 달성할 수 있는 점수보다 낮게 나왔습니다. Claude Opus 5.5의 결과는 조기 접근 기간에 Zapier가 자체적으로 수행한 평가에서 가져왔습니다. Opus 5, GPT-5.6 Sol, GPT-6 Astra의 결과는 Zapier의 공개 순위표에서 가져왔습니다. ↩

  3. Terminal-Bench-Science 0.1: 모델별 표준오차는 ±3.5~5%포인트입니다. 공개 순위표에서는 작업당 3회 시도하고 Claude Code 실행 환경을 사용했을 때 Claude Opus 5가 30.0%를 기록했습니다. 우리 환경에서 재현한 결과는 29.0%로, 오차 범위 안에 있습니다. GPT-6 Astra의 수치는 OpenAI가 발표한 값입니다. ↩

  4. WANDR: Claude 모델은 웹 검색 및 웹 가져오기 도구의 오프라인 버전, 프로그래밍 방식의 도구 호출, 코드 실행을 사용하고 작업당 토큰 한도를 98만으로 설정해 실행했습니다. 이는 Perplexity가 발표한 평가 설정과 다르므로 두 평가의 점수를 직접 비교할 수 없습니다. 여기에는 동일한 조건에서 평가한 모델만 표시했습니다. ↩

Edit this page

Search the archive

Find a page by title, or search the text inside one.