Redeploying Claude Fable 5
Anthropic Blog · 2026-07-01 · AI 안전/배포
Anthropic은 미국의 수출통제 해제로 Claude Fable 5와 Mythos 5에 대한 접근을 복원한다고 발표했다. 두 모델은 6월 9일 공개된 뒤 6월 12일 정부의 지시로 외국인 접근 제한 조치가 즉시 발효되자 전 사용자에 대해 일시 중단되었고, 6월 30일 통제가 해제되어 Fable 5는 7월 1일부터 글로벌로 재가용화된다. Anthropic은 문제의 직접적 계기로 Amazon 연구진이 보고한 Fable 5 안전장치 우회 기법을 지목했고, 검증 결과 유사한 취약 식별은 낮은 성능 모델에서도 가능했으나 공격적 능력을 고유하게 제공한 것은 아니었다고 설명한다. 회사는 우회 사례를 차단하기 위해 새로 훈련한 안전 분류기를 도입해 보고된 기법을 99% 이상 차단하도록 했으며, 차단된 요청은 Opus 4.8으로 우회 처리하는 등 사용자 영향과 위협 완화 사이에서 균형을 취하고 있다. 기술적 접근은 ‘다층 방어(defense in depth)’와 의도적 과잉차단(안전 마진 확대)에 기반한다. Anthropic은 분류기가 오탐을 일으킬 수 있음을 인정하면서도, 대다수의 악용가능성을 어렵게 만드는 쪽으로 설정했다고 밝혔다. 더 나아가 Amazon·Microsoft·Google 등과 함께 AI '줄브레이크(jailbreak)'의 심각도를 평가하는 산업 표준 프레임워크 초안을 제시했는데, 여기에는 능력 획득의 크기, 적용 범위, 무기화의 용이성, 발견 가능성 등 네 가지 기준을 제안한다. 마지막으로 정부와의 사전평가·정보공유·공동연구 확대를 약속하며, HackerOne을 통한 연구자 제출 등 실무적 협업 채널을 마련해 향후 전면적 규제와 산업 표준 정립을 모색하겠다고 밝혔다. 이번 사안은 고성능 모델의 배포·통제·안전성 개선이 어떻게 정책·산업 협력과 맞물리는지를 보여주는 사례로, 분류기 기반의 차단 전략과 오탐-위험 완화 간 트레이드오프를 기술적으로 시사한다.