Frontier threats red teaming for AI safety
Anthropic Blog · 2026-07-08 · AI Safety / Red Teaming
Anthropic은 고위험 영역을 대상으로 한 'frontier threats red teaming' 접근법과 생물학 분야 시험 프로젝트의 소결과를 공개했다. 연구팀은 수십 년 경험의 도메인 전문가와 협력해 위협 모델을 정의하고, 모델 능력을 파헤치기 위해 전문가들이 모델과 수백 시간(사례에 따라 100시간 이상, 생물학 분야는 150시간 이상)을 투자해 대화·우회·정량적 평가 도구를 개발했다고 밝혔다. 결과적으로 현재 프런티어 모델이 일부 분야에서는 전문가 수준의 정밀하고 유용한 정보를 생성할 수 있음을 확인했으며, 모델의 규모 확대 및 외부 도구 접근이 생물학 관련 역량을 빠르게 끌어올릴 수 있다고 평가했다. Anthropic은 이러한 위험이 오늘날에는 작지만 비교적 빠르게 성장하고 있으며, 완화되지 않으면 향후 2~3년 내 실현될 수 있는 단기적 위협으로 판단했다는 점을 강조한다. 원문에서는 민감한 세부사항은 공개하지 않았다. 동시에 연구 과정에서 적용한 완화책도 제시했다. 학습 절차의 변경(예: Constitutional AI 관련 접근)과 분류기 기반 필터를 통해 유해·무해 사용을 구분하고, 여러 단계를 연쇄적으로 연결해 악용하는 것을 어렵게 만든다는 실증을 보고하며 일부 방어책은 공개 배포 모델에 이미 적용했다고 밝혔다. 향후 과제로는 LLM이 검색엔진 대비 실제로 해를 일으키는 속도를 측정하는 반복 실험, 도구 사용 모델 및 멀티모달 모델에 대한 평가 확대, 레드팀을 거치지 않은 모델의 출시에 대비한 대응 전략 마련 등을 제시한다. Anthropic은 위험 신고·완화 공유를 위한 공개 절차를 마련하고 제3자 독립 평가 조직 설립을 권장하며, 관련 전문 인력 확충과 이해관계자와의 협력을 확대하겠다고 밝혔다. 이 연구는 국가안보와 관련된 AI 위험을 조기에 탐지하고 완화할 수 있는 체계적 레드팀 방법론을 확장해야 한다는 기술적·정책적 시사점을 제공한다.