Skip to main content

Progress from our Frontier Red Team

Anthropic Blog · 2026-07-08 · AI 보안/안전


Anthropic의 Frontier Red Team 보고서는 첨단 AI 모델이 국가안보 관점에서 보이는 ‘초기 경고’ 신호를 정리하면서, 사이버 보안과 생물학 분야에서의 빠른 능력 향상과 여전히 남아있는 실무적 제약을 함께 제시한다. 사이버 영역에서는 Claude 계열 모델이 1년 사이 CTF(포착·이용형 취약점 실습) 성능이 고등학생 수준에서 학부 수준으로 도약했고, 최신 Claude 3.7 Sonnet이 공개 벤치마크 Cybench에서 다섯 차례 시도 내에 약 3분의1 문제를 풀 수 있을 정도로 개선되었다는 구체적 수치를 제시한다. 다만 역공학·네트워크 정찰·횡적 이동 등 전문가 수준 기술은 아직 부족하며, 도구(toolkit)를 결합했을 때만 알려진 대규모 개인정보 유출과 유사한 공격을 복제할 수 있었다는 한계도 분명히 보고한다. 생물보안 측면에서는 모델이 일부 실험 설계·클로닝 워크플로에서 전문가 기준을 넘어서기도 했으나, 과학적 도표 해석 등에서는 여전히 뒤처진다. 통제된 사용자 연구와 전문가 레드팀의 평가는 모델이 초보자에게 일정한 보조 효과(uplift)를 제공했지만, 실제 실행에서 치명적 오류를 포함한 계획으로 인해 무기화 전과정을 신뢰성 있게 안내할 수준은 아니라는 결론을 내린다. 보고서는 US·UK AI Safety Institutes, Carnegie Mellon, NNSA와의 협업 사례와 사전배포 시험 결과를 근거로 내부의 Responsible Scaling Policy와 AI Safety Level(ASL) 기준을 적용해 위험을 모니터링한다고 밝히며, 자동화된 평가 확대와 정부·연구기관과의 더 깊은 협력이 조기 경보와 안전한 확장에 필수적이라는 기술적·정책적 시사점을 강조한다.

Anthropic Blog에서 원문 읽기 →