Skip to main content

Will It Mythos?

Hacker News · 2026-06-23 · 보안/AI 벤치마크


작성자는 Mythos가 실전에서 발견했다고 공개한 취약점 샘플 9건을 모아 Opus 4.7로 검증한 뒤, 동일한 간이 하니스에서 여러 공개·상용 모델에게 소스 전체를 제시하고 단서 없이 취약점을 찾게 하는 벤치마크를 만들었다. 실험은 .git 디렉터리를 제거한 채 네트워크 접근을 허용한 소스체크아웃을 제공하는 방식으로 진행되었고, 각 버그는 모델들의 지식 컷오프 이후에 발생한 것으로 처리해 메모리 답변 가능성을 배제했다. 저자는 에이전트(예: Claude Code)는 비용·토큰 문제에도 불구 성능 영향을 적게 줬지만, 구글의 antigravity(agy)는 보안 분석 요청 자체를 거부해 에이전트 가드레일이 연구에 영향을 미친 사례를 지적한다. 실험 결과는 단일 실행·표본 수 제한 등 제약에도 흥미로운 경향을 드러낸다. Qwen 3.6 같은 비교적 소형 모델과 MiMo·DeepSeek 같은 저비용 중국 모델은 Opus나 GPT 5.5에 필적하는 성능을 보였고, Gemma 4 MoE는 일부 케이스에서 우수했으나 루프에 빠지는 불안정한 실패 모드가 발견됐다. 반면 Mistral과 Laguna는 취약점 탐지에서 거의 성과를 내지 못했고, Nemotron 계열은 모델 크기와 성능이 역상관을 보이는 등 예측과 다른 패턴이 관찰되었다. 저자는 Mythos가 일부 독보적 발견을 한 가능성을 배제하지 않으면서도, 최적의 도구·프롬프트·시간을 제공하면 공개 모델도 많은 취약점을 찾아낼 잠재력이 있음을 시사한다. 기술적 시사점은 에이전트 가드레일과 하니스 설계, 반복 실험의 필요성, 비용·시간 제약이 보안용 AI 평가에 큰 영향을 준다는 점이다.

Hacker News에서 원문 읽기 →