APIMart
Claude Mythos가 60시간 만에 찾아낸 암호학 결함

Claude Mythos가 60시간 만에 찾아낸 암호학 결함

Claude Mythos가 60시간과 10만 달러를 들여 HAWK 논스 결함을 찾아낸 과정, 사람의 검증이 중요했던 이유, 보안팀이 얻을 교훈을 살펴봅니다.

모델 분석

핵심부터 말하면, 저는 이 사례를 AI가 혼자서 현대 암호를 깰 수 있다는 증거가 아니라 비용, 집중력, 사람의 검토에 관한 이야기로 봅니다.

60시간 동안 $100,000를 지출한 끝에 Claude Mythos는 **HAWK**와 관련된 논스 생성 결함을 찾는 데 기여했습니다. 이 문제를 악용하면 공격자는 공개 서명을 이용해 격자 공격으로 개인 키 복구를 시도할 수 있습니다. 동시에 이 글은 한 가지를 분명히 짚습니다. 라운드 수를 줄인 AES는 완전한 AES가 아닙니다.

이 글을 몇 줄로 요약하면 다음과 같습니다.

  • 대상: HAWK와 라운드 수를 줄인 AES
  • 결과: HAWK에서 확인된 논스 편향 문제
  • 위험: 취약한 논스가 충분히 쌓이면 공개 서명이 키 탈취 경로가 될 수 있음
  • 비용: 주말처럼 집중적으로 진행된 한 차례 작업에 $100,000
  • 과정: AI가 단서를 만들고 사람이 이를 걸러 검증함
  • 교훈: 저렴하게 시작하고, 일찍 검증하며, 최상위 모델은 워크플로 후반에 사용해야 함

제가 특히 주목한 부분은 탐색증명의 분리입니다. 글에 따르면 모델은 코드와 공격 아이디어를 빠르게 살피는 데 도움을 줬고, 첫 시도에서 익스플로잇을 재현한 비율은 **83.1%**였습니다. 하지만 글 자체가 전하는 메시지는 명확합니다. 무엇이 진짜인지 결국 사람이 확인해야 했습니다.

개발자와 보안팀을 향한 조언도 단순합니다.

  • 먼저 더 작은 모델을 사용할 것
  • 엄격한 예산 상한을 정할 것
  • 지출을 늘리기 전에 검증할 것
  • 모델 출력을 최종 발견이 아닌 단서로 다룰 것

제가 기억할 부분은 바로 이것입니다. 핵심은 AI가 새로운 무언가를 찾았다는 데 있지 않습니다. 범위를 좁히고 사람이 검증하는 워크플로라면, 시간과 비용을 투입할 의향이 있을 때 이미 알려진 공격 패턴을 실제로 시험된 발견으로 바꿀 수 있다는 점입니다.

AI가 암호화 라이브러리에서 취약점을 찾는 방법

2. Claude Mythos가 시간과 비용을 사용한 방식

Claude Mythos

AI 지원 암호 감사 워크플로: 60시간에 $100K
AI 지원 암호 감사 워크플로: 60시간에 $100K

60시간 조사 타임라인

60시간의 집중 작업은 공격 정의, 모델 기반 분석, 개선, HAWK 및 라운드 수를 줄인 AES에 대한 검증이라는 명확한 순서로 진행됐습니다. 처음에 팀은 구체적인 공격 목표를 정하고 무엇을 확인된 발견으로 볼지 정의했습니다. 이후 Claude Mythos는 표준 SAST 도구를 사용하지 않은 채, 알려진 취약점 패턴을 암호화 코드의 잠재적 결함과 대조하며 반복적으로 변형 사례를 찾았습니다 [4].

중간 단계에서는 후보 취약점을 시험하고 오탐을 줄이는 데 집중했습니다. 이 필터링은 사람이 맡았습니다. Claude Mythos는 **83.1%**의 사례에서 첫 시도에 익스플로잇을 재현해 막다른 길과 낭비되는 수고를 줄였습니다 [1].

마지막 단계에서 팀은 가장 유력한 후보를 소스 코드 및 각 대상의 암호학적 전제와 대조했습니다. 이 검증을 바탕으로 다음에 설명할 공격 시나리오가 마련됐습니다.

$100,000의 사용처

$100,000에는 반복적인 모델 실행, 워크플로 오케스트레이션, 사람의 검토 비용이 포함됐습니다. 쉽게 말해, 돈은 단 한 번의 큰 시도에 들어간 것이 아닙니다. 약한 단서가 탈락하고 강한 단서가 검증될 때까지 같은 과정을 거듭 실행하는 데 쓰였습니다.

더 작은 오픈 웨이트 모델도 검증 단계에서 도움이 될 수 있습니다. 경우에 따라 토큰 백만 개당 $0.11만으로도 복잡한 익스플로잇 체인을 복원할 수 있습니다 [3].

다중 모델 보안 워크플로에 APIMart를 활용하는 방법

GccAi

APIMart는 하나의 OpenAI 호환 엔드포인트를 통해 가설 생성, 분석, 검증을 라우팅할 수 있습니다. 덕분에 여러 도구 사이에서 복잡한 인계 과정을 따로 구성하지 않고도 후보 발견에서 검증으로 더 쉽게 넘어갈 수 있습니다.

3. 실제 결함: 공격자가 할 수 있는 일

이번 발견으로 가능해진 공격 시나리오

가장 강력한 단서는 공개 서명을 개인 키 복구 경로로 바꾸는 논스 생성 결함이었습니다. Claude Mythos는 대상 구현에서 편향된 논스 생성을 발견했습니다. 논스가 균일하지 않으면 공격자는 시간이 지나며 서명을 수집하고 격자 기반 Hidden Number Problem(HNP) 공격을 실행해 개인 키를 복구할 수 있습니다 [5].

가장 손쉬운 표적은 많은 서명을 공개하는 시스템입니다. 범위를 벗어난 논스 비율이 약 6%만 되어도 취약한 논스 생성을 식별하고 공개 서명을 이용한 키 복구 시도를 정당화하기에 충분할 수 있습니다 [5]. 공격자가 개인 키를 얻으면 서명을 위조하고 키 소유자를 사칭할 수 있습니다 [5]. 바로 이 점이 공격을 현실적으로 만듭니다. 공개 서명 자체가 공격의 원재료가 되는 것입니다.

기존 공격 기준과 비교한 측정 결과

여기서 가장 큰 변화는 운영 측면에 있습니다. 모델은 알려진 공격 유형을 수동 분류만 할 때보다 더 빠르게 작동하는 경로로 바꿨습니다. Claude Mythos가 첫 시도에 익스플로잇을 재현한 비율이 83.1%였기 때문에 이 속도는 중요합니다 [1].

4. 개발자, 보안팀, AI 운영에 미치는 영향

암호학 연구에서 AI가 가장 큰 도움을 주는 영역

AI가 여기서 새로운 공격 유형을 발명한 것은 아닙니다. AI의 역할은 유력한 후보를 찾고, 가설을 확인하며, 보안 중심 코드베이스 전반에 알려진 공격 패턴을 적용하는 고된 작업의 속도를 높이는 것이었습니다.

실무에서는 이 차이가 중요합니다. AI는 탐색 범위를 줄일 수 있지만 무엇이 진짜 문제인지 결정할 수는 없습니다. 사람이 여전히 코드를 읽고, 주장을 시험하고, 암호 설계와 대조해야 합니다.

2026년 칠월, zkSecurity의 AI 감사 에이전트 _zkao_는 Cloudflare의 실험적 암호화 라이브러리 CIRCL에서 실제 버그 일곱 개를 확인했습니다. 여기에는 임계값 RSA의 심각한 float64 정밀도 손실과 속성 기반 암호화의 접근 제어 붕괴가 포함됐으며, 이후 모두 업스트림에서 수정됐습니다 [2]. 간단히 말하면 역할은 이렇게 나뉩니다. AI는 팀이 검사할 항목을 더 많이 찾도록 돕고, 사람 검토자는 그중 실제로 성립하는 것을 판단합니다.

예산을 낭비하지 않고 비슷한 감사를 계획하는 방법

좋은 감사 흐름은 꽤 단순합니다.

  • 더 저렴한 모델로 올바른 코드 경로를 찾고 명백한 후보를 표시합니다
  • 발견 내용을 소스 코드와 암호학적 전제에 대조합니다
  • 후보가 검토를 통과한 뒤에만 플래그십 모델로 넘어갑니다
  • 작업을 시작하기 전에 예산 상한을 정합니다
  • 초기 검증 지점을 추가해 가치 없는 경로에 비용을 태우기 전에 계속 진행할지, 방향을 바꿀지, 중단할지 결정합니다

이 순서가 중요합니다. 3.6 billion 파라미터 규모의 오픈 웨이트 모델은 토큰 백만 개당 단 $0.11로 복잡한 익스플로잇을 탐지할 수 있습니다 [3]. 따라서 비싼 연산은 파이프라인의 시작이 아니라 끝에 배치해야 합니다.

이것이 암호 감사에서 AI가 유용한 이유입니다. 단순히 더 빨라지는 것만이 아닙니다. Mythos 집중 작업의 핵심 교훈은 속도, 검증, 비용 사이의 절충입니다. $100,000와 60시간을 투입해 사람의 검증을 거친 발견을 확인할 수 있었던 것은 과정이 대상에 필요한 엄밀성 수준에 맞춰졌기 때문입니다.

5. 결론: AI 지원 암호 분석의 비용과 보안 가치

Mythos는 LLM 하위 에이전트를 활용해 파일을 병렬로 검사하고 소스 코드를 직접 살펴봄으로써 HAWK의 논스 생성 결함을 확인했습니다. 결과에 신뢰성을 부여한 것은 사람의 검증이었습니다. AI 작업은 탐색 시간을 줄이고, 검토자가 확인하고 측정할 수 있는 후보 문제를 드러냈습니다 [4]. 이로 인해 초점도 달라집니다. 핵심 질문은 새로움보다 비용에 가깝습니다.

다음 문제는 효율성입니다. 그 탐색에 실제로 얼마가 들었을까요? 이 정도 규모에서는 예산 압박을 외면하기 어렵고, 답은 범위에 크게 좌우됩니다. 합리적인 구성은 첫 단계에 더 작은 오픈 웨이트 모델을 사용하고, 더 깊은 추론이 필요한 부분을 위해 플래그십 모델을 아껴 두는 것입니다 [3].

팀이 얻을 교훈은 추상적이지 않고 실용적입니다. 범위를 좁게 유지하고, 일찍 검증하며, AI 출력을 최종 답이 아닌 단서로 다루세요. Curl의 Daniel Stenberg는 이를 명확하게 표현했습니다.

AI는 사람의 검토를 대체하는 것이 아니라 지원합니다

이 점은 Curl 감사 한 건에서 분명히 드러납니다. Mythos는 문제 다섯 개를 표시했지만, 수동 검토 결과 목록은 심각도가 낮은 CVE 한 개와 버그 한 개로 줄었습니다 [4].

자주 묻는 질문

이 결함이 실제 시스템의 개인 키를 노출할 수 있나요?

그렇습니다. 누군가 커널 수준 접근 권한을 제공하는 결함을 악용하면 시스템 전체를 장악할 수 있습니다. 그러면 해당 기기에 저장된 개인 키를 비롯한 민감한 데이터가 노출될 수 있습니다.

이 연구는 AI 지원 분석이 복잡한 취약점을 찾아 연결할 수 있음을 보여줍니다. 쉽게 말하면 공격자가 작은 결함들을 더 큰 침해로 엮기 쉬워질 수 있으며, 이는 대규모 공격 위험을 높입니다.

감사 비용이 약 $100,000에 달한 이유는 무엇인가요?

$100,000라는 비용은 60시간 동안 심층 보안 분석을 실행하는 데 필요한 전문 연산 자원, 고급 도구, 테스트 인프라를 집중적으로 사용한 데서 발생했습니다.

복잡하고 위험 부담이 큰 암호화 시스템에서 중대한 결함을 식별하고 검증하며 문서화하는 데 필요한 기술 작업도 여기에 포함됐습니다.

AI가 하지 못해 사람이 검증한 것은 무엇인가요?

사람들은 직접 소스 코드를 읽고 각 사례를 하나씩 검토해 오류를 찾아내는 방식으로 AI의 발견을 확인했습니다.

AI가 “확인했다”고 한 문제 중 다수가 실제로는 오탐이거나 단순한 버그였지 보안 결함은 아니었습니다. 이 추가 검토 덕분에 누구든 심각도가 높은 발견을 유효하다고 받아들이기 전에 정확성을 확보할 수 있었습니다.

이제 직접 테스트해 보세요

모델 마켓에서 원하는 모델을 선택하세요

APIMart 모델 마켓에서 채팅, 이미지, 비디오 모델을 사용해 보고 하나의 통합 API로 모델 기능을 빠르게 경험하세요.

채팅 모델이미지 모델비디오 모델
모델 마켓 보기