
Claude Mythosが60時間で暗号の欠陥を発見
Claude Mythosが60時間と$100,000を費やしてHAWKのnonce生成の欠陥を発見した経緯、人間による検証の重要性、セキュリティチームが学べる教訓を解説します。
結論から言えば、これはAIが単独で現代暗号を破れる証拠ではなく、コスト、集中力、そして人間によるレビューについての物語として捉えるべきです。
60時間と**$100,000の費用をかけて、Claude MythosはHAWKに関連するnonce生成の欠陥の発見に貢献しました。この問題により、攻撃者が公開署名を利用し、格子攻撃による秘密鍵の復元**へと進める可能性があります。同時に、この記事は一点を慎重に区別しています。ラウンド数を減らしたAESは、完全なAESではありません。
この記事を数行でまとめるなら、次のとおりです。
- 対象: HAWKとラウンド数を減らしたAES
- 結果: HAWKで確認されたnonceバイアスの問題
- リスク: 弱いnonceが十分にあれば、公開署名が鍵窃取への経路になり得る
- コスト: 週末の集中作業のような取り組みに**$100,000**
- プロセス: AIが手掛かりを生成し、人間が選別して検証
- 教訓: 低コストで始め、早期に検証し、最上位モデルはワークフローの後半で使う
私が特に注目するのは、探索と証明の分担です。記事で示された初回のエクスプロイト再現率**83.1%**から見ると、モデルはコードと攻撃アイデアを素早く選別する助けになったようです。しかし、記事自体のメッセージは明快です。何が本物かを確認する作業は、依然として人間が担う必要がありました。
開発者とセキュリティチームに向けた記事の助言は明快です。
- まず小規模なモデルを使う
- 厳格な予算上限を設ける
- 支出を拡大する前に検証する
- モデルの出力を最終的な発見ではなく手掛かりとして扱う
私なら、この点を最も重視します。最大の要点は、AIが何か新しいものを発見したことではありません。 厳密に範囲を定め、人間が確認するワークフローなら、時間と費用を投じることで、既知の攻撃パターンを検証済みの発見へと変えられるということです。
AIは暗号ライブラリの脆弱性をどう発見するのか
2. Claude Mythosは時間と費用をどう使ったか


60時間にわたる調査のタイムライン
60時間の集中調査は、攻撃の枠組み作り、モデル主導の分析、絞り込み、そしてHAWKとラウンド数を減らしたAESに対する検証という明確な順序で進みました。最初にチームは具体的な攻撃目標を選び、何をもって確認済みの発見とするかを定義しました。その後Claude Mythosは、標準的なSASTツールを使わず、既知の脆弱性パターンを暗号コード内の潜在的な欠陥と照合しながら、変種を繰り返し探索しました[4]。
中盤では、脆弱性候補のテストと誤検知の削減に重点が置かれました。その選別を担当したのは人間のレビュアーです。Claude Mythosは**83.1%**の割合で初回にエクスプロイトを再現できたため、行き止まりと無駄な作業が減りました[1]。
最終段階では、チームが最も有力な候補をソースコードと各対象の暗号上の前提に照らして確認しました。これらの確認により、次に説明する攻撃シナリオが整いました。
$100,000の使途
$100,000には、モデルの反復実行、ワークフローのオーケストレーション、人間によるレビューが含まれています。簡単に言えば、費用は一度の大勝負に使われたのではありません。弱い手掛かりが脱落し、有力なものが検証に耐えるまで、同じループを何度も回すために使われました。
小規模なオープンウェイトモデルも検証を支援できます。場合によっては、百万トークン当たりわずか**$0.11**で複雑なエクスプロイトチェーンを復元できます[3]。
APIMartをマルチモデル型セキュリティワークフローに組み込む方法

APIMartなら、仮説生成、分析、検証を一つのOpenAI互換エンドポイント経由で振り分けられます。そのため、ツール間で煩雑な引き継ぎを組み立てることなく、候補の発見から検証へ移りやすくなります。
3. 実際の欠陥:攻撃者に何ができるのか
この発見によって可能になる攻撃シナリオ
最も有力な手掛かりは、公開署名を秘密鍵復元への経路に変えるnonce生成の欠陥でした。Claude Mythosは対象実装で偏りのあるnonce生成を発見しました。nonceが一様でなければ、攻撃者は時間をかけて署名を収集し、格子ベースのHidden Number Problem(HNP)攻撃を実行して秘密鍵を復元できます[5]。
最も狙われやすいのは、多数の署名を公開しているシステムです。範囲外のnonceが約6%あるだけでも、弱いnonce生成を見抜き、公開署名を使った鍵復元を試みる根拠になり得ます[5]。攻撃者が秘密鍵を入手すれば、署名を偽造して鍵の所有者になりすますことができます[5]。これが、この攻撃を現実的なものにする理由です。公開署名そのものが攻撃の材料になります。
過去の攻撃基準と比較した実測上の影響
ここでの主な変化は運用面にあります。モデルは、既知の攻撃クラスを手作業のトリアージだけの場合より速く、実用的な経路へと変えました。この速度が重要なのは、Claude Mythosが83.1%の割合で初回にエクスプロイトを再現したためです[1]。
4. 開発者、セキュリティチーム、AI運用への影響
暗号研究でAIが最も役立つ領域
ここでAIが新しい攻撃クラスを発明したわけではありません。AIが行ったのは、見込みのある候補の発見、仮説の確認、既知の攻撃パターンをセキュリティ重視のコードベース全体に適用するという地道な作業の高速化です。
この違いは実務上重要です。AIは探索空間を狭められますが、何を本物の問題と見なすかは決められません。人間がコードを読み、主張をテストし、暗号設計と照らし合わせる必要があります。
2026年七月、zkSecurityのAI監査エージェント_zkao_は、Cloudflareの実験的暗号ライブラリCIRCLで七件の実在するバグを確認しました。その中には、しきい値RSAにおける重大なfloat64精度損失や、属性ベース暗号におけるアクセス制御の破綻が含まれ、いずれもその後アップストリームで修正されました[2]。端的に言えば、これが役割分担です。AIはチームが調査すべき項目をより多く見つける助けになり、人間のレビュアーがどれが検証に耐えるかを判断します。
予算を無駄にせず同様の監査を計画する方法
優れた監査フローはとてもシンプルです。
- 低コストなモデルから始め、適切なコードパスを見つけて明らかな候補を抽出する
- その発見をソースコードと暗号上の前提に照らして確認する
- 候補がレビューを通過した後にのみ、最上位モデルへ移行する
- 作業開始前に予算上限を設定する
- 初期検証のチェックポイントを設け、見込みのない候補に費用を浪費する前に、継続、方向転換、中止を判断できるようにする
この順序が重要です。3.6 billionパラメータのオープンウェイトモデルなら、百万トークン当たりわずか$0.11で複雑なエクスプロイトを検出できます[3]。したがって、高価な計算資源はパイプラインの最初ではなく最後に投入すべきです。
これこそが、暗号監査でAIが有用となる理由です。単に作業が速くなるだけではありません。Mythosの集中調査から得られる最大の教訓は、速度、検証、コストのトレードオフです。$100,000と60時間によって、人間が確認した確かな発見が得られたのは、プロセスの厳密さが対象に必要な水準と一致していたからです。
5. 結論:AI支援型暗号解析のコストとセキュリティ価値
Mythosは、LLMサブエージェントで複数ファイルを並列に走査し、ソースコードを直接調査することで、HAWKのnonce生成の欠陥を確認しました。結果に信頼性を与えたのは人間による検証です。AIによる作業は探索時間を短縮し、レビュアーが確認・測定できる問題候補を浮かび上がらせました[4]。これにより焦点が変わります。中心的な問いは新規性よりもコストです。
次の論点は効率性です。その探索には実際いくらかかったのでしょうか。この規模では予算圧力を無視できず、答えは範囲に大きく左右されます。合理的な構成は、最初の調査に小規模なオープンウェイトモデルを使い、より深い推論が必要な部分のために最上位モデルを温存することです[3]。
チームにとっての教訓は抽象論ではなく実践的なものです。範囲を絞り、早期に検証し、AIの出力を最終回答ではなく手掛かりとして扱ってください。CurlのDaniel Stenbergは端的にこう述べています。
AIは人間によるレビューを置き換えるのではなく、支援するものです
この点は、あるCurl監査にはっきり表れています。Mythosは五件の問題を指摘しましたが、手動レビューによって、最終的には深刻度の低いCVE一件とバグ一件に絞られました[4]。
よくある質問
この欠陥によって実際のシステムで秘密鍵が漏えいする可能性はありますか?
はい。カーネルレベルのアクセスを得られる欠陥を悪用されると、システム全体を乗っ取られる可能性があります。その結果、マシンに保存された秘密鍵を含む機密データが漏えいしかねません。
この調査は、AI支援型分析が複雑な脆弱性を発見し、連鎖させられることを示しています。平たく言えば、攻撃者が小さな欠陥を組み合わせてはるかに大きな侵害へつなげやすくなる可能性があり、大規模攻撃のリスクが高まります。
監査に約$100,000かかったのはなぜですか?
約**$100,000**という費用は、60時間にわたる詳細なセキュリティ分析に必要な専用計算資源、高度なツール、テスト基盤を大量に使用したことで発生しました。
また、複雑かつ高リスクな暗号システムにおける重大な欠陥を特定、検証、文書化するための技術作業も含まれています。
AIにはできず、人間が検証したことは何ですか?
人間は自らソースコードを読み、誤りを見つけるために各事例を手作業で確認することで、AIの発見を検証しました。
その結果、AIが「確認済み」とした問題の多くは、実際には誤検知または単なるバグであり、セキュリティ上の欠陥ではないことが分かりました。この追加レビューにより、重大度の高い発見を有効と扱う前に、その正確性を確認できました。
モデルマーケットで使いたいモデルを選ぶ
APIMart のモデルマーケットでチャット、画像、動画モデルを試し、統一 API でモデルの能力をすばやく体験できます。