
Claude Mythos 在 60 小时内发现加密缺陷
深入了解 Claude Mythos 如何耗时 60 小时、花费 $100,000 发现 HAWK nonce 缺陷,为什么人工验证至关重要,以及安全团队能从中学到什么。
结论是:我会把这看作一个关于成本、专注度和人工审查的故事,而不是 AI 能够独自破解现代密码学的证明。
在 60 小时内、花费 $100,000 后,Claude Mythos 协助发现了一个与 HAWK 有关的 nonce 生成缺陷。该问题可能让攻击者利用公开签名,通过格攻击逐步实现私钥恢复。与此同时,文章谨慎强调了一点:缩减轮数的 AES 并不等同于完整的 AES。
如果要用几句话概括这篇文章,重点如下:
- 目标: HAWK 和缩减轮数的 AES
- 结果: HAWK 中一个已确认的 nonce 偏差问题
- 风险: 足够多的弱 nonce 可能让公开签名成为窃取密钥的途径
- 成本: 在一次周末式集中攻关中花费 $100,000
- 过程: AI 提供线索;人类负责筛选和核验
- 经验: 从低成本方案开始,尽早验证,并在工作流后期使用顶级模型
最引人注目的是搜索与证明之间的分工。模型似乎帮助团队快速筛查了代码和攻击思路,文章还提到其首次尝试复现漏洞利用的成功率为 83.1%。但文章本身传达的信息很明确:仍然需要人来确认哪些发现是真实的。
文章给开发者和安全团队的建议很直接:
- 先使用较小的模型
- 设定严格的预算上限
- 在扩大支出之前完成验证
- 将模型输出视为线索,而不是最终结论
这是我会记住的部分。核心结论并不是 AI 发现了新事物。 真正的重点是,一个范围明确且经过人工核验的工作流,可以把已知攻击模式转化为经过测试的发现——前提是你愿意投入时间和资金。
AI 如何发现加密库中的漏洞
2. Claude Mythos 如何投入时间与资金


60 小时调查时间线
这次 60 小时的集中攻关按照清晰的顺序推进:构建攻击框架、模型引导的分析、细化,以及针对 HAWK 和缩减轮数 AES 的验证。开始时,团队选定了具体攻击目标,并定义了什么样的结果才算得到确认。随后,Claude Mythos 开始反复寻找变体,在不使用标准 SAST 工具的情况下,将已知漏洞模式与密码学代码中的潜在缺陷进行匹配 [4]。
中间阶段的重点是测试候选弱点并减少误报。这一步筛选由人工审查人员负责。Claude Mythos 首次尝试就成功复现漏洞利用的比例为 83.1%,这意味着更少的死胡同和更少的无效工作 [1]。
在最后阶段,团队根据源代码和每个目标背后的密码学假设,核验了最有力的候选项。这些核验为接下来介绍的攻击场景奠定了基础。
$100,000 花在了哪里
这 $100,000 用于反复运行模型、编排工作流和人工审查。简单来说,这笔钱并不是押在一次重大尝试上,而是用来一遍又一遍地运行循环,直到薄弱线索被淘汰、有力线索经受住检验。
较小的开放权重模型也能在验证环节提供帮助。在某些情况下,它们能以低至每百万 token $0.11 的成本还原复杂的漏洞利用链 [3]。
APIMart 如何融入多模型安全工作流

APIMart 可以通过一个兼容 OpenAI 的端点来路由假设生成、分析和验证。这样一来,从发现候选项过渡到验证变得更加容易,无需在不同工具之间拼接混乱的交接流程。
3. 实际缺陷:攻击者能做什么
该发现可能带来的攻击场景
最有力的线索是一个 nonce 生成缺陷,它让公开签名成为恢复私钥的途径。Claude Mythos 在目标实现中发现了存在偏差的 nonce 生成方式。当 nonce 分布不均匀时,攻击者可以逐步收集签名,并运行基于格的隐藏数问题(HNP)攻击来恢复私钥 [5]。
最容易成为目标的是会公开大量签名的系统。大约 6% 的越界 nonce 比例就可能足以发现薄弱的 nonce 生成方式,并有理由尝试利用公开签名恢复密钥 [5]。攻击者一旦获得私钥,就可以伪造签名并冒充密钥所有者 [5]。这正是该问题具有现实可行性的原因:公开签名本身会成为攻击的原材料。
与以往攻击基线相比的实测影响
这里的主要变化体现在操作层面。相比单纯依靠人工分类,模型能更快把一种已知攻击类型转化为可行路径。这种速度很重要,因为 Claude Mythos 首次尝试复现漏洞利用的成功率达到了 83.1% [1]。
4. 这对开发者、安全团队和 AI 运维意味着什么
AI 在密码学研究中最能发挥作用的环节
AI 并没有在这里发明一种新的攻击类型。它所做的是加快繁琐工作:寻找可能的候选项、检查假设,并将已知攻击模式应用到以安全为重点的代码库中。
这种差异在实践中很重要。AI 可以缩小搜索范围,但无法决定什么才算真正的问题。人仍然必须阅读代码、测试相关主张,并对照密码学设计进行核验。
2026 年七月,zkSecurity 的 AI 审计代理 zkao 在 Cloudflare 的 CIRCL 实验性密码学库中确认了七个真实 bug,其中包括阈值 RSA 中严重的 float64 精度损失,以及基于属性的加密中一处访问控制失效——这些问题随后都在上游得到修复 [2]。简单来说,这就是二者的分工:AI 帮助团队找到更多值得检查的内容,而人工审查人员则判断哪些发现能够成立。
如何规划类似审计而不浪费预算
一个良好的审计流程其实很简单:
- 先用成本较低的模型找到正确的代码路径并标记明显的候选项
- 根据源代码和密码学假设核验这些发现
- 只有候选项通过审查后,才转向旗舰模型
- 在工作开始前设置预算上限
- 设置早期验证检查点,让团队能在无效方向上耗尽资金之前选择继续、调整方向或停止
这个顺序很重要。一个拥有 3.6 billion 参数的开放权重模型可以用低至每百万 token $0.11 的成本检测复杂漏洞利用 [3]。因此,昂贵的计算资源应该放在工作流末端,而不是一开始就投入。
这正是 AI 在密码学审计中的价值所在。重点不只是提高速度。Mythos 集中攻关带来的主要经验,是速度、验证与成本之间的权衡:$100,000 和 60 小时之所以产出一项经过确认和人工验证的发现,是因为其流程达到了目标所要求的严谨程度。
5. 结论:AI 辅助密码分析的成本与安全价值
Mythos 使用 LLM 子代理并行扫描文件并直接检查源代码,从而确认了 HAWK 中一个 nonce 生成缺陷。人工验证让这一结果具有可信度。AI 的工作缩短了搜索时间,并呈现出一个可供审查人员进一步确认和衡量的候选问题 [4]。这让关注点发生了变化。关键问题与其说是新颖性,不如说是成本。
下一个问题是效率:这次搜索究竟花了多少钱?在这样的规模下,预算压力很难忽视,而答案很大程度上取决于范围。合理的方案是让较小的开放权重模型完成第一轮检查,再把旗舰模型留给需要更深度推理的部分 [3]。
对团队来说,结论是实践性的,而不是抽象的。严格控制范围,尽早验证,并把 AI 输出当作线索而不是最终答案。正如 Curl 的 Daniel Stenberg 直言:
AI 是对人工审查的支持,而不是替代
这一点在一次 Curl 审计中体现得很清楚。Mythos 标记了五个问题,但人工审查最终将其缩减为一个低严重性 CVE 和一个 bug [4]。
常见问题
这个缺陷会在真实系统中暴露私钥吗?
会。如果有人利用能够获得内核级访问权限的缺陷,就可以控制整个系统。这可能暴露敏感数据,包括存储在这些机器上的私钥。
这项研究表明,AI 辅助分析可以发现并串联复杂漏洞。简单来说,这意味着攻击者可能更容易把小缺陷串联成严重得多的入侵,从而增加大规模攻击的风险。
为什么这次审计花费了约 $100,000?
大约 $100,000 的费用来自大量使用专业计算资源、高级工具和测试基础设施,以便在 60 小时内进行深度安全分析。
其中还包括在复杂、高风险的密码系统中识别、验证和记录关键缺陷所需的技术工作。
人类验证了哪些 AI 无法验证的内容?
人们通过亲自阅读源代码并逐项人工审查,核验 AI 的发现并排查错误。
他们发现,AI 已经“确认”的许多问题其实是误报或普通 bug,而不是安全缺陷。这项额外审查有助于确保高严重性发现准确无误,然后才会有人将其视为有效结论。
去模型市场挑选你想要的模型
在 APIMart 模型市场尝试聊天、图像和视频模型,用统一 API 快速体验模型能力。