据报道,一位名叫 Trim 的俄语威胁参与者将 Claude 越狱方法转变为一个名为 AI Pentest Checker 的商业人工智能渗透测试平台。
该平台将前沿人工智能模型与现有的网络安全工具相结合,以自动执行侦察、漏洞扫描、结果分析、漏洞利用报告和 PDF 报告创建。尽管合法的安全专业人员通常使用底层扫描仪,但将它们与越狱的人工智能打包在一起可以使高级攻击工作流程更易于操作。
根据Cato Networks 发表的研究Trim 记录了在俄语网络犯罪论坛上推广成品平台之前绕过 Claude Opus 安全控制的方法。
Trim 从 Claude 越狱转移到商业平台
Cato Networks 表示,Trim 于 2026 年 3 月 13 日在该论坛上创建了一个帐户。该演员随后发布了六项技术,据称这些技术说服了 Claude 回应通常会拒绝的请求。
近三个月后的 6 月 21 日,Trim 再次为 AI Pentest Checker 做广告。该产品是一个自动化网络安全平台,能够在 10 分钟内评估目标并生成格式化报告。
该时间表显示了人工智能滥用技术如何快速地从论坛讨论转变为打包服务。据报道,Trim 没有开发新模型,而是使用商业和开放模型以及现有的安全软件。
| 报告日期 | 发展 |
|---|---|
| 2026 年 3 月 13 日 | Trim 发布了六项声称的绕过 Claude Opus 防护措施的技术。 |
| 2026 年 6 月 21 日 | Trim 将 AI Pentest Checker 推广为商业自动扫描平台。 |
| 2026 年 7 月 21 日 | Cato Networks 发布了对参与者和平台的分析。 |
报道的克劳德越狱方法是如何运作的
Trim 描述的技术依赖于即时操纵,而不是利用 Claude 中的软件漏洞或损害 Anthropic 的基础设施。
一种称为“上下文温暖”的方法从无害的专业问题开始,旨在将用户确立为合法的安全审核员。然后,对话将转向模型可能会归类为有害的请求。
另一种技术称为“幽灵重置”,涉及在拒绝后打开新对话并提交请求的软化版本。 Trim 声称这种方法在 90% 的尝试中取得了成功,尽管这个数字来自演员并且尚未得到独立验证。
- Context Warming 建立了一个明显合法的安全测试场景。
- 黑盒原理要求模型在不考虑意图的情况下评估代码结构。
- Ghost Reset 重新启动了新的或重新构建的对话中拒绝的请求。
- 模型级联在具有不同保护措施的模型之间移动请求。
- 当商业服务拒绝请求时,本地模型提供了替代方案。
- 灰色市场 API 访问绕过了正常的帐户注册和支付渠道。
这卡托 CTRL 调查发现 AI Pentest Checker 将其 AI 组件连接到 14 种传统扫描和侦察工具。
报告的工具集包括 Nuclei、ffuf、katana、subfinder 和 Gitleaks。这些实用程序可以发现域和端点,识别暴露的秘密,测试已知的漏洞模式,并收集有关面向互联网的系统的信息。
这些工具都不会因为操作员使用而变得恶意。安全研究人员、渗透测试人员和防御者依靠它们在攻击者利用漏洞之前找到漏洞。风险来自平台如何协调工具、解释其输出以及指导进一步的活动。
| 成分 | 报告的角色 |
|---|---|
| 近距离工作 4.8 | 审查并升级被归类为严重漏洞的发现结果。 |
| GLM-5 | 生成以开发为重点的报告。 |
| 细胞核 | 基于模板的漏洞检测。 |
| 气 | Web 内容和端点发现。 |
| 武士刀 | 网站爬行和攻击面映射。 |
| 子查找器 | 子域发现。 |
| 吉特泄密 | 检测暴露的凭证和秘密。 |
据报道 Trim 使用了灰市 Claude API 密钥
Trim 声称以 4 美元的价格从 Telegram 经销商处购买了 Claude API 密钥的访问权限。灰色市场密钥可能来自被盗的帐户、被盗的支付方式、滥用的促销活动或在提供商批准的流程之外创建的帐户。
廉价的访问降低了构建实验性攻击服务的成本。当提供商检测到并暂停滥用行为时,它还允许运营商更换帐户。

据报道,当克劳德拒绝请求时,特里姆推荐了 Kimi AI、GLM-5 和 MiniMax 2.5。该演员还讨论了租用高内存服务器来运行本地托管模型,而无需商业提供商强制执行的保护措施。
泄露的《神鬼寓言 5》即时声明仍未得到证实
Cato Networks 报道称,Trim 将 Claude 升级提示描述为泄露的《神鬼寓言 5》系统配置的修改版本。公开证据证实 Trim 提出了这一主张,但并未独立证明该提示是如何获得的,或者是否符合 Anthropic 的生产说明。
系统提示包含隐藏的指令,用于指导模型的行为、定义限制以及确定模型评估用户请求的方式。访问这些指令可以帮助攻击者围绕已知规则和边缘情况设计提示。
然而,泄露的提示不提供对模型权重、私有基础设施或 Anthropic 内部系统的访问。提供商还可以通过分类器、帐户监控、模型训练、API 控制和系统提示之外的其他层来实施保护措施。
人工智能正在深入网络攻击工作流程
此案符合更广泛的趋势,即网络犯罪分子使用人工智能的目的不仅仅是编写网络钓鱼电子邮件或生成基本代码。模型现在可以帮助组织多个步骤、评估工具输出、选择后续操作以及将技术结果转换为可读的报告。
2026 年 6 月,Anthropic发表分析2025 年 3 月至 2026 年 3 月期间,有 832 个帐户因恶意网络活动而被禁止。该公司发现,攻击者在其操作的后期和技术要求更高的阶段越来越多地使用人工智能。
Anthropic 表示,在接受审查的账户中,有 560 个(即 67.3%)使用人工智能进行与恶意软件相关的准备工作。它还发现 54 个帐户使用人工智能来协助受感染环境中的横向移动。
- 人工智能可以解释大量扫描仪输出。
- 模型可以优先考虑看起来更有价值的发现。
- 代理系统可以连接操作的不同阶段。
- 自动报告可以使犯罪服务更容易销售。
- 后备模型可以在拒绝后保持工作流程运行。
AI脚手架可以降低操作员技能的重要性
人们越来越担心的是围绕人工智能模型构建的架构,而不仅仅是模型回答有害提示的能力。平台可以提供工具、存储上下文、执行命令、查看结果并决定下一步应该运行哪个步骤。
人择的网络威胁研究研究发现,其数据集中技能较差的攻击者平均使用约 16 种不同的攻击技术,而技能最高的攻击者则使用大约 20 种攻击技术。差异的缩小表明人工智能辅助可以帮助缺乏经验的操作员执行更广泛的任务。
该公司还表示,高风险参与者越来越多地创建脚手架,让模型以有限的人力输入将多个攻击阶段链接在一起。 AI Pentest Checker 似乎遵循了这一一般模式,将扫描仪、模型分析和报告生成连接到一个工作流程中。
Anthropic 此前曾阻止过 Claude 的恶意使用
Anthropic 记录了威胁行为者滥用 Claude 进行侦察、恶意软件开发、数据分析、凭证盗窃和勒索相关任务的案例。
在较早的威胁情报报告Anthropic 描述了其为识别滥用账户、禁止运营商、改进分类器以及与相关合作伙伴共享指标所采取的措施。
这些强制措施可能会扰乱官方服务的活动。然而,犯罪分子可能会通过轮换帐户、购买未经授权的 API 访问、更换提供商或在本地运行限制较少的模型来应对。
组织应该如何应对人工智能辅助攻击
组织无法阻止犯罪分子尝试人工智能,但可以减少自动化工具可以发现和利用的弱点数量。
安全团队应不断盘点面向互联网的资产、删除被遗忘的服务、修补已知漏洞并测试外部可访问的应用程序。暴露的凭证和秘密也需要快速轮换。
公司应将不寻常的扫描活动、重复的身份验证尝试、自动端点发现和大量探测视为人工智能辅助侦察的可能迹象。
- 维护公共域、应用程序、API 和云资产的最新清单。
- 根据可利用性和暴露程度修补面向互联网的系统。
- 需要对特权帐户进行防网络钓鱼的多因素身份验证。
- 从公共存储库中删除机密并立即轮换暴露的凭据。
- 对敏感端点进行速率限制并监控异常的自动请求。
- 查看 API 密钥以了解异常位置、数量和使用模式。
- 针对更快、部分自动化的攻击测试事件响应计划。
Trim 案例并没有表明人工智能已经取代了经验丰富的攻击者。它表明模型可以充当连接现有工具的操作层。
人择的滥用调查Cato 的研究结果表明,防御者应该为能够比以前更快地研究、扫描、解释和记录潜在漏洞的攻击者做好计划。
减少暴露的服务、修复已知的弱点、保护凭证和检测自动侦察仍然是限制 AI Pentest Checker 等平台价值的最直接方法。
FAQ
什么是AI渗透测试检查器?
据报道,AI Pentest Checker 是一个由俄语威胁参与者 Trim 推广的自动化 Web 漏洞扫描平台。它将人工智能模型与传统的侦察和安全测试工具结合起来。
Trim 是否破解了 Anthropic 或 Claude?
报告的方法没有利用 Anthropic 的基础设施或 Claude 的模型权重。据称,Trim 使用精心设计的提示、后备模型、本地系统和灰色市场 API 密钥来绕过安全控制。
AI Pentest Checker 使用哪些工具?
Cato Networks 报道称,该平台集成了 14 个工具,包括 Nuclei、ffuf、katana、subfinder 和 Gitleaks。这些工具支持漏洞扫描、爬行、子域发现、端点枚举和秘密检测。
《神鬼寓言5》系统提示是否已确认泄露?
Cato Networks 报道称,Trim 声称使用源自泄露的《神鬼寓言 5》配置的修改提示。公开报道尚未独立确定该材料是如何获得的,或者是否符合 Anthropic 的积极生产提示。
为什么人工智能驱动的渗透测试平台存在安全风险?
他们可以协调扫描工具、解释结果、确定漏洞的优先级并生成报告。这种自动化可以减少执行复杂的进攻性安全任务所需的时间和专业知识。
组织如何防御人工智能辅助攻击?
组织应减少公共攻击面、修补暴露的系统、使用防网络钓鱼的多因素身份验证、轮换受损凭证、保护 API 密钥,并监控自动侦察和异常扫描活动。
