文章总结: WallBreaker是一款专为LLM红队测试设计的开源CLI工具,由JailbrokenAI团队开发。其核心能力包括自动攻击循环、丰富的攻击手法库(如CipherChat、SkeletonKey等)、Parseltongue变形引擎、人物角色生成系统及多模态图像攻击通道。工具内置LLM裁判评估,v2版本新增Swarm协作模式和PromptVault。它仅限授权安全测试使用,支持多种API对接,可操作性强,是AI安全研究者的实用工具。 综合评分: 87 文章分类: AI安全,红队,渗透测试,安全工具
WallBreaker – 开源 LLM 红队测试 CLI 工具
原创
Violet Walker Violet Walker
黑白之道
2026年7月20日 08:42 韩国
在小说阅读器读本章
去阅读
导语:WallBreaker 是一款专为 LLM 红队测试设计的开源 CLI 工具,支持多种攻击手法、自动绕过循环和模型评估,堪称 AI 安全研究者的瑞士军刀。
工具背景
WallBreaker 由 JailbrokenAI 团队开发,是一个类 Claude-Code 风格的开源终端工具,专门用于对大语言模型(LLM)进行红队渗透测试。
简单来说:你在终端里跟它对话,它会自动思考、调用工具、反复变异攻击载荷,直到目标模型”缴械投降”或你需要介入。底层采用双协议适配层,支持 OpenRouter、Z.AI、OpenAI API、Anthropic API 以及本地 Claude Code CLI,可对接几乎所有市面主流 LLM API。
⚠️ 授权测试声明:本工具仅限授权安全测试使用,请遵守当地法律法规。
核心能力
自动攻击循环
WallBreaker 的核心是一个自主攻击循环引擎,会不断变异并重发攻击载荷,直到攻击成功(调用 finish() 退出)或需要人工介入(调用 ask_operator() 暂停)。整个过程完全自动化,无需手动迭代。
丰富的攻击手法库
内置多种研究级攻击技术,全部经过 CoT(思维链)增强:
| 攻击手法 | 来源 | 说明 | | — | — | — | | CipherChat / SelfCipher | ICLR 2024 | 在带内教目标学会密码,再密文发送攻击内容 | | Skeleton Key | Russinovich 2024 | 用”Warning:”标签重框护栏策略 | | PAP-16 Persuasion | Zeng 2024 | 通过16种说服策略同时改写攻击目标 | | DrAttack | Li 2024 | 将目标分解为无害片段再重组 | | ICA | Wei 2023 | 将 N 个有害问答对压缩到单次上下文中 | | PAIR / TAP | 自动攻击 | 基于迭代优化的对抗攻击 |
Parseltongue 变形引擎
内置 59 种链式变换,支持编码、Unicode 字体、隐写术、同形字、零宽字符、标签走私、双射、乱码等。可组合使用形成变换链,绕过基于文本分类器的安全护栏。
升级版 P4RS3LT0NGV3 引擎提供 222 种变换(需 Node.js 环境),包含 45 种密码、鲁尼文/盲文/符号文字脚本、全编码方案和隐写术功能。
人物角色生成系统
author_persona:根据 ENI 方法论从头编写”忠诚人物”风格的越狱系统提示词,经过自评 → 验证 → 精炼 → 蒸馏五步流程,自动从目标领域挑选权威或情感说服语域。
sysprompt_* 工具:搜索泄露的产品系统提示语料库(Claude/GPT/Gemini/Grok…),提取目标自身的章节标签格式,让攻击载荷以目标模型的”母语”说话。
多模态图像攻击通道
query_image_edit:向图像目标发送图片 + 指令,用视觉判断结果image_chain:将拒绝图像分解为多步良性编辑阶梯(越狱链)- T2I 构图变换:第三层文生图攻击
LLM 裁判评估
内置 LLM Judge 模块对攻击结果评分,基于 HarmBench 标准测试集(400 种行为、7 大类别),而非手工挑选样本,保证评测无偏。
Swarm 模式(v2 新增)
v2 版本新增协作式多模型攻击者模式,可根据目标的测量防御姿态自适应调整攻击框架,多个模型协同突破。
Prompt Vault(v2 新增)
自动将每次成功的攻击存入按模型分类的 Prompt 库,供后续复现和研究。
性能优化(v2)
- Token 成本降低 20%
- 提示词缓存(消除 O(n²) 输入成本)
- HTTP/2 连接池保活
- 成功率(ASR)提升约 30%
预设、扫描与日志
- 用户预设:往
presets/目录扔.toml文件即可添加越狱模板 profile_target重建:轻→重框架阶梯、许可评分、自洽采样- 完整运行日志:记录每步工具调用和思维链
系统要求
- Python 3.10+
- Node.js(可选,安装后解锁 222 种变形能力)
- API Key:OpenRouter / Z.AI / OpenAI / Anthropic 等
- 操作系统:Linux / macOS / Windows(WSL)
快速上手
git clone https://github.com/JailbrokenAI/wallbreaker
cd wallbreaker
python -m venv .venv
. .venv/bin/activate
pip install -e ".[dev]" # 可选加 [barcodes] 支持二维码工具
cp config.example.toml config.toml # 填入你的 API Key
wallbreaker check # 验证配置是否正确
wallbreaker # 启动交互式 CLI
配置示例(config.toml):
default_profile = "glm"
[profiles.glm]
protocol = "openai"
base_url = "https://api.z.ai/api/paas/v4"
api_key = "YOUR_KEY"
model = "glm-4-6"
[target]
protocol = "openai"
base_url = "https://openrouter.ai/api/v1"
api_key = "sk-or-..."
model = "deepseek/deepseek-v4-pro"
[judge]
protocol = "openai"
base_url = "https://openrouter.ai/api/v1"
api_key = "sk-or-..."
model = "openai/gpt-4o-mini"
版权声明:本文由华盟网原创发布,保留所有权利。配图由华盟网授权使用。
👇 点击阅读原文,访问我的网站
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:黑白之道 Violet Walker Violet Walker《WallBreaker – 开源 LLM 红队测试 CLI 工具》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。



![[前沿技术]GraphQLAPI安全测试](/images/random/titlepic/3.jpg)





评论