AI+安全
【导航】AI+安全资料索引
AI导航站
人工智能术语解释
MCP介绍和服务导航
Agent Skills导航网站
人工智能AI工具合集
搭建本地知识库:ima.copilot和pandawiki
WPS/Office安装AI插件
Windows安装CUDA环境
Windows使用LM Studio部署本地模型
Windows安装Ollama本地部署大模型
Windows使用LLaMA-Factory微调LlaMA 3大模型
python调用LM Studio(AI)本地API
Ubuntu虚拟机部署Dify+Ollama搭建智能体和工作流
AI大模型第三方API大全
免费大模型agnes
Nvidia NIM平台模型免费一年(包含GLM5.2)
OpenRouter API Key申请与调用
MiniMax API Key申请与调用
AI编程工具
Windows环境+VScode插件,Claude Code连接中转站
Claude Code命令速查手册
Windows安装CodeX(ChatGPT)
小米MiMo API KEY如何配置到Trae/TraeCN
Windows CC Switch教程
Kali Linux安装CC Switch
省Token的AI编程路由代理:9Router
国内Agent(OpenClaw产品)整理
Windows安装使用OpenClaw(龙虾)
Ubuntu安装Hermes Agent教程
网络安全Agent合集(持续更新)
网络安全Skills(持续更新)
IDE中kali MCP不能显示和无法连接的问题
Ubuntu/Kali部署CyberStrikeAI工具
VulnClaw-AI驱动的渗透测试CLI工具
Codex执行渗透任务
Kali安装自动化渗透助手HexStrike-AI(MCP)
Kali安装Pentest-Swarm-AI
Linux运行Strix(AI渗透工具)
Claude Code连接BurpMCP
通过MCP调用Kali工具
大模型安全相关资料
大模型提示词注入靶场OMEGA-9使用说明
大模型(LLM)安全测试开源工具
DeepSeek Harness渗透插件
开源-智能体评测(benchmark)项目
本文档使用 MrDoc 发布
-
+
首页
开源-智能体评测(benchmark)项目
## 1、wgpsec/benchmark-challenges https://github.com/wgpsec/benchmark-challenges WgpSec 团队的挑战数据仓库,是 **WgpSec Agentic Ecosystem** 的数据层,被 benchmark-platform 平台消费。仓库结构清晰: ``` xbow/ # 74 题,来自 xbow-validation-benchmarks argus/ # 60 题,来自 argus-validation-benchmarks custom/ # 4 题,手工定制(XSS、Auth 等) vulhub/ # vulhub 真实漏洞环境转换 quiz/ # 安全基础/网络/系统/密码学等选择题 ``` 它的亮点在于**完整生态**:AboutSecurity(知识库)→ context1337(MCP Server)→ tchkiller(自主渗透 Agent)→ benchmark-platform(评测平台),而 benchmark-challenges 负责提供真实漏洞环境。 ## 2、Richael-y/PentestEval https://github.com/Richael-y/PentestEval 阶段式(stage-level)渗透评测框架,论文 arXiv:2512.14233。它的独特之处是把渗透拆成**五个独立可评分的阶段任务**,便于定位 Agent 的短板到底在"哪一步": | 任务 | 评测内容 | 度量 | | ---------- | -------------------------- | --------------------------- | | 1 弱点收集 | 检索目标相关弱点/CVE | Jaccard / 精确率 / 召回率 | | 2 弱点过滤 | 保留前提确实成立的弱点 | Jaccard | | 3 攻击决策 | 逐步排定利用优先级 | Spearman | | 4 利用生成 | 真实运行漏洞利用(Docker) | 语法 / 功能(真实执行回显) | | 5 利用修复 | 修复失败利用 | 成功率 | 仓库内置 12 个 Docker 化漏洞靶机(Env-1 至 Env-12),提供 Web 控制台与命令行两种方式,支持 mock 模式下零 API、零 Docker 的确定性冒烟测试。协议为 MIT。 ```bash # 启动 Web 控制台(推荐) python -m pentesteval serve # http://127.0.0.1:8000 # 无依赖确定性冒烟测试 python -m pentesteval run --task 3 --variant origin --envs 8 --models gpt-4o --mock ``` ## 3、bountybench/bountybench https://github.com/bountybench/bountybench 斯坦福(Percy Liang、Dawn Song、Dan Boneh 等)出品,发表于 NeurIPS 2025 Datasets & Benchmarks。它包含 **25 个真实开源系统、40 个真实漏洞赏金**,赏金金额从 10 美元到 30485 美元不等,覆盖 OWASP Top 10 中 9 类风险。 它的创新点是**用真实美元赏金作为能力度量**,把 Agent 表现直接映射到经济影响。任务分三类覆盖漏洞全生命周期: - **Detect**:在几乎无提示下发现新漏洞; - **Exploit**:给定赏金报告,利用该漏洞; - **Patch**:给定赏金报告,修复该漏洞。 Agent 在 Kali Linux 容器中以"行动—观察"循环作业,评估器按成功/失败、美元价值、用量指标打分。 ## 4、sunblaze-ucb/cybergym-e2e https://github.com/sunblaze-ucb/cybergym-e2e 伯克利同团队的**端到端** Benchmark,论文发表于 ICML 2026。它从广泛使用的开源项目真实漏洞构建,评测 Agent 从"发现漏洞 → 生成 PoC → 编写补丁"的完整能力。 两种评测模式: - **端到端(e2e)**:只给源码,Agent 须自行发现漏洞、生成 PoC(`poc.bin`)、产出补丁(`fix.patch`)。 - **仅补丁(patch-only)**:给定崩溃日志与 PoC,只产出补丁。 验证分四阶段:① Agent 的 PoC 在未打补丁时触发崩溃;② 打上补丁后 PoC 不再崩溃;③ 项目测试套件在补丁后通过;④ 真实 PoC 在补丁后也不崩溃。默认开启网络层隔离(仅放行 LLM API)。 ```bash # 端到端单任务运行 python scripts/run_agent.py curl/arvo_66012 --mode e2e # 批量运行 MODE=e2e MAX_PARALLEL=4 bash scripts/batch_run.sh scripts/tasks.txt ``` ## 5、sunblaze-ucb/cybergym https://github.com/sunblaze-ucb/cybergym 伯克利(Dawn Song 等)出品的大规模代码审计评测框架,论文发表于 ICLR 2026。它面向**真实漏洞分析任务**,核心是让 Agent 对真实开源项目生成可验证的 PoC。 数据集庞大:完整基准约 240GB(仅二进制模式约 130GB,全套服务端数据约 10TB)。评测流程是"生成任务 → Agent 运行 → 提交 PoC → 验证"。验证用真实执行回显判定:Agent 提交的 PoC 需触发崩溃(vul_exit_code = 0),且打上补丁后不再崩溃(fix_exit_code = 0)。 它内置了**网络隔离防火墙**(基于 Squid 的域名白名单代理),强制 Agent 容器只能访问批准目标,避免评测过程意外出网。 ```bash # 启动隔离代理(仅允许 apt/pip/LLM API 出网) python3 -m cybergym.firewall start ``` ## 6、caiji-maker/agent-redteam https://github.com/caiji-maker/agent-redteam,v0.5.0 这是面向 **AI Agent 自身安全**的红队测试平台,属于AI 攻防类。它内置 **11 种攻击类型、130+ 载荷**:间接注入、直接注入、越狱、工具滥用、多轮对话、Prompt 泄露、工具返回值注入、角色冒充/权限提升、紧急性操纵、意图劫持、工具链攻击。 它的核心理念用一句话概括:**单独测 LLM 没意义,有防护 vs 无防护的攻击成功率差值,才是防护层的真实效果**。 平台测的是"LLM 在收到恶意输入后,是否决定调用危险工具"——工具的返回值是模拟的,但 LLM 的调用决策是真实 API 返回的。 ```bash # 安装并启动(支持 DeepSeek/OpenAI/通义千问/GLM/Moonshot/百川/硅基流动) cd agent-redteam python -m venv .venv && source .venv/bin/activate pip install -e . .venv/Scripts/python -m uvicorn web.server:app --host 127.0.0.1 --port 8000 ``` 防护等级分无防护、低级(基础 prompt)、中级(加强 prompt + 输入检测)、高级(再加工具权限 + URL 白名单 + 文件路径检查 + 邮件限制)、自定义。 ## 7、六项目横向对比 | 项目 | 机构/作者 | 类型 | 规模 | 评测重点 | | --------------------------- | ----------- | ---------- | --------------- | ----------------- | | wgpsec/benchmark-challenges | WgpSec | CTF/Web | 138+ 题 | Web 自动化利用 | | PentestEval | NTU 等 | 阶段式渗透 | 12 靶机/5 任务 | 阶段级能力定位 | | BountyBench | 斯坦福 | CVE/赏金 | 25 系统/40 赏金 | 经济影响(美元) | | cybergym-e2e | 伯克利 | 端到端 | 开源真实漏洞 | 发现→PoC→补丁 | | cybergym | 伯克利 | 代码审计 | 240GB+ 数据 | 真实漏洞 PoC 生成 | | agent-redteam | caiji-maker | AI 攻防 | 11 类/130+ 载荷 | Agent 安全防护 |
八方网域
2026年10月9日 13:23
转发文档
收藏文档
上一篇
下一篇
手机扫码
复制链接
手机扫一扫转发分享
复制链接
如果文档没有解决你的问题,建议把预期结果、命令、错误信息、截图等等发给AI工具提问,描述越详细越容易解决。理解、理论类,推荐豆包。任务、操作类,推荐work buddy
Markdown文件
分享
链接
类型
密码
更新密码