Uber的开源ADR:AgenticAI检测与响应平台

admin 2026-09-30 05:42:27 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 本文介绍Uber开源的ADR平台,用于检测和响应AI智能体安全威胁。平台通过Sensor重建因果链、两级检测控成本、离线红队保鲁棒,在生产环境10个月覆盖7200多台主机,日均处理上万会话,检出数百起凭证泄露,基准测试中零误报检出67%攻击。建议企业先补观测短板,采用动态检测与左移预防结合。 综合评分: 88 文章分类: AI安全,安全运营,威胁情报,安全建设,解决方案


Uber的开源ADR:Agentic AI 检测与响应平台

原创

刘顺 刘顺

安全有术

2026年9月26日 19:37 广东

在小说阅读器读本章

去阅读

在公众号小说中沉浸阅读

每天审 1 万个 AI 智能体会话, Uber 把“安全免疫系统”开源了

拆解 MLSys 2026 工业赛道论文:ADR —— 首个经生产验证的企业级智能体安全框架

导语:

当你的 AI 智能体正在替你读 Jira 工单、改配置文件、调用内部 API 时,谁来盯住它?传统杀毒软件和 EDR 在 AI 智能体面前几乎是“睁眼瞎”。Uber 用 10 个月、7200 多台主机、每天 1 万个会话的真实运营,给出了一个开源答案——ADR(Agentic AI Detection and Response)。这篇发表于 MLSys 2026 工业赛道的论文,是值得企业安全团队精读的一份“智能体安全落地报告”。

原文地址:arxiv.org/abs/2605.17380

论文翻译版本:

https://pan.baidu.com/s/1kUQUHzzwoBnW792zK6aaYg?pwd=x6ri

开源地址:github.com/uber/ADR(CC BY 4.0)

一、为什么传统安全工具“看不住”AI 智能体?

过去一年,MCP(Model Context Protocol)迅速成为智能体连接外部工具的事实标准,公开市场上有超过 16800 个 MCP 服务器。智能体能读文件、写代码、调 API,效率确实起飞了——但攻击面也同步起飞:

🚨 数据外传:智能体可能被一段藏在网页或工单里的恶意指令诱导,把凭证发到外部服务器; 🚨 越权访问:被入侵的 MCP 服务器成为内网横向移动的跳板; 🚨 运营中断:一句注入的提示词,可能让智能体在生产环境执行破坏性命令。

问题的根源在于传统防御体系的不足:

① 可观测性受限。EDR 只能看到“智能体写了一个文件”,看不到它为什么写、是谁让它写的、中间经历了怎样的推理。恶意与良性,差的就是这条因果链。

② 鲁棒性不足。基于预定义规则的静态防线,挡不住千变万化的提示注入、工具投毒和权限滥用。

③ 检测成本高。每天上万个会话,每个都上大模型深度分析?账单会让 CFO 先崩溃。

图:ADR 的三大贡献——可观测性、可靠检测、企业级基准(来源:论文图1)

二、ADR 的解法:把 SOC 团队“搬进”系统

ADR 最有意思的设计哲学是:仿照人类安全运营中心(SOC)的工作方式来构建系统。它由三个组件构成——

🧭 ADR Sensor:无所不见的“眼睛”

一个部署在端点上的轻量级代理,解析 Cursor、Cline、Claude Code 等智能体工具的本地缓存,把用户提示词 → 智能体推理 → 工具调用 → 执行结果的完整因果链重建出来。单次采集平均只要 0.182 秒,几乎无感。

图:ADR Sensor 重建完整的智能体会话因果链(来源:论文图4)

🔍 ADR Detector:两级分诊的“大脑”

就像 SOC 里“一线分析师 + 资深工程师”的分工:Tier 1 用轻量模型做快速分诊,拿高召回率过滤掉明显良性的流量(这层处理了 40.7% 的任务,成本极低);可疑事件升级到 Tier 2,由推理智能体深度调查——查看 MCP 工具源码、查询威胁情报库、核对企业安全策略,再下结论。

🥊 ADR Explorer:永不停歇的“陪练”

一个离线红队引擎,用进化算法自动生成越来越刁钻的攻击变体,在沙箱里反复“打”检测器。打出来的新攻击模式被整理进威胁情报库,反哺 Tier 2——让检测系统在攻击到来之前就已“见过世面”。

图:ADR 整体架构——Sensor(左)、两级在线检测(中)、离线红队(右)(来源:论文图3)

三、10 个月真实战果:数百起凭证泄露,无处遁形

在 Uber 生产环境跑了 10 个月,ADR 的成绩单是:

✅ 覆盖 7200+ 台企业主机,日均处理 10000+ 个智能体会话; ✅ 揪出 26 个类别、数百起意外外传的凭证(API 密钥、令牌……); ✅ 基于检测发现反推建设了“左移”预防层:在提示词发出前用正则+熵值扫描拦截凭证泄露,精度 97.2%(212 个凭证中命中 206 个,仅 6 次误报)。

最有故事性的是 Agent Flayer 案例的复现:一封恶意邮件自动创建了一个内嵌隐藏指令的 Jira 工单;员工用 Cursor IDE 通过 MCP 检索该工单时,注入指令胁迫智能体读取本地配置文件并外传凭证。ADR 靠着完整的因果链遥测,把“提示注入 → 凭证读取 → 数据外传”这条多阶段攻击链完整重建并逐环告警。

图:Agent Flayer 事件攻击链——经 Jira–Cursor 集成的间接提示注入(来源:论文图9)

四、实测:零误报地检出 67% 的攻击

论文同时发布了企业级基准 ADR-Bench(302 个任务、133 个 MCP 服务器、17 种攻击技术)。在这份“模拟考卷”上,ADR 与三个最先进基线同台竞技:

📊 检出 67% 的攻击,误报为零;F1 分数超出基线 2–4 倍(0.800 vs 最强基线 0.366); 📊 基线们有多惨?LlamaFirewall 在 260 个良性任务里误报了 40 次——在企业里,这种误报率意味着安全团队直接被告警淹没; 📊 公开基准 AgentDojo 上:93 个任务检出全部提示注入攻击,仅 3 次误报; 📊 成本:单任务约 0.024 美元、18.5 秒,比 LlamaFirewall 便宜 19 倍。

对企业管理者来说,ADR 传递了一个重要理念:智能体安全检测必须“精确率优先”。漏报可以靠纵深防御兜底,而海量误报会让体系在运营层面直接瘫痪。

图:ADR 在五类威胁战术上的检测率(来源:论文图6a)

五、给企业安全团队的三点启示

1️⃣ 先补“因果链”这块观测短板。在铺开智能体应用之前,先想清楚:你能还原一次智能体操作从提示词到执行的全过程吗?做不到,谈检测都是空中楼阁。

2️⃣ 别指望一套规则包打天下。静态规则防不住涌现性攻击,“离线红队持续生成难例 + 在线检测持续进化”的闭环才是可持续路线。

3️⃣ 检测要“左移”,预防要前置。ADR 的实践证明:对凭证泄露这类高价值、模式明确的威胁,一个简单的 pre-prompt 钩子(正则+熵值)就能以 97.2% 的精度拦在事前——不必什么都等大模型事后分析。

💬 一句话总结:ADR 的价值不在于某个单点技术,而在于它验证了一条完整路径——高保真遥测打底、两级检测控成本、离线红队保鲁棒、生产环境真刀真枪跑通。代码和基准都已开源(github.com/uber/ADR),值得每个正在推进智能体落地的团队拿来抄作业。

AI 智能体越能干,越需要有人“看着”它。 安全的尽头,是让能力跑得快,也让风险看得见。

论文翻译版本:

https://pan.baidu.com/s/1kUQUHzzwoBnW792zK6aaYg?pwd=x6ri


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。

本文转载自:安全有术 刘顺 刘顺《Uber的开源ADR:Agentic AI 检测与响应平台》

评论:0   参与:  0