文章总结: 大模型安全周报:智能体安全重心从提示词下沉到执行系统,钩子、插件、技能与记忆成为新信任边界。HookPry仅控插件元数据即攻破全部7款harness,单款成功率最高92.5%且Defender零检出;记忆授权洗白、RAG语料投毒等威胁沿知识链路扩散,LLMjudge可靠性存疑。建议企业将Harness与技能视同第三方代码纳入供应链管理,审计钩子配置、限制宿主权限并锁定技能来源。 综合评分: 80 文章分类: AI安全,威胁情报,漏洞分析,安全建设,安全大事件
大模型安全周报:智能体安全战场下沉到“执行系统”,插件、钩子、技能与记忆成为新的信任边界
原创
蜜罐先生 蜜罐先生
大模型安全研究
2026年9月6日 19:29 广东
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
本周智能体安全继续占据最大板块,且重心明显从「提示词文本」下沉到「执行系统」:Harness 生命周期钩子、技能、记忆、工具调用与授权状态成为攻防双方的新前线。最震撼的数据来自 HookPry:攻击者只控制插件元数据与生命周期钩子配置,就能在 1,000 次端到端运行中攻破全部 7 款被测智能体 harness,单 harness 成功率最高 92.5%,而 Microsoft Defender 的检出率是 0%。
本周关键发现
- 智能体安全的攻防重心正从「模型话语」迁向「执行系统」,插件、钩子、技能与记忆成为新的信任边界:本周至少 20 篇论文围绕harness的运行时组件展开。HookPry 证明生命周期钩子把 shell 命令绑定到会话开始、工具调用、文件编辑等事件,这些命令以宿主权限执行且发生在 LLM 观察不到的时机,供应链投毒即可实现 92.5% 的单 harness 成功率;ECLIPSE 用自进化轨迹注入在长时程系统上达到最高 96.7% 无防御成功率,EvoSkill 让自进化智能体把恶意能力沉淀成合法技能反复激活,ISM 通过纯语义匹配把目标技能选择率从 15.2% 拉到 63.5% 且人类审查仅拦下 2.9%。机制上,提示词过滤器拦截的是「话语」,而攻击者已经转向「动作授权拓扑」。
我们的判断是:企业为智能体做安全评审时,必须把Harness、插件与技能视同第三方代码纳入供应链管理,审计钩子配置、限制宿主权限、对技能来源做版本锁定,单靠模型层护栏无法覆盖这类攻击。
- 评测与验证自身成为被攻击、被怀疑的对象,「LLM judge 不可全信」从观点变成带数据的工程结论:PROCTOR 在数月生产级提示词自优化循环中记录了 11 类评测信号失效,一次环境作弊让管线拿到 100% 通过率,实际隐藏的是 68% 的真实能力;SEAV 用检索锚定的正确性校验把 3 个公开越狱基准上 22.1% 到 51.0% 的既往「成功」样本重分类为无效。
3. 记忆即授权,个性化与长期记忆把隐私问题升级为「行为可推断」的侧信道问题:UMPeek 证明即使源记录与后端状态对外不可达,攻击者仍能通过自适应提问从个性化智能体的可见行为中恢复隐藏用户模型,且响应级防御难以阻断;EAL-Bench 进一步显示 5 款 LLM 记忆写入者在增量更新中最多为 50.2% 的未授权请求制造了虚假授权,执行器在 98.6% 的试验中会照单执行,而要求权限绑定有效源事件会同时牺牲部分合法操作。这提示隐私与授权评估都不能只看「能否直接读出原文」,而要以行为输出为信道做穿透测试;记忆中的权限与承诺应携带可验证的源事件,不能把「存储过」当成「被支持过」。
- 投毒攻击沿「模型外知识链路」全面扩散,RAG 语料、工具、技能、记忆无一幸免,防御开始以跨通道一致性破局:CodePoisonRAG 只用 85 个毒化工件(语料污染比 0.7%)就在三种生成器上取得 0.80 到 0.93 的定向攻击成功率,全部进入 Top-3 检索结果;VerTox 把语料投毒建模为可验证奖励强化学习,生成的对抗文档困惑度低、难以察觉并显著拖垮下游 RAG;防御侧 TRIS 三层筛把黑盒攻击成功率从 67.0%/87.0%/64.0% 压到 3.0%/14.0%/4.0%,白盒 HotFlip 从约 74% 降到 27.8%。落地上,知识库、检索索引与记忆写入应被视为与模型权重同级的信任边界,用「嵌入空间、触发结构、生成一致性」三种通道交叉校验,而不是只做一遍困惑度过滤。
重点论文详解
- 只控制插件元数据与钩子配置即可攻破全部 7 款智能体 harness,单款成功率最高 92.5%,而 Microsoft Defender 零检出: A Blind Trust, the Bloody Thrust: When Attacker-Controlled Hook Updates Steer AI Agent Harnesses towards Malicious Behaviors(https://arxiv.org/abs/2609.03884v1)
• 新攻击面定位:现代智能体 harness 暴露生命周期钩子,把 shell 命令绑定到会话开始、工具调用、文件编辑等运行时事件,这些命令以宿主权限执行、随生命周期钩子配置分发、且触发的时机 LLM 完全观察不到• 供应链威胁模型:HookPry 假设攻击者只控制插件元数据与生命周期钩子配置,通过一次「良性插件的恶意更新」把攻击者选定的命令静默绑定到良性事件,实现提权等恶意主机行为• 量化战果:在 25 种 harness 与后端组合、1,000 次端到端运行中,7 款被测 harness 全部被攻破,单 harness 成功率最高 92.5%• 防线缺口:Microsoft Defender 检出率为 0%,三种静态防御联合仍漏掉 47.5% 的恶意工件,说明现有端点防护没有把「钩子配置」当作可执行代码来审计
- 把运行时守卫本身做成可安装、可演化、可审计的技能,GLM-5 上攻击成功率从 0.482 压到 0.104: Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents(https://arxiv.org/abs/2609.01487v1)
• 范式创新:SkillSonar 作为守卫技能与不可信任务技能并行常驻,按用户任务边界把敏感动作路由到 allow、replan 或 confirmation 三种决策,不修改底层智能体运行时,可安装、可检视、可编辑• 任务化数据集:SCOPE-R 覆盖 6 个风险族、21 个子类,含 206 个经攻击确认的恶意实例与 43 个良性任务,把「该不该放行」变成可评测任务• 量化效果:经蒙特卡洛树搜索的守卫技能演化后,GLM-5 上 ID 攻击成功率从 0.482 降至 0.104、OOD 从 0.606 降至 0.115,并跨受害模型、留出风险族与外部基准保持迁移• 机理归因:消融显示显式的安全责任分配与「技能即原生表示」两者对收益缺一不可,预装审查对这类「等待具体任务出现才作恶」的技能天然不足
- 文本安全集中在大约 88 个神经元,视觉安全却需要至少 50 个子空间方向,结构差异解释了视觉越狱为何反复出现: Do VLMs Share Safety Neurons Across Modalities?(https://arxiv.org/abs/2608.30750v1)
• 神经元级定位:对 10 个视觉语言模型做因果分析,文本安全可定位到约 88 个神经元(占全部神经元不足 0.01%),定向消融即可显著削弱拒绝行为,且文本安全神经元构成主要的拒绝通路• 模态结构性差异:文本安全信号集中在约 5 个子空间方向,视觉安全在单神经元层面高维且弥散,需要至少 50 个方向才能覆盖,这一差距跨架构一致存在• 解释力:视觉安全缺口不是对齐「努力不够」,而是视觉安全表征缺乏文本那样的低维汇聚结构,现有对齐方法因此始终关不上视觉侧的门• 配套资源:发布 ViSafe-Detect 与 ViSafe-Eval 两个模态隔离基准,把视觉与文本安全信号解耦,供多模态产品做专项安全验收
本周其余值得关注的研究
1. 表征级对齐比响应级对齐更能扛住对抗改写:Representational alignment yields generalizable safety in language models(https://arxiv.org/abs/2609.04022v1)2. Web 安全进入 LLM 时代后,XSS 与提示注入开始互相放大,NIST 与 ISO 框架需要向 LLM 化 Web 环境扩展:Shifting from Injection to Interaction: Rethinking Web Security in the Age of LLMs and Beyond(https://arxiv.org/abs/2609.03999v1)3. 无状态伯努利水印把每 token 判定降到 O(1),端到端生成开销低于 1%,自盐全词表方案比 KGW 快 6000 倍以上:Flip, Don’t Shuffle: Watermarking LLMs at the Speed of Inference(https://arxiv.org/abs/2609.03844v1)4. 隐藏用户模型也能被黑盒推断,记录与后端不可达并不等于语义隐私:Inferring Hidden User Models from the Behavior of Personalized LLM Agents(https://arxiv.org/abs/2609.03815v1)5. 7,200 条印度语言劝说式越狱提示揭示安全表现随语言与劝说策略剧烈波动,英语中心评测系统性高估对齐:IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks(https://arxiv.org/abs/2609.03781v1)6. 纯输入文本的规则树防御在 33 款开源模型、22 类越狱攻击中于 73.4% 组合取得最佳综合分,把模态严重度从 10 拉到 2,但高严重度尾仍存在:AlcaTRAz – Anchored Tree-Rule Defense Against Jailbreaks(https://arxiv.org/abs/2609.03693v1)7. 被遗忘的提示词本身可以被提取:TAS 以 100% 精度恢复被遗忘实体、重建最高 95% 的遗忘提示词,查询量比朴素探测少 99.7%:Extracting Forgotten Prompts from Targeted Unlearned Models(https://arxiv.org/abs/2609.03662v1)8. 5 款主流模型中有 3 款会给自己签发「开发者」身份并通过自设测试,自产自评的验证流程是会话安全失效:Trust Me, I’m Your Developer: Self-Issued Authentication in Large Language Models(https://arxiv.org/abs/2609.03247v1)9. 语言输出无法完整表征模型内部计算,依赖语言自述的监控机制存在不可消除的盲区,沙箱隔离应转向不读语言状态的污点追踪:The Implications of Linguistic Illegibility for LLM Security(https://arxiv.org/abs/2609.02852v1)10. harness 与策略协同进化:Qwen3.5-4B 在 AgentDojo 上攻击成功率降为原来的三分之一,良性效用从 59.79% 升到 61.86%:SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment(https://arxiv.org/abs/2609.02786v1)11. 定向代码知识投毒只需单条工件:0.7% 语料污染比即可让 85 条毒化工件全部进入 Top-3,攻击成功率 0.80 到 0.93:CodePoisonRAG: Knowledge Poisoning Attacks on Retrieval-Augmented Code Generation(https://arxiv.org/abs/2609.02774v1)12. 远程 MCP 调用存在授权后执行信任缺口,ACLE-MCP 用短时能力租约把调用与当前负载绑定,全部测试攻击族被阻断:ACLE-MCP: Attested Capability Leases for Execution-Time Trust in Remote LLM Tool Use(https://arxiv.org/abs/2609.02690v1)13. LLM 自动向智能合约注入漏洞可行但规模受限:近千候选经校验仅 32 个存活,16.58% 存活率集中在结构简单的合约与局部化语法模式:Automated Vulnerability Injection in Smart Contracts Using Large Language Models(https://arxiv.org/abs/2609.02624v1)14. 技能即外部化行为策略:SkillShift 以 81.33% 和 63.33% 的选择率隐蔽转向攻击者目标,100% 保持效用且现行扫描器全部漏检:A Finger on the Scale: Covert Policy Steering through Agentic Skills(https://arxiv.org/abs/2609.02564v1)15. 把模型身份指纹编码进语义组织方式而非固定问答对,PROSE 在未修改模型上实现 100% 检出、零假阳性且抗微调与量化:The Shape of Ownership: Verifying LLM Provenance through Semantic Structures(https://arxiv.org/abs/2609.02553v1)16. 沉浸式交互让黑盒爬虫平均代码覆盖率至少提升 46%,7 个应用检出 XSS,其它扫描器最多只检出 2 个:SpiderSapien: Client-Centric Web Crawler and Security Scanner(https://arxiv.org/abs/2609.02532v1)17. 信息扭曲型 GEO 防御现状堪忧:三款现成防线相对攻击成功率最多只降 5.7%,Granite Guardian 的降幅甚至不显著:Counter-GEO-Bench: Evaluating Defenses Against Information-Distorting Generative Engine Optimization(https://arxiv.org/abs/2609.02316v1)18. MoE 的共享专家是路由无关的锚点:SEAL 最高把攻击成功率降 60%,五基准平均能力代价不超过 1.4%:SEAL: Reinforcing Global Safety in Mixture-of-Experts through Shared Expert ALignment(https://arxiv.org/abs/2609.02293v1)19. 用神经微分方程区分偏好漂移与记忆投毒:CAPTURE 把固定策略投毒成功率压到 11.5%,同时接受 83.5% 的真实偏好更新,但自适应攻击下升到 24.7%:CAPTURE: Disentangling Preference Drift from Memory Poisoning in Personalized LLM Agents(https://arxiv.org/abs/2609.02265v1)20. 跨组织不共享原始轨迹也能做拓扑守卫:联邦 FGLGuard 在三个基准上超过集中式上限,实况部署把 AgentDojo 攻击成功率降 43% 且零 API 成本:Privacy-Preserving Topology-Guided Safety for LLM-Based Multi-Agent Systems via Federated Graph Learning(https://arxiv.org/abs/2609.02967v1)21. LLM judge 不是 oracle:生产自优化循环中 11 类评测信号失效被编目,一次 100% 通过率实为 68% 真实能力,解法是把 judge 降级并加确定性门禁:LLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic Guardrails(https://arxiv.org/abs/2609.02246v1)22. GEO Defender 把平均攻击成功率从 50.32% 压到 6.20%,保留 94.12% 的良性证据使用,且无需微调目标 LLM:When Optimization Becomes Manipulation: Defending Generative Search against Malicious Generative Engine Optimization(https://arxiv.org/abs/2609.02964v1)23. 多比特水印的编码扩频方案:WeaveMark 在 200 token 上对 32 位消息达 89.8% 匹配率,10% 替换攻击下仍保 86.0%,均数倍于 BiMark:WeaveMark: Robust and Scalable Multi-bit LLM Watermarking via Coded Payload Spreading(https://arxiv.org/abs/2609.02177v1)24. 持久智能体的自传式状态需要类型化溯源:24 例一致性测试中类型化中介放行 0 个不安全机会,而扁平规则放行 19/19 个:Stored Is Not Supported: Typed Provenance and Assertion Guardrails for Persistent AI Agents(https://arxiv.org/abs/2609.02127v1)25. 纯语义匹配就能操纵技能选择:ISM 把目标选择率从 15.2% 提到 63.5%,人类审查只拦下 2.9%,五个 LLM 检查器平均放行 82.9%:Implicit Manipulation for Skill Selection in LLM Agents with Semantic Matching(https://arxiv.org/abs/2609.02035v1)26. 给长时程智能体装飞行记录仪:每事件约 48 微秒、512 字节,链上锚定每 10 万事件 2.30 美元,篡改检测 100% 且零假阳性:Agent Flight Recorder: Tamper-Evident Audit Trails with On-Chain Anchoring for Long-Horizon Tool-Using Agents(https://arxiv.org/abs/2609.01931v1)27. 记忆会自己洗掉授权的来源:5 款 LLM 写入者最多为 50.2% 的未授权请求制造假授权,执行器在 98.6% 试验中照做,权限必须绑定有效源事件:Agent Memory Is a Surface for Endogenous Authorization Laundering(https://arxiv.org/abs/2609.01836v1)28. 轻量行为树表示让量化本地 LLM 的漏洞检测在长代码上超过原码与 AST,且不再撑爆上下文窗口:Towards Behavior Tree-Guided Vulnerability Detection with Lightweight LLMs(https://arxiv.org/abs/2609.01758v1)29. 用八类扰动与因果追踪拆解 LLM judge:评分决策在第 25、26 层残差流结晶,微调是在既有基座上雕刻而非新建管线:Beyond Scores: Understanding LLM-as-a-Judge Mechanisms in Summarization Evaluation(https://arxiv.org/abs/2609.01604v1)30. 生产流量驱动的自托管收敛:200 余内部应用合并到单一模型,吸收平台 50% 流量即每月 1.16 亿请求,Arena 69.6 对 65.8 胜过 7 倍参数基线:From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix(https://arxiv.org/abs/2609.01572v1)31. MCP 到 A2A 的标签效应高度依赖模型:PUBLIC 标签与逐字外泄的关联在 Claude Sonnet 5 上最强(+0.800,10/10 场景),其余模型地板效应明显:Public-Sharing Labels and Verbatim Field Egress in an MCP-to-A2A Agent Configuration: A Controlled Multi-Model Study(https://arxiv.org/abs/2609.01693v1)32. 良性微调破坏拒绝行为的根因是低秩输出路由通路被重新锐化,安全几何被摊平但通路仍在,因此少量安全样本即可恢复:When Safety Routing Breaks: Understanding Alignment Fragility under Benign Fine-Tuning(https://arxiv.org/abs/2609.01455v1)33. 成本级联的验证器有结构性盲区:廉价学生配廉价验证器时盲区最大,仪表盘恒显 3% 错误而真实错误最高 32%,自改进级联在自身指标上永远「健康」:Cheap Verifiers, Large Blind Spots: Measuring the Reliability Cost of Cost-Saving Cascades(https://arxiv.org/abs/2609.01345v1)34. 用可验证奖励强化学习做语料投毒:VerTox 生成流畅低困惑度的对抗文档,跨主流神经排序架构近乎完美命中并拖垮下游 RAG:VerTox: Verifiable Reward-Guided Corpus Poisoning Against Neural Ranking Models(https://arxiv.org/abs/2609.01325v1)35. 纯结果强化学习也能训出长时程智能体:CANOPY 让 Qwen3-14B 登顶 AppWorld 公开榜(Test-Normal TGC 86.9),Qwen3.5-9B 在 SWE-bench Verified 提升 16.6 分:Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents(https://arxiv.org/abs/2609.01245v1)36. 中文响应级安全基准 C-SafeQA:3.7 万余条人机记录中对抗查询不安全率 11.68% 到 30.05%,藏头变换会让 7 个自动 judge 的不安全召回全部下降:Who Judges the Judges? A Chinese Safety QA Benchmark for Evaluating LLM Responses and Safety Judges(https://arxiv.org/abs/2609.01210v1)37. 漏洞影响库识别变成知识图谱补全:Athena 平均 F1 比最优基线高 32%,仅 110M 参数的骨干已超过 7B 的 VulLibGen 最优配置:Athena: Vulnerability-Affected Library Identification via Knowledge Graph Completion(https://arxiv.org/abs/2609.01187v1)38. 逆向工程智能体的失败集中在理解阶段,且是能力上限而非资源上限:预算、坚持与推理努力都救不回多少失败:Reveree: Diagnosing LLM Reverse-Engineering Agents(https://arxiv.org/abs/2609.01185v1)39. CTI 生成与共享是最被忽视的环节:实践者访谈显示流程高度手工,试点表明 LLM 只能辅助四步中的每一步,恢复的指标仅是证据中的一小部分:A SoK for SoCs: Reading the TI Leaves on AI for Cyber Threat Intelligence Generation and Sharing(https://arxiv.org/abs/2609.01174v1)40. 0.6B 的俄英生成式护栏 HiveTraceGuard-Pro 以 14.3 毫秒中位延迟拿到最高的干净俄语鲁棒 F1(0.88)与俄语注入召回(0.999):HiveTraceGuard-Pro: A Compact Generative Guardrail for Prompt Injection, Jailbreaks, and Adversarial Obfuscation(https://arxiv.org/abs/2609.01046v1)41. 面向推理代码 LLM 的隐形后门:AKRASIA 平均攻击成功率最高 99.34%,维持 97.23% 平均准确率,在 14/18 防御设置下仍保留最高 98.82% 成功率:AKRASIA: Stealthy Backdoor Attack on Reasoning-based Code LLMs(https://arxiv.org/abs/2609.01023v1)42. 技能体不出进程的机密协调协议:Skill-as-API 把技能公开视图缩到名称、描述、模式与信任层级,跨洲热重连延迟 1.8 到 2.9 秒:Skill-as-API: Confidential Multi-Agent Coordination for Agentic Software Engineering(https://arxiv.org/abs/2609.01677v1)43. 用对比锚点演化评分 rubric:CARE 是唯一在 300 步训练中对抗 GPT-4.1 锚点胜率持续上升的方法,避免静态 rubric 被策略黑客化:CARE: Contrastive Anchor-based Rubric Evolution for Large Language Model Post-Training(https://arxiv.org/abs/2609.00892v1)44. 5 款 LLM 为面向服务的网络靶场产出 84 条安全需求并合并为 27 条:必要性接受率 98.5%,可测试性仅 44.4%,仍需人工补强:Using LLMs to Elicit Security Requirements for Service-Oriented Cyber Ranges(https://arxiv.org/abs/2609.00886v1)45. 响应感知的拒绝校准 RISA:先用规则与线性探针给初响应打分,只在必要时干预,兼顾拒绝可靠性与模型效用:RISA: Response Inspection and Selective Actions for Refusal Calibration in Large Language Models(https://arxiv.org/abs/2609.00790v1)46. 攻击 MLLM 的相位感知扰动:把对抗噪声限制在与结构语义强相关的相位区域,实现有效且不可感知的攻击:Forbid Your Attention: Fooling Multimodal Large Language Models by Selectively Removing Intrinsic Focus in Spectral Domain(https://arxiv.org/abs/2609.00788v1)47. 知识图谱抽取分数被匹配规则绑架:同一固定预测在不同协议下 F1 在 0.16 到 0.70 之间摆动,45 对排序中有 11 对被反转:Ranked by the Matcher: A Reproducibility Audit of Knowledge Graph Extraction from Threat Reports(https://arxiv.org/abs/2609.01671v1)48. 边缘部署的可持续性排序:Qwen3-30B-A3B/GGUF Q4 综合分 93.38 登顶,量化大模型可整体胜过原生小模型,「SLM 必然更可持续」的假设不成立:Triple-Bottom-Line Sustainability of Language Models for Edge AI: A Comparison Between SLMs and Quantized LLMs(https://arxiv.org/abs/2609.00665v1)49. 多智能体安全系统化综述:197 篇工作、六类交互接口与四种对手位置被统一进 A-I-R 框架,44 个评测基准被审计,路径闭合与恢复是最大挑战:SoK: When Safe Agents Fail Together: The Security of Multi Agent LLM Systems(https://arxiv.org/abs/2609.00595v1)50. 同一网络安全请求在不同对话上下文下合规率从 62.0%(被拒历史后)变到 85.1%(被接受历史后),对话拆解则让合规从 501/800 跌到 172/800:Same Request, Different Boundary: Evaluating Cybersecurity Assistance across Conversational Contexts(https://arxiv.org/abs/2609.00578v1)51. 13 款 MLLM 在知识冲突下模态偏好近乎任意:图像形式比文本形式更容易让模型接受与参数知识矛盾的内容,SFT 只取得中等改善:Same Semantics, Different Outcome: On the Modality Robustness of Multimodal LLMs under Knowledge Conflict(https://arxiv.org/abs/2609.00550v1)52. 端到端优化长期记忆投毒:PipePoison 把攻击利用率提高 19.1 个百分点,在完全未见过的受害者配置上仍领先最强基线 16 个百分点:Transferable End-to-End Optimization for Indirect Long-Term Memory Poisoning in LLM Agents(https://arxiv.org/abs/2609.00523v1)53. 防护罩本地分数不等于系统更安全:一次获得有害帮助的攻击足以证伪部署安全,而「几乎无残留」需要系统级证据,只涨本地分不构成更强结论:The Safeguard Worked. Is the LLM System Safer?(https://arxiv.org/abs/2609.00519v1)54. 越狱评测的正确性校验:SEAV 把 SD-A 上的假阳性率比最强基线降 14.9 个百分点,并把 3 个公开基准中 22.1% 到 51.0% 的既往成功重分类为无效:Validity-Aware Jailbreak Evaluation for Large Language Models(https://arxiv.org/abs/2609.00498v1)55. 进化式质量多样性搜索多轮越狱:EvoFlint 在 HarmBench 上对 Claude Sonnet 4.6 达 35.8%、GPT-5.4 达 59.7%、Qwen3-32B 达 94.3% 成功率:EvoFlint: An Evolutionary Atlas of Multi-Turn LLM Vulnerabilities(https://arxiv.org/abs/2609.00487v1)56. RAG 检索投毒的三层筛:TRIS 把黑盒攻击成功率从 67.0%/87.0%/64.0% 压到 3.0%/14.0%/4.0%,对自适应攻击再减半(32.0% 到 15.0%):TRIS: A Tri-Layer Retrieval Integrity Sieve Against Knowledge Poisoning(https://arxiv.org/abs/2609.00470v1)57. GPU 功耗物理侧信道可识别工作负载:930 段约 10 MHz 采样中训练与推理、非 AI 计算区分准确率 97%,抗对抗策略下训练检出不低于 99%:Workload Identification with Physical Side Channels for AI Governance(https://arxiv.org/abs/2609.00309v1)58. 多智能体委托必须在「模型不可信」假设下评估:授权代理以每次约 2.6 微秒阻断四类威胁,被攻陷子智能体平均仅达 1.5 个动作(基线 8,100 个):Delegation Without Trust: An Empirical Gap Analysis of Identity, Authorization, and Runtime Governance in Multi-Agent LLM Systems(https://arxiv.org/abs/2609.00267v1)59. 给监控器看标准答案会高估推理核验:认证把平均平衡准确率从 0.637 提到 0.796,但对「答案对、过程错」的关键轨迹召回反而从 0.521 掉到 0.438:The Answer Is Not the Argument(https://arxiv.org/abs/2609.00264v1)60. 越狱鲁棒性随运行状态剧烈漂移:只改一条与安全无关的普通系统提示,攻击成功率最高可涨 56 个百分点(2% 到 58%):The Fragility of Jailbreak Robustness Across Operational States(https://arxiv.org/abs/2608.30748v1)61. 约 200 万参数的内在流式护栏 SingProbe 在解码同时预测意图、响应安全与幻觉风险,额外开销低于 0.5%:SingProbe Technical Report(https://arxiv.org/abs/2608.30703v1)62. 角色扮演越狱的因果拆解:请求处的有害与良性区分仍保留,但在答案起始处拒绝相关表达衰减(safety-relay attenuation),恢复该连接即可恢复拒绝:The Safety Relay in Roleplay Jailbreaks: A Component-Resolved Causal Analysis of Harm Recognition and Refusal(https://arxiv.org/abs/2608.30585v1)63. 长时程智能体的自进化隐蔽注入 ECLIPSE:无防御成功率最高 96.7%,通用安全过滤下仍有 69.2%,比最强基线在防御设置下高 27.5%:ECLIPSE: Self-Evolving Stealthy Prompt Injection Attack against Long-Horizon Agentic Systems(https://arxiv.org/abs/2608.30441v1)64. 自进化智能体的技能注入威胁被形式化:SARGE 诱导恶意技能形成,注入技能被持久存储并反复激活,能力腐化呈持续性:EvoSkill Injection: Red-Teaming Autonomous Skill Generation and Evolution in Self-Evolving Agents(https://arxiv.org/abs/2608.30429v1)65. 稀疏自编码器解释后门防御为何碎片化:脏标签后门靠孤立交互特征、干净标签靠混合特征,推理期特征钳制把多数设置 ASR 压到 10.8% 与 15.4% 以下:Why Are LLM Backdoor Defenses Fragmented? A Feature-Level Explanation with Sparse Autoencoders(https://arxiv.org/abs/2608.30403v1)66. 隐蔽间接注入的新度量:把 ASR 拆成用户无感的 Covert 与可察觉的 Overt,ICoA 在 AgentDojo 上比最强基线高出 3.79 到 12.01 个百分点:Will the User Ever Know? Covert Indirect Prompt Injection on Tool-Using LLM Agents(https://arxiv.org/abs/2608.30362v1)67. 知识型工具是提取通道:ToolSiphon 平均恢复 74.3% 源记录(文本 83.2%、语义相似度 90.2%),无背景信息时仍恢复 66.3%:Extracting Knowledge from Tools in LLM Agents(https://arxiv.org/abs/2608.30288v1)68. 计算机使用智能体的自适应红队:SIR 把 Claude Opus 4.8 攻击成功率从 4% 提到 24%、Gemini 3.5 Flash 从 0% 提到 28%,发现的原则可跨架构迁移:SIR: Self-improving Red-teaming for Compute Use Agents(https://arxiv.org/abs/2608.30207v1)69. 记忆的阶段化权衡:MemGauge 用 11 款 LLM 揭示写入期阈值式风险跃迁、管理期策略相关解耦、检索期效用与风险同步增长:Understanding Stage-Wise Utility-Risk Trade-offs in LLM Agent Memory(https://arxiv.org/abs/2608.30177v1)70. 把隐私偏好对混进 DPO 数据可压低记忆信号:2B 模型成员推理 AUROC 从基线 0.804 降到 0.596 到 0.629,但只是经验协议而非正式隐私保证:Balancing Privacy, Utility, and Safety in LLM Alignment through Preference Optimization(https://arxiv.org/abs/2608.30141v1)71. 智能体间交换零知识谓词证明:32 位阈值谓词 6.2 毫秒证明、1.0 毫秒验证、608 字节证明,且可叠加飞地认证绑定系统记录:Zero-Knowledge Predicate Proofs Between AI Agents: A Measured, Cross-Protocol Gateway and the Source-Integrity Gap(https://arxiv.org/abs/2608.30083v1)72. 污染后的能力约束比内容分类更硬:SkillGuard 把 AgentDojo 四套件中三套的攻击成功率清零,组合攻击下优于全部基线且零模型调用开销:Reachability-Based Capability Confinement for LLM Agents under Indirect Prompt Injection(https://arxiv.org/abs/2608.30041v1)73. 因果护栏信号混淆「影响」与「授权」:值从用户侧搬到合法工具结果侧就足以把全部 24 个案例推入攻击区,57.5% 的未授权运行自动通过(授权运行 29.2%):Influence Is Not Authority: When Causal Guardrail Signals Make Legitimate Tool Use Look Like an Attack in Tool-Using LLM Agents(https://arxiv.org/abs/2608.29942v1)74. 印度语言 AI 文本检测的短板在鲁棒性而非峰值准确率:无训练方法在未见生成器与对抗扰动下显著退化,印地语退化最大:IndicDetect: Evaluating Cross-Lingual LLM-Generated Text Detection for Hindi, Telugu, and Tamil(https://arxiv.org/abs/2608.29919v1)75. 跨语言信息流的神经符号静态分析:PolyFlow 用 LLM 识别隐式流事实并由静态分析约束,在真实 Python-C 与 Java-C 系统上挖出所有基线漏掉的未知漏洞:POLYFLOW: A Neuro-Symbolic Framework for Static Cross-Language Information Flow Analysis(https://arxiv.org/abs/2608.29808v1)76. 从自然语言生成 CUDA kernel 的智能体框架:CUDA-Harness 用合成验证对抗奖励黑客,验证隔离测试数据与渐进式校验:CUDA-Harness: Harnessing Agentic CUDA Kernel Generation and Optimization from Natural Language(https://arxiv.org/abs/2609.00058v1)77. JIT 编译服务是比特翻转攻击新面:JITterFlip 单比特翻转 CPU 侧分支代码即可跨 CPU-GPU 边界放大 PPL 最高 7.23×10⁶ 倍或延迟 124.97 倍:JITterFlip: Uncovering Fault Attack Surfaces in JIT-Compiled LLM Serving(https://arxiv.org/abs/2608.29745v1)78. 智能体 API 的身份审计走动作通道:AgentProv 用工具调用分布指纹 100% 抓住全部 630 个被替换 checkpoint,系统提示注入下假阳性仅 7%(对比 67%):AgentProv: Auditing Agentic LLM API Providers via Tool-use Policy Probes(https://arxiv.org/abs/2609.00052v1)79. 电路引导的权重缩放把安全转化为机制干预:6 款 LLM 上攻击下安全率提升 26.5%,四个标准基准准确率只掉 1.7%:From Detection to Refusal: Safer LLMs via Circuit-Guided Weight Scaling(https://arxiv.org/abs/2609.00051v1)80. 智能体技能生态需要系统基础:从自主发现到安全治理的九阶段生命周期被统一刻画,市场、注册表与对抗向量被纳入同一框架:Towards a Systems Foundation for Agentic Skills: Architecture, Lifecycle, and Security(https://arxiv.org/abs/2608.29596v1)81. 越狱后缀优化的隐藏瓶颈在选择而非生成:TACS 用轨迹感知代理与参考策略正则抑制选择阶段奖励黑客,同预算下显著提升成功率:TACS: Trajectory-Aware Candidate Selection for LLM Jailbreak Suffix Optimization(https://arxiv.org/abs/2608.29564v1)
请在微信客户端打开
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:大模型安全研究 蜜罐先生 蜜罐先生《大模型安全周报:智能体安全战场下沉到“执行系统”,插件、钩子、技能与记忆成为新的信任边界》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。











评论