从“能用AI”到“敢用AI”,网易智企给出AI时代可信安全答案

admin 2026-07-23 04:43:18 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 本文指出AIAgent面临权限失控等风险,强调仅靠模型对齐不足,企业需建立独立于模型的安全控制面。网易智企推出大模型安全围栏与Agent行为防护体系,并联合发布AI安全白皮书,提出五维风险识别与合规成熟度模型,为企业构建从可用到可信的AI安全治理体系提供实操路径。 综合评分: 78 文章分类: AI安全,解决方案,产品介绍,安全建设,软文广告


cover_image

从“能用AI”到“敢用AI”,网易智企给出AI时代可信安全答案

AI驱动的 AI驱动的

网易智企-易盾

2026年7月22日 18:59 浙江

在小说阅读器读本章

去阅读

AI正在变得越来越聪明,但”聪明”本身并不等于”安全”。

2026世界人工智能大会暨人工智能全球治理高级别会议上,这一议题被推到了行业讨论的中心。7月17日发布的《主席声明》明确提出,要重视人工智能带来的安全风险,推动构建法律法规、技术监测、风险预警、应急响应等治理体系。“为人工智能大模型加装必要护栏”,这句话的背后,折射出人工智能发展的清晰信号:AI不仅需要持续提升能力,也需要建立与之匹配的安全治理体系。

从全球治理共识到产业实践探索,网易智企举办“用可信AI构建企业新智生产力”专题论坛。网易智企副总经理朱浩齐围绕《AI安全:从内容安全到AGI和具身智能安全》主题展开分享,结合网易智企长期在安全领域的实践,探讨AI从技术创新走向产业应用过程中,企业如何建立更加可靠、可持续的安全治理体系。

技术本身没有好坏,但它越来越像一把锋利的双刃剑。企业想要真正释放AI价值,就必须同步建立可靠的安全防护能力,让AI在可控、可信的边界内服务业务。

01

AI Agent时代,内生风险与权限失控是最大挑战

论坛上一个引发广泛共鸣的视角是:将AI Agent理解为新入职的”数字员工”。这个员工聪明、勤奋,能处理大量任务,也可能拥有较高权限。但正因如此,企业更需要思考:该给它什么权限?它的行为是否可记录?发生异常时能否及时阻断?

多个公开案例已经敲响警钟:攻击者通过AI客服流程绕过账号安全机制完成高价值账号接管;安全研究显示AI Agent具备自主侦察、执行攻击和发起勒索流程的潜在能力。这些案例说明,AI不再只是内容生成工具,而正在进入业务流程和权限系统。最大的风险不是AI不工作,而是它工作得太快、权限太大、过程不可见。这与WAIC《主席声明》中”明确决策权限和行为边界,建立行为追溯和风险提示机制”的要求形成了精准对应。

与此同时,大模型的内生风险同样不容忽视。大模型基于海量数据训练,在学习知识的同时,也可能吸收了危险知识、攻击方法、违规内容生成方式和错误价值倾向。一个典型案例是:某企业使用历史数据训练模型筛选简历,结果模型在推荐高管候选人时倾向于男性,造成明显的性别偏见。模型本身并不知道这是歧视,它只是从历史数据中学习到了某种统计相关性。大模型基于概率预测的本质,与企业场景中对确定性、合规性和道德约束的要求之间,天然存在张力,仅靠模型自身训练不足以解决安全问题。

#

02

越强的智能,越需要独立的安全控制面

在AI快速发展的过程中,一个重要问题正在被行业重新认识:安全是否可以完全依赖模型自身解决?

答案是否定的。

大模型通过海量数据训练获得强大的理解、推理和生成能力,但其本质仍然是基于概率预测的系统。模型能力越强,并不意味着其天然具备稳定、确定和可控的安全能力。一方面,大模型在学习知识的过程中,也可能接触到错误信息、危险知识或潜在偏见;另一方面,现实业务中的风险变化速度远远快于模型迭代周期,企业无法通过不断重新训练模型来应对所有新出现的问题。

因此,企业需要建立独立于模型之外的安全控制能力。

朱浩齐用“大脑”与“缩手反应”这一有趣的比喻生动诠释了二者的关系:大模型更像人的“大脑”,负责复杂认知、推理和创造;而安全能力更像“脑干”,负责在风险出现时快速识别并做出防护。二者并不是替代关系,而是协同关系。当企业面对提示词注入、敏感信息泄露或者异常调用行为时,并不一定需要重新训练模型,而是可以通过独立安全层快速识别风险、调整策略并进行阻断。

Google DeepMind近期发布的AI Control Roadmap也印证了同一方向:AI安全不能只依赖”对齐”。越复杂的系统,越做不到绝对零错误。即便模型经过了充分的对齐训练,在架构设计上也必须假设它可能出错甚至失控。重点不再是”怎么让它永远不犯错”,而是”它一旦犯错,系统如何拦截”。因此,系统级防护、权限控制和持续监测正在成为与模型训练同等重要的安全手段。AI安全正在从”让模型本身更安全”,扩展到”让AI进入业务系统后仍然可控”,这是一种重要的安全思考范式转变。

与此同时,AI安全也需要更加专业、独立的第三方能力支撑。

从社会信任角度看,模型厂商自己说自己安全是不够的,就像安全座椅需要独立检测报告一样,AI系统也需要更透明、更独立的安全机制来支撑信任。第三方安全服务还具备”群体免疫”效应:一个安全问题一旦被识别并形成策略,所有接入同一安全服务的客户都可以更快获得防护能力。

正如朱浩齐所比喻的:“安全是高速公路上的护栏,只有护栏足够可靠,AI这辆快车才能跑得更快、更远。”

03

从数字内容风控到AI安全治理,持续拓展安全边界

面对AI时代新的安全挑战,网易智企正在将长期积累的安全能力延伸至大模型和智能体场景。

在大模型应用快速落地的过程中,企业首先需要解决的是AI内容交互过程中的安全问题。围绕这一需求,网易智企持续建设大模型安全围栏能力,其核心是抓住大模型与外部世界交互的关键节点,通过覆盖输入、输出以及交互过程的安全检测机制,帮助企业识别提示词攻击、越狱风险、敏感信息泄露以及违规内容生成等风险。

通过双轨自适应训练机制,将大模型能力蒸馏到更轻量、更高性能的小模型中,结合低成本、高性能的检测手段实现快速安全响应,覆盖文本生成、图片生成、视频生成及智能体交互等多种AI场景,在不拖慢业务进度的前提下,让安全能力实时嵌入AI应用流程。

未来,随着智能体将越来越多地参与企业生产活动,Agent带来的风险也将从内容层进一步扩展到行为层。例如,智能体是否调用了不必要的数据资源,是否执行了超出授权范围的操作,是否受到外部指令干扰导致任务目标偏移,都成为企业必须面对的新问题。

基于这一趋势,网易智企进一步探索面向Agent时代的安全治理能力,从工具调用、权限控制、任务执行、行为审计等环节出发,帮助企业建立更加完整的智能体安全防护体系。

04

从实践经验到治理体系,探索可信AI未来路径

随着AI逐步进入企业核心业务场景,安全不再只是单点风险防护,而需要覆盖数据、模型、应用、智能体等多个环节的全生命周期治理。企业需要的不仅是一项安全技术,更是一套能够识别风险、评估风险并持续优化的治理方法。

基于多年安全领域技术积累和产业实践,网易智企联合金山办公、MiniMax发布《AI安全白皮书》,围绕AI技术演进趋势、风险变化、治理框架和实践路径展开系统研究,探索面向智能体时代的安全治理体系,帮助企业构建“看得见、管得住、测得出、追得回”的可信AI安全能力。

白皮书提出,从数据层、模型层、应用层、智能体层和生态层五个维度识别AI生命周期风险,并结合风险发生概率、影响程度、检测难度、修复成本和扩散能力进行综合评估,通过P0-P2三级风险分级,帮助企业明确治理优先级。同时,白皮书进一步探索AI安全体系建设路径,构建AI安全合规体系成熟度模型,帮助企业评估自身安全建设阶段,明确能力提升方向,推动AI安全从被动防护走向主动治理。

未来,随着AI进一步进入企业核心业务,安全能力将不再只是AI应用的附加模块,而会成为企业敢用AI、规模化使用AI的重要基础设施。

正如WAIC《主席声明》所言,人工智能带来的机遇和挑战同步上升。网易智企将持续结合企业AI应用实践与多年安全积累,推动AI能力从”可用”走向”可信”,从”技术创新”走向”可靠落地”。

让AI不仅拥有更强的智能,也具备更加可靠的安全边界。

活动推荐

作为网易旗下一站式企业 AI 应用服务提供商,网易智企倾力打造企业 AI 实战栏目——「AI 实战派」,聚焦 AI 在真实业务中的落地应用,通过实战教学、案例拆解、研讨交流等多元形式,将前沿的 AI 技术转化为真实的业务动能,为企业管理者、业务决策者和一线实践者提供可迁移、可复用的实战方法论与深度洞察。

关于我们

免费下载干货资料


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:网易智企-易盾 AI驱动的 AI驱动的《从“能用AI”到“敢用AI”,网易智企给出AI时代可信安全答案》

评论:0   参与:  0