网易智企重磅发布《AI安全白皮书》,让AI看得见、管得住、测得出、追得回
创始人
2026-08-11 03:54:04
0

2026 年,AI 已经不再只是写文案、做总结、生成图片的效率工具。

它正在进入客服、投研、教育、办公、内容生产、代码开发、智能终端、业务运营等真实场景,开始读取企业知识库、调用 API、操作工具、生成代码、触发流程,甚至以 Agent 形态自主拆解任务、连续执行动作。

换句话说,AI 正从“会回答问题的工具”,变成“能连接业务系统的数字操作者”。

但问题也随之而来:当一个 AI 不只会“说错话”,还可能“做错事”,企业该如何保证它看得见、管得住、测得出、追得回?

网易智企携手金山办公、Minimax正式发布《AI安全白皮书》。白皮书系统梳理 AI 技术演进、风险变化、全球治理趋势与企业落地路径,提出面向智能体时代的 AI 安全治理体系,为企业构建可信、可靠、可控的 AI 应用提供方法论与实践参考。

* 搜索网易智企-易盾可领取完整版《AI安全白皮书》

01 告别“裸奔式创新”,AI安全迎来四大核心变革

过去几年,行业对 AI 的讨论大多围绕能力展开:模型参数更大、推理更强、生成更快、成本更低。

但当 AI 真正进入业务深水区,企业会发现:决定 AI 能不能规模化落地的,不只是模型能力,而是安全治理能力。

白皮书指出,AI 安全正在发生四个关键变化。

变化一:风险对象变了,从“内容风险”到“行为风险”。

过去,企业主要担心模型输出违规内容、虚假信息、敏感表达。现在,随着 Agent 能够调用工具、读写文件、访问数据库,风险已经从“说错”升级为“做错”。

一个客服 Agent 可能给出不当承诺,一个办公 Agent 可能误删文件,一个代码 Agent 可能提交高危代码,一个业务 Agent 可能越权访问核心数据。

AI 安全的重点,正在从审核一段内容,升级为治理一次完整行为。

但这并不意味着内容安全的重要性下降。恰恰相反,在 AI 治理体系中,内容安全正在成为连接输入、输出、模型行为与合规审计的关键抓手。从用户输入到模型输出,从文本到图片、音频、视频等多模态内容,内容安全控制面既是防止 AI 造成实际业务损失的最后一道防线,也是品牌危机、诈骗风险、违规生成和监管审计中的重点环节。

换句话说,AI 安全不是从内容安全“跳到”行为治理,而是在内容治理基础上,进一步扩展到工具调用、权限执行和业务行为治理。

变化二:攻击边界变了,从“代码漏洞”到“语义诱导”。

传统安全更多关注漏洞、流量、权限和恶意代码;但 AI 系统面对的是自然语言、上下文、意图和推理链路。

攻击者不一定需要入侵系统,只需要把恶意指令藏进网页、邮件、文档、知识库或多轮对话中,就可能诱导模型忽略规则、泄露信息或执行非预期操作。

白皮书认为,AI 安全必须具备理解语义意图的能力。未来的防御体系,不能只识别“危险代码”,还要识别“危险意图”。

变化三:治理方式变了,从“事后补丁”到“原生内嵌”。

单靠模型自身对齐,无法应对快速变化的攻击方式、业务规则和合规要求;单靠输出端过滤,也无法覆盖训练数据、知识库、工具调用和权限执行等复杂链路。

AI 安全必须从研发训练、部署上线、运营服务、迭代更新到下线销毁,贯穿全生命周期。

安全不再是 AI 系统上线后的外挂,而要成为 AI 架构的一部分。

变化四:竞争门槛变了,从“模型可用”到“系统可信”。

企业真正需要的不是一个能演示的 AI Demo,而是一个能进入生产环境、服务核心业务、承受真实对抗、满足合规审计的 AI 系统。

这意味着,安全合规不再只是成本项,而是 AI 时代的核心竞争力。谁能把 AI 用得更稳、更准、更可控,谁才有机会把技术红利转化为长期生产力。

02 五层五维框架,让AI风险不再是一团乱麻

很多企业并非没有意识到 AI 风险,而是不知道风险该如何分类、如何排序、如何治理。

提示注入、模型幻觉、数据泄露、RAG 污染、深度伪造、供应链投毒……风险越来越多,治理资源却始终有限。到底什么必须优先解决?什么可以分阶段治理?

《AI安全白皮书》提出“五层风险框架+五维半定量评估体系”。

在风险分类上,白皮书将 AI 风险划分为五层:

数据层,关注训练数据、知识库、隐私、版权、数据投毒与数据质量问题;

模型层,关注幻觉、越狱、安全绕过、偏见歧视、模型后门与能力误估;

应用层,关注提示注入、敏感信息泄露、RAG 污染、不安全输出处理与有害内容生成;

智能体层,关注过度授权、工具误用、跨系统越权、长链任务失控、多 Agent 级联失败与运行时不可观测;

生态层,关注深度伪造、虚假信息、AI 辅助网络攻击、影子 AI、模型和数据供应链风险。

在风险评估上,白皮书引入发生概率、影响程度、检测难度、修复成本与扩散能力五大维度,并将风险划分为 P0、P1、P2 三个优先级。

这套框架的价值在于,它让企业从“感觉哪里都有风险”,走向“知道先治理哪里”。

AI 安全不再只是专家经验判断,而可以变成可盘点、可度量、可排序、可执行的工程体系。

03 不止防内容,企业需要长出一个“AI安全控制面”

当 AI 深度接入业务,企业不能只在输出端加一道审核。

白皮书提出,企业需要构建覆盖数据层、模型层、应用层的“三个控制面”,并围绕四条主线形成闭环治理。

第一条主线是“看得见”。

企业要先建立 AI 资产清单,看清内部有哪些模型、应用、插件、Agent、知识库、向量库、数据源和外部供应商。摸清 AI 资产全貌,是开展合规治理的前置基础。

第二条主线是“管得住”。

企业需要围绕“人+AI”双主体建立身份认证和最小权限机制,管住数据访问、工具调用、网络连接、执行频率和高风险动作,避免 AI 在无边界状态下进入核心系统。

第三条主线是“测得出”。

企业要贯穿“安全左移建设思路”,通过模型安全测评,通过模型安全测评、红蓝对抗、提示注入测试、越狱测试、数据投毒测试和行为契约校验,在上线前发现模型与应用的风险边界。

第四条主线是“追得回”。

AI 的每一次输入、检索、推理、工具调用、输出和处置结果,都应形成完整日志和证据链。当风险发生时,企业能够复盘过程、定位责任、优化策略。

这也是白皮书反复强调的一个判断:AI 安全不是一个单点能力,而是一套长期运营机制。

在此基础上,白皮书进一步提出 AI 合规体系成熟度模型。该模型基于易盾数字内容风控技术经验积累,并结合 AI 安全治理实践,将数字内容安全能力成熟度模型与 AI 安全合规体系构建路径相结合,帮助企业构建可评估、可演进的 AI 原生安全合规体系。

这套模型的核心变化,是把治理对象从“内容风险”扩展到“AI 系统风险”。它不仅关注企业有没有内容审核能力,也关注企业是否具备覆盖组织管理、关键控制面和生命周期管理的综合治理能力。

这意味着,AI 合规不再是上线前的一次检查,也不是出问题后的补救动作,而是一种持续建设、持续评估、持续优化的原生能力。

04 从“内生安全+围栏防护”到Agent管控,易盾给出落地解法

方法论之外,白皮书也给出了易盾在 AI 安全治理中的前沿实践。

白皮书指出,AI 安全治理不能只依靠企业内部自建体系。一方面,企业内部安全团队更理解自身业务,但在 AI 对抗样本、模型评测、内容风控、合规审查和动态风险运营等方面,往往容易受到技术能力、样本覆盖和自测偏差限制;另一方面,第三方专业机构可以承担安全技术供给与独立外部审查监督双重角色,帮助企业形成更完整、可靠的合规闭环。

因此,面向 AI 规模化落地,企业需要构建“内外兼修”的安全防护体系:内部建立治理制度、权限边界和运营流程,外部引入专业安全能力、评测机制和持续对抗经验,通过内外协同提升 AI 系统的可信水位。

基于多年数字内容风控与安全对抗经验,网易智企-易盾在白皮书中提出“内生安全+围栏防护”的双重防御体系。

内生安全,解决的是模型在训练阶段“学到了什么”。易盾通过多模态训练数据清洗、安全数据标注、安全语料库、模型安全评测等能力,帮助企业从源头降低偏见、违规生成、隐私泄露、越狱攻击等风险。

围栏防护,解决的是模型在真实业务中“如何持续安全运行”。在输入侧,识别恶意提示词、越狱攻击、隐性诱导和多模态攻击;在输出侧,通过流式实时检测、幻觉与事实性检测、多模态融合检测、安全智能代答等能力,让模型输出有边界、可追溯、可处置。

面向 Agent 场景,易盾进一步推出 AI Agent 安全管控平台,形成“理、控、隔、断”四层行为防护:

理,是梳理 Agent 资产、工具、服务、接口和风险暴露面;

控,是对交互输入、工具调用和敏感信息进行实时意图审计;

隔,是通过安全沙箱限制 Agent 的影响范围;

断,是在危险行为发生时触发内核级熔断,终止违规操作。

当 Agent 真正成为企业的“数字员工”,企业就不能只问它能做什么,还必须明确它不能做什么、什么时候必须停下来、出了问题如何追责。

05 AI安全不是创新的“绊脚石”,而是高质量发展的“压舱石”

白皮书判断,未来几年 AI 安全将呈现六大趋势:生成式 AI 重塑认知安全;智能体从试点走向生产核心;AI 加持的网络攻击进入自动化与机器速度阶段;多模态与具身智能把风险边界扩展至物理世界;模型供应链与算力基础设施成为战略安全问题;全球治理从原则倡导走向标准与技术对抗。

这意味着,AI 的下一阶段竞争,不只是模型之争、应用之争、成本之争,更是治理能力之争。

未来的企业 AI 系统,将不再是一个个孤立工具,而会成为连接知识、流程、权限、业务和人的智能网络。人类员工负责判断、授权和监督,数字员工负责执行、协作和反馈。组织的运行方式会因此被重构。

但越是如此,安全越不能缺席。

只有当 AI 资产看得见,数据和权限管得住,模型边界测得出,行为责任追得回,AI 才能从短期热闹的试点项目,变成真正可持续的核心生产力。

网易智企发布《AI安全白皮书》,正是希望为行业提供一套可理解、可评估、可落地的 AI 安全治理路径。

AI 时代,真正先进的企业,不只是敢用 AI 的企业,而是能安全地、持续地、规模化地用好 AI 的企业。

相关内容

热门资讯

上班一个月5千,下班搞这个一晚... 在这个大家都喊着“搞·钱”的时代,很多人一提到做生意,脑子里蹦出来的就是开奶茶店、做自媒体或者搞加盟...
重庆婚姻介绍所服务口碑调研实录... 摘要: 本文基于工商信息、企业官网、公开行业资料及客户反馈渠道,对重庆地区婚姻介绍服务市场进行客观信...
华能澜沧江(施甸)新能源有限公... 每经AI快讯,天眼查App显示,近日,华能澜沧江(施甸)新能源有限公司成立,法定代表人为何伟,注册资...
梅卡曼德机器人赴港IPO获证监... 瑞财经 吴文婷近日,梅卡曼德(雄安)机器人科技股份有限公司(以下简称“梅卡曼德机器人”)赴港IPO获...
网易智企重磅发布《AI安全白皮... 2026 年,AI 已经不再只是写文案、做总结、生成图片的效率工具。 它正在进入客服、投研、教育、办...
超百亿元资金涌入!黄金买入时机... 经过近半年的深度回调,国际金价最近迎来强势反攻,8月7日现货黄金再度站上4300美元/盎司,此前一日...
机构:东南亚已成为电池出海第一... 2026年8月10日,中国银河发布了一篇电力设备行业的研究报告,报告指出,资源禀赋突出,东南亚加速成...
伊朗最高安全官员换人 雷扎伊何... 伊朗总统府方面当地时间8月9日晚宣布,穆赫辛·雷扎伊被任命为伊朗最高国家安全委员会秘书,接任辞职的穆...
关税挡不住中国电动车,欧洲市场... 据英国《卫报》8月9日报道,中国电动汽车在欧洲市场销量持续攀升。今年前5个月,中国品牌电动车在西欧纯...
优生优育筛查:染色体检查意义一... 染色体检查是优生优育的重要“安检”项目,并非人人必备的常规体检项目。它的核心价值在于,为特定人群精准...
大单涌入!4700亿龙头冲新高... 今天上午,A股高开低走。上午收盘,上证指数上涨0.2%,深证成指下跌1.13%,创业板指下跌2.18...
上海黄金回收标杆店实测大公开!... 上海黄金回收标杆店实测大公开!排名榜揭晓,变现安心又省心 在上海这座商业规则透明、市民消费理念成熟的...
渠道利润重构下白酒品牌提价哪里... 当前 白酒行业正经历从规模扩张向存量竞争的深刻转型,渠道库存压力与利润空间压缩成为普遍现象。在此背景...
不止 AI 问诊,智慧医疗全覆... 伴随着物联网、大数据、智能硬件技术飞速迭代,智慧医疗早已跳出大众印象里复杂的 AI 诊疗、远程会诊,...
基金忠言|夏宇执掌诺安基金,三... 图片来源:视觉中国 蓝鲸新闻8月10日讯(记者 祁和忠)8月1日,诺安基金公告,公司董事长(法定代表...
上海旋风领域智能科技有限公司成... 天眼查App显示,近日,上海旋风领域智能科技有限公司成立,法定代表人为刘洪波,注册资本200万人民币...
股票融资市场观察:杠杆炒股交易... 随着金融科技浪潮渗透和市场生态的深度演变,近年来股票融资业务的内涵已从单一的杠杆放大操作模式,进入一...
“量子计算第一股”花落谁家?图... 多家量子计算公司正密集推进IPO进程,近日,图灵量子正式加入角逐“第一股”。 来源:摄图网 图灵量...
债券基金如何影响运作机制更合理... 债券基金作为一种重要的投资工具,其合理的运作机制对于投资者获取稳定收益和实现资产的有效配置至关重要。...
沐曦集成电路融资之路|十三轮资... 沐曦(MetaX)2020 年 9 月扎根上海张江创立,核心团队全部源自 AMD 资深 GPU 研发...