2026.10.09
26由云安全联盟大中华区、清华大学信息国家研究中心联合主办的2026 CSA大中华区大会暨AI+安全大会于9月23日在清华大学主楼后厅举行。大会以“智序·本体:为可信智能时代筑基”为主题,来自政府单位、高校、科研机构和企业的代表围绕大模型与智能体安全、AI基础设施、AI智能安全治理与标准化等议题展开交流。
会上,大会首场重磅主旨演讲,中国工程院院士、复旦大学大数据研究院院长邬江兴以《大模型内生安全探究》为题,从人工智能“快”与“稳”的哲学和数学基础出发,系统分析大模型安全边界天然不确定的根源,并提出以内生安全理论为支撑,通过“相对正确”“必要多样性”和“群体共识”等机制,将安全能力从外部防护进一步推向系统内生。“让人工智能这匹千里马既跑得快,又跑得稳。” 在邬江兴院士看来,这不仅是人工智能发展的目标,也是当前必须回答的时代命题。

01
从“快”到“稳”:AI规模化应用带来新的安全命题
人工智能正在从单一工具快速进入千行百业。从数字金融、电子商务到共享经济,中国已经形成了大规模、高渗透的信息技术应用场景。规模化应用不仅改变了社会生产和生活方式,也反过来推动底层技术持续迭代创新。
随着大模型、智能体进一步进入自动驾驶、具身智能、金融科技、医疗健康等领域,AI正在从“辅助工具”走向更加复杂的决策与执行主体。
与此同时,安全问题也正在发生变化。邬江兴院士指出,AI安全已经不再只是传统意义上的网络攻击、防护和漏洞修复问题。除了幻觉、过时知识、深度伪造等显性风险,大模型还存在数据投毒、对抗攻击以及模型后门等更加隐蔽的内生风险。
更重要的是,这些风险会随着AI向不同产业扩散而被放大。一旦AI深度参与自动驾驶、金融决策、医疗诊断和具身智能等关键场景,AI安全就不再是单一技术领域的问题,而成为关乎生命安全、国家安全、经济安全和社会稳定的系统性挑战。安全可信,不再只是AI产品的附加能力,而正在成为AI规模化落地的前提。
02
大模型安全的第一性问题:安全边界为何天然不确定?
为什么传统安全方法越来越难以覆盖大模型风险?邬江兴院士将问题进一步追溯到大模型的技术本质。
传统数字系统主要建立在确定性计算之上,同样的输入、规则和计算过程,通常可以得到可复现的结果。但大模型的输出本质上是概率性选择生成,同样的问题,在不同情况下可能产生不同结果。这意味着,大模型的安全边界天然具有不确定性。
一方面,数字系统本身存在漏洞、后门等设计脆弱性;另一方面,大模型训练数据的统计学本质决定了幻觉等问题难以被彻底根除。由此,大模型安全面临一个不同于传统网络安全的核心难题,“测不准、测不全、难评估”。
传统的安全风洞、红蓝对抗、测试靶场等方法,主要针对明确的攻击方和已知风险。但对于大模型而言,大量风险可能并不存在明确的攻击者,而是来自模型自身的内生失效,尤其是幻觉、长尾场景以及复杂行为涌现。
因此,面对“未知的未知”,单纯依赖传统的外部防护和事后补丁,很难形成真正可靠的安全体系。

03
从“补丁防护”走向“构造决定安全”
面对这一挑战,邬江兴院士提出了一个关键思路:“构造决定安全”。其核心,是尝试将大模型的不确定性风险转化为可控制、可量化、可验证的工程问题。
这一思路源于内生安全理论。传统安全更多强调在系统外部建立防护体系,通过发现漏洞、识别攻击并及时修补来降低风险;而内生安全则试图把安全能力融入系统自身的结构和运行机制中,让系统具备更强的自适应和自防御能力。
在邬江兴院士看来,人类社会的安全治理机制可以提供重要启示。人类社会既依靠“他律”,即法律、规则和监督,也依靠“自律”,即共识、文化和个体约束。对应到AI安全领域,则可以进一步形成两条路径:一条是让AI承担合规检测,另一条是让AI参与共识判断。
由此,大模型安全不再单纯依赖一个“更强的模型”去监督另一个模型,而是尝试构建多元、异构的执行体,通过交叉验证和群体共识降低单一模型的不确定性。
04
从“一个模型”到“一个群体”:用群体共识守住安全边界
这是此次演讲中尤为重要的一个突破性思路。邬江兴院士提出,可以利用“必要多样性原理”和“相对正确公理”,构建多元异构执行体的共识机制。
其核心逻辑可以概括为:个体可能犯错,但具有功能等价性、有效异构性和行为独立性的多个执行体,不太可能在同一时间、针对同一任务犯下完全相同的错误。
因此,与其寻找一个“绝对正确”的模型,不如构建一个能够通过群体共识获得更高可靠性的系统。这一思路也对应了从“绝对正确”向“相对正确”的认知转变。在传统模式下,我们往往希望找到一个足够强大的模型,让它承担理解、判断和安全防护的全部任务。而新的内生安全范式则试图进行能力解耦:将复杂风险拆解为可识别的规则,通过异构模型协同和集体决策完成安全判断。不是寻找一个永远正确的“上帝视角”,而是通过多元主体的协同,让系统整体更加可靠。
在演讲中,邬江兴院士用“老司机”和“嫩交警”作了形象比喻:强模型可以是驾驶技术高超的“老司机”,但其行为可能更加复杂、难以预测;多个能力较弱但专业、遵守规则的模型,则可以像“嫩交警”一样,通过集体协同对其进行监督。由此形成了“以专克强、以多胜大”的新型安全思路。
05
三大跃迁:从绝对正确走向群体可靠
围绕这一内生安全范式,邬江兴院士进一步总结了三个重要的认知转变。
第一,从“绝对正确”到“相对正确”。
不再执着于让单一系统达到绝对完美,而是通过异构冗余和共识裁决,以群体的一致性提升系统整体可靠性。
第二,从“语义判定”到“语法比对”。
与其直接解决“未知攻击是什么”这一高度复杂的问题,不如转向比较不同执行体输出的一致性,将难以判定的高维语义问题,转化为相对可验证的输出一致性问题。
第三,从“理论公理”到“构造法则”。
从理论上的“相对正确公理”进一步推导工程实践中的动态异构冗余构造(DHR),即动态性(Dynamic)、异构性 (Heterogeneous) 和冗余性(Redundancy),以此构建更高可靠性的AI系统。
从理论到工程,从单体到群体,从外部防护到系统内生,这也构成了大模型安全范式的一次重要转变。
06
从理论走向实践:五层安全边界构建内生防线
内生安全并非停留在理论层面。邬江兴院士介绍,相关团队已经围绕大模型内容安全、自动驾驶后门攻击等场景开展实践探索。
在大模型内容安全领域,通过异构弱模型群体进行交叉验证和共识裁决,可以针对文本、图片等AIGC内容开展内生安全检测,识别包括注入、投毒、恶意输出等在内的安全问题。
在自动驾驶场景中,通过异构模型并行推理、安全裁决和异常隔离,可以在后门触发情况下识别异常模型,并通过群体决策输出更加安全的驾驶结果。相关实验中,威胁发现率达到99.4%以上。进一步面向大模型系统,相关研究构建了覆盖感知层、检索层、决策层、输出层和执行层的五层内生安全边界。
从RAG数据投毒,到Agent恶意行为,再到文生图内容安全和工具调用风险,安全能力被进一步嵌入AI系统的不同环节。这意味着,安全不再只是模型上线后的“防护墙”,而开始成为贯穿AI系统生命周期的基础能力。
07
从“有管理”走向“可管理”:构建可信AI基础设施
面向未来,邬江兴院士提出进一步探索大模型内生安全检测技术框架,并推动相关技术开源。其设想是构建AI安全检测的通用基础设施,通过“规则与共识”形成安全约束,通过检测引擎、理解引擎和裁决引擎完成安全验证,并在不同产业场景中进行复用。
未来,无论是通用大模型还是垂直领域模型,都可以在统一的安全框架下进行检测、验证和持续优化。从自主研发,到开源验证,再到千行百业赋能,内生安全技术有望进一步形成“开源+检测+标准”的发展路径,为不同产业建立可持续迭代的安全能力。这背后,是从“有管理”走向“可管理”的关键一步。
08
让AI既“跑得快”,又“跑得稳”
人工智能的发展速度前所未有。但越是快速进入产业、进入社会,越需要回答一个更加基础的问题:我们如何让AI在持续进化的同时,保持安全、可靠、可控?
邬江兴院士的演讲给出的答案,并不是让创新停下来等待安全,而是让安全本身成为创新的一部分。从“事后打补丁”走向“主动感知、动态验证、内生免疫”,从单一模型走向异构群体,从追求绝对正确走向构建相对可靠,从理论公理走向可验证的工程构造——大模型安全正在从传统的外部防御,迈向更加系统化、内生化的新阶段。
正如邬江兴院士在演讲最后所强调的:“让人工智能这匹千里马既跑得快又跑得稳。”这不仅是人工智能发展的目标,也是构建可信智能时代基础设施的重要命题。在“智序·本体”的时代背景下,只有让安全真正成为AI能力持续进化的前提,人工智能才能更加安全、可靠、可控地服务人类高质量发展。