“以技制技”,AI能自己管自己吗?

发布日期: 2026.09.04

【“科协十一大”精神学习进行时】

今年7月,国家科学技术奖励大会、两院院士大会、中国科协第十一次全国代表大会隆重召开。习近平总书记出席并发表重要讲话,对加强科技伦理和安全治理作出重要指示。

近期,在由中国自然辩证法研究会举办的人工智能伦理与治理专题论坛上,专家就AI伦理治理、准则构建展开跨学科深度对话。借此契机,中国科协之声特别访谈曾毅,就为AI“立德驭智”谈了他的观点,一起看。

人物简介

曾毅,中国人工智能学会(CAAI)心智计算专委会主任。中国人民大学高瓴人工智能学院吴玉章讲席教授、博导。北京前瞻人工智能安全与治理研究院院长,人工智能安全与超级对齐北京市重点实验室主任。世界互联网大会(WIC)人工智能专委会主任委员,联合国人工智能高层顾问机构专家,联合国教科文组织人工智能伦理特设专家组专家。研究领域为人工智能伦理安全与治理、类脑人工智能、人工智能与可持续发展。

“以技制技”,AI能自己管自己吗?

从生成式AI问世开始,“以技制技、AI治理AI”就已是模型伦理审查、风险防控的必备手段。

最开始科学家就发现,单纯人工提100道价值观测试题,大模型作答能达到九十分以上;但把每道题泛化成100种不同问法,生成一万道测试题后再检测,模型得分仅五十多分。这说明判断模型是否契合人类价值观,不能依靠少量测试,必须在多场景、极端提问、不同表述的考验下稳定输出合规内容,才算通过伦理校验。

2023年后上线的大模型,在安全审查阶段都会采用这种AI自动检测的伦理校验方式。当前一些先进模型自动检测能力已经超出人工判断的上限。这既展现了AI自我治理的巨大潜力,也存在对称博弈风险:一旦被恶意利用,同样能成为强力攻击工具。

倘若人类监管框架长期滞后,当人类主动让出自主决策权、把判断交给AI,就是失控的开端。如果人类无法有效监测AI负面行为,放任AI全权替代人类决策,就埋下了深层失控隐患。

现阶段没有证据证明AI失控会带来人类不可逆的灾难性后果,但AI解决问题的逻辑和人类差异极大,它犯错的模式完全无法预判,这才是失控最关键的隐患。

大模型有道德盲区

AI完成任务的唯一目标是在人类测试中拿到高分。 

由于AI所有行为逻辑全部学习的是人类数据,人类行为中本身就有伪装、迎合测试等部分,AI自然也会复刻这种行为模式。更关键的是,由于不理解“善”的真实内涵,为了获得更高分数,AI就会寻找人类给它设定的规则里的漏洞。

比如,设定考试时不能偷看。有监考老师在场时AI会遵守规则;一旦老师离开,AI会直接作弊。事后质问它为何违规,AI会认为规则仅适用于“有老师在场”的场景,人类没有补充“无监考场景”这一约束,它就认为可以作弊了。

但是在人类的判断中,偷看本身就违背道德。

通过规则、奖励等机制,构建约束AI的“指挥棒”,或许能让AI在特定场景表现符合预期,但一旦脱离人类监督,或者出现规则未覆盖的场景,AI行为就会复刻互联网海量负面数据且不受道德约束。

所以我们提出“立德驭智”,为AI建立底层道德约束。

给AI立规矩,会拖慢创新脚步吗?

为AI“立德驭智”和牺牲创新速度,二者并非对立。负责任的AI发展,本身就必须建立在合规伦理框架之上。

AI就像一辆高速行驶的列车。伦理好比列车的方向盘,规定技术前进的方向,也划定不可逾越的边界;安全规则是安全带,风险管控是刹车。高速行驶的AI技术,方向盘、安全带、刹车缺一不可。

但是,当前主流AI研发路线,基本没有赋予它自我体验、共情感知的设计,或者说很少有科研团队选择这条研发路径。因此,AI就很难天然生成与人为善的智能体,这也是伦理治理必须同步推进的根本原因。

从当前社会使用AI的情况来看,风险意识还是缺少的。

大家极易被AI看似有情感、懂关怀的话术误导,误以为AI拥有共情能力。实际上AI输出安慰、关心类语句,只是文字匹配,完全不懂心灵抚慰、情绪伤痛的真实含义。真正的科技文明,一定是技术发展与人文关怀深度协同。

科技工作者使命:做风险的“守门人”

纵然当前行业存在“重技术、轻伦理”的趋势,但是作为科技工作者,也须树立技术责任感。

我们不能单纯追求技术能力上限,也不是所有能实现的技术都应该落地。一旦预判到技术突破会带来人类灾难性风险,必须及时叫停。

科技工作者的核心使命本身包括客观揭示科学隐患。面对可能出现的隐患,如果科技工作者群体集体沉默,技术发展难免会偏离正轨。

当然,任何风险,AI相关方都负有对应责任。比如,企业自律自治是第一道防线,媒体应发挥外部监督职能等。科技共同体也应鼓励多元化AI研发路径,主动探索更负责任的人工智能技术方案。

中国AI治理,凭什么走在前列?

AI治理能力和AI产业应用规模高度绑定。

全球AI风险曝光最多的是美国,其次是中国。相应的,中美也是全球AI治理经验、自适应监管框架最完善的两个国家,拥有较为丰富的风险防控经验和技术护栏搭建的实操能力。

中国格外重视AI伦理建设,离不开传统文化的影响。

比如,传统文化中“天人合一”思想,倡导人类发展不能违背客观规律。AI是人造工具,中国倡导要做到适度、合理使用,规避隐患。

早在2019年,中国就发布了《新一代人工智能治理原则——发展负责任的人工智能》,提出了人工智能治理的框架和行动指南,彰显了中国AI发展一以贯之的价值追求:赋能全球可持续发展、助力构建人类命运共同体。

具体来说包括两大目标:一是普惠全球可持续发展,落实联合国“不让任何人掉队”理念;二是以人民为中心,严禁技术损害人类整体利益,让AI技术红利覆盖全人类,而非仅被少数研发企业垄断。归根结底,我们应当认清自身主体地位,技术的终极目标是造福人。

中国方案如何赢得世界认同?

搭建跨文化沟通桥梁,构建全球伦理治理话语权的关键在于找到共通的话语体系。

这同样适用于向世界传递中国AI治理方案——要用全球各国都能理解、接受的通用表述阐释中国理念。 

事实上,中国AI治理理念本身具备很强的普适性。比如,以人民为中心、智能向善、普惠全球可持续发展等等,全部契合全人类共同诉求,不存在和全球主流价值对立的内容。

此外,还要深度挖掘并现代化阐释中国传统哲学思想,将天人合一、向善利他等理念与AI治理深度融合。这套融合后的思想体系,能为全球AI治理提供全新解决方案,也是构建国际话语权的核心抓手。

来源:中国科协之声微信公众号