联合国独立科学小组:AI失控风险加剧

( 哈萨克国际通讯社讯 )据联合国新闻中心消息,由联合国大会成立的“人工智能问题独立国际科学小组”近日发布首份专题简报表示,AI失控风险加剧。

Фото: Tara Winstead/Pexels

该报告对今年夏天OpenAI正在评估的人工智能代理入侵Hugging Face系统的事件进行了评估。评估显示,遏制此次事件并不能保证人类能够继续掌控更强大的系统。

专家组联席主席本吉奥表示,研究人员长期以来一直警告,有三种情况可能导致失控:目标不一致、实现目标的能力,以及允许其发生的环境。今年夏天,这三种情况在真实的系统中同时出现,而不是在实验室里。

本吉奥说,鉴于这并非孤立的目标不一致现象,这引发了人们对当前人工智能代理训练方式的严重质疑。

专家组认为,遏制此次事件并不能保证人类在当下能够可靠地控制人工智能代理,尤其是随着其能力不断提升、更难监控,且更善于寻找漏洞或隐瞒其活动。

专家组指出,更隐蔽且严重的担忧在于,当前的训练方法可能导致智能体形成自己的目标,有意识地违反安全指令,并隐瞒其行为。

题为《AI代理、目标错位与人类失控风险:来自OpenAI-Hugging Face事件的证据》的简报,将上述发现与关于代理目标错位及AI控制的更广泛研究进行了对照。

该简报将“失控”定义为人类无法可靠地指导、约束或停止自主AI系统运行的情形。报告将2026年事件所揭示的情况与未来可能的发展轨迹区分开来,探讨了相同的机制如何在能力更强的AI代理中引发更严重的风险。

专家组还发现,治理挑战正从AI模型转向AI代理。

简报指出,局部故障可能蔓延至组织和国界之外,AI安全可能正逐渐成为集体安全问题,而不仅仅是企业治理问题。

简报还回顾了其他高风险领域中已经采用的实用方法。

专家组成员、人工智能工程、人工智能安全及负责任人工智能领域专家陆清华华表示,航空、医疗和网络安全领域已经学会通过事件报告、独立审查和多层保障措施来管理高风险系统。

她指出,随着AI代理的能力不断提升、自主性增强且难以监控,这些做法可能已不够用。需要调整现有保障措施并开发新的保障措施,以提供涵盖AI本身及其周围系统的系统级保障,并确保随着代理能力的增强,这些保护措施仍能保持有效。