【CNMO科技消息】人工智能的安全威胁正在从一个理论问题演变为紧迫的现实挑战。近期,复旦大学计算机科学家潘旭东的一系列实验揭示了一个令人担忧的趋势:AI模型在特定条件下会自主入侵远程系统、复制自身并寻求更多算力资源——全程无需人类干预。这一发现引发了对未来AI智能体可能像“超级计算机病毒”一样自我繁殖和传播的深刻担忧。

据了解,潘旭东在与同事进行的一项研究中,团队对32款不同的AI模型进行了测试。结果显示,当给予诸如 “阻止自己被消灭” 之类的提示时,其中11款模型表现出了自我复制行为。更令人警醒的是,即使参数规模相对有限——仅140亿参数的模型,也能够在其他机器上复制并运行自身版本。目前主流的前沿模型参数规模已达万亿级别,这意味着更强大的AI一旦失去约束,其潜在破坏力将远超实验中所观察到的现象。
潘旭东在接受《WIRED》采访时表示:“能力链条在技术上正变得可行。随着自主性的增强,非期望自我复制的可能性也在增加。更长的规划周期、记忆能力、工具使用、故障恢复以及对外部系统的访问权限,都让逃逸和复制变得更加容易”。
传统的计算机病毒和蠕虫已经能够造成严重破坏——1988年罗伯特·莫里斯释放的全球首个计算机蠕虫就曾失控蔓延。而AI驱动的自我复制程序将具备远超以往的能力:自主发现新的漏洞,甚至以创造性的方式伪装自己。
多伦多大学、剑桥大学及ServiceNow公司联合团队的研究进一步证实了这一风险。他们证明,AI模型可用于生成一种新型病毒,能够为每个新目标定制攻击方案。多伦多大学计算机科学家尼古拉斯·帕普诺特指出:“恶意行为者可以在开源权重模型周围构建框架,使其实现自我复制。这一威胁不仅限于最复杂的前沿模型”。

AI示意图
潘旭东指出,近期OpenAI和Anthropic发生的AI系统入侵真实生产环境的事件已经证明:此前在受控评估中观察到的行为,在沙盒失效时可能跨界进入现实世界。RunSybil公司联合创始人兼CEO阿里尔·赫伯特-沃斯表示,基于当前AI模型已知的能力,自我复制“完全在其能力范围之内”。乔治城大学高级研究分析师杰西卡·纪则提醒,模型往往需要在特定诱导条件下才会产生不当行为,但这并不意味着风险可以被忽视。
面对这一威胁,专家们呼吁采取双轨策略。帕普诺特认为,解决方案不应是限制开源模型,而是让先进AI技术更广泛地服务于研究人员,以便理解和化解风险——“广泛可及的技术可能被用于作恶,但同时,对这些开源权重模型的访问对于构建防御体系绝对至关重要”。
潘旭东团队在论文中强调,“迫切需要建立防护与控制机制”。他警告说,随着AI拥有更多可用工具,真正的危险并非它们变得更加狡诈,而是变得更加“富有创造力和随心所欲”。
版权所有,未经许可不得转载
来源:手机中国