谷歌研究人员利用GPT-4攻破审核系统AI-Guardian
创始人
2025-06-28 06:41:41
0

8月2日消息,据外媒报道,谷歌的研究人员展示了OpenAI的GPT-4如何作为研究助手来规避AI-Guardian。

AI-Guardian是一种用于检测图片中是否存在不当内容的AI审核系统,同时还可以识别图片是否被其他AI修改过。一旦发现有不当内容或篡改迹象,该系统将提示管理员进行处理。

谷歌DeepMind研究科学家Nicholas Carlini在论文中揭示了GPT-4是如何被指示设计出一种攻击方法,以避开AI-Guardian的保护措施的。该实验展示了聊天机器人在推进安全研究方面的潜在价值,并突出了GPT-4等强大语言模型对未来网络安全的影响。

Carlini的研究探讨了如何利用OpenAI的大型语言模型GPT-4来开发针对AI-Guardian的攻击策略。在最初的设计中,AI-Guardian的开发是为了通过识别和阻止包含可疑工件的输入来防止对抗性攻击。但是,Carlini的论文表明,GPT-4在通过提示的指导下,可以通过生成脚本和解释图像调整来克服AI-Guardian的防御,这些图像调整欺骗了分类器,而不会触发AI-Guardian的检测机制。

Carlini的论文包括GPT-4建议的Python代码,可以利用AI-Guardian的漏洞。因此,在原始AI-Guardian研究的威胁模型下,AI-Guardian的鲁棒性从98%降低到仅8%。AI-Guardian的作者承认Carlini的攻击成功地绕过了他们的防御。

Nicholas Carlini使用GPT-4击败AI-Guardian的实验标志着AI对AI行动的一个重要里程碑。它展示了如何利用语言模型作为研究助手来发现漏洞并加强网络安全措施。虽然GPT-4的能力为未来的安全研究提供了良好的前景,但也强调了人类专业知识和协作努力的重要性。随着人工智能语言模型的不断发展,它们有可能彻底改变网络安全领域,并激发防御对抗性攻击的创新方法。

相关内容

热门资讯

PHP新手之PHP入门 PHP是一种易于学习和使用的服务器端脚本语言。只需要很少的编程知识你就能使用PHP建立一个真正交互的...
网络中立的未来 网络中立性是什... 《牛津词典》中对“网络中立”的解释是“电信运营商应秉持的一种原则,即不考虑来源地提供所有内容和应用的...
各种千兆交换机的数据接口类型详... 千兆交换机有很多值得学习的地方,这里我们主要介绍各种千兆交换机的数据接口类型,作为局域网的主要连接设...
粉嫩如何诠释霸道 东芝M805... “霸道粉”是个什么玩意东芝M805拿过来的时候,笔者扑哧笑了,不是笑这款笔记本,而是笑这款产品的颜色...
什么是大数据安全 什么是大数据... 在《为什么需要大数据安全分析》一文中,我们已经阐述了一个重要观点,即:安全要素信息呈现出大数据的特征...
如何利用交换机和端口设置来管理... 在网络管理中,总是有些人让管理员头疼。下面我们就将介绍一下一个网管员利用交换机以及端口设置等来进行D...
全面诠释网络负载均衡 负载均衡的出现大大缓解了服务器的压力,更是有效的利用了资源,提高了效率。那么我们现在来说一下网络负载...
如何允许远程连接到MySQL数... [[277004]]【51CTO.com快译】默认情况下,MySQL服务器仅侦听来自localhos...
30分钟搞定iOS自定义相机 最近公司的项目中用到了相机,由于不用系统的相机,UI给的相机切图,必须自定义才可以。就花时间简单研究...
Intel将Moblin社区控... 本周二,非营利机构Linux基金会宣布,他们将担负起Moblin社区的管理工作,而这之前,Mobli...