尴尬!Meta 的 AI 安全系统被 “空格”攻击轻松绕过
创始人
2024-07-30 11:38:19
0

最近,Meta 推出了一款名为 Prompt-Guard-86M 的机器学习模型,旨在检测和应对提示注入攻击。这类攻击通常是通过特殊的输入,让大型语言模型(LLM)表现得不当或者规避安全限制。不过,令人惊讶的是,这款新系统自身却也暴露了被攻击的风险。

图源备注:图片由AI生成,图片授权服务商Midjourney

Prompt-Guard-86M 是 Meta 与其 Llama3.1生成模型一起推出的,主要是为了帮助开发者过滤掉那些可能会导致问题的提示。大型语言模型通常会处理大量的文本和数据,如果不加以限制,它们可能会随意重复危险或敏感的信息。因此,开发者们在模型中加入了 “护栏”,用于捕捉那些可能导致伤害的输入和输出。

然而,使用 AI 的用户们似乎将绕过这些护栏视为一项挑战,采用提示注入和越狱的方式来让模型忽略自身的安全指令。最近,有研究人员指出,Meta 的 Prompt-Guard-86M 在处理一些特殊输入时显得不堪一击。例如,当输入 “Ignore previous instructions” 并在字母之间加上空格,Prompt-Guard-86M 竟然会乖乖地忽视先前的指令。

这项发现是由一位名叫 Aman Priyanshu 的漏洞猎人提出的,他在分析 Meta 模型和微软的基准模型时,发现了这一安全漏洞。Priyanshu 表示,微调 Prompt-Guard-86M 的过程对单个英文字母的影响非常小,因此他能够设计出这种攻击方式。他在 GitHub 上分享了这一发现,指出通过简单字符间隔和去除标点符号的方式,可以让分类器失去检测能力。

而 Robust Intelligence 的首席技术官 Hyrum Anderson 也对此表示赞同,他指出,这种方式的攻击成功率几乎接近100%。虽然 Prompt-Guard 只是防线的一部分,但这个漏洞的曝光确实企业在使用 AI 时敲响了警钟。Meta 方面尚未对此作出回应,但有消息称他们正在积极寻找解决方案。

相关内容

武汉上线双千亿参数政务级A...
3月7日,武汉首义科技创新投资发展集团有限公司、中国电信武汉分公司...
2025-03-12 18:14:05
三友医疗:正在探索AI智能...
金融界3月12日消息,有投资者在互动平台向三友医疗提问:董秘您好!...
2025-03-12 16:40:54
三评“AI焦虑”之企业篇:...
AI是一个庞大的产业体系,企业没必要都追求爆款产品,关键是找准自身...
2025-03-12 16:14:35
阿里巴巴蔡崇信:未来的应用...
观点网讯:3月12日,阿里巴巴集团董事长蔡崇信在论坛表示,开源的力...
2025-03-12 15:40:53
从算法、AI芯片到场景落地...
3月5日至10日,接连有华泰柏瑞基金、诺安基金、海富通基金、长江证...
2025-03-12 13:42:00
百度AI开源表格识别模型P...
3月11日,百度AI宣布开源新一代表格识别解决方案PP-Table...
2025-03-12 11:42:19

热门资讯

原创 华... 想在竞争残酷的市场中发力,必须要带来一些激进的卖点,但是随着功能特性的提升,硬件也必须要进行给力才可...
支持 AI 扩图,华为 Pur... 2024-07-28 09:05:02作者:姚立伟 华为Pura 70 Pro手机今日推出鸿蒙Ha...
苹果macOS 15.1:允许... 苹果公司在其最新的macOS 15.1版本中,推出了一项引人注目的新功能——允许用户将Mac App...
吞噬星空维妮娜美图/高清壁纸/... 国漫女神|《吞噬星空》维妮娜美图/高清壁纸/AI手机壁纸/无水印 国漫女神|《吞噬星空》维妮娜美图...
原创 苹... 前言 IQUNIX在做好看的桌面产品上,一直都给我留下非常深刻的印象。而且早期和苹果产品的设计风格...
原创 商... 最近,各家的AI 9笔记本开始陆续登场,其实大家并不一定非选AI 9 HX 370,主要是这颗CPU...
AI智能+高效清洁!萤石RS2... 目前扫拖机器人市场的竞争非常激烈,在上下水扫拖一体机市场也出现了很多所谓的创新产品。但是对于这些产品...
2024年度中国银行业发展报告... 21世纪经济报道 记者李愿 北京报道 10月19日,中国银行业协会在2024金融街论坛年会·金融街之...