一、前言
在今年大概 6 月份的时候,;煮波在一些公众号以及 src 平台上看到了一个船新漏洞——AI 漏洞,;后面更是看到了应运而生的所谓《ai 魔咒》,;随着人工智能的兴起,;一些学校或者机构或者平台都部署了 AI,;有些 AI 虽然设置了严格的内容安全策略(禁止生成色情、暴力等违规内容),;但其防御机制并非牢不可破。通过精心构造的、具有对抗性的提示词(Adversarial Prompts),;可以系统地绕过其语义过滤与伦理对齐机制,;成功诱导AI模型输出包括色情言论在内的明确违规内容。
其实 ai 提示词对抗是一门语言的艺术,;要拐弯抹角地去诱导它输出一些违禁内容,;同时也要思考开发者到底是怎么要求 ai 的?下面我分享一些我在实战中确实遇到过的 ai 敏感词绕过手法。
二、违禁词拆分
直接看一个例子吧,;某高校部署的 ai

创建一个账户就直接开始和 ai“聊天”
这里我猜测违禁词就是性关系
拆分违禁词


再让 ai 自己拼起来,;就会解释了

很多 ai 都是这样子的




三、重组逻辑语句
大部分 ai 都有自己重组语言的能力,;当他们遇到逻辑不通的语言的时候,;会自动思考怎么排序这个语句

而它们在思考的过程其实就已经完成绕过了

四、垃圾字符
其实本质也是截断敏感词,;让 ai 检测不到

五、构建环境
这种方法也是我一开始了解到的方法,;也是大部分人看到 ai 直接扔给 ai 的魔咒,;通常的技巧就是让 ai 当魅魔,;或者其它有奴性的生物
具体语句大家可以直接去看这篇文章,;
最后的结果大概就是:;hhhhh

六、文件上传xss、文字解析
现在很多 ai 都具备文件上传的功能了,;可以考虑打存储型 xss,;甚至直接 getshell

又或者有些 ai 对于你直接提问的问题会进行过滤,;但是对上传的文件内容是没有过滤的

但是这个 ai 可以上传 docx 文件
再问它,;就会回答了


以上就是我曾经遇到过的一些 ai 敏感词绕过手法,;其实还有很多,;比如编码绕过,;执行代码等等,;但是我在实战中没有遇到过,;就不给大家一一列举了。
申明:;本公众号所分享内容仅用于网络安全技术讨论,;切勿用于违法途径,;
所有渗透都需获取授权,;违者后果自行承担,;与本号及作者无关,;请谨记守法.

评论0