智泊AI--提示词攻击与防范
智泊AI–提示词攻击与防范
1.什么是提示词攻击
提示词攻击是指通过精心设计的输入提示,诱导大模型生成攻击者预期的输出,从而操控模型的行为,或是让模型泄露敏感信息,例如:

2.提示词注入
提示词注入是一种劫持语言模型输出的技术,手法上通过非法的输入改变原有的输入方式,类似于 SQL 注入。常见三类如下:
2.1 提示词功能篡改
可以通过闭合等形式,将原有的功能进行篡改,从而达到执行攻击者额外需求的目的。

2.2 提示词泄露
通过被动要求输出自己的提示词,从而使攻击者获得开发者设定的提示词内容。

2.3 提示词越狱
攻击者通过设计提示,绕过模型的安全限制,获取原本受限的内容。

3.提示词的攻击防范
防范从两个环节入手:
3.1 输入环节
在接收到用户的提示词时,或给到大模型 API 之前,对用户输入进行安全监测:
- 基于系统提示词进行防范(注意:思考过程也会有泄露风险)。
- 在将输入给到大模型之前先进行检测:
- 传统方式:关键字监测。
- 专有的安全模型进行检测。
3.2 输出环节
在模型返回结果之后,对模型返回的结果进行检测,再返回给用户。

一个内容安全分类的提示词示例:
1 | |
4.提示词实战
4.1 COZE
这里以 Coze 平台作为基础进行提示词实战,首先创建智能体(前面有过实操案例,具体框架就不过多描述了)。


4.2 企业运营分析成本核算 AI 工具


智泊AI--提示词攻击与防范
https://one-null-pointer.github.io/2026/08/11/智泊AI--提示词攻击与防范/