Content Safety
Content Safety 是检测和过滤有害内容(暴力、色情、仇恨言论、违法信息)的机制,应用于用户输入和 LLM 输出。
#type / concept
#status / evergreen
#tech / ai
#tech / security
[!info] related notes
- 所属 MOC: AI Agent Application MOC, Security MOC
- 相关: Guardrails, Output Validation
Content Safety
一句话定义
Content Safety 是检测和过滤有害内容的机制。它应用于两个位置:用户输入(防止发送有害内容)和 LLM 输出(防止返回有害内容)。
核心原理
检测维度
| 维度 | 说明 |
|---|---|
| 暴力 | 暴力、血腥内容 |
| 色情 | 色情、性暗示内容 |
| 仇恨 | 仇恨言论、歧视 |
| 违法 | 违法犯罪信息 |
| 自残 | 自杀、自残相关内容 |
实现方式
| 方式 | 优点 | 缺点 |
|---|---|---|
| 关键词 | 快、简单 | 容易绕过 |
| 分类模型 | 准确 | 需要训练 |
| 云服务 | 维护少 | 依赖第三方 |
云服务示例
class ContentSafetyChecker:
async def check(self, text: str) -> dict:
# 调用内容安全 API
result = await content_safety_api.check(text)
return {
"safe": result.severity == "safe",
"categories": result.categories,
"severity": result.severity,
}
常见坑
- 只检查输入: LLM 输出也可能有害
- 误判太多: 正常内容被误判为有害
- 不做分级: 应该区分”拒绝”和”警告”