Content Safety

Content Safety 是检测和过滤有害内容(暴力、色情、仇恨言论、违法信息)的机制,应用于用户输入和 LLM 输出。

#type / concept #status / evergreen #tech / ai #tech / security

[!info] related notes

Content Safety

一句话定义

Content Safety 是检测和过滤有害内容的机制。它应用于两个位置:用户输入(防止发送有害内容)和 LLM 输出(防止返回有害内容)。

核心原理

检测维度

维度说明
暴力暴力、血腥内容
色情色情、性暗示内容
仇恨仇恨言论、歧视
违法违法犯罪信息
自残自杀、自残相关内容

实现方式

方式优点缺点
关键词快、简单容易绕过
分类模型准确需要训练
云服务维护少依赖第三方

云服务示例

class ContentSafetyChecker:
    async def check(self, text: str) -> dict:
        # 调用内容安全 API
        result = await content_safety_api.check(text)
        return {
            "safe": result.severity == "safe",
            "categories": result.categories,
            "severity": result.severity,
        }

常见坑

  1. 只检查输入: LLM 输出也可能有害
  2. 误判太多: 正常内容被误判为有害
  3. 不做分级: 应该区分”拒绝”和”警告”

参考资料

创建于 2026/6/30 更新于 2026/7/15