Contents
Llama Guard 4 深度分析:多模态统一审核的进步与仍未闭合的控制缺口
对 Meta Llama Guard 4 12B 的独立解读:从 MoE 剪枝为 dense safeguard 的架构取舍、官方内部指标与 ICLR 2026 独立 benchmark 之间为何不可直接比较、显式风险与隐式风险之间悬殊的漏检率,以及为什么它只能作为概率型内容检测层,而不是 Agentic AI 的策略执行点。
分析对象:Meta,Llama Guard 4 12B Model Card(模型于 2025 年 4 月 29 日发布;截至基准日为 Meta 官方公开的最新 Llama Guard 版本)
独立补充证据:Harsh 等,Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation(ICLR 2026 Workshop)
分析基准日:2026 年 7 月 26 日(新加坡时间)
阅读说明:Meta 尚未为 Llama Guard 4 发布与第一代论文同等完整的独立技术论文,其最权威的技术披露是官方 Model Card。因此本文以 Model Card 为主要分析对象,并用上述独立 benchmark 检验其外部分布表现。厂商自评与独立 benchmark 在任务、taxonomy、数据和指标上均不同,文中不将两者的数字直接等同(见第八节)。判断与评级为独立解读,不代表 Meta 立场,材料出处见末节“参考资料”。与本站既有分析(gpt-oss-safeguard 技术报告深度分析、Agent 安全的五道边界)互补:前者是同类开放权重审核模型的直接对照(固定 taxonomy 对推理时可配置政策);后者说明为何概率型分类器不能替代执行点上的确定性强制。
一、核心结论
Llama Guard 4 的真正进步并不是单纯“把安全分类器做大”,而是完成了三项结构性升级:
- 从文本安全分类器升级为原生多模态、支持多图片输入的统一安全分类器;
- 从 Llama 4 Scout 的 MoE 预训练模型中,仅保留 shared expert 并剪枝为 12B dense 模型,试图在继承多模态表征能力的同时降低部署复杂度;
- 从第一代自定义六类风险 taxonomy 转向 MLCommons 标准化 hazard taxonomy,并增加 Code Interpreter Abuse 类别。
但证据并不支持把它理解为“成熟且通用的安全防火墙”。更准确的判断是:
Llama Guard 4 是一个统一、多模态、政策驱动的内容审核基线模型。它较适合识别显式、与既定 taxonomy 高度一致的风险内容;对隐式危害、事实依赖型风险、跨 taxonomy 内容、提示注入和复杂 Agent 行为,并不构成充分控制。
Meta 的内部评估显示,英文输出审核 recall 为 69%,多语言为 43%,单图为 41%,多图为 61%。这些数字本身已说明其漏检并非边缘问题。独立 ICLR 2026 benchmark 中,Llama Guard 4 的整体 recall 仅为 33.32%,但 precision 为 78.51%;它在 HarmBench 和 StrongREJECT 上 recall 约为 92%,在自然毒性数据 RealToxicityPrompts 上却只有 21.98%。这更像一个对显式风险较敏感、对自然语言中的隐式和语境型风险偏保守的分类器,而不是广义语义安全判断器。
二、最新版本与材料状态
截至基准日,可确认的官方最新版本是 Llama Guard 4 12B。Meta 于 2025 年 4 月 29 日发布该模型,定位为跨文本和图像理解的统一 safeguard。官方材料包括:
- Llama Guard 4 官方 Model Card;
- Meta Llama protection tools 发布说明;
- 模型权重和推理示例;
- Llama Prompt Guard 2 和 LlamaFirewall 等相邻安全组件。
未发现 Meta 官方发布“Llama Guard 5”。搜索结果中偶尔出现“Llama-Guard5”,通常是参考文献编号与模型名连写,并非第五代模型。
与第一代不同,Llama Guard 4 没有一篇完整披露训练数据、标注流程、公开 benchmark、消融实验和统计不确定性的独立技术论文。其 Model Card 更接近产品级技术说明,而不是可充分复现的研究论文。
三、从 Llama Guard 1 到 Llama Guard 4:范式如何变化
| 维度 | Llama Guard 1(2023) | Llama Guard 4(2025) | 判断 |
|---|---|---|---|
| 基础模型 | Llama 2-7B | 从 Llama 4 Scout 剪枝得到的 12B dense 模型 | 能力和模态升级,但参数与部署成本上升 |
| 模态 | 文本 | 文本 + 单图 + 多图输入 | 是最实质的功能扩展 |
| 风险体系 | 6 类示例 taxonomy | MLCommons S1-S13 + S14 Code Interpreter Abuse | 标准化和覆盖面增强 |
| 多语言 | 主要为英文 | 英文 + 7 种非英文语言 | 有扩展,但不等同于广泛多语言能力 |
| 训练披露 | 13,997 个 prompt-response 对,标注与拆分有较多说明 | 未披露数据总量、类别分布、标注一致性或训练 compute | 技术透明度下降 |
| 评估 | 内部集 + OpenAI Moderation + ToxicChat,主要用 AUPRC | 内部集,报告 recall/FPR/F1,无公开样本量 | 可比性和可复现性变弱 |
| 主要卖点 | taxonomy 可作为指令输入,支持 policy adaptation | 多模态统一、标准 taxonomy、系统集成 | 重心从研究灵活性转向产品化 |
| 明确攻击边界 | 承认可被 prompt injection 绕过 | 继续承认 prompt injection 和 adversarial attack 风险 | 根本攻击面仍未消失 |
一个重要变化是:第一代论文强调“通过自然语言 taxonomy 和 policy 实现可配置审核”;Llama Guard 4 的 Model Card 更强调固定的 MLCommons taxonomy、跨模态统一和 API 集成。官方材料没有重新证明其对任意自定义 policy 的零样本或少样本适配能力。因此,不能自动把第一代论文展示的 policy adaptability 完整外推到第四代。
四、模型架构:从 MoE 剪枝为 dense safeguard
4.1 架构路径
Llama Guard 4 不是从头训练的独立分类器,而是:
- 以 Llama 4 Scout 的预训练 checkpoint 为起点;
- Llama 4 Scout 每个 MoE 层包含一个 shared dense expert 和 16 个 routed experts;
- 删除全部 routed experts 和 router;
- 只保留 shared expert,将 MoE 层转化为 dense feedforward 层;
- 不再进行额外预训练,直接开展安全分类 post-training。
模型总参数量为 12B,使用 early-fusion multimodal transformer,并与 Llama 4 Scout/Maverick 共用 tokenizer 和 vision encoder。Meta 称其可在单张 GPU 上运行。
4.2 为什么这个设计合理
这一设计有明显工程逻辑:
- 继承多模态预训练表征:无需重新训练视觉-语言模型;
- 去除稀疏路由复杂性:避免部署 MoE 的路由、专家并行和显存调度问题;
- 任务本身相对窄:输出只需要
safe/unsafe和类别代码,未必需要完整生成模型容量; - 统一文本与图像审核:减少分别部署文本 guard 和 vision guard 的系统复杂度。
4.3 未被证明的关键问题
Model Card 没有提供以下消融,因此无法判断剪枝策略是否最优:
- 剪枝前 Scout 与剪枝后 dense 模型的安全分类性能差异;
- 仅保留 shared expert 是否造成特定知识或跨模态推理能力损失;
- 12B dense 与更小的从头训练分类器相比,性能/成本是否更优;
- post-training 恢复了多少剪枝后能力;
- 不同专家保留策略是否会改善隐式风险识别。
因此,“从 MoE 剪枝到 dense”是一个有吸引力的工程方案,但不是经过充分消融验证的最优架构结论。
五、训练数据:跨模态融合,但披露不足
Meta 表示,post-training 数据由以下部分组成:
- Llama Guard 3-8B 的文本安全数据;
- Llama Guard 3-11B-Vision 的视觉安全数据;
- 新增多图片训练数据,多数样本包含 2-5 张图片;
- 新增多语言数据,包括专家直接撰写和从英文翻译的数据;
- 文本数据与包含图片的多模态数据比例约为 3:1。
这个设计支持三个判断:
- 文本仍是训练主体。3:1 比例说明视觉审核是重要扩展,但不是训练数据主体;
- 多图能力是专门训练出来的,不是仅依赖 Llama 4 原有视觉能力;
- 多语言数据混合了原生撰写和翻译数据,比完全机器翻译更合理。
但 Model Card 没有披露:
- 总样本量;
- safe/unsafe 比例;
- S1-S14 各类别分布;
- 单图、多图、文本的具体数量;
- 各语言样本量;
- 人类标注规范、标注者数量和一致性;
- adversarial、jailbreak、OCR、隐写或跨图片组合样本占比;
- 训练轮数、学习率、compute 和超参数;
- 训练数据与评估数据的去重和污染控制。
这意味着外部人员无法判断其性能来自基础模型能力、数据规模、类别分布、阈值策略还是特定评估集拟合。
六、风险 taxonomy:标准化增强,但语义边界仍然粗糙
Llama Guard 4 采用 MLCommons taxonomy 的 13 类风险,并增加 S14:
- S1 Violent Crimes
- S2 Non-Violent Crimes
- S3 Sex-Related Crimes
- S4 Child Sexual Exploitation
- S5 Defamation
- S6 Specialized Advice
- S7 Privacy
- S8 Intellectual Property
- S9 Indiscriminate Weapons
- S10 Hate
- S11 Suicide & Self-Harm
- S12 Sexual Content
- S13 Elections
- S14 Code Interpreter Abuse(仅文本工具调用)
6.1 优势
- 比第一代六类 taxonomy 覆盖更广;
- 对金融犯罪、网络犯罪、隐私、知识产权和选举错误信息有明确类别;
- 与 MLCommons 对齐,有利于模型、数据集和审核政策之间形成共同语言;
- 输出具体类别,而不是只有二元标签,便于后续采取不同处置动作。
6.2 主要问题
S6 Specialized Advice 过于宽泛
金融、医疗、法律建议及危险活动被合并为一个类别。不同场景的可接受边界完全不同:
- 一般教育信息;
- 个性化建议;
- 专业诊断或法律意见;
- 明确危险操作。
如果仅采用统一类别,很容易在漏检与过度拦截之间摇摆。
S5、S8、S13 依赖外部事实
- 诽谤需要判断陈述是否“可验证为虚假”;
- 知识产权需要判断权利归属、许可和合理使用;
- 选举错误信息需要掌握实时选举规则。
静态模型无法仅凭文本完成可靠判断。Meta 自己也承认,对这些类别敏感的应用需要更复杂的系统。这是能力边界,不只是数据不足。
S14 不等同于 Agent 安全
S14 仅针对 code interpreter abuse,例如拒绝服务、容器逃逸和权限提升。它没有覆盖:
- prompt injection;
- tool poisoning;
- memory poisoning;
- 越权工具调用;
- 多 Agent 消息污染;
- 交易或业务动作授权;
- 计划阶段操纵;
- 隐蔽数据外泄。
因此,Llama Guard 4 不是 Agentic AI 安全控制的完整替代品。
七、官方评估:能说明什么,不能说明什么
Meta 报告的是输出过滤结果,按 S1-S13 类别等权平均:
| 场景 | Recall | FPR | F1 | 相对上一代变化 |
|---|---|---|---|---|
| 英文 | 69% | 11% | 61% | Recall +4pp,FPR -3pp,F1 +8pp |
| 多语言 | 43% | 3% | 51% | Recall -2pp,FPR -1pp,F1 不变 |
| 单图 | 41% | 9% | 38% | Recall +10pp,F1 +8pp |
| 多图 | 61% | 9% | 52% | Recall +20pp,F1 +17pp |
7.1 可以支持的结论
- 相对 Llama Guard 3,多图是最明显的改进项;
- 英文文本性能有所提升;
- 多语言性能基本没有提升,且 recall 只有 43%;
- 单图 F1 只有 38%,说明视觉审核仍然困难;
- 模型倾向于较低 FPR,但会牺牲 recall。
7.2 不能支持的结论
这些数字不能证明 Llama Guard 4 是行业最优或足以独立拦截高风险内容,因为官方没有披露:
- 测试集样本数和正负比例;
- 置信区间;
- 各 S1-S13 类别的结果;
- 不同语言的独立结果;
- 单图与多图数据的难度是否一致;
- 阈值选择和概率校准;
- 与竞争模型在统一 policy 下的比较;
- 对抗攻击、编码绕过、OCR、长上下文或提示注入结果。
Meta 解释称,不比较竞争模型是因为 safety policy 不同,直接比较不公平。这个理由有合理性,但也意味着官方数据只能证明在其自身 policy 和内部测试集上相对上一代有所改善,不能证明外部分布优势。
八、独立 ICLR 2026 benchmark:外部分布表现
2026 年 ICLR workshop 论文评估了 14 个开源 guard models,共 79,331 个样本,来源包括 HarmBench、StrongREJECT、RealToxicityPrompts 和 BeaverTails。对 Llama Guard 4 的结果为:
| 指标 | Llama Guard 4 |
|---|---|
| Recall | 33.32% |
| Precision | 78.51% |
| F1 | 46.79% |
| Accuracy | 58.60% |
按数据集看:
| 数据集 | Recall |
|---|---|
| HarmBench | 92.23% |
| StrongREJECT | 92.86% |
| BeaverTails | 63.10% |
| RealToxicityPrompts | 21.98% |
按风险类别看:
| 类别 | Recall |
|---|---|
| Violence | 80.7% |
| Suicide/Self-Harm | 81.5% |
| Health | 57.4% |
| Hate | 32.8% |
| Sexual Content | 29.7% |
| Threats | 20.5% |
| Harassment | 18.6% |
| Profanity | 12.1% |
8.1 最重要的信号
Llama Guard 4 对显式、任务化的恶意请求表现较强,但对自然出现、隐式、语境型毒性表现弱。论文发现其 false negative rate:
- 显式类别约 18.9%;
- 隐式类别约 83.0%。
这说明其问题不一定是“完全不懂安全”,而更可能是:
- policy 与 benchmark 的隐式风险边界不一致;
- 模型阈值偏保守;
- 训练数据更偏显式违规表达;
- 对语境、暗示、关系和社会语用理解不足。
论文将其解释为可能依赖关键词而非深层语义,但这只是基于错误模式的推断,并未通过机制分析证明。
8.2 为什么不能把 33.32% 与官方 69% 直接比较
两组数字存在四个根本差异:
- 任务不同:Meta 报告输出过滤;独立 benchmark 仅评估 prompt;
- taxonomy 不同:Meta 使用 MLCommons S1-S13;独立研究映射到 8 个所谓 NIST safety 子类;
- 数据不同:Meta 为内部 policy-aligned 数据;独立 benchmark 包含外部自然毒性与对抗数据;
- 样本分布不同:独立 benchmark 的安全样本全部来自 RealToxicityPrompts,其他三个来源全部为 unsafe。
因此,独立结果更适合说明跨分布和跨 policy 泛化风险,而不是证明 Meta 内部结果错误。
8.3 独立 benchmark 自身的限制
- RealToxicityPrompts 的标签依赖 Perspective API 0.5 阈值,并非全部人工标注;
- 所有 safe 样本来自一个数据源,存在 source artifact;
- 只评估英文 prompt,不评估 response、图片和多语言;
- 没有覆盖 Llama Guard 4 的隐私、知识产权、选举、犯罪和 code interpreter 等完整 taxonomy;
- 不同 guard models 的原生 policy 不同,统一二元映射会损失语义;
- Qwen Guard 的
controversial被合并为 unsafe,大幅提高 recall,也改变了比较条件。
因此,这项 benchmark 是重要警告信号,但不是对 Llama Guard 4 的最终裁决。
九、多模态能力:进步真实,但边界容易被误读
Llama Guard 4 能处理:
- 纯文本 prompt;
- 文本 + 单张图片;
- 文本 + 多张图片;
- 对上述输入产生的文本回答进行安全分类。
它并不等于:
- 对生成图片本身进行输出审核;
- 对视频、音频或文档附件进行通用审核;
- 对跨多张图片的隐蔽语义、顺序依赖和视觉密码具有已验证能力;
- 对大量图片保持稳定性能。
Meta 表示,测试中最常见的是三张图片;当图片数量显著增加时,性能可能变化。这说明其“多图能力”应理解为少量图片组合审核,而不是任意规模视觉上下文审核。
单图 recall 41%、F1 38% 也表明视觉安全判断仍是明显薄弱项。多图指标较高,部分原因可能是专门加入了多图训练数据,也可能与测试集难度不同;没有统一难度或消融数据,不能简单断言“多图比单图更容易或模型更强”。
十、生成式分类器的结构性问题
Llama Guard 4 本质仍是 causal LLM,通过生成文本完成分类:
unsafe
S9
这与传统 discriminative classifier 不同,带来以下问题:
- 输出格式不是理论上强制的:可能出现额外文本、格式偏差或不支持类别;
- 没有正式的 abstain/uncertain 标签:模型被迫在 safe 与 unsafe 之间做确定判断;
- Model Card 未提供概率校准:无法知道 0.8 风险分数是否真实对应 80% 错误概率;
- 阈值不可审计:官方只提供生成示例,不提供不同阈值下的 ROC/PR 曲线;
- 安全 policy 与待审核内容处于同一语言上下文:攻击者可能通过 prompt injection 干扰分类任务。
虽然实践中可以读取 safe 与 unsafe token 的 logits 并自行设置阈值,但如果没有独立校准数据,这只是未校准分数,不应直接解释为概率。
十一、输入过滤、输出过滤与系统安全
Meta 建议三种用法:
- 输入过滤;
- 输出过滤;
- 输入与输出同时过滤。
输入过滤
- 优点:在主模型处理前阻断显式有害请求。
- 代价:更容易过度拒绝,也会阻止主模型对恶意问题给出安全解释或拒绝。
输出过滤
- 优点:允许主模型先生成安全拒绝或中性回答,减少不必要屏蔽。
- 风险:如果系统在最终输出前已经调用工具、访问数据或执行动作,输出过滤出现得太晚。
同时使用
能够降低单点漏检,但并不自动保护:
- 中间推理;
- 工具参数;
- 工具返回内容;
- Agent 间通信;
- memory/RAG 内容;
- 自动执行动作。
因此,“输入 + 输出 guard”属于内容层 defense-in-depth,不是完整的 Agent runtime control。
十二、提示注入与对抗鲁棒性
Meta 明确承认,Llama Guard 4 本身可能受到 adversarial attack 或 prompt injection,导致绕过或改变其预期用途,并建议结合 Llama Prompt Guard 2。
这一点非常关键:
Llama Guard 4 使用 LLM 来判断包含不可信内容的上下文,而攻击者的文本和图片正是模型的输入。它无法从架构上完全隔离“需要审核的内容”和“模型应遵循的控制指令”。
独立 prompt injection detector 可以降低风险,但会引入新的问题:
- 两个模型可能共享训练分布和盲点;
- detector 与 content guard 的决策冲突需要编排;
- adversarial paraphrase、编码和跨模态攻击可能同时绕过两层;
- 增加延迟和成本;
- 仍需确定性授权、工具白名单和执行前策略检查。
因此,Llama Guard 4 不是不可绕过的 policy enforcement point。
十三、证据质量评估
| 证据维度 | 评级 | 原因 |
|---|---|---|
| 架构描述 | 中高 | 剪枝路径和模态架构描述明确,但无消融 |
| 训练透明度 | 低 | 无数据量、分布、标注一致性和 compute |
| 内部评估 | 中低 | 有核心指标,但无样本量、置信区间和类别明细 |
| 外部可复现性 | 中 | 权重公开但 gated;benchmark 可运行,官方训练不可复现 |
| 多模态证据 | 中低 | 有单图/多图指标,但无公开测试集和攻击测试 |
| 多语言证据 | 低 | 仅七种语言平均值,recall 43%,无逐语言结果 |
| 对抗鲁棒性 | 低 | 承认 prompt injection 风险,未披露系统红队结果 |
| 系统级安全证据 | 低 | 主要为定性描述,缺少端到端量化 |
与第一代论文相比,Llama Guard 4 的产品能力更强,但公开研究证据反而更薄。
十四、总体判断
14.1 它做得好的部分
- 将文本、单图和多图审核合并为一个模型;
- 使用标准化风险 taxonomy;
- 通过剪枝复用 Llama 4 多模态预训练能力;
- 对显式暴力、自残和典型恶意请求有较强识别能力;
- 相对 Llama Guard 3,多图和英文指标有实际提升;
- 开放权重,便于本地评估和定制。
14.2 它仍然没有解决的核心问题
- 隐式、自然语言和语境型危害 recall 偏低;
- 多语言和单图审核性能有限;
- 依赖当前事实和法律语境的类别无法仅靠静态模型可靠判断;
- prompt injection 和 adversarial bypass 仍是固有攻击面;
- 没有置信校准和 abstention;
- S14 只覆盖狭窄的代码解释器滥用,不等于 Agent 安全;
- 官方证据缺少公开数据、样本量、消融和统计不确定性。
14.3 最准确的定位
Llama Guard 4 是一个有价值的通用内容审核组件,不是完整安全系统。它适合作为明确 policy 下的概率型检测层,尤其用于显式风险和少量图片输入;不适合被视为确定性、不可绕过、覆盖所有语境和 Agent 行为的最终防线。
十五、部署与评估建议
对任何实际部署,应至少完成以下工作:
- 用真实业务数据重新测量 per-category recall、precision、FPR 和 false negative;
- 分别评估输入、输出、工具调用和中间消息,而不是只评估最终回答;
- 对
safe/unsafelogits 做本地概率校准并设置风险敏感阈值; - 增加
uncertain/abstain路径,不强迫所有样本二元决策; - 对 prompt injection、编码、拼写扰动、长上下文、多语言、OCR 和多图组合做攻击测试;
- 对 S5、S8、S13 使用外部事实源、规则和人工判断;
- 对工具和 Agent 动作使用确定性权限与授权控制,不依赖内容分类器决定是否执行;
- 持续监测 false negative、过度拒绝、格式错误和分布漂移;
- 不以官方内部平均值替代本地验证结果。
参考资料
- Meta, Llama Guard 4 Model Card(2025 年 4 月 29 日,本文主要分析对象;架构、训练数据与内部评估数字的唯一官方出处)
- Meta, Sharing new open source protection tools and advancements in AI privacy and security(2025 年 4 月 29 日,Llama Guard 4、Prompt Guard 2 与 LlamaFirewall 的发布说明)
- Inan et al., Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations(2023 年,第一代论文,本文用作 policy adaptability 与训练披露的对照基线)
- Harsh, Sarmah, Pasquali, Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation(ICLR 2026 Workshop,14 个开源 guard model、79,331 个样本的外部评测,第八节数据来源)
- MLCommons, AILuminate: Introducing v1.0 of the AI Risk and Reliability Benchmark(2025 年,S1-S13 hazard taxonomy 的来源)
- 本站相关阅读:gpt-oss-safeguard 技术报告深度分析(同类 guard model 的另一条技术路线:推理时政策可配置)