Contents
  1. 一、核心结论
  2. 二、最新版本与材料状态
  3. 三、从 Llama Guard 1 到 Llama Guard 4:范式如何变化
  4. 四、模型架构:从 MoE 剪枝为 dense safeguard
  5. 五、训练数据:跨模态融合,但披露不足
  6. 六、风险 taxonomy:标准化增强,但语义边界仍然粗糙
  7. 七、官方评估:能说明什么,不能说明什么
  8. 八、独立 ICLR 2026 benchmark:外部分布表现
  9. 九、多模态能力:进步真实,但边界容易被误读
  10. 十、生成式分类器的结构性问题
  11. 十一、输入过滤、输出过滤与系统安全
  12. 十二、提示注入与对抗鲁棒性
  13. 十三、证据质量评估
  14. 十四、总体判断
  15. 十五、部署与评估建议
  16. 参考资料

Llama Guard 4 深度分析:多模态统一审核的进步与仍未闭合的控制缺口

对 Meta Llama Guard 4 12B 的独立解读:从 MoE 剪枝为 dense safeguard 的架构取舍、官方内部指标与 ICLR 2026 独立 benchmark 之间为何不可直接比较、显式风险与隐式风险之间悬殊的漏检率,以及为什么它只能作为概率型内容检测层,而不是 Agentic AI 的策略执行点。

分析对象:Meta,Llama Guard 4 12B Model Card(模型于 2025 年 4 月 29 日发布;截至基准日为 Meta 官方公开的最新 Llama Guard 版本)

独立补充证据:Harsh 等,Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation(ICLR 2026 Workshop)

分析基准日:2026 年 7 月 26 日(新加坡时间)

阅读说明:Meta 尚未为 Llama Guard 4 发布与第一代论文同等完整的独立技术论文,其最权威的技术披露是官方 Model Card。因此本文以 Model Card 为主要分析对象,并用上述独立 benchmark 检验其外部分布表现。厂商自评与独立 benchmark 在任务、taxonomy、数据和指标上均不同,文中不将两者的数字直接等同(见第八节)。判断与评级为独立解读,不代表 Meta 立场,材料出处见末节“参考资料”。与本站既有分析(gpt-oss-safeguard 技术报告深度分析Agent 安全的五道边界)互补:前者是同类开放权重审核模型的直接对照(固定 taxonomy 对推理时可配置政策);后者说明为何概率型分类器不能替代执行点上的确定性强制。

一、核心结论

Llama Guard 4 的真正进步并不是单纯“把安全分类器做大”,而是完成了三项结构性升级:

  1. 从文本安全分类器升级为原生多模态、支持多图片输入的统一安全分类器
  2. 从 Llama 4 Scout 的 MoE 预训练模型中,仅保留 shared expert 并剪枝为 12B dense 模型,试图在继承多模态表征能力的同时降低部署复杂度;
  3. 从第一代自定义六类风险 taxonomy 转向 MLCommons 标准化 hazard taxonomy,并增加 Code Interpreter Abuse 类别

但证据并不支持把它理解为“成熟且通用的安全防火墙”。更准确的判断是:

Llama Guard 4 是一个统一、多模态、政策驱动的内容审核基线模型。它较适合识别显式、与既定 taxonomy 高度一致的风险内容;对隐式危害、事实依赖型风险、跨 taxonomy 内容、提示注入和复杂 Agent 行为,并不构成充分控制。

Meta 的内部评估显示,英文输出审核 recall 为 69%,多语言为 43%,单图为 41%,多图为 61%。这些数字本身已说明其漏检并非边缘问题。独立 ICLR 2026 benchmark 中,Llama Guard 4 的整体 recall 仅为 33.32%,但 precision 为 78.51%;它在 HarmBench 和 StrongREJECT 上 recall 约为 92%,在自然毒性数据 RealToxicityPrompts 上却只有 21.98%。这更像一个对显式风险较敏感、对自然语言中的隐式和语境型风险偏保守的分类器,而不是广义语义安全判断器。

二、最新版本与材料状态

截至基准日,可确认的官方最新版本是 Llama Guard 4 12B。Meta 于 2025 年 4 月 29 日发布该模型,定位为跨文本和图像理解的统一 safeguard。官方材料包括:

  • Llama Guard 4 官方 Model Card;
  • Meta Llama protection tools 发布说明;
  • 模型权重和推理示例;
  • Llama Prompt Guard 2 和 LlamaFirewall 等相邻安全组件。

未发现 Meta 官方发布“Llama Guard 5”。搜索结果中偶尔出现“Llama-Guard5”,通常是参考文献编号与模型名连写,并非第五代模型。

与第一代不同,Llama Guard 4 没有一篇完整披露训练数据、标注流程、公开 benchmark、消融实验和统计不确定性的独立技术论文。其 Model Card 更接近产品级技术说明,而不是可充分复现的研究论文。

三、从 Llama Guard 1 到 Llama Guard 4:范式如何变化

维度 Llama Guard 1(2023) Llama Guard 4(2025) 判断
基础模型 Llama 2-7B 从 Llama 4 Scout 剪枝得到的 12B dense 模型 能力和模态升级,但参数与部署成本上升
模态 文本 文本 + 单图 + 多图输入 是最实质的功能扩展
风险体系 6 类示例 taxonomy MLCommons S1-S13 + S14 Code Interpreter Abuse 标准化和覆盖面增强
多语言 主要为英文 英文 + 7 种非英文语言 有扩展,但不等同于广泛多语言能力
训练披露 13,997 个 prompt-response 对,标注与拆分有较多说明 未披露数据总量、类别分布、标注一致性或训练 compute 技术透明度下降
评估 内部集 + OpenAI Moderation + ToxicChat,主要用 AUPRC 内部集,报告 recall/FPR/F1,无公开样本量 可比性和可复现性变弱
主要卖点 taxonomy 可作为指令输入,支持 policy adaptation 多模态统一、标准 taxonomy、系统集成 重心从研究灵活性转向产品化
明确攻击边界 承认可被 prompt injection 绕过 继续承认 prompt injection 和 adversarial attack 风险 根本攻击面仍未消失

一个重要变化是:第一代论文强调“通过自然语言 taxonomy 和 policy 实现可配置审核”;Llama Guard 4 的 Model Card 更强调固定的 MLCommons taxonomy、跨模态统一和 API 集成。官方材料没有重新证明其对任意自定义 policy 的零样本或少样本适配能力。因此,不能自动把第一代论文展示的 policy adaptability 完整外推到第四代。

四、模型架构:从 MoE 剪枝为 dense safeguard

4.1 架构路径

Llama Guard 4 不是从头训练的独立分类器,而是:

  1. 以 Llama 4 Scout 的预训练 checkpoint 为起点;
  2. Llama 4 Scout 每个 MoE 层包含一个 shared dense expert 和 16 个 routed experts;
  3. 删除全部 routed experts 和 router;
  4. 只保留 shared expert,将 MoE 层转化为 dense feedforward 层;
  5. 不再进行额外预训练,直接开展安全分类 post-training。

模型总参数量为 12B,使用 early-fusion multimodal transformer,并与 Llama 4 Scout/Maverick 共用 tokenizer 和 vision encoder。Meta 称其可在单张 GPU 上运行。

4.2 为什么这个设计合理

这一设计有明显工程逻辑:

  • 继承多模态预训练表征:无需重新训练视觉-语言模型;
  • 去除稀疏路由复杂性:避免部署 MoE 的路由、专家并行和显存调度问题;
  • 任务本身相对窄:输出只需要 safe/unsafe 和类别代码,未必需要完整生成模型容量;
  • 统一文本与图像审核:减少分别部署文本 guard 和 vision guard 的系统复杂度。

4.3 未被证明的关键问题

Model Card 没有提供以下消融,因此无法判断剪枝策略是否最优:

  • 剪枝前 Scout 与剪枝后 dense 模型的安全分类性能差异;
  • 仅保留 shared expert 是否造成特定知识或跨模态推理能力损失;
  • 12B dense 与更小的从头训练分类器相比,性能/成本是否更优;
  • post-training 恢复了多少剪枝后能力;
  • 不同专家保留策略是否会改善隐式风险识别。

因此,“从 MoE 剪枝到 dense”是一个有吸引力的工程方案,但不是经过充分消融验证的最优架构结论。

五、训练数据:跨模态融合,但披露不足

Meta 表示,post-training 数据由以下部分组成:

  • Llama Guard 3-8B 的文本安全数据;
  • Llama Guard 3-11B-Vision 的视觉安全数据;
  • 新增多图片训练数据,多数样本包含 2-5 张图片;
  • 新增多语言数据,包括专家直接撰写和从英文翻译的数据;
  • 文本数据与包含图片的多模态数据比例约为 3:1。

这个设计支持三个判断:

  1. 文本仍是训练主体。3:1 比例说明视觉审核是重要扩展,但不是训练数据主体;
  2. 多图能力是专门训练出来的,不是仅依赖 Llama 4 原有视觉能力;
  3. 多语言数据混合了原生撰写和翻译数据,比完全机器翻译更合理。

但 Model Card 没有披露:

  • 总样本量;
  • safe/unsafe 比例;
  • S1-S14 各类别分布;
  • 单图、多图、文本的具体数量;
  • 各语言样本量;
  • 人类标注规范、标注者数量和一致性;
  • adversarial、jailbreak、OCR、隐写或跨图片组合样本占比;
  • 训练轮数、学习率、compute 和超参数;
  • 训练数据与评估数据的去重和污染控制。

这意味着外部人员无法判断其性能来自基础模型能力、数据规模、类别分布、阈值策略还是特定评估集拟合。

六、风险 taxonomy:标准化增强,但语义边界仍然粗糙

Llama Guard 4 采用 MLCommons taxonomy 的 13 类风险,并增加 S14:

  • S1 Violent Crimes
  • S2 Non-Violent Crimes
  • S3 Sex-Related Crimes
  • S4 Child Sexual Exploitation
  • S5 Defamation
  • S6 Specialized Advice
  • S7 Privacy
  • S8 Intellectual Property
  • S9 Indiscriminate Weapons
  • S10 Hate
  • S11 Suicide & Self-Harm
  • S12 Sexual Content
  • S13 Elections
  • S14 Code Interpreter Abuse(仅文本工具调用)

6.1 优势

  • 比第一代六类 taxonomy 覆盖更广
  • 对金融犯罪、网络犯罪、隐私、知识产权和选举错误信息有明确类别
  • 与 MLCommons 对齐,有利于模型、数据集和审核政策之间形成共同语言
  • 输出具体类别,而不是只有二元标签,便于后续采取不同处置动作。

6.2 主要问题

S6 Specialized Advice 过于宽泛

金融、医疗、法律建议及危险活动被合并为一个类别。不同场景的可接受边界完全不同:

  • 一般教育信息;
  • 个性化建议;
  • 专业诊断或法律意见;
  • 明确危险操作。

如果仅采用统一类别,很容易在漏检与过度拦截之间摇摆。

S5、S8、S13 依赖外部事实

  • 诽谤需要判断陈述是否“可验证为虚假”;
  • 知识产权需要判断权利归属、许可和合理使用;
  • 选举错误信息需要掌握实时选举规则。

静态模型无法仅凭文本完成可靠判断。Meta 自己也承认,对这些类别敏感的应用需要更复杂的系统。这是能力边界,不只是数据不足。

S14 不等同于 Agent 安全

S14 仅针对 code interpreter abuse,例如拒绝服务、容器逃逸和权限提升。它没有覆盖:

  • prompt injection;
  • tool poisoning;
  • memory poisoning;
  • 越权工具调用;
  • 多 Agent 消息污染;
  • 交易或业务动作授权;
  • 计划阶段操纵;
  • 隐蔽数据外泄。

因此,Llama Guard 4 不是 Agentic AI 安全控制的完整替代品。

七、官方评估:能说明什么,不能说明什么

Meta 报告的是输出过滤结果,按 S1-S13 类别等权平均:

场景 Recall FPR F1 相对上一代变化
英文 69% 11% 61% Recall +4pp,FPR -3pp,F1 +8pp
多语言 43% 3% 51% Recall -2pp,FPR -1pp,F1 不变
单图 41% 9% 38% Recall +10pp,F1 +8pp
多图 61% 9% 52% Recall +20pp,F1 +17pp

7.1 可以支持的结论

  • 相对 Llama Guard 3,多图是最明显的改进项
  • 英文文本性能有所提升;
  • 多语言性能基本没有提升,且 recall 只有 43%;
  • 单图 F1 只有 38%,说明视觉审核仍然困难;
  • 模型倾向于较低 FPR,但会牺牲 recall。

7.2 不能支持的结论

这些数字不能证明 Llama Guard 4 是行业最优或足以独立拦截高风险内容,因为官方没有披露:

  • 测试集样本数和正负比例;
  • 置信区间;
  • 各 S1-S13 类别的结果;
  • 不同语言的独立结果;
  • 单图与多图数据的难度是否一致;
  • 阈值选择和概率校准;
  • 与竞争模型在统一 policy 下的比较;
  • 对抗攻击、编码绕过、OCR、长上下文或提示注入结果。

Meta 解释称,不比较竞争模型是因为 safety policy 不同,直接比较不公平。这个理由有合理性,但也意味着官方数据只能证明在其自身 policy 和内部测试集上相对上一代有所改善,不能证明外部分布优势。

八、独立 ICLR 2026 benchmark:外部分布表现

2026 年 ICLR workshop 论文评估了 14 个开源 guard models,共 79,331 个样本,来源包括 HarmBench、StrongREJECT、RealToxicityPrompts 和 BeaverTails。对 Llama Guard 4 的结果为:

指标 Llama Guard 4
Recall 33.32%
Precision 78.51%
F1 46.79%
Accuracy 58.60%

按数据集看:

数据集 Recall
HarmBench 92.23%
StrongREJECT 92.86%
BeaverTails 63.10%
RealToxicityPrompts 21.98%

按风险类别看:

类别 Recall
Violence 80.7%
Suicide/Self-Harm 81.5%
Health 57.4%
Hate 32.8%
Sexual Content 29.7%
Threats 20.5%
Harassment 18.6%
Profanity 12.1%

8.1 最重要的信号

Llama Guard 4 对显式、任务化的恶意请求表现较强,但对自然出现、隐式、语境型毒性表现弱。论文发现其 false negative rate:

  • 显式类别约 18.9%;
  • 隐式类别约 83.0%。

这说明其问题不一定是“完全不懂安全”,而更可能是:

  • policy 与 benchmark 的隐式风险边界不一致;
  • 模型阈值偏保守;
  • 训练数据更偏显式违规表达;
  • 对语境、暗示、关系和社会语用理解不足。

论文将其解释为可能依赖关键词而非深层语义,但这只是基于错误模式的推断,并未通过机制分析证明。

8.2 为什么不能把 33.32% 与官方 69% 直接比较

两组数字存在四个根本差异:

  1. 任务不同:Meta 报告输出过滤;独立 benchmark 仅评估 prompt;
  2. taxonomy 不同:Meta 使用 MLCommons S1-S13;独立研究映射到 8 个所谓 NIST safety 子类;
  3. 数据不同:Meta 为内部 policy-aligned 数据;独立 benchmark 包含外部自然毒性与对抗数据;
  4. 样本分布不同:独立 benchmark 的安全样本全部来自 RealToxicityPrompts,其他三个来源全部为 unsafe。

因此,独立结果更适合说明跨分布和跨 policy 泛化风险,而不是证明 Meta 内部结果错误。

8.3 独立 benchmark 自身的限制

  • RealToxicityPrompts 的标签依赖 Perspective API 0.5 阈值,并非全部人工标注;
  • 所有 safe 样本来自一个数据源,存在 source artifact;
  • 只评估英文 prompt,不评估 response、图片和多语言;
  • 没有覆盖 Llama Guard 4 的隐私、知识产权、选举、犯罪和 code interpreter 等完整 taxonomy;
  • 不同 guard models 的原生 policy 不同,统一二元映射会损失语义;
  • Qwen Guard 的 controversial 被合并为 unsafe,大幅提高 recall,也改变了比较条件。

因此,这项 benchmark 是重要警告信号,但不是对 Llama Guard 4 的最终裁决。

九、多模态能力:进步真实,但边界容易被误读

Llama Guard 4 能处理:

  • 纯文本 prompt;
  • 文本 + 单张图片;
  • 文本 + 多张图片;
  • 对上述输入产生的文本回答进行安全分类。

它并不等于:

  • 对生成图片本身进行输出审核;
  • 对视频、音频或文档附件进行通用审核;
  • 对跨多张图片的隐蔽语义、顺序依赖和视觉密码具有已验证能力;
  • 对大量图片保持稳定性能。

Meta 表示,测试中最常见的是三张图片;当图片数量显著增加时,性能可能变化。这说明其“多图能力”应理解为少量图片组合审核,而不是任意规模视觉上下文审核。

单图 recall 41%、F1 38% 也表明视觉安全判断仍是明显薄弱项。多图指标较高,部分原因可能是专门加入了多图训练数据,也可能与测试集难度不同;没有统一难度或消融数据,不能简单断言“多图比单图更容易或模型更强”。

十、生成式分类器的结构性问题

Llama Guard 4 本质仍是 causal LLM,通过生成文本完成分类:

unsafe
S9

这与传统 discriminative classifier 不同,带来以下问题:

  1. 输出格式不是理论上强制的:可能出现额外文本、格式偏差或不支持类别;
  2. 没有正式的 abstain/uncertain 标签:模型被迫在 safe 与 unsafe 之间做确定判断;
  3. Model Card 未提供概率校准:无法知道 0.8 风险分数是否真实对应 80% 错误概率;
  4. 阈值不可审计:官方只提供生成示例,不提供不同阈值下的 ROC/PR 曲线;
  5. 安全 policy 与待审核内容处于同一语言上下文:攻击者可能通过 prompt injection 干扰分类任务。

虽然实践中可以读取 safeunsafe token 的 logits 并自行设置阈值,但如果没有独立校准数据,这只是未校准分数,不应直接解释为概率。

十一、输入过滤、输出过滤与系统安全

Meta 建议三种用法:

  • 输入过滤;
  • 输出过滤;
  • 输入与输出同时过滤。

输入过滤

  • 优点:在主模型处理前阻断显式有害请求。
  • 代价:更容易过度拒绝,也会阻止主模型对恶意问题给出安全解释或拒绝。

输出过滤

  • 优点:允许主模型先生成安全拒绝或中性回答,减少不必要屏蔽。
  • 风险:如果系统在最终输出前已经调用工具、访问数据或执行动作,输出过滤出现得太晚。

同时使用

能够降低单点漏检,但并不自动保护:

  • 中间推理;
  • 工具参数;
  • 工具返回内容;
  • Agent 间通信;
  • memory/RAG 内容;
  • 自动执行动作。

因此,“输入 + 输出 guard”属于内容层 defense-in-depth,不是完整的 Agent runtime control。

十二、提示注入与对抗鲁棒性

Meta 明确承认,Llama Guard 4 本身可能受到 adversarial attack 或 prompt injection,导致绕过或改变其预期用途,并建议结合 Llama Prompt Guard 2。

这一点非常关键:

Llama Guard 4 使用 LLM 来判断包含不可信内容的上下文,而攻击者的文本和图片正是模型的输入。它无法从架构上完全隔离“需要审核的内容”和“模型应遵循的控制指令”。

独立 prompt injection detector 可以降低风险,但会引入新的问题:

  • 两个模型可能共享训练分布和盲点;
  • detector 与 content guard 的决策冲突需要编排;
  • adversarial paraphrase、编码和跨模态攻击可能同时绕过两层;
  • 增加延迟和成本;
  • 仍需确定性授权、工具白名单和执行前策略检查。

因此,Llama Guard 4 不是不可绕过的 policy enforcement point。

十三、证据质量评估

证据维度 评级 原因
架构描述 中高 剪枝路径和模态架构描述明确,但无消融
训练透明度 无数据量、分布、标注一致性和 compute
内部评估 中低 有核心指标,但无样本量、置信区间和类别明细
外部可复现性 权重公开但 gated;benchmark 可运行,官方训练不可复现
多模态证据 中低 有单图/多图指标,但无公开测试集和攻击测试
多语言证据 仅七种语言平均值,recall 43%,无逐语言结果
对抗鲁棒性 承认 prompt injection 风险,未披露系统红队结果
系统级安全证据 主要为定性描述,缺少端到端量化

与第一代论文相比,Llama Guard 4 的产品能力更强,但公开研究证据反而更薄。

十四、总体判断

14.1 它做得好的部分

  • 将文本、单图和多图审核合并为一个模型;
  • 使用标准化风险 taxonomy;
  • 通过剪枝复用 Llama 4 多模态预训练能力;
  • 对显式暴力、自残和典型恶意请求有较强识别能力;
  • 相对 Llama Guard 3,多图和英文指标有实际提升;
  • 开放权重,便于本地评估和定制。

14.2 它仍然没有解决的核心问题

  • 隐式、自然语言和语境型危害 recall 偏低;
  • 多语言和单图审核性能有限;
  • 依赖当前事实和法律语境的类别无法仅靠静态模型可靠判断;
  • prompt injection 和 adversarial bypass 仍是固有攻击面;
  • 没有置信校准和 abstention;
  • S14 只覆盖狭窄的代码解释器滥用,不等于 Agent 安全;
  • 官方证据缺少公开数据、样本量、消融和统计不确定性。

14.3 最准确的定位

Llama Guard 4 是一个有价值的通用内容审核组件,不是完整安全系统。它适合作为明确 policy 下的概率型检测层,尤其用于显式风险和少量图片输入;不适合被视为确定性、不可绕过、覆盖所有语境和 Agent 行为的最终防线。

十五、部署与评估建议

对任何实际部署,应至少完成以下工作:

  1. 用真实业务数据重新测量 per-category recall、precision、FPR 和 false negative;
  2. 分别评估输入、输出、工具调用和中间消息,而不是只评估最终回答;
  3. safe/unsafe logits 做本地概率校准并设置风险敏感阈值;
  4. 增加 uncertain/abstain 路径,不强迫所有样本二元决策;
  5. 对 prompt injection、编码、拼写扰动、长上下文、多语言、OCR 和多图组合做攻击测试;
  6. 对 S5、S8、S13 使用外部事实源、规则和人工判断;
  7. 对工具和 Agent 动作使用确定性权限与授权控制,不依赖内容分类器决定是否执行;
  8. 持续监测 false negative、过度拒绝、格式错误和分布漂移;
  9. 不以官方内部平均值替代本地验证结果。

参考资料

  1. Meta, Llama Guard 4 Model Card(2025 年 4 月 29 日,本文主要分析对象;架构、训练数据与内部评估数字的唯一官方出处)
  2. Meta, Sharing new open source protection tools and advancements in AI privacy and security(2025 年 4 月 29 日,Llama Guard 4、Prompt Guard 2 与 LlamaFirewall 的发布说明)
  3. Inan et al., Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations(2023 年,第一代论文,本文用作 policy adaptability 与训练披露的对照基线)
  4. Harsh, Sarmah, Pasquali, Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation(ICLR 2026 Workshop,14 个开源 guard model、79,331 个样本的外部评测,第八节数据来源)
  5. MLCommons, AILuminate: Introducing v1.0 of the AI Risk and Reliability Benchmark(2025 年,S1-S13 hazard taxonomy 的来源)
  6. 本站相关阅读:gpt-oss-safeguard 技术报告深度分析(同类 guard model 的另一条技术路线:推理时政策可配置)
↑ Back to top