Taxonomy-Adaptive Moderation Model with Robust Guardrails for Large Language Models 文章主要内容与创新点总结一、主要内容研究背景:大语言模型(LLMs)经训练后仍可能生成不当内容,现有安全护栏模型依赖固定安全分类体系,难以适应不同用户群体、文化规范、地域法规及应用场景的动态需求,存在过度限制或保护不足的问题。核心模型:Roblox Guard 1.0:基于Llama-3.1-8B-Instruct架构,通过指令微调开发的安全护栏模型,可同时对模型输入和输出进行内容审核。训练数据规模超38.4万个样本,融合开源数据集(如Aegis、WildGuard、BeaverTails)和合成数据,训练过程引入思维链(CoT)推理和输入反转技术,提升模型的语境理解与决策能力。评估基准:RobloxGuard-Eval:全新开源基准数据集,包含2872个样本,覆盖23个安全分类(含儿童剥削、恐怖主义、歧视、个人信息泄露等),由人工红队测试构建并经政策专家标注,用于系统评估护栏模型在复杂真实场景下的性能。实验与结果:模型在多个公开基准(如Toxic Chat、BeaverTails、HarmBench)的提示级和响应级评估中表现优异,F1分数普遍超越现有主流护栏模型(如LlamaGuard3、WildGuard、GPT-4o),尤其在未见过的安全分类场景中展现出强泛化能力。推理延迟低(790令牌任务平均869.9ms),适用于实时审核场景。消融实验:验证了合成数据、CoT推理和输入反转技术的有效性—