Label Studio 内容审核(Content Moderation)标注模板:构建文本有害内容多标签分类任务 Label Studio 内容审核Content Moderation标注模板构建文本有害内容多标签分类任务【免费下载链接】label-studioLabel Studio is a multi-type data labeling and annotation tool with standardized output format项目地址: https://gitcode.com/GitHub_Trending/la/label-studio本指南围绕 Label Studio 开源仓库中的内容审核标注模板展开讲解如何用它搭建一条文本内容审核Content Moderation标注流水线标注员阅读待审核文本从“Toxic / Severely Toxic / Obscene / Threat / Insult / Hate”六个预置类别中任意多选并在可选文本框中补充审核意见。读完本文你将掌握Text、Choices、TextArea、View组合配置的完整写法与参数语义并能结合仓库源码理解模板的实际落地方式。模板总览一次多标签、带人工备注的内容审核标注内容审核Content Moderation是 NLP 领域最常见的业务场景之一广泛覆盖社交媒体平台、在线社区与论坛、聊天与直播弹幕、用户生成内容UGC与评论过滤、游戏聊天、信任与安全Trust Safety、内容政策与社区规范、仇恨言论与骚扰检测、网络霸凌、虚假信息治理等场景。本模板正是为这类文本有害内容检测toxic content detection / profanity filtering而设计展示原始文本用Text标签把任务数据中的$text字段渲染在标注界面上多标签判定用Choices标签提供 6 个类别复选框允许标注员同时勾选多种违规类型例如一条评论既Toxic又Insult人工备注用一个带样式的View容器包裹TextArea让标注员对为什么选这些标签或其他观察补充说明且该输入为可选项requiredfalse。该模板在仓库中有两处正式落点一处是本文档页面另一处是可直接导入使用的一体化模板配置 content-moderation/config.yml。后者在details字段中给出了更完整的行业应用与领域术语清单二者配置内容完全一致可以互相印证。提示使用模板时只需将下面任一处的View.../View配置整体复制到 Label Studio 项目设置的 Labeling Interface 中即可从标注模板库中直接选择 Content Moderation 模板可免去手动粘贴。完整标注配置Labeling Configuration内容审核模板的完整配置如下View Text nametext value$text/ Choices namecontent_moderation toNametext choicemultiple showInlinefalse Choice valueToxic backgroundred/ Choice valueSeverely Toxic backgroundbrown/ Choice valueObscene backgroundgreen/ Choice valueThreat backgroundblue/ Choice valueInsult backgroundorange/ Choice valueHate backgroundgrey/ /Choices View stylemargin: var(--spacing-tight); box-shadow: 0 4px 8px rgba(var(--color-neutral-shadow-raw) / 10%); padding: var(--spacing-tight) var(--spacing-base); border-radius: var(--corner-radius-small); background-color: var(--color-neutral-background); border: 1px solid var(--color-neutral-border); Header valuePlease provide additional comments/ TextArea namecomments toNametext requiredfalse/ /View /View配置整体分为三个部分文本展示区Text、类别判定区Choices与备注输入区带样式的View包裹TextArea。下面对每个部分逐一展开。Text展示待审核文本Text nametext value$text/该标签将任务数据中$text字段的内容渲染为可读文本供标注员审核。文本导入有多种方式例如直接上传 CSV/JSON 数据或通过本地文件存储Local Storage接入文本文件详见 任务数据导入说明 与 Text 标签文档。围绕本模板的用法Text还有几个值得掌握的参数详见 includes/tags/text.mdvalueType取值url或text默认text。当待审核文本量很大、不适合直接内嵌在任务数据中时可在value中给 URL并设置valueTypeurl让前端按需加载saveTextResult是否把被标注的文本一并存入结果。默认对valueTypeurl不保存原文encodingnone/base64/base64unicode用于解码编码后的文本字段granularitysymbol/word/sentence/paragraph控制文本区域选择粒度。内容审核模板默认不做区域标注因此未设置该参数若未来升级为选中某一句再打标签的区域级审核可在此基础上扩展selectionEnabled默认true决定文本是否可被选中标注。需要注意的是Label Studio 编辑器会把\r\n计为两个符号并按\n\n显示导致行间距看起来异常在涉及文本偏移offset计算时尤其要留意。建议预处理时把\r\n统一替换为\n或在 Python 中打开文件时使用newline避免转换with open(my-file.txt, encodingutf-8, newline) as f: text f.read()Choices多选内容审核类别Choices namecontent_moderation toNametext choicemultiple showInlinefalse Choice valueToxic backgroundred/ Choice valueSeverely Toxic backgroundbrown/ Choice valueObscene backgroundgreen/ Choice valueThreat backgroundblue/ Choice valueInsult backgroundorange/ Choice valueHate backgroundgrey/ /ChoicesChoices标签为文本提供一组分类选项详细参数见 includes/tags/choices.md其核心语义如下参数类型默认值说明namestring—选项组的名称在结果序列化与后续逻辑引用时使用toNamestring—关联的数据对象标签名此处为textchoicesingle/single-radio/multiplesingle单选 / 单选radio 风格/ 多选showInlinebooleanfalse是否在同一行内横向展示选项模板中choicemultiple是关键允许标注员在一段文本上同时勾选多个类别符合内容审核一条内容可能同时触犯多条规则的业务现实。而showInlinefalse让每个选项独占一行、纵向排列避免多标签情况下横向拥挤。每个Choice的background参数控制该选项在界面上的颜色模板中为六个类别分别配置了可区分的色标Toxic有毒→ 红色Severely Toxic严重有毒→ 棕色Obscene淫秽/下流→ 绿色Threat威胁→ 蓝色Insult侮辱→ 橙色Hate仇恨→ 灰色从源码结构看background会被映射为选项在渲染时的背景色若未提供则回退到标签默认色板。除模板用到的参数外Choices还支持required校验是否至少选择一项、requiredMessage校验失败提示、visibleWhen系列条件显隐如region-selected/choice-selected、perRegion按区域而非整条任务选择、layoutselect/inline/vertical以及randomize每次打开任务时打乱选项顺序以降低位置偏差且不影响序列化结果等进阶能力可用于扩展更复杂的审核工作流。Choices也可与任意数据类型音频、图片、时间序列等搭配本模板将其用于文本分类。此外它还支持动态加载选项在value中指定任务数据字段该字段提供选项对象数组即可按任务动态生成Choice适用于类别集合随数据变化的场景。TextArea 与 View可选的人工备注区View stylemargin: var(--spacing-tight); box-shadow: 0 4px 8px rgba(var(--color-neutral-shadow-raw) / 10%); padding: var(--spacing-tight) var(--spacing-base); border-radius: var(--corner-radius-small); background-color: var(--color-neutral-background); border: 1px solid var(--color-neutral-border); Header valuePlease provide additional comments/ TextArea namecomments toNametext requiredfalse/ /ViewHeader显示Please provide additional comments标题引导标注员填写备注TextArea提供多行文本输入框requiredfalse表示备注为可选项不强制填写View类似 HTML 的div负责布局与样式。模板通过内联 style 为该备注区施加了边距、圆角、阴影、背景色与边框使其在界面上呈现为一张独立的卡片与上方的标签选择区形成视觉分区更多布局能力见 View 标签文档。TextArea的完整参数见 includes/tags/textarea.md与内容审核场景强相关的几个参数参数类型默认值说明namestring—TextArea 的名称toNamestring—关联的对象标签名此处为textrequiredbooleanfalse内容是否必填requiredMessagestring—校验失败时的提示信息placeholderstring—输入框占位提示不可提交maxSubmissionsstring—最大提交次数editablebooleanfalse提交后是否允许标注员编辑已添加的文本skipDuplicatesbooleanfalse是否禁止重复提交重复时弹窗警告displayModetag/region-listtagregion-list时每个区域在 Regions 面板下各有一个输入框rowsnumber1输入框行数rows1时按 Enter 提交多行时点Add或 Shift Enter 提交在内容审核场景中备注区通常用于记录为什么勾选这些标签是否属于误判边缘案例是否需要升级人工复核等自由文本信息。由于模板未设置rows将使用默认值 1此时标注员输入后按 Enter 即可提交若希望备注框更醒目或容纳更长意见可显式设置rows3等更大的值。结果输出多标签与备注如何序列化当标注员完成一次审核并提交后Label Studio 会将选择与备注序列化为标注结果annotation result。从Choices与Text的结果参数定义见 includes/tags/text.md可以推断本模板的典型导出结果结构大致如下[ { from_name: content_moderation, to_name: text, type: choices, value: { choices: [Toxic, Insult] } }, { from_name: comments, to_name: text, type: textarea, value: { text: [该评论含人身攻击建议折叠处理] } } ]即choices数组保存被勾选的类别可含多个值text数组保存备注内容。该结构化输出可直接用于训练多标签文本分类模型或作为人工审核流水线的决策依据。当需要把审核结果回灌给下游模型时还可以结合 导出功能 将标注结果导出为 JSON/CSV 等格式。在仓库中的落点与扩展方向模板配置content-moderation/config.yml 是模板库中的官方配置包含完整的 XML 配置与行业应用、领域术语说明标签参考Texttags/text.md、Choicestags/choices.md、TextAreatags/textarea.md、Viewtags/view.md四个标签的完整参数表与示例参数明细includes/tags/text.md、includes/tags/choices.md、includes/tags/textarea.md 提供了带默认值与取值范围的权威参数清单。基于该模板可结合实际业务做如下扩展增加区域级审核为Text设置granularity并配合perRegion的Choices实现选中某一句/某一段后单独判定违规类型增加类别直接在Choices内追加Choice value... background.../如增加Harassment、Spam等条件显隐利用visibleWhenchoice-selected与whenChoiceValue实现勾选某一类别后自动展开追问框的交互选项随机化设置randomizetrue打乱选项顺序降低标注员的位置偏好偏差与 LLM 预筛结合仓库文档中另有 LLM 响应审核模板 与 moderation 插件 等资料可组合构建机器预筛 人工复核的内容安全流水线。小结内容审核模板以Text展示原文、Choices choicemultiple提供六类多选标签、TextArea收集人工备注三部分通过toName关联到同一个text对象构成了一个开箱即用的文本有害内容多标签标注方案。该配置同时存在于标注模板库config.yml与本文档中可直接复制使用并可按区域标注、条件显隐、选项随机化等方向灵活扩展适用于社交媒体、社区论坛、聊天审核等各类内容安全治理场景。【免费下载链接】label-studioLabel Studio is a multi-type data labeling and annotation tool with standardized output format项目地址: https://gitcode.com/GitHub_Trending/la/label-studio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考