
架构设计内容解析为结构化数据。信息检测。采用关键帧提取 场景切换检测。3.1 内容解析 Agent视频抽帧策略采用关键帧提取 场景切换检测。15秒短视频抽取5-8帧关键帧即可覆盖主要内容长视频按每2-3秒一帧 场景切换点额外补帧。ASR选型使用支持时间戳对齐的ASR模型如 Whisper / FunASR输出带时间戳的文本片段便于后续证据定位。OCR后处理OCR结果需做去重、合并、版面恢复。特别关注画面底部小字、快速闪现的文字使用连续帧OCR差异检测。VLM理解深度不仅描述画面有什么还要理解在做什么——例如人物是否在做引导性手势、画面是否有暗示性构图。处理阶段技术方案输出视频预处理解码 → 分辨率标准化 → 时长检测 → 场景切换检测基于帧间差异关键帧时间戳列表关键帧抽取场景切换帧 固定间隔帧每2-3秒 首尾帧 画面变化异常帧5-15张关键帧图片音频分离从视频中提取音轨 → 降噪 → 语音活动检测VAD分段分段音频片段ASR转写使用支持时间戳的ASR模型转写 → 标点恢复 → 说话人分离如有多人带时间戳的文本片段帧OCR对每张关键帧做OCR → 去重合并 → 版面恢复 → 小字区域放大重试每帧的文字列表位置坐标VLM理解对关键帧做画面描述 → 物体检测 → 场景分类 → 人物动作识别画面语义描述时序异常检测连续帧OCR差异分析检测闪现文字→ 音频语速异常检测 → 音画同步验证异常时间点列表3.2 有害信息检测 Agent职责基于内容解析Agent输出的结构化内容对8类有害信息风险进行逐一检测输出风险类型、风险等级、证据片段和判定理由。检测流程风险预筛规则引擎 小模型快速扫描标记可能存在风险的维度如检测到敏感词、暴露画面特征等LLM深度分析对标记维度使用大模型进行语义级推理分析知识库检索RAG检索相关法规条款和历史相似案例辅助判定证据提取定位具体违规内容片段标注来源模态和时间戳3.3 引流信息检测 Agent职责专门负责6类引流信息的检测重点攻克隐蔽引流和对抗性变体。该Agent需要更强的推理能力和模式识别能力。检测策略检测层方法覆盖类别规则匹配层正则匹配微信号格式、URL格式、电话号码格式二维码检测已知黑名单词库匹配D1/D2/D3/D5 显性部分谐音变体检测谐音词典 拼音相似度匹配 LLM语义推理威信→微信薇芯→微信D1 隐性部分Emoji编码检测Emoji组合模式库 LLM推理数字组合 电话号码引导D1/D6行为意图检测LLM分析文案/音频中的引导性行为话术搜索加私信扫码等动词 宾语组合D2/D3/D4/D6音画交叉检测对比音频转写与画面内容检测音频口述但画面不展示或画面闪现但音频不提及的不一致模式D6 核心检测时序异常检测检测画面中快速闪现的文字/图像连续帧OCR差异分析检测音频中语速异常变化段D63.4 综合决策 Agent职责聚合有害信息检测Agent和引流信息检测Agent的结果结合规则引擎和置信度评估输出最终审核决策。决策逻辑风险聚合合并所有检测结果按风险等级排序规则引擎兜底命中一票否决规则如涉政、毒品直接拒绝置信度计算综合各Agent置信度、证据充分性、模型一致性决策输出置信度 ≥ 0.95 且无风险 →自动通过置信度 ≥ 0.90 且有明确违规 →自动拒绝附拒绝理由和证据0.70 ≤ 置信度 0.95 →人工复审附AI初审报告置信度 0.70 或存在矛盾判定 →人工复审标记为难例3.5 人工审核调度 Agent职责管理人工审核工作流将低置信度case智能路由到合适的审核员收集审核结果并反馈到系统优化闭环。核心能力智能路由根据case类型、难度、审核员专业领域和工作负载将case分配给最合适的审核员初审报告生成为每个待人工审核的case生成结构化初审报告包含AI检测结果、证据片段、推荐决策帮助审核员快速判断难例标记标记模型不确定或存在矛盾判定的case为难例优先分配给资深审核员反馈收集记录审核员的最终决策与AI决策的差异作为模型迭代训练数据批量优化对相似case进行聚类支持批量审核提升效率角度垃圾发布者账号识别注册时间、关联手机/邮箱、IP、发布频率等。垃圾内容识别色情、暴力恐怖、广告过滤、违禁、违法、政治敏感。AI生成内容鉴别。垃圾广告、谩骂内容检测。针对未成年进行未成年 不宜信息识别。引流到其他APP、渠道的识别。风控算法