STINER:从 X 平台自动化提取战略网络威胁情报 大家读完觉得有帮助记得关注和点赞摘要战略网络威胁情报侧重于高层面的洞察例如识别被针对的行业、将攻击归因于特定的勒索软件组织以及评估数据丢失的规模。如今X原Twitter已成为获取此类情报的最快来源通常会在正式的厂商报告发布前几天就发布实时的违规公告。将这种原始的讨论转化为可操作的情报需要驾驭复杂的语言环境。传统的命名实体识别模型难以解析社交媒体上非正式且高度不规则的方言这给自动化防御系统带来了盲点。为应对这一挑战我们引入了 STINER一个用于从社交媒体流中提取战略情报的分类体系和专家标注语料库。我们构建了一个高质量的、由专家标注的包含 2,100 条真实世界警报的数据集并提出了一个细粒度的分类体系包含八种实体类型聚焦于诸如威胁行为体、行业和位置等战略支点。我们在 12 种评估配置中对 9 种模型进行了基准测试涵盖了通用和领域自适应编码器、开放模式提取以及零样本和微调设置下的生成式大语言模型。领域自适应编码器如 DarkBERT达到了 89.33% 的严格 F1 分数优于通用基线和微调后的大语言模型后者还伴随着明显更高的推理延迟。利用 STINER-DarkBERT我们对 2025 年上半年的欧洲威胁态势进行了分析。我们的结果与关于主要目标的官方报告一致同时突出了西班牙攻击事件的独特可见性特征并说明了社交媒体驱动的提取如何在 SafePay 勒索软件活动被事后纳入厂商威胁态势报告之前就能捕捉到其早期信号。关键词 网络威胁情报 命名实体识别 社交媒体挖掘1 引言网络威胁情报通常分为四个层次技术、战术、操作和战略[1]。虽然安全行业在自动化技术层方面已达到较高成熟度每天可摄入数百万个原子级入侵指标如 IP 地址和文件哈希值[2]但在战略层面仍然存在关键差距。如“痛苦金字塔”所示原子级指标对攻击者而言易于更改对防御者而言易于检测而战略洞察则需要上下文推理并且在很大程度上仍难以自动化[3]。战略网络情报侧重于威胁态势的“谁”、“为什么”和“多少”而非技术层面的“什么”和“如何”[4]。它通过回答诸如“我的行业是否正被针对”或“哪个威胁行为体在我的地区活动”等问题来支持高层决策。与短暂的技术指标不同战略网络情报为长期规划、资源分配和组织风险管理提供信息。传统上获取此类情报需要人工分析长篇的厂商报告或访问昂贵的付费信息源[5, 6]。然而现代威胁行为体的行动节奏已改变了情报传播的主要渠道。如今战略风险的最早和最细粒度的信号包括勒索软件受害者公告、初始访问代理拍卖和黑客活动分子的攻击目标声明首先发布在 X 等社交媒体平台上通常比它们出现在正式报告中要早几天[7, 8]。将社交媒体用于网络威胁情报引入了一个固有的权衡。正式的厂商报告需要数周才能发布正是因为分析师必须严格核实事实、过滤偏见并确认真实性。相比之下社交媒体提供了极快的速度但本质上是嘈杂且未经核实的。为了利用这种高速流而不被噪音淹没自动化系统必须首先隔离并结构化所提出的主张例如某个特定的勒索软件集团声称入侵了一个目标行业。虽然核实这些主张是下游任务——通常需要与暗网泄露信息交叉参考或分析转发和情感等社交元数据——但将非结构化文本进行结构化处理是关键瓶颈。社交媒体并非仅仅充当警报机制它已演变成一个整合的情报聚合器[9]。如图1所示单一的流提供了对不同行为体和活动的可见性消除了分析师手动监控碎片化来源的需要。这种转变使得主动过滤成为可能防御者可以隔离针对特定地区或行业的威胁。为了大规模实现这一能力需要强大的自动化提取。命名实体识别天然适合此任务然而现有的网络威胁情报资源从根本上与社交媒体领域不匹配。著名的开源数据集如 DNRTI [10] 和 CyNER [11] 几乎完全源自长篇的厂商报告和高级持续性威胁白皮书。在此类正式文本上训练的模型难以应对社交媒体网络威胁情报中不规则的、缩写的和以井号标签驱动的语法其中归因通常是隐式的例如#LockBit而目标很少明确说明。先前关于社交媒体网络威胁情报的工作已产生标注语料库但这些语料库要么针对二分类相关性[12, 13, 14]要么针对侧重于受影响产品、版本和漏洞的技术实体提取[15]。据我们所知没有公开的、专家标注的社交媒体语料库针对战略层面——受害者组织、行业和量化的泄露影响——而这正是组织风险决策所依据的层面。为填补这一空白我们引入了 STINER战略威胁情报命名实体识别这是一种用于从社交媒体中提取战略网络威胁情报的资源。STINER 包含三部分一个包含八种战略实体类型的分类体系一个包含 2,100 条网络威胁情报推文的专家标注语料库以及一份报告编码器、开放模式模型和生成模型在其上性能表现的基准测试。STINER 不包含自身模型。它定义了要提取的内容并提供了训练提取器所需的标注数据而架构的选择是开放的。在整篇论文中STINER 指代这一资源而 STINER-DarkBERT 指代我们在其上训练的性能最佳的提取器我们将其用于第 5 节的分析。我们的贡献有三方面面向社交媒体的战略网络威胁情报命名实体识别数据集 我们发布了一个包含 2,100 条专家标注的网络威胁情报推文的精选语料库覆盖八种战略实体类型以及数据集构建过程中使用的上游网络威胁情报相关和不相关分类分区。与先前标注相关性或技术指标的社交媒体网络威胁情报语料库不同STINER 标注了受害者、行业和影响实体。数据集、标注指南和实验资源可在 https://github.com/ChammakhYasir/STINER 公开获取。广泛的基准测试 我们对领域自适应编码器和生成式解码器进行了严格的比较证明像 DarkBERT 这样的专用模型在嘈杂的社交媒体文本上实现了卓越的提取准确率严格 F1 为 89.33%同时保持了毫秒级的推理延迟。欧洲威胁态势分析 我们利用 STINER 重建了 2025 年上半年的欧洲战略威胁态势证实了关于顶级目标德国、意大利、西班牙的官方报告。至关重要的是我们展示了结构化社交媒体主张如何提供可操作的前置时间成功地在 SafePay 勒索软件活动被纳入正式厂商报告之前识别了其升级。图 1 来自 Twitter (X) 的代表性网络威胁情报警报。非结构化文本包含密集的战略指标包括目标、行业和行为体。2 相关工作网络威胁情报的自动化已从简单的关键词过滤发展到语义提取管道这主要由能够捕捉领域特定威胁语言的标注语料库的可用性所驱动。早期的网络威胁情报命名实体识别工作依赖于长篇威胁报告。诸如 DNRTI [10] 和 Gao 等人[16] 的工作等数据集在厂商白皮书上训练 BiLSTM-CRF 模型以提取恶意软件名称和技术指标。较新的资源包括 CyNER [11] 和协调的 CyberNER 语料库[17]在诸如 STIX 2.1 [18] 等框架下标准化了这些工作。然而这些数据集共享一个关键限制它们几乎完全源自正式的、长篇的报告。当模型应用于社交媒体网络威胁情报时这造成了显著的领域不匹配在社交媒体中语言是缩写的归因是隐式的例如井号标签并且诸如表情符号等视觉分隔符起着语义作用。在厂商散文上训练的模型难以泛化到这种非正式、高速的环境特别是对于诸如受害者行业或泄露影响等战略实体。第二类工作直接针对社交媒体。Behzadan 等人[12] 发布了一个用于网络威胁相关性分类的标注 Twitter 语料库Le 等人[13] 将同一任务构建为针对 CVE 描述的新颖性检测避免了负训练样本引入的采样偏差。Simran 等人[14] 通过用于推文级威胁分类的深度文本表示方法扩展了这一方向。与我们工作最接近的是Dionísio 等人[15] 将 CNN 相关性分类器与推文上的双向命名实体识别模型配对证明了从社交媒体网络威胁情报中进行令牌级提取是可行的。最近Arikkat 等人[19] 使用基于 BERT 的相关性过滤器从精选的 Telegram 频道构建了一个大规模网络威胁情报数据集将社交媒体网络威胁情报收集扩展到 Twitter 之外。这些努力确立了社交媒体作为可行网络威胁情报来源的地位但它们的标注模式仍然面向技术层面实体表示受影响的产品、版本和漏洞支持补丁优先级排序而非战略风险评估。因此STINER 是互补而非竞争的它标注了谁受害、在哪个行业和地区以及以何种量化成本受害。自然语言处理领域的并行工作通过诸如 WNUT17 [20] 等基准和 BERTweet [21] 等模型解决了嘈杂的用户生成文本证明针对特定媒体进行预训练显著提高了对不规则语法的鲁棒性。然而这些模型缺乏网络安全语义。例如一个在 WNUT 上训练的模型可能正确识别“LockBit”为一个实体但将其错误分类为通用组织或者无法区分提及的公司与被入侵的受害者。这暴露了一个持续的空白现有资源要么处理社交媒体语法要么处理网络安全语义但不能同时处理两者。在此背景下大型语言模型的最新进展重新引发了人们对生成式架构是否可以在没有任务特定训练的情况下弥合这一差距的兴趣。它们在广泛的语言理解任务上的强劲表现导致越来越多地探索将大型语言模型用于网络威胁情报提取通常假设仅凭指令遵循可能就无需专门的命名实体识别系统。然而实证证据越来越多地挑战这一假设。Mezzi 等人[22] 表明GPT-4 和 Claude 等模型在应用于网络威胁情报时表现出不一致的提取行为和幻觉。Shafee 等人[23] 在开源情报中报告了类似发现大型语言模型在分类上表现良好但在令牌级提取上表现不佳。AthenaBench 评估[24] 进一步突显了在复杂威胁场景上的推理局限性。除了准确性自回归解码的延迟使得大型语言模型在处理高容量社交媒体流的实时处理中不切实际。除了社交媒体地下论坛和市场构成了一个具有显著不同可见性属性的互补网络威胁情报来源。先前的工作已对从黑客论坛讨论中提取的安全事件进行了聚类和排序[25]表明可以从对抗性社区文本中恢复可操作的信号。另一条并行的工作路线是刻画行为体本身而非事件使用基于图和表示学习的方法对网络犯罪论坛中的有影响力参与者进行排序[26, 27, 28]。这些来源以公共社交媒体的速度和广度为代价换取了对抗性上下文的深度我们将跨平台整合视为未来工作第6节。综上所述先前的工作揭示了网络威胁情报自动化中的一个结构性空白以报告为中心的数据集在社交媒体语法上失败社交媒体的自然语言处理缺乏领域语义而大型语言模型既不精确也不具备操作效率。STINER 通过将社交媒体原生数据集与战略网络威胁情报分类体系相结合来弥补这一空白实现了精确、低延迟的提取性能优于通用大型语言模型和基于报告训练的基线。3 STINER 数据集构建本节描述 STINER 语料库的构建过程包括战略实体分类体系、数据收集流程以及用于确保一致可靠标注的专家标注工作流。3.1 分类体系定义虽然诸如 MITRE ATTCK 和 STIX 2.1 等既定框架是建模战术网络威胁情报的全球标准例如捕获特定的利用向量、恶意软件家族和原子指标但它们与社交媒体披露的性质根本不对齐。公开的勒索声明和初始访问代理拍卖很少详述技术程序相反它们侧重于经济杠杆和业务影响。因此我们并非将高层次的社交媒体讨论强行纳入战术框架而是特意设计了 STINER 分类体系以捕获战略情报。它重构了安全事件的核心叙述谁受到影响、事件发生在何处以及影响有多严重。该模式的核心是 TARGET受害者组织和相应的 SECTOR例如医疗、能源它们共同允许追踪个别事件以及随时间推移的更广泛的行业级趋势。为支持地理和归因分析我们还提取受害者 LOCATION 和声称负责的威胁 ACTOR。为表征事件影响我们标注了泄露严重性的定量和定性指标。这些包括被外泄数据的 SIZE例如“500 GB”、涉及的 DATA_TYPE例如“源代码”、“电子邮件”以及与勒索要求或数据销售相关的 PRICE。这些实体共同为下游影响评估和经济分析提供了必要的背景。所有八种实体类型的完整定义见表1。表 1STINER 实体分类体系按核心战略支点目标、行为体、行业、位置和影响相关上下文大小、数据类型、价格、日期进行组织。实体标签定义示例TARGET受事件影响的组织、公司或机构。威奇塔州立大学, 塔科马工程师ACTOR声称负责的勒索软件组织或威胁行为体。LockBit, PLAY, IntelBrokerSECTOR受害者运营所在的行业或市场领域。医疗, 能源, 金融LOCATION与受害者相关的国家或地区。美国, 意大利, 法国SIZE报告的外泄数据量或记录数。10GB, 1.4TB, 完整转储DATA_TYPE受损信息或资产的类别。个人身份信息, 源代码, SQL 转储PRICE与该事件相关的赎金要求或出售价格。$1500, 10 BTC, 50万美元DATE与披露或事件时间相关的明确日期。2025-02-14, 2024年10月图 2 数据集构建过程中使用的标注界面快照。3.2 数据收集与筛选我们使用 Apify [29] 平台收集了约 66,500 条推文并使用轻量级基于 BERT 的分类器筛选出与网络威胁情报相关的子集。从这个子集中选取了 2,100 条推文供专家标注。筛选过程优先考虑来源多样性和时间覆盖从独立安全研究人员中进行比例抽样并降低高流量新闻聚合器的权重。推文从 2022 年到 2025 年均匀采样以避免时间偏差并反映不断演变的报告实践。3.3 标注方法所有推文均由两名网络安全研究人员使用 Label Studio 界面 [30]图2进行手动标注。为评估标注一致性数据集的 10%210 条推文由两名标注者独立标注在跨度级别使用精确匹配标准要求实体边界和标签完全一致计算得到了 Cohens [31] κ 0.84 的标注者间一致性。剩余的差异通过资深评审员的裁决来解决以建立一致的指南。一个反复出现的分歧来源涉及官方名称中包含地理描述的组织例如“韩国环境部”。为解决此问题我们定义了一个身份规则当地理名称是组织官方名称的一部分时它被包含在 TARGET 跨度内当地理名称在语法上是独立的例如“位于韩国”则被标注为独立的 LOCATION 实体。此规则确保了整个语料库中对命名实体处理的一致性。表 2STINER 数据集中实体标注的分布。实体类型数量频率 (%)LOCATION4,72827.36TARGET3,74321.66DATA_TYPE3,41919.79ACTOR2,43014.06SECTOR1,2447.20SIZE9785.66PRICE5613.25DATE1781.03总计17,281100.03.4 数据集统计与特征最终的 STINER 语料库包含 2,100 条标注推文总计 85,066 个令牌。每条推文包含多个战略实体平均每个样本有 8.23 个实体。此密度显著高于通用社交媒体基准如 WNUT-17 [20]后者平均每条推文少于一个实体。数据集词汇表包含 7,870 个唯一令牌类型-令牌比率为 0.093。这反映了网络威胁报告中常见的专业化和重复性术语其中技术术语在不同事件中频繁出现。因此该数据集强调领域特定概念而非对话语言。如表2所示大多数标注对应于上下文实体如 LOCATION、TARGET 和 ACTOR它们构成了归因和态势感知的基础。影响相关实体如 DATA_TYPE 和 SIZE也有很好的代表性使得能够对泄露严重性进行定量分析。相比之下PRICE 仍然相对不常见反映出赎金要求通常在私下协商并不总是在公开报告中披露。4 模型基准测试为识别用于实时战略情报提取的最佳架构我们进行了最先进自然语言处理模型的严格比较研究。本节详述我们的实验框架对比专用判别式编码器与生成式方法在精度和延迟的严格操作约束下的效果。4.1 实验设置我们使用旨在反映现实世界部署条件的时间评估协议来评估 STINER。数据集按时间顺序分为训练集70%、验证集15%和测试集15%分区。具体来说训练集包含从 2022 年到 2024 年中期的推文而测试集仅包含 2024 年末到 2025 年的推文。这确保了模型在面对未来的、未见过的威胁活动时进行评估而不是记忆同一时间段的事件。由于威胁行为体、活动名称和受害者组织迅速演变2025 年的测试分区包含了训练数据中未出现的威胁组织和受害者组织。这种设计提供了更强的证据表明框架是基于语言上下文和网络安全语义进行泛化而非仅仅匹配已知行为体的静态字典——直接解决了跨多年数据集中评估污染的风险。所有模型均直接在原始推文文本上操作保留 URL、话题标签、表情符号和用户句柄这些在社交媒体网络威胁情报中通常传达归因和活动级信息。我们对四个模型家族进行了基准测试通用编码器 BERT-Base [32] 和 Twitter-RoBERTa [33]。领域特定编码器 SecBERT [34], DarkBERT [35], 和 CySec-BERT [36]。开放模式编码器 GLiNER-Large-v2.1 [37]在零样本设置中使用自然语言标签描述进行评估。生成式大语言模型 Llama-3-8B [38], Gemma-2-9B [39], 和 Qwen-2.5-14B [40]在零样本配置指令提示和通过 QLoRA [41] 进行监督微调后进行评估。只有这些模型的子集在 STINER 上进行了训练。五个判别式编码器BERT-Base, Twitter-RoBERTa, SecBERT, CySecBERT, DarkBERT在 STINER 训练集上进行了微调三个生成模型在其 QLoRA 配置中也是如此。其余条目——GLiNER 和三个零样本配置下的指令微调大语言模型——从未见过 STINER 训练数据仅使用标签描述或提示直接在测试集上进行评估。所有十二个条目都在相同的保留测试集上进行了评估因此训练和未训练的配置可直接比较。基于编码器的模型使用标准的线性令牌分类头进行训练。我们额外评估了条件随机场解码作为一项有针对性的消融研究第4.3节。生成模型采用约束 JSON 解码以强制固定的输出模式。提取质量使用跨度级别的微平均 F1 进行衡量采用严格匹配标准要求预测实体跨度与真实实体跨度完全一致。有关批处理策略、硬件配置和延迟测量的详细信息请参见附录 0.A。4.2 性能分析表3展示了九种模型在 12 种配置下对保留测试集的比较评估。我们的分析揭示了领域适应、模型规模和操作延迟之间的关键权衡。社交媒体语法 vs. 领域词汇DarkBERT (89.33%) 和 Twitter-RoBERTa (89.23%) 实现了几乎相同的性能表明仅网络安全特定词汇并非社交媒体网络威胁情报中提取质量的主导因素。相反对平台特定语法如话题标签、用户句柄、缩写和表情符号的鲁棒性同样重要。这一效应通过 SecBERT (严格 F1: 71.69%) 较弱的性能得到突显。尽管 SecBERT 编码了丰富的网络安全术语例如CVE 和恶意软件家族但其在正式的高级持续性威胁报告上的预训练限制了其泛化到推文缩写和不规则语法的能力。Twitter-RoBERTa 尽管缺乏明确的网络安全领域预训练但受益于其原生接触社交媒体语言因此表现具有竞争力。DarkBERT 结合了非正式语法暴露和网络安全领域语义实现了最强的整体性能并证明了使媒介和领域对齐的重要性。表 3综合基准测试结果。我们比较了专用编码器与生成式大语言模型在零样本 (*) 和微调设置下的性能。严格 F1 要求精确的跨度边界。延迟表示每个样本一条推文的推理时间。模型架构严格 F1精确率召回率延迟 (毫秒)判别式编码器 (微调)DarkBERT [35]89.3387.7690.950.71Twitter-RoBERTa [33]89.2387.6690.850.71CySecBERT [36]87.0284.2090.040.71BERT-Base (基线) [32]85.0181.8588.420.71SecBERT [34]71.6967.9575.860.37开放模式模型GLiNER-Large-v2.1* [37]71.3174.3468.5335.55生成式大语言模型 (零样本 vs. 微调)Gemma-2-9B-IT* [39]76.3586.2768.48331.54Llama-3-8B (微调) [38]74.5578.6570.861965.94Gemma-2-9B (微调) [39]72.5982.0965.073937.96Qwen-2.5-14B (微调) [40]66.7082.3356.066473.18Qwen-2.5-14B-Instruct* [40]59.7486.1345.73171.77Llama-3-8B-Instruct* [38]27.7889.5616.43110.72生成式人工智能的召回危机虽然零样本大语言模型实现了高精确率86-89%但它们表现出严重的召回率下降16-45%。这种模式表明了一个明显的召回率限制生成模型可靠地提取明确、格式良好的实体例如“LockBit”但经常遗漏社交媒体网络威胁情报中常见的缩写或不规则表达例如“#lockbit3”、“500GB dump”。使用 QLoRA 进行微调显著缓解了此问题。最引人注目的是Llama-3 从 27.78% 的严格 F1 提高到 74.55%——一个 47 个百分点的增益直接量化了针对社交媒体网络威胁情报提取的领域特定监督数据的贡献。这证明了仅靠指令提示是不够的模型必须直接在现实世界社交媒体披露中的语言惯例上进行训练才能实现操作上可用的召回率。关键在于即使在微调后最佳生成模型Llama-3 为 74.55%仍比 DarkBERT (89.33%) 低 15 个百分点同时承受超过 2,700 倍的延迟惩罚使得基于编码器的架构成为操作部署的明确选择。操作延迟考量当战略网络威胁情报提取被嵌入连续监控或早期预警管道时延迟变得相关。在此类设置中基于编码器的模型在批处理推理下可在 1 毫秒内处理样本实现对高容量社交媒体流的近实时分析。相比之下微调后的大语言模型每个样本的延迟达数秒限制了其用于离线或低吞吐量分析。因此STINER 数据集直接兼容依赖于实时命名实体识别进行安全事件检测和优先级排序的系统例如流式开源情报管道和早期预警框架例如Tweezers [7]。在这些架构中低延迟提取是先决条件即使下游情报任务是战略性的而非反应性的。GLiNER冷启动折衷方案GLiNER 占据了一个独特的操作生态位。尽管其零样本性能71.3% F1落后于微调后的编码器但它不需要标注数据。这使其非常适合零日场景例如新兴威胁行为体或新型活动类型其中没有可用的标注示例。GLiNER 提供了比大语言模型快一个数量级的速度优势同时为初始分流提供了足够的准确性在可以训练专用编码器之前充当临时解决方案。4.3 消融研究结构化解码的影响表 4CRF 解码对基于编码器的命名实体识别模型在 STINER 测试集上的有效性严格跨度级微平均 F1和效率每样本延迟方面的影响。模型线性 F1CRF F1Δ F1延迟 (毫秒)减速比BERT-Base0.8500.831−0.0190.71 → 4.846.8×Twitter-RoBERTa0.8920.838−0.0540.71 → 5.057.1×SecBERT0.7170.7690.0520.37 → 3.329.0×CySecBERT0.8700.849−0.0210.71 → 4.856.8×DarkBERT0.8930.841−0.0520.71 → 5.067.1×诸如条件随机场之类的结构化解码层在网络威胁情报命名实体识别管道中被广泛采用特别是在以报告为中心的环境中已有研究表明它们通过强制执行有效的 BIO 转移约束来提高标签一致性例如[42], [43], [44]。受此先例启发我们评估了 CRF 解码是否为社交媒体原生网络威胁情报提取提供了类似的好处。我们比较了配备标准线性令牌分类头独立预测标签的基于编码器的模型与另一种强制执行结构化标签转移例如防止 I-ACTOR 跟在 B-MALWARE 之后的 CRF 解码层。结果报告在表4中。研究结果揭示了一个明确的准确性-效率权衡。虽然 CRF 解码提高了 SecBERT 的性能5.2 F1可能补偿了其在非正式文本中较弱的上下文表示但它持续降低了强编码器的性能。特别是DarkBERT 和 Twitter-RoBERTa 在受到 CRF 解码约束时F1 下降了超过 5 个百分点。这种行为反映了 CRF 假设与社交媒体网络威胁情报结构之间的不匹配。推文经常包含碎片化实体、非常规边界和非规范语法这些违反了严格的 BIO 转移模式。现代 Transformer 编码器通过自注意力隐式地模拟这些不规则性而 CRF 解码则强制执行严格的马尔可夫约束这可能会过度纠正语义上有效但句法上嘈杂的预测。除了准确性CRF 解码还引入了显著的计算开销。非并行化的维特比算法 [45] 将推理延迟增加了约 7 倍将性能从亚毫秒级批处理推理转移到每样本几毫秒。因此我们在最终的 STINER 管道中采用线性解码头以平衡鲁棒的提取准确性和操作效率。4.4 细粒度实体分析图 3 在 STINER 测试集上最佳性能模型带有线性解码头的 DarkBERT的每个实体严格跨度级 F1 分数。为分析优势和失败模式在实体层面的分布我们报告了最佳配置带有线性解码头的 DarkBERT的每类性能。图3显示了八种战略实体类型的严格 F1 分数。该模型在核心归因实体上实现了非常强的性能LOCATION (95.0%)、ACTOR (91.9%) 和 TARGET (91.3%)。这些实体通常使用社交媒体网络威胁情报中独特的表面线索来表达包括国家的旗帜表情符号、标准化的勒索软件组织名称和明确的组织提及。此类线索提供了清晰的信号被基于 Transformer 的注意力机制有效捕获。相比之下SECTOR 表现最低 (76.2%)。对预测错误的检查表明这主要是由于上下文歧义而非提取失败。在许多推文中同一个词可能作为组织名称TARGET的一部分出现或作为受害者业务领域SECTOR的描述出现具体取决于上下文。解决这种歧义通常需要关于组织本身的知识而这并不总是能从局部句子中获得。对于下游风险评估至关重要影响相关实体被高度可靠地提取。DATA_TYPE 达到了 89.1% 的严格 F1SIZE 达到了 88.0%表明模型一致地捕获了外泄数据的性质和规模。这使得能够基于数据敏感性和数量自动估计事件严重性这是战略网络威胁情报分析的核心要求。5 欧洲威胁态势分析2025 年上半年鉴于该地区的地缘政治重要性和 NIS2 指令 [46] 的实施我们将威胁态势分析重点放在欧洲地区。通过过滤 STINER-DarkBERT 提取的位于欧盟 27 国和英国境内的实体我们重建了欧洲关键基础设施面临的战略风险态势。至关重要的是为评估我们实时社交媒体提取的有效性我们将我们的发现与权威的 ENISA 2025 年威胁态势报告 [47] 进行了基准比较。此比较证明STINER 不仅证实了官方的回顾性数据而且往往作为新兴活动的领先指标。5.1 地理目标模式图 4 2025 年上半年公开声称的对欧洲国家的攻击比较了 Q1 和 Q2 的趋势。图4展示了我们数据集中受害者组织在欧洲的分布。西班牙成为我们数据集中的主要目标紧随其后的是意大利和德国。虽然这一发现在受影响最严重的国家方面与官方报告一致但排名有所不同。ENISA 2025 年威胁态势报告基于已确认事件将德国列为受影响最严重的国家而西班牙在源自社交媒体披露的 STINER 数据集中是出现频率最高的目标国家。这种差异反映了底层数据源的性质ENISA 捕获的是已验证的事件而 STINER-DarkBERT 衡量的是通过声明和勒索相关帖子所体现的攻击的公众可见性。因此西班牙的突出地位表明其披露活动更为活跃而非绝对事件数量更高。为验证此假设我们对特定于西班牙的威胁态势进行了细粒度提取。STINER-DarkBERT 成功识别出 Akira 和 Qilin 是 2025 年上半年针对该地区的两个主要对手。这一发现得到了 SOCRadar 西班牙 2025 年威胁态势报告的独立证实该报告将这些组织列为最高的勒索软件威胁 [48]。这种一致性证实了 STINER-DarkBERT 不仅捕捉了广泛的趋势而且无需人工干预即可准确重建区域网络冲突的具体归因特征。5.2 时间分析SafePay 案例研究图 5 SafePay 勒索软件组织的每周提及速度。STINER-DarkBERT 检测到 2025 年 5 月中旬出现明显的活动高峰大约比 ENISA 2025 年第二季度报告期间 SafePay 被确认为上升威胁早 6-7 周。社交媒体驱动网络威胁情报的核心动机之一是时间分辨率。权威的威胁态势报告如 ENISA 2025 年威胁态势报告 [47]必然以季度或半年为汇总周期运作反映的是已确认和策划的事件。相比之下STINER-DarkBERT 能够在公开讨论中实现事件动态的周级别可见性。我们选择 SafePay 作为案例研究因为它被 ENISA 明确确定为一种在 2025 年第二季度崛起的新兴勒索软件变种在对欧盟公共行政部门的勒索软件攻击中它成为部署第二多的变种占该行业勒索软件声明的 33.3%[47]。图5显示STINER-DarkBERT 在 2025 年 5 月 12 日至 18 日这一周检测到 SafePay 相关活动出现了一个急剧的拐点表现为社交媒体上公开声明和受害者披露的突然增加。此峰值对应于该活动的早期升级阶段当时操作者积极公开泄露事件以放大勒索压力和可见性。至关重要的是此检测比 ENISA 在 2025 年第二季度将 SafePay 确认为上升威胁早了大约 6-7 周——这一差距直接量化了社交媒体驱动的网络威胁情报相对于机构报告周期所拥有的早期预警优势。这一轨迹得到了 ENISA 季度勒索软件声明数据的独立证实该数据记录了 SafePay 在同一时期作为欧盟最活跃变种之一的激增 [47]。这一时间差距突显了社交媒体驱动的情报与机构威胁报告之间的结构性互补关系。通过检测披露速度的拐点STINER-DarkBERT 能够实现更早的防御行动例如将行为体置于加强监控之下、发布特定行业警告或优先对相关基础设施进行威胁狩猎。在此角色中STINER-DarkBERT 充当了一个领先指标预测了后来被权威威胁态势评估所证实的趋势。5.3 量化情报差距除了归因和时间战略网络威胁情报中一个持续的挑战是量化影响。包括 ENISA 在内的官方机构明确承认由于对泄露严重性的报告不足和披露不一致评估经济及运营损害存在困难 [47]。通过聚合 STINER 提取的 SIZE 实体我们重建了 2025 年上半年泄露数据量的分布图。虽然事件计数通常因频繁的服务中断而突显公共管理部门但我们的体积分析表5揭示了关于数据丢失的不同现实。制造业成为数据外泄的主要受害者泄露数据超过 146 TB证实了工业间谍活动和勒索对这一垂直行业的沉重打击。值得注意的是政府行业也遭受了大规模数据泄露104 TB表明除了网站中断国家实体还面临严重的数据机密性破坏。这种对比突显了一个关键的情报差距仅通过“事件数量”来衡量风险掩盖了真实的战略成本。STINER 提供了必要的量化维度以便根据潜在数据丢失的严重程度来优先安排防御。表 5行业脆弱性分析泄露数据总量2025 年上半年。行业泄露量 (GB)制造业146,018政府104,445军事82,510建筑与规划71,680医疗67,3655.4 战略威胁剖析Medusa 团伙2025 年第一季度图 6 Medusa 的赎金要求分布2025 年第一季度。为说明 STINER 的细粒度我们展示了 2025 年第一季度 Medusa 勒索软件团伙的聚焦画像。与隐藏谈判的团伙不同Medusa 采用“公开拍卖”模式公开公布赎金要求以加强勒索压力。金融商业模式。 Medusa 的赎金要求中位数为 32 万美元反映了其有意专注于具有足够流动性但运营韧性有限的中端市场受害者。中位数与 400 万美元最大值之间的巨大差距表明了一种分层定价策略范围从截止日期延长到完整数据删除保证。行业受害者学。 将赎金要求与 SECTOR 实体交叉引用显示其集中于对中断敏感的行业以医疗和建筑为首其次是公共部门和教育组织。这种目标选择与 Medusa 的定价逻辑一致即赎金要求被校准为具有财务胁迫性但在长时间停机下又是现实可支付的。6 结论与未来工作在本工作中我们提出了 STINER一个用于从高速社交媒体流中提取战略网络威胁情报的开源资源。与先前标注相关性或技术指标的社交媒体网络威胁情报语料库不同STINER 针对的是与自动化风险评估和决策支持直接相关的战略支点——目标、行业、行为体和影响。通过全面的基准测试我们表明领域和媒介自适应的编码器模型特别是 DarkBERT (89.33% 严格 F1)优于通用编码器和大型生成模型实现了约 15 个点的严格 F1 优势同时运行在数量级更低的延迟下。通过涵盖 2025 年上半年的欧洲案例研究我们进一步展示了 STINER 的实际价值通过重建区域威胁动态并在 SafePay 勒索软件活动被纳入官方威胁态势报告之前很久就识别了其升级。6.1 局限性与伦理考量我们的研究承认两个主要局限性。首先当前数据集仅限于英文内容可能低估了仅在俄语或中文网络犯罪社区中讨论的威胁。其次依赖单一平台X/Twitter引入了对“高调”勒索活动的可见性偏差同时可能遗漏在封闭论坛上讨论的更隐蔽的操作。在伦理方面我们仅使用 Apify 从公开可访问的帖子中收集数据将收集范围限制在公开端点并排除了任何私人内容。为在尊重平台再分发限制的同时支持可重复性我们发布了推文 ID、跨度标注和代码我们不重新分发推文文本。6.2 战略效用除了本文提出的分析STINER 数据集还支持广泛的高影响力战略情报应用。结构化的实体支持复杂的归因和风险分析任务例如识别哪些行业部门被特定的勒索软件组织系统性针对或估计每个行业的平均赎金要求。此外该数据集构成了一个高质量的指令微调资源用于将大型语言模型扎根于现实世界的网络威胁情报中从而在自动化分析和报告生成工作流程中大幅减少领域特定的幻觉。6.3 未来方向未来的工作将沿两个互补轴扩展 STINER 框架。首先我们旨在通过提取实体之间的关系例如ACTOR → TARGET构建时间知识图谱 [49]从而实现活动轨迹的预测性分析。其次我们计划整合跨平台来源如暗网泄露网站和 Telegram 频道以量化“泄露滞后”——即私下勒索要求与其公开披露之间的时间差。通过弥合非结构化社交媒体讨论与结构化情报之间的差距STINER 为下一代主动式、自动化的网络防御奠定了基础。